SERL
SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning进阶伯克利等开源的真机强化学习工具套件,几十分钟就能在真实机械臂上练出策略
加州大学伯克利分校、斯坦福、华盛顿大学和 Intrinsic 的研究者(Jianlan Luo、Sergey Levine 等)2024 年 1 月发布,发表于 ICRA 2024。强化学习难以在真机上落地,除了算法本身,还卡在奖励怎么给、每回合结束后怎么复位、底层控制器是否安全这些工程问题上。SERL 把这些打包成开源工具:用样本效率高的异策略算法 RLPD,可以同时利用少量人类演示;用图像分类器判断任务是否成功,充当奖励;用「前向、后向」两个策略轮流执行来自动复位,省去人工重置;并为 Franka 机械臂提供阻抗控制器,让接触过程安全柔顺。论文中 PCB 元件插装、线缆布线、物体搬移等任务平均 25 到 50 分钟训练就达到接近 100% 的成功率。后续工作 HIL-SERL 在此基础上加入人类在线纠正。
例子做 PCB 元件插装时,先录少量人工演示,再训练一个判断「元件插好没有」的图像分类器当奖励,机械臂自己反复尝试不到一小时就能稳定插好。
- 也叫
- Sample-Efficient Robotic Reinforcement Learning
- 相关
- HIL-SERL、真机强化学习、利用先验数据的强化学习、成功检测器、阻抗控制、样本效率
- 来源
- SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning (arXiv 2401.16013)
SERL project page - 信息截至
- 2024-05