RL-100
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning进阶基于扩散策略的真机强化学习框架,8 个任务 1000 次试验全部成功
上海交通大学、上海期智研究院、清华大学等团队(许华哲等)2025 年 10 月发布,2026 年发表于 Science Robotics。它瞄准家庭和工厂部署需要的、接近熟练操作员的可靠性。框架建立在扩散视觉运动策略上,分三阶段:模仿学习人类演示、离线强化学习、真机在线强化学习,三阶段共用一个作用在去噪过程上的裁剪 PPO 目标,让改进保守稳定;再用一致性蒸馏把多步去噪压成一步,满足高频控制。在推物、保龄球、倒水、叠布、拧螺丝、榨汁、折纸盒等 8 个真机任务上取得 1000/1000 次成功,完成速度达到或超过专家遥操作员。
例子部署在商场的榨汁机器人零样本连续为随机顾客服务约 7 小时,没有出现失败。
- 相关
- 真机强化学习、扩散策略、一致性模型、近端策略优化、离线到在线强化学习、HIL-SERL
- 来源
- RL-100 (arXiv 2510.14830)
RL-100 project page
Tech Xplore: RL-100 framework helps robots refine learned tasks - 信息截至
- 2026-08