具身智能新手名词表English

真机强化学习

Real-World Reinforcement Learning常用

让机器人直接在真实环境里试错学习,而不是只在仿真里训练。

真机强化学习指策略的强化学习训练(至少一部分)直接在物理机器人上进行。它省去仿真建模,也绕开了虚实差距,适合插接、线缆布置这类接触复杂、难以仿真的任务。难点在于:真机数据慢而贵,算法必须样本效率高;每回合结束要有人或程序把场景复位;奖励要能从相机画面自动判断;探索时还不能撞坏机器人。Dulac-Arnold 等人 2019 年把这类难题归纳为九项挑战。常见对策是异策略算法加经验回放、用示范数据热启动、训练成功检测器当奖励、人在回路随时纠正,UC Berkeley 的 SERL / HIL-SERL 是代表工作。

例子SERL(ICRA 2024)在真实机械臂上学 PCB 元件插装、线缆布置和物体搬移,每个策略平均只训练 25–50 分钟;后续的 HIL-SERL 加入人工示范与纠正,在 1–2.5 小时内学会精密装配、动态操作和双臂协作,成功率接近 100%。

也叫
真实世界强化学习、Real-world RL、真机 RL
相关
强化学习、样本效率、人在回路、无重置强化学习、HIL-SERL、仿真到现实迁移
来源
Challenges of Real-World Reinforcement Learning (Dulac-Arnold et al., 2019)
SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)
信息截至
2025-03

在完整名词表里查看 →