强化学习
Reinforcement LearningRL入门必知智能体通过反复试错、根据奖励信号不断改进行为的机器学习方法。
强化学习是与监督学习、无监督学习并列的机器学习范式。智能体在环境中观察状态、做出动作,环境返回新状态和奖励(衡量这一步好坏的数值),目标是学出让长期累计奖励最大的策略。它不需要逐步标注「正确动作」,只要定义好奖励,但智能体得在尝试新动作(探索)和使用已知好动作(利用)之间权衡。问题通常建模为马尔可夫决策过程。在具身智能里,强化学习主要用在两处:一是在仿真器里大规模并行训练足式、人形机器人的运动控制,再迁移到真机;二是在模仿学习打底后,用强化学习微调 VLA,提升成功率和纠错能力。
例子OpenAI 2018 年完全在仿真里用强化学习训练 Shadow 灵巧手,并随机化摩擦系数等物理参数,训出的策略直接迁移到真实灵巧手上,完成基于视觉的手内物体转向。
- 也叫
- 增强学习
- 相关
- 马尔可夫决策过程、奖励函数、策略、近端策略优化、仿真到现实迁移、强化学习微调
- 来源
- Wikipedia: Reinforcement learning
OpenAI Spinning Up: Key Concepts in RL
OpenAI et al. 2018: Learning Dexterous In-Hand Manipulation