无重置强化学习
Reset-Free Reinforcement Learning进阶不靠人一次次把环境复位,让机器人在连续交互中自己学。
标准强化学习默认每个回合结束后环境会重置回初始状态,仿真里一行代码就能做到,真机上却往往要人去把物体摆回原处,这是真机强化学习的主要瓶颈之一。无重置强化学习研究在尽量少的人工复位下学习:2017 年 Eysenbach 等人的 Leave no Trace 同时学「正向策略」和「复位策略」,并用复位策略的价值函数判断何时快要进入无法挽回的状态;2021 年 Gupta 等人让多个任务互相充当彼此的复位,用多任务学习解决复位问题;同年 Sharma、Finn 等人把它形式化为「自主强化学习」并发布 EARL 基准,发现常规回合制算法在减少人工干预后性能明显下降。它和失败恢复、自主数据采集密切相关。
例子让机械臂学开抽屉的同时学关抽屉:开完之后由「关」的策略把环境恢复原样,机器人就能连续练习,而不需要有人守在旁边复位。
- 也叫
- 自主强化学习、Autonomous RL、Autonomous Reinforcement Learning、免重置强化学习
- 相关
- 真机强化学习、回合、失败恢复、自主数据采集、多任务学习、在线强化学习
- 来源
- Eysenbach et al. 2017: Leave no Trace: Learning to Reset for Safe and Autonomous Reinforcement Learning
Gupta et al. 2021: Reset-Free Reinforcement Learning via Multi-Task Learning
Sharma et al. 2021: Autonomous Reinforcement Learning: Formalism and Benchmarking