元强化学习
Meta Reinforcement LearningMeta-RL进阶在大量相似任务上训练,让智能体遇到新任务时只需少量试错就能适应。
元强化学习把「怎样更快地做强化学习」本身当成一个学习问题:在一个任务分布(如不同负载、不同目标位置)上训练,使智能体面对同分布的新任务时只用少量交互就能适应。常见路线有两类:一类如 RL²(2016),用循环神经网络跨回合保留记忆,靠隐藏状态在线「学会」新任务;另一类如 MAML,学一组便于微调的初始参数,几步梯度更新即可适配。它针对的是深度强化学习样本效率低、策略难泛化的问题。机器人上常用于应对负载、地形、机体损伤等变化,Meta-World 是常用的机械臂元强化学习基准。
例子Nagabandi 等人(2018)用元学习训练动力学模型,一台真实的腿式微型机器人在少一条腿、爬坡或拖拽负载时,能用最近几步观测在线调整模型、继续完成移动。
- 也叫
- 元RL、学会强化学习
- 相关
- 元学习、上下文学习、快速运动适应、Meta-World、少样本、多任务学习
- 来源
- A Tutorial on Meta-Reinforcement Learning (arXiv:2301.08028)
RL²: Fast Reinforcement Learning via Slow Reinforcement Learning (arXiv:1611.02779)
Learning to Adapt in Dynamic, Real-World Environments Through Meta-Reinforcement Learning (arXiv:1803.11347)