目标条件策略
Goal-conditioned Policy常用除了当前观测,还把「要达到的目标」作为输入来决定动作的策略。
目标条件策略是把目标也当作输入的策略,常写作 π(a | s, g):s 是当前状态或观测,g 是目标,可以是一个目标位置、一张目标图像或一个目标状态。普通策略只学一个固定任务,目标条件策略用同一个网络完成「到达不同目标」的一族任务,换目标不用重新训练。在强化学习里这叫目标条件强化学习,常配合后见之明经验回放(HER,把没达成原目标的轨迹按实际到达的位置重新标注成功)缓解稀疏奖励;在模仿学习里,Lynch 等人 2019 年的 Play-LMP 用无任务标签的玩耍数据训练,测试时给出目标就能完成对应动作。目标用一句话描述时,就是语言条件策略。
例子给机械臂一张「积木在桌子左上角」的照片作为目标,策略就把积木往那里推;换一张照片,同一个策略就去完成新目标。
- 也叫
- 目标条件化策略
- 相关
- 目标条件强化学习、后见之明经验回放、语言条件策略、目标条件模仿学习、事后重标注、策略
- 来源
- Goal-Conditioned Reinforcement Learning: Problems and Solutions (IJCAI 2022 Survey, arXiv 2201.08299)
Hindsight Experience Replay (arXiv 1707.01495)
Learning Latent Plans from Play (arXiv 1903.01973)