目标条件强化学习
Goal-Conditioned Reinforcement LearningGCRL进阶策略和价值函数都把目标当输入,一个模型学会到达多种目标的强化学习。
普通强化学习通常只学一个固定任务;目标条件强化学习把策略写成 π(a|s,g),同一个网络根据不同目标 g 执行不同任务,奖励往往就是「有没有到达目标」。代表性工作是 DeepMind 2015 年的通用价值函数近似器(UVFA),把价值函数扩展成 V(s,g),能泛化到训练时没见过的目标。它最大的难点是奖励稀疏:大部分尝试都到不了目标,拿不到学习信号,所以常和后见之明经验回放(把没成功的轨迹改标成到达了实际位置)一起用。目标可以是坐标、图像或语言,机器人抓取、推物、导航都常写成这种形式,分层强化学习里的底层策略也常是目标条件的。
例子机械臂推方块:目标是桌上任意一个位置,只有方块被推到目标附近才算成功,同一个策略学会把方块推到不同位置。
- 相关
- 目标条件策略、后见之明经验回放、稀疏奖励、价值函数、目标条件模仿学习、分层强化学习
- 来源
- Goal-Conditioned Reinforcement Learning: Problems and Solutions (IJCAI 2022 survey)
Universal Value Function Approximators (ICML 2015)