具身智能新手名词表English

逆强化学习

Inverse Reinforcement LearningIRL常用

从专家的示范行为反推出它背后在优化的奖励函数。

逆强化学习把强化学习倒过来用:强化学习是给定奖励函数(给行为打分的规则)去学策略,逆强化学习则是观察专家示范,反推专家在优化什么奖励。Stuart Russell 在 1998 年提出这个问题,Andrew Ng 与 Russell 在 2000 年给出第一批算法,Abbeel 与 Ng 在 2004 年把它用于「学徒学习」:先推出奖励,再用强化学习求策略。它的价值在于很多任务的奖励难以手写,而学到的奖励比直接照抄动作更容易迁移到新环境。难点是同一段行为可以用很多种奖励解释,需要最大熵等额外假设来消除歧义。后来的生成对抗模仿学习(GAIL)、对抗运动先验(AMP)都延续了这条思路。

例子Abbeel、Coates 与 Ng 用学徒学习让无人直升机从人类飞手的示范中学会翻滚、筋斗、自转着陆等特技动作,而不是靠人手写奖励函数。

也叫
反向强化学习、逆向强化学习
相关
强化学习、奖励函数、模仿学习、生成对抗模仿学习、对抗运动先验、行为克隆
来源
Apprenticeship learning(Wikipedia,含 Inverse reinforcement learning 一节)
A Survey of Inverse Reinforcement Learning: Challenges, Methods and Progress (arXiv 1806.06877)

在完整名词表里查看 →