具身智能新手名词表English

离线强化学习

Offline Reinforcement LearningOffline RL常用

只用事先收集好的固定数据集训练策略,训练中不再与环境交互。

早期也叫批量强化学习。Sergey Levine 等人 2020 年的综述将其定义为:只利用预先收集的数据、不做额外在线采集的强化学习。数据可以来自人类遥操作、旧策略或部署日志,训练全程不碰真实环境,适合试错昂贵或危险的机器人、医疗等场景。和模仿学习不同,它利用奖励信号,有机会从好坏混杂的次优数据里学出比数据本身更好的策略。核心难点是分布偏移:策略一旦选了数据里没出现过的动作,Q 函数对它的估值往往虚高(外推误差),错误还会逐步累积。保守 Q 学习(CQL)、隐式 Q 学习(IQL)和各类策略约束方法都是为此设计的。

例子保守 Q 学习(CQL)在普通 Q 学习上加一个正则项,故意压低数据集外动作的 Q 值,让学到的价值成为真实价值的下界,避免策略被虚高的估值带偏。

也叫
批量强化学习、Batch RL、Batch Reinforcement Learning
相关
在线强化学习、异策略、保守 Q 学习、隐式 Q 学习、离线到在线强化学习、D4RL 离线强化学习基准
来源
Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (Levine et al., 2020)
Conservative Q-Learning for Offline Reinforcement Learning

在完整名词表里查看 →