具身智能新手名词表English

隐式 Q 学习

Implicit Q-LearningIQL进阶

只用数据集里已有的动作估值、从不查询没见过动作的离线强化学习算法。

伯克利 Kostrikov、Nair、Levine 2021 年提出。离线强化学习只用固定数据集训练,难点是 Q 函数(动作价值)会给数据里没出现过的动作乱估高分(外推误差),策略一追这些动作就崩。IQL 的办法是完全不评估新动作:先用期望分位数回归(expectile regression,一种偏向高分位的回归)从数据集动作中拟合一个接近最好动作价值的状态价值 V,再用它做 Q 的时序差分更新,最后用优势加权回归(按优势大小给行为克隆加权)抽取策略。它实现简单,在 D4RL 离线基准上表现强,也适合先离线训练再在线微调,常被机器人离线强化学习工作当作基线。

例子拿一批混杂好坏操作的机械臂历史数据,不再和环境交互,用 IQL 训出一个比数据里平均水平更好的策略。

相关
离线强化学习、优势加权回归、保守 Q 学习、外推误差、离线到在线强化学习、Q 函数
来源
Offline Reinforcement Learning with Implicit Q-Learning (arXiv 2110.06169)

在完整名词表里查看 →