具身智能新手名词表English

保守 Q 学习

Conservative Q-LearningCQL进阶

刻意压低数据集外动作的 Q 值,让离线强化学习不被虚高的估计带偏。

CQL 由 Aviral Kumar、Aurick Zhou、George Tucker、Sergey Levine 在 2020 年提出(NeurIPS 2020),是离线强化学习(只用固定数据集、不再和环境交互)的代表算法。普通 Q 学习直接拿来离线训练会失败:策略倾向于挑数据里没出现过的动作,这些动作的 Q 值(估计某状态下做某动作的长期回报)没被数据纠正过,常被高估,策略就朝这些虚高的方向跑。CQL 在标准贝尔曼误差之外加一个正则项:压低策略可能选的动作的 Q 值,同时抬高数据集中实际动作的 Q 值,使学到的价值成为真实价值的下界。它容易接到现有的深度 Q 学习或演员-评论家算法上,论文报告最终回报常为已有离线方法的 2–5 倍。Cal-QL 等后续方法都在它的基础上改进。

例子谷歌 DeepMind 2023 年的 Q-Transformer 用 Transformer 表示机器人多任务 Q 函数,在人类演示加自主采集的真实机器人离线数据上训练,用的就是一个改造版的 CQL 保守正则项。

相关
离线强化学习、校准 Q 学习、Q 函数、Q 值高估、外推误差、Q-Transformer
来源
Conservative Q-Learning for Offline Reinforcement Learning (arXiv 2006.04779)
NeurIPS 2020 Proceedings: Conservative Q-Learning for Offline Reinforcement Learning
Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions (arXiv 2309.10150)

在完整名词表里查看 →