具身智能新手名词表English

优势加权回归

Advantage-Weighted RegressionAWR进阶

按动作优势大小加权做模仿学习,优势越大越被模仿的强化学习算法。

AWR 由 Xue Bin Peng、Aviral Kumar、Grace Zhang、Sergey Levine 于 2019 年提出,目标是只用监督学习的回归步骤来做强化学习。每轮两步:先用回归拟合价值函数;再做加权的行为克隆,数据里每个动作按 exp(优势/β) 加权,优势高的动作被模仿得更多,β 是温度系数。它能利用经验回放里的旧数据(异策略),也能只靠固定数据集学习,几行代码即可实现,连续和离散动作都支持。这种「先估优势、再加权模仿」的策略提取方式被后续离线强化学习广泛采用,例如隐式 Q 学习(IQL)就用优势加权行为克隆提取最终策略。

例子隐式 Q 学习先从离线数据学出 Q 函数和价值函数,最后一步用优势加权行为克隆提取策略:优势为正且越大的数据动作,在模仿时权重越高。

也叫
优势加权行为克隆、Advantage-Weighted Behavioral Cloning
相关
优势函数、离线强化学习、隐式 Q 学习、行为克隆、策略约束、优势条件化
来源
Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning (arXiv 1910.00177)
Offline Reinforcement Learning with Implicit Q-Learning (arXiv 2110.06169)

在完整名词表里查看 →