具身智能新手名词表English

深度确定性策略梯度

Deep Deterministic Policy GradientDDPG进阶

把 DQN 扩展到连续动作的演员-评论家算法,策略直接输出一个确定动作。

DDPG 由 DeepMind 的 Lillicrap 等人在 2015 年提出(ICLR 2016),理论基础是 Silver 等人 2014 年的确定性策略梯度(DPG)。DQN 只能处理离散动作,因为要在所有动作里找 Q 值最大的那个,而机械臂关节角这类连续动作没法逐一枚举。DDPG 用两个网络:评论家学 Q 函数,演员(策略网络)直接输出一个确定动作,并沿着「让 Q 值变大」的梯度方向更新。它是异策略算法,沿用 DQN 的经验回放和目标网络,训练时在动作上加噪声来探索。原论文在 20 多个仿真物理任务上验证,其中不少任务可以直接从像素学习。DDPG 对超参数敏感、容易高估 Q 值,后来的 TD3(双延迟 DDPG)针对高估做了改进,SAC 等算法在实践中也更常用。

例子OpenAI 2017 年的后见之明经验回放(HER)实验,就是用 DDPG 在仿真中训练 7 自由度 Fetch 机械臂完成推物、滑动、抓取放置任务,并把策略部署到了真实机器人上。

相关
双延迟深度确定性策略梯度、软演员-评论家、深度 Q 网络、确定性策略 / 随机策略、异策略、后见之明经验回放
来源
Continuous control with deep reinforcement learning (arXiv 1509.02971)
OpenAI Spinning Up: Deep Deterministic Policy Gradient
Hindsight Experience Replay (arXiv 1707.01495)

在完整名词表里查看 →