深度 Q 网络
Deep Q-NetworkDQN常用用深度神经网络估计每个动作长期价值(Q 值)的强化学习算法。
DQN 由 DeepMind 的 Mnih 等人提出:2013 年预印本在 7 个 Atari 游戏上验证,2015 年《自然》论文扩展到 49 个游戏,只看屏幕像素和得分,整体达到与职业人类测试员相当的水平。它把 Q 学习(学习「在某状态做某动作后能拿到多少总回报」)里的表格换成卷积神经网络,并用经验回放(存下历史经验随机抽取训练)和目标网络(定期同步的副本,用来算学习目标)稳住训练,开启了深度强化学习热潮。它要在所有动作里取 Q 值最大者,适合离散动作;机械臂的连续动作多改用 DDPG、SAC 等。
例子谷歌 2018 年的 QT-Opt 把 Q 学习搬到真实机械臂抓取:累计 58 万多次真机抓取尝试,训出的闭环视觉抓取策略在没见过的物体上成功率达 96%。
- 也叫
- Deep Q-Learning、深度 Q 学习
- 相关
- Q 学习、Q 函数、经验回放、目标网络、深度确定性策略梯度、QT-Opt
- 来源
- Playing Atari with Deep Reinforcement Learning (arXiv 1312.5602)
Google DeepMind: Deep Reinforcement Learning
QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation (arXiv 1806.10293)