决策 Transformer
Decision Transformer: Reinforcement Learning via Sequence ModelingDT进阶把强化学习当序列建模:给定想要的回报,用 GPT 式模型逐步预测动作。
伯克利、Facebook AI Research 与 Google Brain 的 Lili Chen、Kevin Lu 等 2021 年 6 月提出,发表于 NeurIPS 2021。它不拟合价值函数、也不算策略梯度,而是把轨迹写成「剩余回报(return-to-go,从这一步到结束还想拿多少奖励)、状态、动作」交替排列的 token 序列,用带因果掩码的 GPT 式 Transformer 做监督学习,预测下一个动作。测试时先设定目标回报,每走一步把拿到的奖励从中扣掉。它只用离线数据,在 Atari、OpenAI Gym 和 Key-to-Door 任务上达到或超过当时的无模型离线强化学习方法,让「用序列模型做决策」成为主流思路之一。
例子在 Atari 游戏中设定一个较高的目标回报,模型读入最近若干帧画面、历史动作和剩余回报,输出下一步按键;每得一次分就把剩余回报相应减少,再生成下一步。
- 也叫
- Decision Transformer
- 相关
- 离线强化学习、Transformer、回报条件化、因果注意力、Decision Diffuser(决策扩散器)、Gato
- 来源
- Decision Transformer (arXiv:2106.01345)
Decision Transformer 项目主页 - 信息截至
- 2021-06