具身智能新手名词表English

决策 Transformer

Decision Transformer: Reinforcement Learning via Sequence ModelingDT进阶

把强化学习当序列建模:给定想要的回报,用 GPT 式模型逐步预测动作。

伯克利、Facebook AI Research 与 Google Brain 的 Lili Chen、Kevin Lu 等 2021 年 6 月提出,发表于 NeurIPS 2021。它不拟合价值函数、也不算策略梯度,而是把轨迹写成「剩余回报(return-to-go,从这一步到结束还想拿多少奖励)、状态、动作」交替排列的 token 序列,用带因果掩码的 GPT 式 Transformer 做监督学习,预测下一个动作。测试时先设定目标回报,每走一步把拿到的奖励从中扣掉。它只用离线数据,在 Atari、OpenAI Gym 和 Key-to-Door 任务上达到或超过当时的无模型离线强化学习方法,让「用序列模型做决策」成为主流思路之一。

例子在 Atari 游戏中设定一个较高的目标回报,模型读入最近若干帧画面、历史动作和剩余回报,输出下一步按键;每得一次分就把剩余回报相应减少,再生成下一步。

也叫
Decision Transformer
相关
离线强化学习、Transformer、回报条件化、因果注意力、Decision Diffuser(决策扩散器)、Gato
来源
Decision Transformer (arXiv:2106.01345)
Decision Transformer 项目主页
信息截至
2021-06

在完整名词表里查看 →