自回归解码
Autoregressive DecodingAR入门必知一个接一个地生成输出,每一步都以前面已生成的内容为条件。
自回归解码是 GPT 等大语言模型生成文字的方式:每次只预测下一个 token,接到输入末尾再预测下一个,直到结束。用到机器人上,要先把连续动作离散成 token。Google DeepMind 2023 年的 RT-2 把动作写成一串数字 token,让视觉语言模型像输出文字一样输出;OpenVLA 把每个动作维度分成 256 个区间,占用 Llama 词表里最少用的 256 个 token。好处是直接复用语言模型的结构和训练方法;缺点是要一个个生成,速度慢,OpenVLA 在一张 RTX 4090 上约 6Hz。所以后来有了 FAST 等压缩动作的分词器、并行解码,以及改用扩散或流匹配生成动作的方案。
例子RT-2 的一个动作输出就是一串 token,形如「1 128 91 241 5 101 127 217」,依次对应是否结束任务、末端位移和旋转、夹爪开合等维度的离散值,再换算回连续数值发给机器人。
- 也叫
- 自回归、自回归模型、Autoregressive Model、逐 token 生成
- 相关
- 下一个 token 预测、动作分词器、分箱离散化、并行解码、RT-2、OpenVLA
- 来源
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(项目页)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)