并行解码
Parallel Decoding进阶一次前向同时输出整段序列,而不是像自回归那样逐个 token 生成。
并行解码是相对自回归解码而言的:自回归模型每次只预测下一个 token,输出 N 个 token 要跑 N 次前向;并行解码让模型一次前向同时预测所有位置。它最早在机器翻译里以「非自回归翻译」被系统研究(Gu 等,2017),延迟降了约一个数量级,代价是位置之间的依赖建模变弱、质量略降。VLA 里这个问题很突出:OpenVLA 把每个动作维度离散成一个 token 逐个生成,7 维动作要跑 7 次,做动作分块后更慢。OpenVLA-OFT 改为输入一组空的动作占位嵌入,把因果注意力掩码换成双向注意力,一次前向输出整段动作块。离散扩散等方法也属于并行或少步并行解码。
例子OpenVLA-OFT 在 LIBERO 上用并行解码加动作分块(每次输出 8 步、每步 7 维动作),动作吞吐从 OpenVLA 的 4.2 Hz 提到 108.8 Hz,约快 26 倍。
- 也叫
- 非自回归解码、Non-autoregressive Decoding
- 相关
- 自回归解码、动作分块、OpenVLA-OFT、因果注意力、离散扩散、投机解码
- 来源
- Non-Autoregressive Neural Machine Translation (arXiv:1711.02281)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT, arXiv:2502.19645)