具身智能新手名词表English

Discrete Diffusion VLA(离散扩散 VLA)

Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies进阶

用离散扩散解码 VLA 动作:动作 token 并行生成,先定有把握的再逐步补全。

Discrete Diffusion VLA 由香港大学、上海交通大学等机构的研究者(通讯作者穆尧、罗平)于 2025 年 8 月发布,已被 ICML 2026 接收。OpenVLA 这类离散 VLA 把动作分箱成 token 后自回归地逐个生成,慢且早期错误无法回改;π0 这类连续扩散头则要另接动作模块。它在 OpenVLA(Prismatic-7B,Llama 2 底座)上把动作块 token 改为双向注意力,用离散扩散(掩码预测)解码:初始全是掩码,每轮并行预测,先确定置信度高的 token,其余继续迭代,并把不够确定的已填 token 重新掩码修正。动作解码和语言模型共用一个 Transformer 与交叉熵目标,也更好保留了原 VLM 的能力。

例子在仿真基准上,它在 LIBERO 平均成功率 96.4%,SimplerEnv-Fractal 视觉匹配 71.2%,SimplerEnv-Bridge 54.2%;作者还在松灵 Cobot Magic 平台上做了真机验证。

也叫
离散扩散 VLA
相关
离散扩散、视觉-语言-动作模型、OpenVLA、分箱离散化、并行解码、自回归解码
来源
Discrete Diffusion VLA (arXiv:2508.20072)
Discrete Diffusion VLA 论文 HTML 全文 v4
信息截至
2026-05

在完整名词表里查看 →