离散扩散
Discrete Diffusion进阶在文字 token 这类离散符号上做加噪和去噪的扩散模型。
普通扩散模型给连续数据(像素、动作数值)加高斯噪声,而文本、离散动作 token 这类数据没法直接加高斯噪声。离散扩散改用「状态转移」加噪:每一步按转移矩阵把 token 随机换成别的值,或换成一个特殊的 [MASK] 符号。2021 年谷歌 Austin 等人在 D3PM 中系统提出这一框架,并指出用「吸收态」(变成 MASK 后不再改变)加噪时,它和掩码语言模型、自回归模型联系紧密。此后掩码扩散成为主流,如 NeurIPS 2024 的 MDLM 把训练目标化简成一组掩码语言建模损失的混合。它是扩散语言模型和离散扩散类 VLA 的理论基础。
例子Discrete Diffusion VLA 把动作块离散成 token,先全部遮住,再按置信度由易到难逐步揭开,对没把握的位置二次遮住重算,在 LIBERO 上报告 96.4% 的平均成功率。
- 也叫
- 掩码扩散、Masked Diffusion、离散去噪扩散
- 相关
- 扩散模型、扩散语言模型、并行解码、Discrete Diffusion VLA(离散扩散 VLA)、去噪扩散概率模型、分箱离散化
- 来源
- Structured Denoising Diffusion Models in Discrete State-Spaces (D3PM, arXiv:2107.03006)
Simple and Effective Masked Diffusion Language Models (MDLM, arXiv:2406.07524)
Discrete Diffusion VLA (arXiv:2508.20072)