扩散 Transformer
Diffusion TransformerDiT常用用 Transformer 取代 U-Net 作为扩散模型去噪网络的架构。
扩散 Transformer 由 William Peebles 和谢赛宁在 2022 年提出(ICCV 2023 发表)。此前扩散模型的去噪网络大多是 U-Net(一种卷积编码-解码网络),DiT 换成了标准 Transformer:先把 VAE 压缩后的潜在图像切成小块(patch)当作 token,再用自适应层归一化(adaLN)把去噪时间步、类别等条件注入每一层。论文发现计算量越大,生成质量越好,缩放规律清晰;最大的 DiT-XL/2 在 ImageNet 256×256 上 FID 达到 2.27。此后视频生成模型大量采用这类结构。机器人领域也用它生成动作:RDT-1B(Robotics Diffusion Transformer)用它做双臂操作,GR00T N1 的动作模块同样是 DiT 的变体。
例子RDT-1B 是一个约 12 亿参数的扩散 Transformer,以语言指令和相机图像为条件,去噪生成双臂机器人接下来一段动作。
- 也叫
- Diffusion Transformers
- 相关
- 扩散模型、Transformer、U-Net、自适应层归一化、潜在扩散模型、RDT-1B
- 来源
- Scalable Diffusion Models with Transformers (arXiv 2212.09748)
DiT project page (William Peebles)
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation (arXiv 2410.07864)