具身智能新手名词表English

扩散 Transformer

Diffusion TransformerDiT常用

用 Transformer 取代 U-Net 作为扩散模型去噪网络的架构。

扩散 Transformer 由 William Peebles 和谢赛宁在 2022 年提出(ICCV 2023 发表)。此前扩散模型的去噪网络大多是 U-Net(一种卷积编码-解码网络),DiT 换成了标准 Transformer:先把 VAE 压缩后的潜在图像切成小块(patch)当作 token,再用自适应层归一化(adaLN)把去噪时间步、类别等条件注入每一层。论文发现计算量越大,生成质量越好,缩放规律清晰;最大的 DiT-XL/2 在 ImageNet 256×256 上 FID 达到 2.27。此后视频生成模型大量采用这类结构。机器人领域也用它生成动作:RDT-1B(Robotics Diffusion Transformer)用它做双臂操作,GR00T N1 的动作模块同样是 DiT 的变体。

例子RDT-1B 是一个约 12 亿参数的扩散 Transformer,以语言指令和相机图像为条件,去噪生成双臂机器人接下来一段动作。

也叫
Diffusion Transformers
相关
扩散模型、Transformer、U-Net、自适应层归一化、潜在扩散模型、RDT-1B
来源
Scalable Diffusion Models with Transformers (arXiv 2212.09748)
DiT project page (William Peebles)
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation (arXiv 2410.07864)

在完整名词表里查看 →