Dita
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy进阶用同一个 Transformer 直接对整段动作去噪的开源通用 VLA 策略,约 3.3 亿参数。
Dita 是上海人工智能实验室、浙江大学、商汤、港中文、北大、清华等机构的研究者于 2025 年 3 月发布的通用机器人策略,收录于 ICCV 2025。不少扩散式 VLA 在大模型后面接一个小的扩散动作头(专门把噪声变成动作的小网络),动作只能看到压缩后的特征。Dita 把语言 token、历史图像的视觉 token 和带噪声的动作 token 拼进同一个因果 Transformer 里一起去噪(上下文条件化),让动作直接对齐原始视觉细节,更好地刻画动作增量和环境差异。模型在 Open X-Embodiment 跨本体数据上预训练,总参数约 3.34 亿(可训练约 2.21 亿),在 SimplerEnv、LIBERO、CALVIN、ManiSkill2 等仿真基准上达到或接近当时最好水平。代码开源,定位是轻量、易复现的扩散 VLA 基线。
例子换到一台新的真机和新场景时,只用每个任务 10 条示范、单个第三视角相机微调,Dita 就能完成多步长程任务,并能应对背景、干扰物摆放和光照的变化。
- 也叫
- RoboDita
- 相关
- 扩散 Transformer、视觉-语言-动作模型、扩散动作头、Open X-Embodiment 数据集、因果注意力、LIBERO
- 来源
- Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy (arXiv 2503.19757)
Dita 项目主页 - 信息截至
- 2025-09