蚂蚁灵波 LingBot-VA
LingBot-VA (Causal World Modeling for Robot Control, Robbyant)进阶蚂蚁灵波开源的视频-动作世界模型,边预测未来画面边输出机器人动作。
LingBot-VA 是蚂蚁集团旗下具身智能公司蚂蚁灵波(Robbyant)2026 年 1 月开源的机器人控制模型,论文题为 Causal World Modeling for Robot Control,收录于 RSS 2026。它走「世界动作模型」路线:用自回归扩散一段段往后生成,在同一序列里交替预测未来视频帧和动作;视觉与动作 token 共享潜在空间,由混合 Transformer(MoT)处理。执行时每段都用真实观测纠偏(闭环推演),并让动作预测与电机执行异步并行以降低延迟。视频编码沿用通义万相 Wan2.2 的 VAE。2026 年 7 月推出 2.0 版,改为从零因果预训练并采用稀疏 MoE 骨干。
例子官方报告在 RoboTwin 2.0 的 50 个双臂仿真任务上,简单/困难设置成功率分别为 92.9% 和 91.6%,LIBERO 平均 98.5%。
- 也叫
- LingBot-VA、LingBot-VA 2.0
- 相关
- 世界动作模型、世界模型、混合 Transformer 架构、异步推理、自回归视频生成、蚂蚁灵波
- 来源
- arXiv 2601.21998: Causal World Modeling for Robot Control
GitHub: Robbyant/lingbot-va
arXiv 2607.08639: Native Video-Action Pretraining for Generalizable Robot Control (LingBot-VA 2.0) - 信息截至
- 2026-07