具身智能新手名词表English

蚂蚁灵波 LingBot-VA

LingBot-VA (Causal World Modeling for Robot Control, Robbyant)进阶

蚂蚁灵波开源的视频-动作世界模型,边预测未来画面边输出机器人动作。

LingBot-VA 是蚂蚁集团旗下具身智能公司蚂蚁灵波(Robbyant)2026 年 1 月开源的机器人控制模型,论文题为 Causal World Modeling for Robot Control,收录于 RSS 2026。它走「世界动作模型」路线:用自回归扩散一段段往后生成,在同一序列里交替预测未来视频帧和动作;视觉与动作 token 共享潜在空间,由混合 Transformer(MoT)处理。执行时每段都用真实观测纠偏(闭环推演),并让动作预测与电机执行异步并行以降低延迟。视频编码沿用通义万相 Wan2.2 的 VAE。2026 年 7 月推出 2.0 版,改为从零因果预训练并采用稀疏 MoE 骨干。

例子官方报告在 RoboTwin 2.0 的 50 个双臂仿真任务上,简单/困难设置成功率分别为 92.9% 和 91.6%,LIBERO 平均 98.5%。

也叫
LingBot-VA、LingBot-VA 2.0
相关
世界动作模型、世界模型、混合 Transformer 架构、异步推理、自回归视频生成、蚂蚁灵波
来源
arXiv 2601.21998: Causal World Modeling for Robot Control
GitHub: Robbyant/lingbot-va
arXiv 2607.08639: Native Video-Action Pretraining for Generalizable Robot Control (LingBot-VA 2.0)
信息截至
2026-07

在完整名词表里查看 →