WorldVLA
WorldVLA: Towards Autoregressive Action World Model进阶阿里达摩院把 VLA 和世界模型合进一个自回归模型,既出动作又预测下一帧
阿里达摩院 2025 年 6 月发布的工作,基于 Chameleon 这类图文统一的自回归模型,把图像、文字、动作都转成 token 放进同一个 Transformer。同一模型兼任两个角色:作为动作模型,根据画面和指令生成动作;作为世界模型,根据当前画面和动作预测下一帧画面。作者发现两者联合训练能互相提升。另一个发现是自回归地连续生成多个动作时,前面动作的误差会传给后面,于是提出一种注意力掩码,生成当前动作时屏蔽之前的动作、只看图像和指令,在 LIBERO 上明显改善多步动作生成。2025 年 11 月项目升级为 RynnVLA-002。
例子在 LIBERO 仿真任务中,同一个模型既能输出机械臂下一段动作,也能在给定动作后生成接下来的画面帧。
- 相关
- 世界动作模型、视觉-语言-动作模型、自回归解码、注意力掩码、达摩院 RynnVLA-002、阿里达摩院
- 来源
- WorldVLA (arXiv:2506.21539)
alibaba-damo-academy/WorldVLA (GitHub) - 信息截至
- 2025-11