通义万相
Wan (Alibaba open video generation model)进阶阿里通义团队的视频生成模型,Wan2.1/2.2 开放权重,常用作世界模型底座。
通义万相是阿里巴巴通义团队的视觉生成模型系列,英文名 Wan。2025 年 2 月底开源的 Wan2.1 有 1.3B 和 14B 两种规模,Apache 2.0 许可,基于扩散 Transformer 并用流匹配训练,自带 3D 因果视频 VAE(Wan-VAE),文本编码器是 umT5,支持文生视频、图生视频和视频编辑。2025 年 7 月的 Wan2.2 改成两个约 14B 专家的混合专家结构(高噪声专家定布局、低噪声专家补细节,每步只激活一个),另有 5B 的文图生视频模型,之后又陆续放出音频驱动(S2V)、角色动画(Animate)等衍生模型。它已从海量视频里学到不少物体运动规律,又开放权重,研究者常拿它做世界模型或世界动作模型的起点。截至 2026 年 9 月,开放权重的主线仍是 Wan2.2 系列。
例子英伟达的 DreamZero 以 Wan2.1-I2V-14B-480P 图生视频模型为骨干,在机器人数据上继续训练,让模型同时生成未来画面和对应动作,作为世界动作模型直接控制机器人。
- 也叫
- Wan2.1、Wan2.2、万相、Tongyi Wanxiang
- 相关
- 视频生成模型、扩散 Transformer、视频分词器、流匹配、混合专家模型、DreamZero
- 来源
- Wan: Open and Advanced Large-Scale Video Generative Models (arXiv:2503.20314)
Wan-Video/Wan2.2 (GitHub)
World Action Models are Zero-shot Policies (DreamZero, arXiv:2602.15922) - 信息截至
- 2026-09