千问 Qwen-Robot 系列
Qwen-Robot series (Qwen-RobotManip / Qwen-RobotNav / Qwen-RobotWorld, Alibaba)常用阿里通义千问团队 2026 年发布的操作、导航、世界模型三件套具身模型。
Qwen-Robot 是阿里通义千问团队 2026 年 6 月集中发布的一组具身模型,都建在 Qwen 视觉语言模型之上,三个成员分工不同。Qwen-RobotManip 是操作用的 VLA,在 Qwen-VL 骨干后接流匹配 DiT 动作头,只用开源机器人数据和由人手视频合成的机器人轨迹,攒出约 3.81 万小时预训练数据,重点是先把不同本体的数据对齐再放大规模;Qwen-RobotNav 用统一的路点预测接口同时做视觉语言导航、物体搜索、目标跟踪和自动驾驶;Qwen-RobotWorld 是语言条件的视频世界模型,用来合成训练数据和评测策略。官方仓库写明目前没有开放 Manip 和 Nav 权重的计划。
例子Qwen-RobotNav 零样本部署在宇树 Go2 四足上,用 Jetson Thor 推理,约 5 Hz 地在没见过的环境里按语言指令导航。
- 也叫
- Qwen-RobotManip、Qwen-RobotNav、Qwen-RobotWorld
- 相关
- 通义千问 Qwen-VL、视觉-语言-动作模型、世界模型、视觉语言导航、流匹配、跨本体
- 来源
- Qwen-RobotManip Technical Report (arXiv:2606.17846)
QwenLM/Qwen-RobotNav GitHub 仓库
Qwen-RobotWorld Technical Report (arXiv:2606.17030) - 信息截至
- 2026-09