千寻 Spirit v1.5
Spirit v1.5 (Spirit AI)进阶千寻智能开源的 VLA 基础模型,主张用多样、不刻意整理的数据做预训练
千寻智能(Spirit AI)2026 年 1 月发布并开源的视觉-语言-动作(VLA)模型,公开了推理代码(MIT 协议)、基座权重和一个微调权重(Apache 2.0 协议),4 月又放出微调代码。结构是常见的「VLM + 动作头」:以通义千问 Qwen3-VL-4B 作视觉语言骨干,接一个扩散 Transformer(DiT)动作头生成连续动作。它的主要观点写在技术博客标题里——「干净数据是好机器人基础模型的敌人」:不给采集员写固定脚本、不刻意摆放物体,只让他们带着一个目标自由完成一连串真实任务,数据里自然包含失败重试和任务切换。团队称这样做让人均有效采集时长提高了 200%。发布时它在 RoboChallenge 的 Table30 真机榜单上排名第一。
例子采集员给自己定一个目标「今天用机器人调一杯饮料」,从备料、发现比例不对再调整到加减配料,整段连续操作都录下来用于预训练。
- 也叫
- Spirit-v1.5、千寻智能 Spirit v1.5
- 相关
- 千寻智能、视觉-语言-动作模型、RoboChallenge、通义千问 Qwen-VL、扩散 Transformer、数据多样性
- 来源
- Spirit-v1.5: Clean Data Is the Enemy of Great Robot Foundation Models (Spirit AI Blog)
Spirit-AI-Team/spirit-v1.5 (GitHub)
Spirit-AI-robotics/Spirit-v1.5 (Hugging Face) - 信息截至
- 2026-04