北京人形 XR-1
XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion RepresentationsXR-1进阶北京人形用「视觉-运动统一编码」做跨本体预训练的 VLA 基础模型
北京人形机器人创新中心 2025 年 11 月发布(部分作者同时任职于北京大学、北京航空航天大学),论文被 ICML 2026 接收为口头报告。核心是 UVMC(统一视觉-运动编码):用双分支的向量量化变分自编码器,把「画面怎么变」和「机器人怎么动」编码进同一本离散码本,并用对齐损失让两者一致。训练分三步:先自监督学 UVMC,再在约 1.64 亿帧跨本体数据(Open-X、自有 XR-D、RoboMIND 和 Ego4D 人类视频)上预训练,最后针对具体任务微调。主模型沿用 π0 架构,另有基于 Florence-2 的轻量版 XR-1-Light。代码和权重已在 GitHub、Hugging Face、魔搭开源。
例子作者在天工 1.0/2.0、单臂与双臂 UR5e、双臂 Franka、松灵 Cobot Magic 等 6 种本体上做了 1.4 万次以上真机测试,覆盖 120 多个操作任务。
- 也叫
- X-Humanoid XR-1、XR-1-Light
- 相关
- 跨本体、向量量化变分自编码器、潜在动作、北京人形机器人创新中心、天工、π0
- 来源
- XR-1 (arXiv:2511.02776)
XR-1 论文 HTML 版 - 信息截至
- 2026-09