具身智能新手名词表English

北京人形 XR-1

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion RepresentationsXR-1进阶

北京人形用「视觉-运动统一编码」做跨本体预训练的 VLA 基础模型

北京人形机器人创新中心 2025 年 11 月发布(部分作者同时任职于北京大学、北京航空航天大学),论文被 ICML 2026 接收为口头报告。核心是 UVMC(统一视觉-运动编码):用双分支的向量量化变分自编码器,把「画面怎么变」和「机器人怎么动」编码进同一本离散码本,并用对齐损失让两者一致。训练分三步:先自监督学 UVMC,再在约 1.64 亿帧跨本体数据(Open-X、自有 XR-D、RoboMIND 和 Ego4D 人类视频)上预训练,最后针对具体任务微调。主模型沿用 π0 架构,另有基于 Florence-2 的轻量版 XR-1-Light。代码和权重已在 GitHub、Hugging Face、魔搭开源。

例子作者在天工 1.0/2.0、单臂与双臂 UR5e、双臂 Franka、松灵 Cobot Magic 等 6 种本体上做了 1.4 万次以上真机测试,覆盖 120 多个操作任务。

也叫
X-Humanoid XR-1、XR-1-Light
相关
跨本体、向量量化变分自编码器、潜在动作、北京人形机器人创新中心、天工、π0
来源
XR-1 (arXiv:2511.02776)
XR-1 论文 HTML 版
信息截至
2026-09

在完整名词表里查看 →