具身智能新手名词表English

智在无界 Being-H0

Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos (BeingBeyond)进阶

智在无界用大规模人手操作视频预训练的灵巧操作 VLA 模型系列。

Being-H0 是北京大学、中国人民大学与具身公司智在无界(BeingBeyond)2025 年 7 月发布的视觉-语言-动作模型,后被 ICML 2026 接收。思路是把人手当作通用操作器:先在人手操作数据上预训练,用分部位的动作分词器把手腕、手指动作压成 token,再做 3D 空间对齐,最后用少量机器人数据后训练,迁移到灵巧手上。配套数据集 UniHand 汇集动捕、VR 和普通视频,约 1100 小时、1.65 亿条指令样本。2026 年 1 月的 Being-H0.5 把数据扩到 3.5 万多小时、覆盖 30 种本体,主打跨本体;4 月的 Being-H0.7 改为隐空间世界-动作模型。

例子真机实验中,研究者把 Being-H0 后训练到装有因时六自由度灵巧手的 Franka 机械臂上做灵巧操作任务。

也叫
Being-H0.5、Being-H0.7、Being-H 系列
相关
人类视频预训练、UniHand 数据集、视觉-语言-动作模型、灵巧操作、跨本体、智在无界
来源
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos (arXiv 2507.15597)
Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization (arXiv 2601.12993)
BeingBeyond/Being-H0 GitHub
信息截至
2026-05

在完整名词表里查看 →