具身智能新手名词表English

银河通用 GraspVLA

GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data (Galbot)进阶

银河通用等 2025 年发布的抓取大模型,主要靠十亿帧仿真合成数据预训练。

GraspVLA 由银河通用机器人(Galbot)联合北京大学王鹤团队、香港大学、北京智源人工智能研究院提出,2025 年 5 月发布,发表于 CoRL 2025。真机数据贵且难扩大规模,团队改在仿真里大规模生成:SynGrasp-1B 数据集约 10 亿帧,覆盖 240 类、1 万多个物体模型,对初始姿态、摆放、背景、光照、材质做大量随机化(域随机化),并用照片级渲染缩小虚实差距。模型采用「渐进式动作生成」:先自回归地预测目标物体的 2D 检测框,再预测抓取位姿,最后用流匹配生成动作块;训练时把合成数据和互联网图文数据一起用,让它能按开放词汇指令抓没见过类别的物体。数据集和模型权重已开源。

例子只用合成数据预训练后,模型可以零样本抓取真实桌面上没见过的物体;若某个场景要求特定抓法,再用少量真机示范做少样本微调即可。

也叫
GraspVLA
相关
SynGrasp-1B 数据集、合成数据、仿真到现实迁移、域随机化、流匹配、抓取
来源
GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data (arXiv 2505.03233)
GraspVLA 项目页
信息截至
2025-08

在完整名词表里查看 →