具身智能新手名词表English

DexGraspVLA

DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping进阶

北大与灵初智能的分层灵巧手抓取框架:大模型负责规划,扩散策略负责出动作。

DexGraspVLA 由北京大学人工智能研究院、北大-灵初智能(PsiBot)联合实验室等团队于 2025 年 2 月发布,后被 AAAI 2026 收为口头报告。它分两层:上层用现成的视觉语言模型(如 Qwen-VL)理解指令、在画面中框出目标物体;下层是扩散控制器,用 SAM 和 Cutie 持续跟踪目标掩码,用冻结的 DINOv2 提取视觉特征,再由扩散 Transformer 输出机械臂和灵巧手动作。核心思路是先借基础模型把多变的图像和语言转成较稳定的表示,缩小训练与测试场景的差异,这样只靠少量人类演示做模仿学习也能泛化到大量新场景。

例子用 36 种家居物体采集 2094 条杂乱场景抓取演示训练后,在 360 个新物体、6 种新背景、3 种新光照组合出的约 1287 种场景里零样本测试,综合成功率 90.8%(睿尔曼 7 自由度机械臂 + 灵初 6 自由度 G0-R 灵巧手)。

相关
视觉-语言-动作模型、灵巧操作、分层架构、扩散策略、DINOv2、灵初智能
来源
DexGraspVLA (arXiv:2502.20900)
DexGraspVLA 项目主页
信息截至
2025-11

在完整名词表里查看 →