具身智能新手名词表English

DexVLA

DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control进阶

美的等提出的 VLA:视觉语言模型接上约十亿参数的扩散动作专家,适配多种本体。

DexVLA 由美的集团、华东师范大学、上海大学的研究者于 2025 年 2 月发布,发表于 CoRL 2025。它把视觉语言模型 Qwen2-VL(20 亿参数)和一个可插拔的扩散动作专家拼在一起:VLM 负责看图和理解指令,动作专家基于 ScaleDP 架构扩到约 10 亿参数,用多个输出头适配不同机器人,专门生成连续动作。训练按「本体课程」分三阶段:先用约 100 小时跨本体数据单独预训练动作专家;再接上 VLM、对齐到具体本体;最后用标注了子步骤的数据做任务后训练。它想解决早期 VLA 动作表示弱、训练贵、换机器人难的问题,和 π0 同属「VLM + 动作专家」路线。

例子论文在 Franka 单臂(夹爪或灵巧手)、双臂 UR5e 和松灵双臂上测试;不做任务专门适配就能叠衬衫(得分 0.92),在完整叠衣任务上得分 0.4,同条件下 π0 为 0.2。

相关
视觉-语言-动作模型、动作专家、扩散动作头、跨本体、π0、通义千问 Qwen-VL
来源
DexVLA (arXiv:2502.05855)
DexVLA 论文 HTML 全文 v3
信息截至
2025-08

在完整名词表里查看 →