EgoVLA
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos进阶用第一人称人类视频预训练的 VLA,把人手动作换算成人形机器人动作。
EgoVLA 是 UC 圣地亚哥联合 UIUC、MIT、英伟达等于 2025 年 7 月发布的论文。动机是真机数据离不开机器人硬件、规模有限,而人类第一人称视频量大、场景丰富。它以 NVILA-2B 视觉语言模型为骨干,先在约 50 万个人类视频图像-动作对上学习预测人的手腕位姿和 MANO 手部参数(一种参数化人手模型);再把机器人手也换算到同一个 MANO 动作空间,用少量机器人演示微调。部署时手腕位姿经逆运动学转成手臂关节角,手指由一个小 MLP 映射到灵巧手关节。
例子在作者基于 Isaac Lab 搭的 Ego Humanoid Manipulation Benchmark 里(仿真中的宇树 H1 加因时灵巧手,共 12 个任务),用人类视频预训练过的 EgoVLA 明显好于只用机器人数据训练的基线,长程任务和精细操作任务提升尤其大。
- 相关
- 第一人称视频、人类视频预训练、MANO 手部模型、动作重定向、视觉-语言-动作模型、EgoScale
- 来源
- EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos (arXiv 2507.12440)
EgoVLA 项目页 - 信息截至
- 2025-07