人类视频数据
Human Video Data入门必知拍人做事的视频,不用机器人就能采,用来教机器人理解和模仿操作。
人类视频数据指记录人完成各种操作的视频,包括第一人称视频、第三视角视频和网上的教学视频。最大优势是量大、便宜、场景多,采集不依赖昂贵的机器人。难点是视频里没有机器人能直接执行的动作标签,且人手和机器人手结构不同(本体差异)。常见用法:用手部姿态估计提取手腕和手指轨迹当动作;用潜在动作模型从前后帧学出抽象动作;或只用来预训练视觉表征和世界模型,再用少量真机数据微调。英伟达 2026 年的 EgoScale 用 2 万多小时带动作标注的第一人称视频预训练 VLA(视觉-语言-动作)模型,发现数据量与验证损失呈对数线性关系。
例子EgoScale 先在人类视频上预训练,再用少量对齐的人-机数据做中训练(预训练和任务微调之间的一段过渡训练),在 22 自由度灵巧手上的平均成功率比不做预训练高 54%。
- 也叫
- 人类数据、人手视频、Human Video
- 相关
- 第一人称视频、互联网视频数据、无动作标签视频、潜在动作预训练、本体差异、人类视频预训练
- 来源
- EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data (NVIDIA GEAR)
EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video (arXiv 2505.11709) - 信息截至
- 2026-02