人类视频机器人化(人→机视频转换)
Robotizing Human Videos / Human-to-Robot Video Translation常用把人手干活的视频改成「机器人在干」的画面,变成可用来训练的机器人数据。
人类视频多又便宜,但画面里是人手人臂,和机器人相机拍到的机械臂差别很大(视觉上的本体差异),直接拿来训策略效果差。人类视频机器人化就是用图像编辑或视频生成把人换成机器人:先估计手的 3D 位姿当动作标签,再把人手人臂抠掉、补全背景(inpainting),最后叠上按同一轨迹渲染出的机械臂或夹爪。斯坦福 Bohg 组 2025 年的 Phantom 只用这样改过的人类视频训出能直接上真机的策略;同组的 Masquerade 用 67.5 万帧编辑视频预训练视觉编码器。2025 年底的 H2R-Grounder 改用微调的视频扩散模型生成机器人画面,不需要人机成对数据。
例子Phantom 录下人用手把桌上多个物体扫拢的视频,抠掉人手后叠上渲染的机械臂,直接用这些改过的视频训练策略并部署到真机。
- 也叫
- 人→机视频转换、人机视频转换、Human-to-Robot Video Translation
- 相关
- 人类视频数据、跨本体图像替换、本体差异、手部姿态估计、第一人称视频、Phantom(无机器人训练)
- 来源
- Phantom: Training Robots Without Robots Using Only Human Videos
Masquerade: Learning from In-the-wild Human Videos using Data-Editing
H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos - 信息截至
- 2025-12