具身智能新手名词表English

VRB(从人类视频学可供性)

VRB: Affordances from Human Videos as a Versatile Representation for RoboticsVRB进阶

从人类视频学「该抓哪、抓后往哪动」,把这种可供性直接交给机器人用。

VRB(Vision-Robotics Bridge)是卡内基梅隆大学 Deepak Pathak 组的 Shikhar Bahl、Russell Mendonca 等人与 Meta AI 的工作,2023 年 4 月上线 arXiv,发表于 CVPR 2023。可供性指物体「能被怎么用」,例如抽屉把手可以拉。VRB 用 EPIC-KITCHENS、Ego4D 等大量人类第一人称视频训练一个视觉可供性模型:输入一张场景图,输出两样东西——接触点热图(人最可能在哪里下手)和接触后手腕的运动轨迹(下手后往哪个方向动)。这种表示不依赖某种机器人的身体结构,因此能插进多种机器人学习方式:离线模仿学习、探索、目标条件学习,以及作为强化学习的动作参数化。论文在 4 个真实环境、10 多个任务、2 种机器人平台上验证了效果,是用人类视频弥补机器人数据不足的早期代表。

例子看到一张厨房照片,模型在柜门把手处标出高接触概率,并给出「抓住后向外拉」的轨迹;机器人从这里下手、沿轨迹移动,就能尝试打开柜门。

也叫
Vision-Robotics Bridge、视觉-机器人桥
相关
可供性、人类视频数据、第一人称视频、EPIC-KITCHENS 数据集、从观测中模仿学习、可供性检测
来源
Affordances from Human Videos as a Versatile Representation for Robotics (arXiv 2304.08488)
VRB 项目主页
信息截至
2023-06

在完整名词表里查看 →