可供性检测
Affordance Detection / Affordance Grounding进阶从图像或点云里找出物体哪里能握、能按、能倒,并标到具体区域上。
可供性指物体为行动者提供的动作可能,比如杯柄可握、按钮可按。可供性检测就是把这种可能落到具体像素或点上:输入 RGB 图、深度图或点云,输出每个区域对应的动作标签或热力图(可供性图)。早期代表 AffordanceNet(Do 等,ICRA 2018)一边检测物体,一边给物体上每个像素分配最可能的可供性标签。「可供性定位」更强调按给定动作词找区域,如 Luo 等人在 CVPR 2022 提出的 AGD20K 数据集(2 万多张图、36 类可供性),从第三人称的人-物交互图里学习,再迁移到物体图上。它补上了「认出物体」到「知道怎么操作」之间的缺口,结果常作为中间表示交给抓取规划或策略。近年也有用视觉语言模型直接预测可操作点的做法,如 RoboPoint。
例子指令是「倒杯水」时,可供性检测在水壶图上把把手标成「握持」区域、壶嘴标成「倾倒」区域,抓取模块只在把手上采样抓取位姿。
- 也叫
- 可供性预测、可供性定位、可供性图、Affordance Map、功能区域检测
- 相关
- 可供性、抓取位姿检测、任务导向抓取(功能性抓取)、RoboPoint、VRB(从人类视频学可供性)、中间表示
- 来源
- AffordanceNet: An End-to-End Deep Learning Approach for Object Affordance Detection (arXiv:1709.07326)
Learning Affordance Grounding from Exocentric Images (CVPR 2022, arXiv:2203.09905)