具身智能新手名词表English

类别级位姿估计

Category-Level Pose Estimation进阶

不需要具体物体的 CAD 模型,对某一类里没见过的物体估计 6D 位姿和尺寸。

实例级 6D 位姿估计要求事先有每个物体精确的 3D 模型,只能处理训练时见过的那几个物体。类别级位姿估计把条件放宽为:只知道物体属于哪一类(杯子、碗、笔记本电脑等),对这一类里没见过的新实例估计位置、朝向和三维尺寸。难点是同类物体形状差别大。斯坦福 Guibas 组王鹤等人在 CVPR 2019 提出 NOCS(归一化物体坐标空间),让网络把每个像素映射到该类别共享的标准坐标,再结合深度图求出位姿和尺寸,并发布了 CAMERA(合成)和 REAL275(真实)两个常用数据集。它适合「拿起任意一个杯子」这类家庭任务;FoundationPose 等零样本方法则换了思路,需要新物体的模型或参考图像。

例子机器人看到桌上一只从没见过的马克杯,网络把杯子像素映射到「杯子」类的标准坐标,再和深度点云对齐,算出杯子的位置、朝向和尺寸,据此规划抓杯柄的位姿。

也叫
类别级 6D 位姿、类别级 6D 位姿与尺寸估计、Category-Level 6D Object Pose and Size Estimation
相关
6D位姿估计、NOCS 归一化物体坐标空间、FoundationPose、位姿跟踪、物体泛化、BOP 位姿估计基准
来源
Normalized Object Coordinate Space for Category-Level 6D Object Pose and Size Estimation (arXiv 1901.02970, CVPR 2019)

在完整名词表里查看 →