具身智能新手名词表English

FoundationPose

FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects常用

英伟达的通用 6D 位姿模型,新物体不用再训练就能估计和跟踪位姿。

FoundationPose 是英伟达 Bowen Wen 等人提出的物体 6D 位姿(三维位置加三维朝向)估计与跟踪模型,发表于 CVPR 2024(Highlight)。它面向训练时没见过的物体,测试时不微调:给一个 CAD 模型,或约 16 张该物体的参考照片,再加上 RGB-D 图像和检测出的物体区域,就能输出位姿。做法是先在物体周围均匀撒大量初始位姿,拿渲染图和实拍图对比逐个修正,再用排序网络挑出最好的;后续帧只做修正,跟踪约 32 Hz。训练数据是借助大语言模型生成的大规模合成数据。截至 2024 年 3 月,它在 BOP 榜单基于模型的新物体位姿估计上排第一,另有 Isaac ROS 版本。

例子机械臂要把一个没训练过的工件插进夹具:先扫出工件的 CAD 模型,第一帧用分割模型框出工件,FoundationPose 估出 6D 位姿并持续跟踪,规划器据此算抓取和插入轨迹。

也叫
NVIDIA FoundationPose
相关
6D位姿估计、位姿跟踪、BOP 位姿估计基准、MegaPose、SAM-6D、英伟达
来源
FoundationPose (arXiv:2312.08344)
NVlabs/FoundationPose (GitHub)
信息截至
2024-03

在完整名词表里查看 →