具身智能新手名词表English

位姿跟踪

Pose Tracking进阶

在连续视频帧里持续估计物体的 3D 位置和朝向。

位姿指物体的 3D 位置加 3D 朝向,共 6 个自由度,所以也叫 6D 位姿。6D 位姿估计通常对单帧从零算出位姿;位姿跟踪则利用上一帧的结果,在新一帧里只做小幅修正,因此更快、更平滑,适合实时闭环控制。英伟达的 FoundationPose(CVPR 2024 Highlight)把估计和跟踪统一在一个框架里:输入 RGB-D 图像,对没见过的物体只需 CAD 模型或少量参考图,用「渲染-比较」迭代细化位姿。机器人抓取移动物体、手内调整物体、视觉伺服时都依赖它;物体被遮挡或运动过快时容易跟丢,需要重新做全局估计。SLAM 里估计相机自身位姿也叫跟踪,对象不同。

例子机器人拧瓶盖时,每帧用 FoundationPose 跟踪瓶子的 6D 位姿,控制器据此调整夹爪位置。

也叫
6D 位姿跟踪、物体位姿跟踪
相关
6D位姿估计、FoundationPose、视觉伺服、手内操作、遮挡、位姿
来源
FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects (arXiv 2312.08344)
FoundationPose 项目主页 (NVIDIA)
信息截至
2024-06

在完整名词表里查看 →