具身智能新手名词表English

任意点跟踪

Tracking Any PointTAP进阶

给视频里任意一个点,输出它在之后每一帧的位置和是否被遮挡。

任意点跟踪是 Google DeepMind 在 2022 年随 TAP-Vid 基准正式提出的视觉任务:用户在视频某一帧上指定任意一个点(可以在物体表面、布料上、背景里),模型要给出这个点在其他所有帧里的像素位置,并判断它是否被遮挡。它和光流的区别是光流只算相邻两帧之间的运动,长时间累积会漂移,也处理不了遮挡后再出现;和目标跟踪的区别是它跟的是点而不是整个物体的框。代表模型有 TAPIR、CoTracker 等。在机器人里,点轨迹是一种与本体无关的中间表示:可以从人类视频里提取物体上点的运动,用来指导策略学习(如 ATM)或做视觉伺服。

例子在人倒水的视频里点选杯把手上的几个点,跟踪出它们随时间的轨迹,机器人策略学习时就以这些轨迹作为「杯子该怎么动」的目标。

也叫
点跟踪、Point Tracking、长时点跟踪
相关
TAPIR、CoTracker、光流、场景流、ATM(任意点轨迹建模)、3D 点跟踪
来源
TAP-Vid: A Benchmark for Tracking Any Point in a Video (arXiv 2211.03726)
CoTracker: It is Better to Track Together (arXiv 2307.07635)

在完整名词表里查看 →