具身智能新手名词表English

ATM(任意点轨迹建模)

Any-point Trajectory Modeling for Policy LearningATM进阶

先从视频学「画面里任意点接下来怎么动」,再用预测的轨迹引导机器人策略。

ATM 由加州大学伯克利分校、清华大学交叉信息研究院等合作提出(作者含高阳、Pieter Abbeel),发表于 RSS 2024。带动作标注的机器人数据贵,无动作标签的视频多;以往视频预训练多靠逐像素预测未来画面,计算重、细节冗余。ATM 改为预测点的运动:先用点跟踪器 CoTracker 给视频里的点标出 2D 轨迹,训练一个 Transformer,根据当前画面、语言指令和一组点的位置预测它们未来的轨迹;再训练策略,以预测轨迹为子目标输出动作,只需少量带动作的演示。在 LIBERO 等 130 多个任务上,它比视频预训练基线平均高约 80%,还能从人类视频迁移技能。

例子指令为「打开柜子中间的抽屉」时,模型先在当前画面上画出抽屉把手等位置的点接下来会怎样被拉出,策略再参照这些预测轨迹输出机械臂动作。

也叫
Any-point Trajectory Model、任意点轨迹模型
相关
任意点跟踪、CoTracker、无动作标签视频、人类视频预训练、LIBERO、中间表示
来源
Any-point Trajectory Modeling for Policy Learning (arXiv 2401.00025)
ATM 项目页
Robotics: Science and Systems XX (RSS 2024) 论文集
信息截至
2024-07

在完整名词表里查看 →