TraceVLA
TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies进阶把画面中关键点的历史运动轨迹画在图上当提示,增强 VLA 时空理解的方法
马里兰大学与微软研究院(Ruijie Zheng、Jianwei Yang 等)2024 年 12 月发布,发表于 ICLR 2025。VLA 通常只看当前一帧,不知道机器人和物体刚才怎么动过。TraceVLA 提出「视觉轨迹提示」:用点跟踪模型 CoTracker 追踪画面中关键点过去若干帧的运动,把轨迹直接画在图像上,再把原图和叠加了轨迹的图一起输入模型。作者用这种方式在自己收集的 15 万条操作轨迹上微调 OpenVLA,得到 TraceVLA:在 SimplerEnv 的 137 种配置上比 OpenVLA 高约 10%,在 WidowX 真机 4 个任务上达到其 3.5 倍。另有基于 40 亿参数 Phi-3-Vision 的小版本,效果接近 70 亿参数的 OpenVLA。
例子机械臂正在把勺子挪向毛巾,输入图上叠着夹爪和勺子前几步的彩色轨迹线,模型据此判断运动方向和进度,决定下一步动作。
- 也叫
- 视觉轨迹提示 VLA、Visual Trace Prompting
- 相关
- OpenVLA、视觉提示、任意点跟踪、CoTracker、SimplerEnv、视觉-语言-动作模型
- 来源
- TraceVLA (arXiv 2412.10345)
TraceVLA project page - 信息截至
- 2025-01