具身智能新手名词表English

银河通用 TrackVLA

TrackVLA: Embodied Visual Tracking in the Wild (Galbot)进阶

只靠第一视角相机,边认出目标边规划路线去跟随它的具身跟踪 VLA

北京大学 EPIC 实验室(王鹤团队)与银河通用等机构 2025 年 5 月发布的视觉-语言-动作模型(VLA),发表于 CoRL 2025。任务是具身视觉跟踪:机器人只用自己的第一视角相机,在动态环境里认出并持续跟住指定目标。以往做法把「认出目标」和「规划怎么走」拆成两个模块,误差会层层累积;TrackVLA 让两者共用一个大语言模型骨干(Vicuna-7B),语言头负责识别,基于锚点的扩散模型负责输出行进轨迹。训练数据约 170 万条,一半是自建 EVT-Bench 仿真基准里的跟踪样本,一半是视频问答识别样本。真机部署在宇树 Go2 四足上,模型跑在远程 RTX 4090 服务器,推理约 10 帧/秒,对遮挡和目标快速移动比较鲁棒。

例子对宇树 Go2 说「跟着穿蓝衣服的人」,它只靠头上一台 RGB 相机在人群中认出目标并一路跟随,目标短暂被挡住后还能接着跟。

也叫
TrackVLA
相关
具身视觉跟踪(目标跟随)、视觉-语言-动作模型、银河通用 NavFoM、导航、扩散模型、宇树 Go2
来源
TrackVLA: Embodied Visual Tracking in the Wild (arXiv 2505.23189)
TrackVLA project page
信息截至
2025-05

在完整名词表里查看 →