ViNT
ViNT: A Foundation Model for Visual Navigation (Visual Navigation Transformer)进阶伯克利用多种机器人导航数据训练、看图找目标的视觉导航基础模型
UC Berkeley 的 Dhruv Shah、Sergey Levine 等人 2023 年 6 月发布,CoRL 2023 口头报告论文。此前导航模型大多只在一种机器人、一种场景的数据上训练。ViNT 用 EfficientNet 编码图像、再接 Transformer,输入当前及过去几帧画面和一张目标图片,预测离目标还有多远以及下一步该怎么走;训练数据来自多种机器人平台、累计数百小时的导航数据。配合一个生成候选子目标图的扩散模型,它能在陌生环境里探索,再加上 GPS 等远程启发信息可完成公里级导航;还能通过提示微调把目标换成 GPS 路点或转向指令。它继承自更早的 GNM,后续有 NoMaD。
例子先让机器人沿一条路线拍一串照片,之后只给它其中一张作为目标图,ViNT 就能在同一环境中自己走到拍摄那张照片的位置;同一个模型可以部署到不同的移动机器人上。
- 也叫
- Visual Navigation Transformer
- 相关
- GNM(通用导航模型)、NoMaD、图像目标导航、导航、基础模型、提示微调 / 软提示
- 来源
- ViNT (arXiv 2306.14846)
ViNT project page - 信息截至
- 2023-10