RVT-2
RVT-2: Learning Precise Manipulation from Few Demonstrations (Robotic View Transformer 2)进阶英伟达的多视角 3D 操作策略,每个任务约 10 条演示就能学会毫米级插装
英伟达研究团队(Ankit Goyal、Dieter Fox 等)2024 年 6 月发布,发表于 RSS 2024,是 RVT(Robotic View Transformer)的升级版。这类方法先把 RGB-D 相机得到的点云重新渲染成几张虚拟视角图像,由 Transformer 在这些图上预测下一个关键位姿(夹爪该到的位置、朝向和开合),再交给运动规划器去执行。RVT-2 采用由粗到细的多阶段推理:先在整个场景里找到大致区域,再放大该区域做精确预测;同时让旋转预测以位置为条件,并用自研渲染器和更高效的训练实现提速。结果是训练比 RVT 快 6 倍、推理快 2 倍,RLBench 多任务成功率从 65% 提到 82%;真机上只用一台 RGB-D 相机、每个任务约 10 条演示,就能完成插销、插插头这类需要毫米级精度的任务。
例子在真实机械臂上为「把销钉插进孔里」录大约 10 次演示,RVT-2 就能学会对准只留很小间隙的孔完成插入。
- 也叫
- Robotic View Transformer 2
- 相关
- PerAct、关键帧动作预测、多视角、RLBench、轴孔装配、少样本
- 来源
- RVT-2: Learning Precise Manipulation from Few Demonstrations (arXiv 2406.08545)
RVT-2 project page - 信息截至
- 2024-06