BridgeVLA
BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models进阶把 3D 点云投影成 2D 图、用热力图输出动作的 3D 操作 VLA。
BridgeVLA 由中科院自动化所、字节跳动 Seed 等团队 2025 年 6 月提出,发表于 NeurIPS 2025。问题在于:VLM 是在 2D 图文上预训练的,而 3D 操作要处理点云、输出 3D 位姿,两边对不齐,知识难迁移。BridgeVLA 把点云渲染成几张多视角 2D 图送进 PaliGemma,让模型在同一张图上输出 2D 热力图(每个像素表示「在这里动作」的可能性),再综合多视角热力图确定末端要去的 3D 位置;正式训练前还先用目标检测数据练它输出热力图。它在 RLBench 上把成功率从 81.4% 提到 88.2%。2026 年 8 月团队又开源了 BridgeVLA++。
例子真机上用 Franka Research 3 机械臂测试 10 多个任务,每个任务只给 3 条演示,平均成功率 96.8%。
- 也叫
- BridgeVLA++
- 相关
- 3D VLA、PaliGemma、RVT-2、RLBench、The Colosseum、关键帧动作预测
- 来源
- BridgeVLA (arXiv 2506.07961)
BridgeVLA GitHub - 信息截至
- 2026-08