视觉泛化
Visual Generalization进阶画面外观变了(背景、光照、颜色、干扰物、相机角度),策略照样能完成任务。
泛化的一个子类,指机器人策略在训练没见过的视觉条件下仍能完成同样的任务:换了背景和桌布、光照变化、物体换了颜色或纹理、画面里多出干扰物、相机位置挪动等。任务和动作没变,变的只是「看到的样子」,所以常和语义泛化(新物体、新指令)、位置泛化分开评测,OpenVLA 的真机评测就单列了这一项。模仿学习策略直接从像素学动作,容易把背景、光照这些无关细节也记进去。2023 年 Xie、Finn 等人逐个拆解这些因素,发现新背景最容易适应、新相机位置最难。常见应对办法有域随机化、数据增强、用预训练视觉编码器,以及在更多样的场景里采数据。
例子OpenVLA 真机评测里的「把茄子放进锅里」:用一只手工纸糊、外观与 BridgeData V2 训练数据中不同的锅,考查策略还能不能认出锅并完成任务。
- 也叫
- 视觉鲁棒性、外观泛化
- 相关
- 泛化、语义泛化、位置泛化(空间泛化)、干扰物、域随机化、数据增强
- 来源
- Decomposing the Generalization Gap in Imitation Learning for Visual Robotic Manipulation (Xie et al., 2023)
OpenVLA: An Open-Source Vision-Language-Action Model
What Can RL Bring to VLA Generalization? An Empirical Study - 信息截至
- 2025-05