语义泛化
Semantic Generalization进阶面对没见过的物体、概念或指令说法,仍能理解意思并正确执行。
语义泛化是评测机器人策略、尤其是视觉-语言-动作模型(VLA)时常用的一个泛化维度,看模型能否在「意思层面」举一反三:没见过的物体类别、新的容器、换一种说法的指令、需要常识或概念推理的任务。它和视觉泛化(背景、光照、纹理变化)、执行层面的泛化(物体位置、初始姿态变化)相区分。2025 年的《What Can RL Bring to VLA Generalization?》按视觉、语义、执行三类构造测试,语义类包括未见物体、未见容器、未见指令表述、干扰容器等。VLA 被寄予厚望,一大原因就是能从互联网图文预训练中继承语义知识。
例子RT-2 能执行「把可乐罐移到泰勒·斯威夫特的照片旁」或「捡起可以当临时锤子用的东西」(它选了石头),这些概念并不在机器人训练数据里。
- 相关
- 泛化、视觉泛化、物体泛化、组合泛化、视觉-语言-动作模型、RT-2
- 来源
- What Can RL Bring to VLA Generalization? An Empirical Study (arXiv 2505.19789)
RT-2: New model translates vision and language into action (Google DeepMind) - 信息截至
- 2025-05