具身智能新手名词表English

ERQA 具身推理问答基准

ERQA (Embodied Reasoning Question Answer Benchmark)ERQA进阶

谷歌 DeepMind 发布的 400 道具身推理图文选择题基准

ERQA 是 Google DeepMind 在 2025 年 3 月随 Gemini Robotics 一起开源的基准,用来衡量多模态大模型的具身推理能力,也就是看懂真实物理场景、为机器人行动做判断的能力。它有 400 道图文混排的单选题(选项 A–D),场景多来自机器人相关的真实环境,题型包括空间推理、轨迹推理、动作推理、状态估计、指向、多视角推理和任务推理,其中 28% 的题要看多张图。因为只考选择题,不需要机器人或仿真器,任何视觉语言模型都能直接跑。Gemini Robotics 技术报告中,Gemini 2.0 Pro Experimental 得 48.3%,GPT-4o 得 47.0%,Claude 3.5 Sonnet 得 35.5%,说明当时模型离可靠的具身推理还有距离。Embodied Arena 等评测平台也收录了它。

例子类似这样的题:给出机械臂夹着水杯的照片,问「要把水倒进旁边的碗里,夹爪下一步应该往哪个方向转」,从 A–D 四个选项中选一个。

也叫
Embodied Reasoning QA
相关
具身推理、Gemini Robotics-ER、视觉问答、多模态大语言模型、Embodied Arena 具身评测竞技场、VSI-Bench 空间智能基准
来源
embodiedreasoning/ERQA GitHub
Gemini Robotics: Bringing AI into the Physical World (arXiv 2503.20020)
信息截至
2025-03

在完整名词表里查看 →