具身智能新手名词表English

EmbodiedBench

EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents进阶

评测多模态大模型当具身智能体大脑能力的基准,含 4 个环境

EmbodiedBench 由 UIUC 等机构的 Rui Yang、Tong Zhang 等人提出,发表于 ICML 2025,专门评测多模态大语言模型(MLLM,能同时看图和读文字的大模型)充当具身智能体「大脑」时的能力。它有 4 个环境共 1128 个测试任务,分两层:EB-ALFRED 和 EB-Habitat 考高层任务分解与规划(如「把书放到桌上」,模型输出一串高层技能);EB-Navigation 和 EB-Manipulation 考底层动作规划(直接输出平移、旋转等控制量),要求精确的感知和空间推理。任务还按 6 种能力分组:基础任务、常识推理、复杂指令理解、空间感知、视觉感知、长程规划。作者测了 24 个闭源和开源模型,发现模型擅长高层任务、难以做好底层操作,论文摘要称最好的 GPT-4o 平均只有 28.9%。

例子在 EB-Manipulation 里,模型看到桌面图像和指令「把红色方块叠到蓝色方块上」,要直接给出机械臂末端的位置、姿态和夹爪开合,而不是调用现成的「抓取」技能。

也叫
EB-ALFRED、EB-Habitat、EB-Navigation、EB-Manipulation
相关
基准测试、多模态大语言模型、ALFRED、Habitat、大模型任务规划、Embodied Arena 具身评测竞技场
来源
EmbodiedBench (arXiv 2502.09560)
EmbodiedBench 项目主页
信息截至
2025-02

在完整名词表里查看 →