具身问答
Embodied Question AnsweringEQA进阶智能体在三维环境里自己走动收集信息,再回答问题的任务。
具身问答由 Abhishek Das、Dhruv Batra 等人在 2017 年底提出(CVPR 2018 口头报告):智能体被放在 3D 房屋环境的随机位置,收到一个问题,比如「车是什么颜色」,它必须以第一人称视角自己导航、找到相关物体,再给出答案。首个数据集 EQA v1 建在 House3D 仿真器上,问题分位置、颜色、房间颜色、介词关系几类。这个任务把主动感知、语言理解、目标导航、常识推理和语言接地放在一起,因此常被当作检验具身智能的综合基准。之后出现了多目标、真实扫描场景等变体;Meta FAIR 在 CVPR 2024 发布的 OpenEQA 把它扩展到开放词汇,分为「凭记忆回答」和「主动探索后回答」两种设置。大模型时代常用视觉语言模型加前沿探索来做。
例子问智能体「厨房里有几把椅子」,它需要从客厅出发找到厨房、数清椅子,再给出答案。
- 也叫
- Embodied QA
- 相关
- 具身交互、视觉问答、OpenEQA 开放词汇具身问答基准、主动探索、视觉语言导航、具身记忆
- 来源
- Embodied Question Answering (Das et al., CVPR 2018)
EmbodiedQA project page
OpenEQA: Embodied Question Answering in the Era of Foundation Models - 信息截至
- 2024-06