OpenEQA 开放词汇具身问答基准
OpenEQA (Open-Vocabulary Embodied Question Answering Benchmark)进阶Meta 推出的具身问答基准,考智能体能否凭对真实环境的观察用自然语言答题。
OpenEQA 由 Meta FAIR 于 2024 年 4 月发布,论文发表于 CVPR 2024。具身问答(EQA)要求智能体理解自己所处或曾经看过的环境,并用自然语言回答,比如「我把钥匙放哪了」。它包含 1600 多个人工撰写、非模板生成的问答对,对应 180 多个真实环境的视频和扫描,场景来自 HM3D 和 ScanNet。设有两种设定:情景记忆 EM-EQA,根据已录下的观察历史作答,对应智能眼镜;主动探索 A-EQA,机器人需要自己移动去收集信息。由于答案是开放词汇的自由文本,作者用大语言模型打分的 LLM-Match 指标自动评估,与人工评判高度相关。
例子Meta 公布的结果中,GPT-4V 准确率为 48.5%,人类为 85.9%;在需要空间理解的问题上,能看图的模型并不比只读文字的模型强多少。
- 也叫
- OpenEQA、EM-EQA、A-EQA
- 相关
- 具身问答、视觉问答、开放词汇、具身记忆、HM3D 数据集、ScanNet 数据集
- 来源
- Meta AI Blog: OpenEQA: From word models to world models
OpenEQA project page
GitHub: facebookresearch/open-eqa (data) - 信息截至
- 2024-04