幻觉
Hallucination常用模型一本正经地输出与事实或眼前场景不符的内容。
幻觉指大模型生成看似合理、实际与事实或输入不符的内容,最早在大语言模型上被广泛讨论,比如编造不存在的论文;视觉模型也会「看到」图里并不存在的物体。到了具身场景,幻觉会从「说错」变成「做错」:规划器可能让机器人去拿房间里根本没有的东西,或对无法完成的指令硬着头皮执行。2025 年的 HEAL 研究(EMNLP 2025 Findings)专门测试了大语言模型驱动的具身智能体,在两个仿真环境中评测 12 个模型,发现指令与场景对不上时模型普遍识别不出来,在专门构造的测试集上幻觉率最高可达普通提示的 40 倍。常见对策包括用感知结果核对计划、让模型不确定时向人求助、做不确定性估计。
例子厨房里没有苹果,用户却说「把苹果放进冰箱」,基于大语言模型的规划器仍然生成「走到苹果旁、拿起苹果」的步骤。
- 也叫
- AI 幻觉、模型幻觉
- 相关
- 大语言模型、视觉语言模型、语言接地、不确定性估计、KnowNo(会求助的机器人)、具身安全
- 来源
- A Survey on Hallucination in Large Language Models (arXiv 2311.05232)
HEAL: An Empirical Study on Hallucinations in Embodied Agents Driven by Large Language Models (arXiv 2506.15065)
Hallucination (artificial intelligence) - Wikipedia - 信息截至
- 2025-10