3D-LLM
3D-LLM: Injecting the 3D World into Large Language Models进阶能直接输入 3D 场景特征、回答空间问题和做任务分解的大语言模型。
3D-LLM 由洪一宁、淦创(Chuang Gan)等来自 UCLA、UMass Amherst、MIT 等机构的研究者在 2023 年 7 月提出,NeurIPS 2023 spotlight。大语言模型和视觉语言模型只处理文字或 2D 图片,对空间关系、布局这类三维概念把握不好。3D-LLM 把 3D 场景从多个视角渲染成图片,用 2D 特征提取器取特征再映射回 3D 点,得到带语义的 3D 特征,然后接到 BLIP-2 等现成视觉语言模型上训练;另加 3D 定位机制帮模型理解位置。作者设计三类提示方法,收集了 30 多万条 3D-语言数据,覆盖场景描述、3D 问答、任务分解、定位和导航。在 ScanQA 上 BLEU-1 比当时最好方法高 9%。它是较早把 3D 场景接入大模型的工作,后来的 3D VLA、LEO 等延续了这一方向。
例子给 3D-LLM 一个房间的 3D 扫描,问「冰箱在沙发的哪一侧」,或让它把「做早餐」分解成走到厨房、打开冰箱、拿出鸡蛋等步骤。
- 也叫
- 3D 大语言模型
- 相关
- 3D VLA、多模态大语言模型、空间推理、3D视觉定位、LEO(3D 具身通才智能体)、ScanNet 数据集
- 来源
- 3D-LLM: Injecting the 3D World into Large Language Models (arXiv 2307.12981)
3D-LLM 代码仓库 (GitHub) - 信息截至
- 2023-12