ConceptGraphs
ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning进阶把多视角图像融合成开放词汇的 3D 物体场景图,供大模型推理和机器人规划使用。
ConceptGraphs 由 MIT、蒙特利尔大学、多伦多大学等团队提出(第一作者 Qiao Gu),发表于 ICRA 2024。它逐帧用通用分割模型切出物体区域,提取每块区域的 CLIP 特征,借助深度投影成 3D 点云,再跨视角把属于同一物体的区域合并,得到一组带语义特征的 3D 物体;随后用 LLaVA 为物体生成文字描述、用 GPT-4 推断物体间的空间关系作为边,构成 3D 场景图(节点是物体,边是关系)。全程不需要 3D 标注,也不微调模型。建好的图可转成文本交给大模型,回答「找一个篮球」这类查询;论文在 Jackal 等移动机器人上演示了物体检索、重定位,以及判断哪些障碍物可以推开的导航任务。
例子机器人先在房子里转一圈建好场景图,用户说「找个能把手机垫高的东西」,大模型从图中物体描述里挑出「书」,机器人按该节点的 3D 位置导航过去。
- 也叫
- 开放词汇 3D 场景图(ConceptGraphs)
- 相关
- 3D场景图、开放词汇、语义地图、CLIP、大模型任务规划、SayPlan
- 来源
- ConceptGraphs (arXiv 2309.16650)
ConceptGraphs 项目页 - 信息截至
- 2024-05