具身智能新手名词表English

SpatialVLM

SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities进阶

用自动生成的海量 3D 空间问答数据,教视觉语言模型估算距离和大小

Google DeepMind 联合 MIT、斯坦福 2024 年 1 月发布,发表于 CVPR 2024。作者发现,视觉语言模型(VLM)能认出图里有什么,却答不好「杯子离盒子多远」「哪个更高」这类定量空间问题,原因是训练数据缺少 3D 空间知识。他们搭了一条自动数据流水线:对真实图片做目标检测、分割和度量深度估计,把 2D 图片提升成带真实尺度的 3D 点云,再按模板生成空间问答,在 1000 万张图片上产出 20 亿条问答,是首个互联网规模的度量空间推理数据集。用这些数据训练后,模型在定性和定量空间问答上都明显提升,还能配合大语言模型做多步空间推理,并把距离估计用作机器人任务的稠密奖励。

例子问「红色积木离蓝色碗大约多少厘米」,普通 VLM 往往只给出模糊描述,SpatialVLM 能直接给出一个带单位的距离估计。

也叫
Spatial VLM
相关
空间推理、视觉语言模型、视觉问答、单目深度估计、空间智能、谷歌 DeepMind
来源
SpatialVLM (arXiv 2401.12168)
SpatialVLM project page
信息截至
2024-06

在完整名词表里查看 →