VSI-Bench 空间智能基准
VSI-Bench (Thinking in Space: Visual-Spatial Intelligence Benchmark)VSI-Bench进阶用室内视频考多模态大模型空间理解能力的评测基准
VSI-Bench 出自论文 Thinking in Space,由纽约大学谢赛宁团队联合耶鲁、斯坦福(含李飞飞)于 2024 年 12 月发布,入选 CVPR 2025 口头报告。它从 ScanNet、ScanNet++、ARKitScenes 三个室内扫描数据集选了 288 段第一人称视频,构造 5000 多道问答,覆盖 8 类任务:物体计数、相对距离、相对方向、物体尺寸、绝对距离、房间大小、出现顺序和路线规划。作者测了 15 个支持视频输入的多模态大模型,普遍明显低于人类(人类平均约 79%),主要卡在空间推理;思维链这类语言提示反而会掉分,而先让模型画出「认知地图」能改善距离判断。
例子给模型看一段绕客厅拍的视频,问「沙发和电视相距几米」「站在冰箱前面向水槽,炉灶在你左边还是右边」,按数值误差或选择题正确率打分。
- 也叫
- VSI-Bench 视觉空间智能基准、Thinking in Space
- 相关
- 空间智能、空间推理、多模态大语言模型、基准测试、ERQA 具身推理问答基准、3D视觉
- 来源
- Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces (arXiv)
Thinking in Space 项目主页
vision-x-nyu/thinking-in-space (GitHub) - 信息截至
- 2025-06