具身智能新手名词表English

FoundationStereo

FoundationStereo: Zero-Shot Stereo Matching进阶

英伟达的双目立体匹配基础模型,换场景不用微调也能出深度

英伟达 Bowen Wen 等人提出的立体匹配模型,发表于 CVPR 2025。输入左右两张相机图像,输出稠密视差图,再用基线和焦距换算成深度或点云。以往的立体匹配网络换到新场景往往要重新微调;FoundationStereo 用约 100 万对高真实感合成双目图(FSD 数据集)训练,并通过旁路微调(side-tuning)引入视觉基础模型的单目深度先验,缩小仿真与真实的差距,做到零样本泛化,官方称发布时在 Middlebury 和 ETH3D 榜单排第一。机器人里常用它从双目图像得到更完整的深度,供抓取和位姿估计使用;2025 年 12 月又推出实时版 Fast-FoundationStereo。

例子用双目相机拍下桌面的左右两张图,送进 FoundationStereo 得到深度图和点云,再交给 FoundationPose 估计目标物体的 6D 位姿。

也叫
Fast-FoundationStereo
相关
立体匹配、视差、双目相机、深度估计、FoundationPose、Depth Anything
来源
FoundationStereo: Zero-Shot Stereo Matching (arXiv 2501.09898)
NVlabs/FoundationStereo GitHub
信息截至
2025-12

在完整名词表里查看 →