深度估计
Depth Estimation常用推断图像里每个像素离相机有多远,输出一张深度图。
深度估计是从图像推断场景各点到相机距离的任务,结果通常是一张与图像同尺寸的深度图。做法大致三类:双目立体匹配,按两台相机的视差用三角关系计算;主动测距,如结构光、ToF 深度相机和激光雷达;单目深度估计,用神经网络从单张图推断。单目天然有尺度歧义,早期模型多只给相对深度,MiDaS(TPAMI 2020)靠混合多数据集训练提升了跨场景泛化,近年的 Depth Pro、Metric3D 等可直接输出以米为单位的度量深度。对机器人,深度是把像素变成点云、做抓取和避障的基础,学习型方法还能弥补深度相机在透明、反光物体上的空洞。
例子深度相机拍玻璃杯时杯身区域深度大片缺失,用学习型模型从 RGB 图估计深度把洞补上,才能生成完整点云供抓取检测使用。
- 也叫
- 深度预测
- 相关
- 单目深度估计、立体匹配、深度相机、度量深度 / 相对深度、深度补全、Depth Anything
- 来源
- Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer (MiDaS, arXiv 1907.01341)
Depth Anything V2 (arXiv 2406.09414)