具身智能新手名词表English

单图生成3D

Single-Image 3D Reconstruction (Image-to-3D)进阶

只给一张照片,让模型补全出物体完整的三维形状和纹理。

单图生成3D指输入一张 RGB 图片,输出物体或场景的三维网格、点云或高斯表示。一张图只拍到正面,背面和被挡住的部分要靠模型从大量 3D 数据里学到的先验去「猜」,所以近年主流做法是用扩散模型(逐步去噪生成数据的模型)先生成多视角图像再重建,或直接生成 3D 表示。对具身智能来说,它能把真实照片里的物体快速变成仿真资产(仿真器里可用的 3D 模型),用于数字孪生、Real-to-Sim 和合成数据;也能帮机器人估计没看到的物体背面形状,辅助抓取规划。

例子拍一张桌上马克杯的照片,用混元3D 生成带纹理的网格,再导入 Isaac Sim 当抓取训练的物体。

也叫
图生 3D、Image-to-3D、单视图重建
相关
混元3D(Hunyuan3D)、SAM 3D、仿真资产、现实到仿真、点云补全 / 形状补全、扩散模型
来源
Zero-1-to-3: Zero-shot One Image to 3D Object (arXiv)

在完整名词表里查看 →