潜在扩散模型
Latent Diffusion ModelLDM进阶先用自编码器把数据压缩到低维隐空间,再在隐空间里做扩散生成的模型。
扩散模型通过逐步去噪生成数据,但直接在像素上做,高分辨率图像和视频的计算量很大。2021 年 12 月,德国 CompVis 组的 Rombach 等人提出潜在扩散模型(CVPR 2022):先训练一个自编码器,把图像压缩成尺寸小得多的隐变量,扩散模型只在这个隐空间里去噪,最后由解码器还原成图像;文字等条件通过交叉注意力注入。这大幅降低了训练和推理成本,开源的 Stable Diffusion 就基于这一框架。视频生成和世界模型普遍沿用这一思路,例如英伟达 Cosmos 中基于扩散的世界基础模型,就在 Cosmos 视频分词器(把视频压缩成隐变量的编码器)的隐空间里运行,时间和空间上的压缩比为 8×8×8。
例子Stable Diffusion 先把 512×512 的彩色图像压缩成 64×64×4 的隐变量,在这个小得多的张量上去噪,最后再解码回 512×512 的图像。
- 也叫
- 隐空间扩散模型、Latent Diffusion、潜空间扩散模型
- 相关
- 扩散模型、变分自编码器、扩散 Transformer、视频分词器、Cosmos、交叉注意力
- 来源
- High-Resolution Image Synthesis with Latent Diffusion Models (arXiv:2112.10752)
Cosmos World Foundation Model Platform for Physical AI (arXiv:2501.03575) - 信息截至
- 2025-01