一句话定义
扩散模型(Diffusion Model)是一类生成模型:它先学会把一张图逐步「毁」成雪花屏,再把这套毁图过程倒着走一遍,于是就能从一团纯随机噪声里,一步步去噪还原出图像、音频或视频。
它到底在干什么
扩散模型有两个过程。
前向加噪:拿一张清晰的图,每次撒一点高斯噪声,反复几十到上千次,最后图变成一团完全随机的雪花点。这一步不需要学习,是固定的数学操作,加噪到什么程度都由公式说了算。
反向去噪:真正要训练的是这一步。给模型看无数张「加了第 t 步噪声的脏图」,让它猜:这一步被加进去的噪声长什么样?猜错了就调整参数。训练完成后,模型就成了一个有经验的「修图师」——你给它一张脏图,它能估出噪声并减掉,让图干净一点点。
打个比方:一滴墨水滴进清水,墨迹慢慢散开,最后整杯水变成均匀的淡灰色——这是前向。反向就是把录像倒放:从一杯淡灰色的水开始,蒙着眼睛一勺一勺把墨粒「捞」回来。每次只捞一点点,所以生成一张图往往要迭代几十到上千次。模型不是一次画出整幅画,而是分很多小步,把噪声一点点抠掉。
和相邻概念的区别
| 对比项 | 扩散模型 | GAN | VAE | 自回归模型 |
|---|---|---|---|---|
| 生成方式 | 多步迭代去噪 | 一次前向生成 | 编码后一次解码 | 逐个 token 顺序生成 |
| 训练稳定性 | 较稳定 | 易不稳定、模式崩塌 | 稳定但常偏模糊 | 稳定 |
| 生成速度 | 慢,可加速 | 快 | 快 | 与序列长度成正比 |
| 常见产物 | 图像、音频、视频 | 图像 | 图像 | 文本 |
核心差别在于:GAN 是「一步到位」,靠生成器和判别器互相博弈;扩散是「多次微调」,靠反复去噪。前者快但难驯服,后者慢但听话。另一个常见变体是潜空间扩散(AI 词典:Latent Diffusion">Latent Diffusion):不在原始像素上做,而是先把图压缩到更小的潜空间再去噪,能显著降低计算量,这也是很多文生图产品的底层思路,具体实现以官方页面为准。
对从业者和普通人意味着什么
对普通人来说,AI 绘画、修图、换背景、语音合成这些体验,背后大概率跑的就是扩散模型。理解它的关键一点是:生成不等于从素材库里拼贴,而是从随机噪声出发,一步步「雕刻」出结果——所以同一句提示词每次生成都不一样,因为起点噪声不同。
对从业者来说,噪声调度、采样步数、引导强度是需要调的旋钮;推理成本主要压在迭代步数上,所以加速采样、模型蒸馏、潜空间扩散一直是工程热点。训练稳定、容易扩展,是扩散模型能成为当前生成模型主流路线的直接原因,代价则是采样慢,需要用工程手段补上。
