跳到主内容
快讯直播
AI智模界
AI 词典

扩散模型(Diffusion Model):从一团噪声里「雕」出图像

一句话定义

扩散模型(Diffusion Model)是一类生成模型:它先学会把一张图逐步「毁」成雪花屏,再把这套毁图过程倒着走一遍,于是就能从一团纯随机噪声里,一步步去噪还原出图像、音频或视频。

它到底在干什么

扩散模型有两个过程。

前向加噪:拿一张清晰的图,每次撒一点高斯噪声,反复几十到上千次,最后图变成一团完全随机的雪花点。这一步不需要学习,是固定的数学操作,加噪到什么程度都由公式说了算。

反向去噪:真正要训练的是这一步。给模型看无数张「加了第 t 步噪声的脏图」,让它猜:这一步被加进去的噪声长什么样?猜错了就调整参数。训练完成后,模型就成了一个有经验的「修图师」——你给它一张脏图,它能估出噪声并减掉,让图干净一点点。

打个比方:一滴墨水滴进清水,墨迹慢慢散开,最后整杯水变成均匀的淡灰色——这是前向。反向就是把录像倒放:从一杯淡灰色的水开始,蒙着眼睛一勺一勺把墨粒「捞」回来。每次只捞一点点,所以生成一张图往往要迭代几十到上千次。模型不是一次画出整幅画,而是分很多小步,把噪声一点点抠掉。

和相邻概念的区别

对比项扩散模型GANVAE自回归模型
生成方式多步迭代去噪一次前向生成编码后一次解码逐个 token 顺序生成
训练稳定性较稳定易不稳定、模式崩塌稳定但常偏模糊稳定
生成速度慢,可加速与序列长度成正比
常见产物图像、音频、视频图像图像文本

核心差别在于:GAN 是「一步到位」,靠生成器和判别器互相博弈;扩散是「多次微调」,靠反复去噪。前者快但难驯服,后者慢但听话。另一个常见变体是潜空间扩散AI 词典:Latent Diffusion">Latent Diffusion):不在原始像素上做,而是先把图压缩到更小的潜空间再去噪,能显著降低计算量,这也是很多文生图产品的底层思路,具体实现以官方页面为准。

对从业者和普通人意味着什么

对普通人来说,AI 绘画、修图、换背景、语音合成这些体验,背后大概率跑的就是扩散模型。理解它的关键一点是:生成不等于从素材库里拼贴,而是从随机噪声出发,一步步「雕刻」出结果——所以同一句提示词每次生成都不一样,因为起点噪声不同。

对从业者来说,噪声调度、采样步数、引导强度是需要调的旋钮;推理成本主要压在迭代步数上,所以加速采样、模型蒸馏、潜空间扩散一直是工程热点。训练稳定、容易扩展,是扩散模型能成为当前生成模型主流路线的直接原因,代价则是采样慢,需要用工程手段补上。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。