跳到主内容
快讯直播
AI智模界
AI 词典

DDIM:让扩散模型跳着步子快速出图

扩散模型(diffusion model)的标准流程是:给图片逐步加噪直到变成纯噪声,再训练一个网络把它一步步去噪还原。问题在于,还原要走几百上千步,太慢。DDIM(Denoising Diffusion Implicit Models,去噪扩散隐式模型)改的就是后半段的采样方式——让同一个模型用几十步走完,而且过程是确定性的。

它做了什么

先看 DDPM(Denoising Diffusion Probabilistic Models)的做法。它把去噪定义成一条马尔可夫链:每步减掉一点预测出的噪声,再重新注入一点随机噪声,然后才进入下一步。因为有随机成分,只能一小步一小步挪,像在浓雾里下楼梯,每踩一级都得先摸一下。

DDIM 的思路是:训练时学到的噪声预测网络其实在回答"此刻大概有多少噪声"。既然它知道噪声,就能反推出"这张图大概长什么样"(即估计 x_0),于是可以从当前时刻一口气跳到任意更早的时刻,不必逐格走。一串 1000 步的链条,因此可以重排成 50 步甚至 20 步的跳步表。

同时,DDIM 把每一步注入的随机噪声关掉,反向过程变成一个确定性映射。可以粗略理解为:它把"逐格随机游走"换成了沿着概率流常微分方程(ODE,Ordinary Differential Equation)做一次粗糙的一阶推进。

和 DDPM 的区别

DDPMDDIM
反向过程马尔可夫链,每步加随机噪声非马尔可夫,随机性可设为零
采样步数通常需要上千步几十步即可,支持跳步
采样结果每次都不一样同一初始噪声得到同一结果
训练权重—通常可直接复用,无需重训

关键点是:DDIM 改的是"怎么采样",不是"怎么训练"。所以很多已有的模型权重可以直接换成 DDIM 采样器,这也是它流传得快的原因。

对从业者的意义

  • 快:采样耗时显著下降,跑实验和上线的成本都低得多。
  • 可控:同一个随机种子跑两次,出来的图一样,调试和对比实验时省事很多。
  • 可编辑:噪声与图像之间成了可逆映射,可以用 DDIM 反演(DDIM inversion)把真实图片编码回噪声,再做条件修改。
  • 可插值:在两个初始噪声之间做插值,能得到语义上平滑过渡的一串图。

代价也要讲清楚:步数压得太狠,细节会掉;随机性本身不全是坏事,它对生成多样性是有贡献的。如今主流的快速采样器大多沿着这条确定性路线继续做高阶求解,具体支持哪些采样器、参数如何设置,以各工具的官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。