跳到主内容
快讯直播
AI智模界
AI 词典

DiT:扩散模型为什么换上了 Transformer 主干

一句话定义:DiT(Diffusion Transformer)指的是用 Transformer 充当扩散模型(diffusion model)里那个“去噪网络”的主干,取代过去常见的 U-Net。

它是怎么工作的

扩散模型生成一张图,大致是先把随机噪声铺满画布,再一步步把噪声“擦掉”,最后显影成图像。负责“擦”的那个网络,是整个模型最核心的部件。早期它通常是一个 U-Net:由卷积(convolution)堆成,先下采样、再上采样,配上跳跃连接,像一条 U 形流水线。

DiT 换个思路:把图像切成一个个小块(patch),每块当作一个词元(token),交给标准的 Transformer 处理——和语言模型读句子几乎一样。时间步、文字提示这类条件,用调制归一化层(如 adaLN)的方式注入,而不是额外挂一个交叉注意力模块。

打个比方

U-Net 像一家层级森严的公司:信息一层层往上报,再一层层往下传,左上方和右下方两个部门想沟通,得绕好几道审批。Transformer 的注意力(attention)像全员群聊:每个小块都能直接“@”任意另一个小块,一步到位。

换了主干,为什么更好

  • 全局视野。卷积天生只看局部,想看整张图得靠层层堆叠;注意力一层就能让任意两个位置直接对话,构图、光影、物体之间的关系更容易学对。
  • 先验更少,上限更高。U-Net 内置了“局部相关”“多尺度”这些假设,小数据下是优势,规模做大反而成了束缚。DiT 更接近一张白纸,把规律交给数据去学。
  • 扩展性可见。Transformer 在语言模型上已经证明:参数量和算力往上加,效果大体平滑、可预测地变好(scaling law)。U-Net 的通道数、层数、下采样次数彼此纠缠,放大时不好拿捏。换成 Transformer,扩散模型也能像大语言模型那样“堆规模”。
  • 工程可复用。同为 Transformer,就能直接借用语言模型那套成熟基础设施:并行训练、高效注意力实现、显存优化。文本、图像、视频统一成 token 序列,多模态也更好拼在一起。

和相邻概念的区别

概念主干特点
传统扩散模型U-Net(卷积)局部感受野,结构先验强
DiTTransformer全局注意力,先验弱,好扩展
ViTTransformer做判别式任务,如分类
自回归图像模型Transformer逐 token 顺序预测,而非迭代去噪

对从业者的意义

做图像、视频生成,主干选型如今基本绕不开 DiT 这条路线,近年不少生成模型都采用了类似设计。对普通人来说,最直观的体感是:同一代模型里,规模更大、训练更充分的那一档,画面一致性和细节通常更稳——这正是“可扩展”落到体验上的样子。至于某个具体模型用了什么主干、支持哪些功能,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。