一句话说清:扩散语言模型(Diffusion LLM,简称 dLLM)是把图像生成里那套「先加噪、再去噪」的流程搬到文字上的一类模型——它不从左到右逐字写,而是从一团噪声出发,反复删改,最后把整段文字「显影」出来。
它是怎么工作的
训练时,把一句正常的话一步步加噪(随机替换、打乱、遮住),模型要学的是:给定一个被弄乱的版本,把原样还回去。生成时反过来——起点是一堆几乎随机、毫无意义的 token 分布,模型先定下大致轮廓:这是一封邮件还是一段议论、大概几个句子;再一轮轮细化用词、修语法。
这很像洗照片:一开始只有灰蒙蒙的轮廓,越洗越清楚,而且每一轮你都能对整张照片同时下手,而不是只能从左角洗到右角。
和自回归比,差在哪
自回归(AI 词典:Autoregressive">Autoregressive)模型写字的姿势是「说一个字,再想下一个字」。这个顺序有个硬伤:已经说出口的话改不了。前面写偏了,后面只能硬着头皮往下圆。扩散模型没有这种锁定,每一步都可以重新审视所有位置,推翻上一轮的决定。
| 维度 | 自回归 LLM | 扩散 LLM |
|---|---|---|
| 生成顺序 | 严格从左到右 | 任意顺序,多轮迭代 |
| 单步计算 | 一次一个 token | 一次修订整段 |
| 改错 | 说出口就算数 | 后面还能翻案 |
| 全局约束(押韵、括号配对、表格对齐) | 只能边写边赌 | 可以整段一起满足 |
| 生态成熟度 | 成熟 | 仍在探索 |
和「填空模型」的区别
掩码语言模型(Masked Language Model)也做补洞,但它训练时洞里往往还有上下文可用,也不负责从全空走到成篇。dLLM 强调的是那条完整的去噪轨迹。
难点在哪
文本是离散的,一个词要么是「猫」要么是「狗」,没有「七成猫」这种中间态,而经典扩散恰恰是靠连续数值上的噪声工作的。所以 dLLM 要么在连续空间里架一层映射,要么改用离散或掩码式的扩散。另外,固定几十步迭代听上去很适合并行,但步数本身就是成本,短文本上未必比自回归划算。
对从业者意味着什么
如果你做的是带硬约束的输出——结构化 JSON、需要对齐的改写、要配平括号的代码——「全局一起收敛」这个思路值得关注。但也要清楚,推理框架、缓存、量化这些围绕自回归打磨多年的工程积木,在 dLLM 上还没那么齐。
对普通人来说,短期变化不大:主流聊天产品仍是自回归的天下。但可以记住这个概念——它代表了「生成文本」的另一种可能姿势。具体有哪些模型、能力如何,以官方页面为准。
