跳到主内容
快讯直播
AI智模界
AI 词典

ControlNet:给扩散模型装一根可训练的操纵杆

一句话定义:ControlNet 是一种给预训练扩散模型(diffusion model)外挂「可训练分支」的技术,让出图时除了听文字提示,还能听一张条件图——边缘、深度、人体姿态、线稿、分割图——从而精确控制画面的构图与结构。

它是怎么工作的

想象一位功底深厚但脾气随意的老画师,这就是预训练扩散模型。你说「一个女孩坐在窗边」,他画出来的人可能歪着、手不知放哪。你要的不是换画师,而是给他配一位拿着施工图的助手。

ControlNet 的做法是:把老画师的本事原样冻结(原模型权重不动),复制一份「影子网络」当可训练分支,把条件图喂进去。分支每一层的输出,再通过特殊连接加回原模型的对应层。关键在连接处的卷积权重初始化为 0,叫零卷积(zero convolution)。训练一开始,分支输出全是 0,等于什么都没加,原模型完全不受影响;随着训练推进,分支才慢慢学会「往哪里加、加多少」。

好处很直接:不用重新训练几十亿参数的大模型,只训练一个小分支,就能学会一种控制方式。而且原模型没被破坏,画质和审美依然在线。

和相邻概念的差别

概念管什么输入
提示词(prompt)画面语义与风格倾向文字
图生图(img2img)整体重绘,粗略保留原图一张参考图
LoRA风格、人物、特定概念少量样本训练出的权重
ControlNet空间结构与构图边缘/深度/姿态/线稿/分割图

一句话:LoRA 决定「画的是谁、什么味道」,ControlNet 决定「东西摆在哪儿、什么姿势」。

对实际工作的意义

过去用 AI 出图更像抽卡,改十遍提示词也未必让手放到指定位置。有了 ControlNet,流程变成:草图或白模 → 提取条件图 → 生成成图,可控、可迭代、可复用。电商可以固定模特姿态,只换服装和场景;建筑和室内能在草图阶段就出效果图;动画可以做姿态迁移和结构对齐。对普通职场人来说,它把「生成图片」往「执行设计稿」推近了一步。

局限也要知道:一种条件通常对应一个单独训练的分支;多个条件叠在一起可能互相打架;条件图本身画得粗糙,结果也不会精细。至于具体支持哪些条件类型、权重怎么调,以各工具的官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。