一句话定义:IP-Adapter(Image Prompt Adapter,图像参考适配器)是一种给扩散模型(diffusion model)加“图像提示”的轻量适配器——你丢一张参考图进去,模型生成时会参考它的外观、风格或主体,而不是只听文字。
先看普通文生图怎么走。提示词先经过文本编码器(text encoder)变成一组向量,在去噪网络 UNet 的交叉注意力(cross-attention)层里充当 Key/Value,每一步去噪都靠它指路。
IP-Adapter 的做法是另开一条支路:参考图经过图像编码器(如 CLIP 图像编码器),再通过一个小投影网络,变成和文本 Key/Value 同维度的图像 Key/Value。然后在同一批交叉注意力层里,图像和文本各算一份注意力,再把结果合起来。于是每去噪一步,模型都会“瞄一眼”参考图。
“贴”这个字很形象:它基本不动主模型,主模型冻结,只训练这个适配器小模块。所以它能即插即用,换参考图很方便。推理时一般有个权重参数:调大更像参考图,调小更听文字的话。
打个比方:文字提示像“口述需求”,IP-Adapter 像把样品照片拍在桌上说“照这个样子来”,而 AI 词典:ControlNet">ControlNet 像递过去一张线稿或骨架图说“手脚摆这里”。
两者的分工差别可以这样看:
| 维度 | IP-Adapter | ControlNet |
|---|---|---|
| 输入 | 参考图,提供外观、风格、主体特征 | 空间条件图,如边缘、深度、姿态、分割 |
| 管什么 | “长什么样、什么调性” | “在哪里、什么结构、什么姿势” |
| 注入方式 | 图像特征进交叉注意力,与文本并列 | 复制编码器分支,逐层注入空间控制信号 |
| 训练成本 | 轻量适配器,主模型冻结 | 控制分支较大,常需成对数据训练 |
| 组合使用 | 可与 ControlNet 叠加 | 可与 IP-Adapter 叠加 |
对从业者来说,它的价值在于“少训模型、多给参考”。电商可以用商品图或模特图生成多场景图,尽量保持外观一致;品牌和自媒体可以统一视觉风格,不必为每种风格单独训 LoRA;做角色设定时,用定妆照生成多张连续插图;文字说不清的颜色、材质、气质,直接丢参考图往往更快。
局限也要知道:一张参考图可能把背景、构图一起“带”进来,出现串味;它对精确位置和姿势的控制较弱,这类需求交给 ControlNet 更合适;主体一致性仍然有限,产品级使用常要配合多图、蒙版或微调。使用他人图片时,版权与肖像权要留意。具体能力和参数以所用工具的官方页面为准。
