跳到主内容
快讯直播
AI智模界
AI 词典

文本反转:两三张图,给模型教个新词

一句话定义:文本反转(Textual Inversion)是一种让文生图模型学会新概念的方法——你给它三五张同一个事物或同一种风格的图片,它就能把概念"压缩"成一个全新的词;之后你在提示词里写下这个词,模型就能照着画出来。

原理:只教一个新词,不动整个模型

扩散模型AI 词典:Diffusion Model">Diffusion Model)画图时,先由文本编码器(Text Encoder)把你的提示词翻译成一串数字向量,也就是嵌入(Embedding),再照着这串数字一步步"去噪"出画面。普通词对应的向量是训练时就定好的,改不了。

文本反转的做法很取巧:先在词表里塞一个原本不存在的"空词",比如 <my-dog>,然后把整个模型冻结,只用你那几张图去反复调整这一个词对应的向量。调到最后,模型一看到这个向量,画出来的就越来越像你那几张图。整个过程中,模型的其他参数一动没动。

打个比方:模型像一位画师,常见的东西都会画,但你说"画我家那只左耳缺一块、爱趴在窗台的橘猫",他画不出来。文本反转不是送他进美术进修班(那是重训),也不是给整本画册加批注(那是微调全模型),而是递给他一张小卡片:写上"阿黄"这个新词,配三五张照片。以后你说"阿黄在窗台",他就懂了。

和相邻概念的区别

概念改动了什么通常需要多少图
提示词工程什么都不改,只是换措辞0 张
文本反转新增一个词的向量几张
LoRA给网络插入小的适配层数张到数十张
DreamBooth 类微调改动模型本身的权重十几张以上

区别的核心是"改动量":文本反转的产物是一个很小的嵌入文件,好保存、好分享、好叠加,但表达力也相对有限。它擅长记住"长什么样"和"什么风格",对复杂动作、精确构图往往力不从心——那些更适合交给 LoRA 或完整微调。

对谁有用

对从业者,这是把"自定义概念"成本压到最低的一条路:一个几百字节到几 KB 的嵌入文件可以像表情包一样发给同事,对方在同一个底模(Base Model)上加载它,就能复现出同一种风格或同一个角色。做内容的可以把自己的吉祥物、固定视觉元素固化成词,纳入批量生产流程。

对普通人,意味着不必懂训练也能"给工具加词":凑三五张图,跑一次,你就多了个专属词汇。

要注意的是,它和底模绑定得很紧,同一个词换一个底模常常就失效;各家工具具体支持哪些写法、怎么加载,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。