跳到主内容
快讯直播
AI智模界
AI 词典

激活引导:不改权重,只拨内部状态

一句话定义:激活引导(Activation Steering)是在模型推理时,直接给内部中间层的激活向量(activation)加一个方向,从而在不重训练、不动权重的前提下,改变模型的风格或行为。

它是怎么做到的

大模型每一层、每个位置都在用一个高维向量表示「此刻在想什么」,这个向量叫激活。有意思的是,很多语义在激活空间里大致呈线性:存在一个「正式—随意」的方向,也存在「拒绝—配合」「简洁—啰嗦」的方向。

既然方向存在,就可以人为造一个方向向量 v,推理时把激活 h 临时改成 h + α·v,α 是强度。方向从哪来?常见做法是准备一批成对提示(比如同一句话分别要求「正式地说」和「随意地说」),各跑一遍,取中间层激活的均值差,差值方向就是那根「轴」。

打个比方:模型权重像是员工的全部能力和经验,激活引导则像开会时递过去的一张纸条——人没换、本事没变,只是此刻的语气被拨了一下。也像调音台上的旋钮,乐手和乐谱都没动,只是把某个频段推高一点。

和相邻概念的区别

激活引导微调(Fine-tuning)提示词工程(Prompt Engineering)
改什么推理时的中间激活模型权重输入文本
要训练吗不用不用
生效范围本次推理写进模型,长期生效本次对话
可控粒度可指定某一层、某个位置全局取决于模型是否「愿意听」

和提示词工程的关键差别在于:提示词是跟模型商量,模型可以不理你;激活引导是直接动它内部状态,绕过了「愿不愿意听话」这一环。所以它既能用来做精细控制,也可能被用来绕过安全对齐,用的时候要有边界意识。

对从业者和普通人的意义

对研究者,它是理解模型内部表征的工具,有点像显微镜:想知道「礼貌」在模型里长什么样,就去那根轴上找。

对工程师,它提供了一种低成本的行为调节方式。想让客服机器人在不改变知识范围的前提下更耐心,或者让摘要更简洁,不必为每种风格各训一个模型,调一个强度和层号就行。相关方法有时被归入「表示工程」(Representation Engineering)的范畴,不同团队的叫法不完全一致。

对职场里的普通人,它解释了一件事:模型的「性格」是可以被临时拨动的,同一套权重能给出不同风格的回答。换句话说,你看到的输出不完全等于模型的「本意」,它也可能是被某根方向轴推了一把的结果。

需要提醒的是,具体实现细节、可用工具和开源实现差异很大,真要落地请以官方文档和论文页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。