一句话定义:激活引导(Activation Steering)是在模型推理时,直接给内部中间层的激活向量(activation)加一个方向,从而在不重训练、不动权重的前提下,改变模型的风格或行为。
它是怎么做到的
大模型每一层、每个位置都在用一个高维向量表示「此刻在想什么」,这个向量叫激活。有意思的是,很多语义在激活空间里大致呈线性:存在一个「正式—随意」的方向,也存在「拒绝—配合」「简洁—啰嗦」的方向。
既然方向存在,就可以人为造一个方向向量 v,推理时把激活 h 临时改成 h + α·v,α 是强度。方向从哪来?常见做法是准备一批成对提示(比如同一句话分别要求「正式地说」和「随意地说」),各跑一遍,取中间层激活的均值差,差值方向就是那根「轴」。
打个比方:模型权重像是员工的全部能力和经验,激活引导则像开会时递过去的一张纸条——人没换、本事没变,只是此刻的语气被拨了一下。也像调音台上的旋钮,乐手和乐谱都没动,只是把某个频段推高一点。
和相邻概念的区别
| 激活引导 | 微调(Fine-tuning) | 提示词工程(Prompt Engineering) | |
|---|---|---|---|
| 改什么 | 推理时的中间激活 | 模型权重 | 输入文本 |
| 要训练吗 | 不用 | 要 | 不用 |
| 生效范围 | 本次推理 | 写进模型,长期生效 | 本次对话 |
| 可控粒度 | 可指定某一层、某个位置 | 全局 | 取决于模型是否「愿意听」 |
和提示词工程的关键差别在于:提示词是跟模型商量,模型可以不理你;激活引导是直接动它内部状态,绕过了「愿不愿意听话」这一环。所以它既能用来做精细控制,也可能被用来绕过安全对齐,用的时候要有边界意识。
对从业者和普通人的意义
对研究者,它是理解模型内部表征的工具,有点像显微镜:想知道「礼貌」在模型里长什么样,就去那根轴上找。
对工程师,它提供了一种低成本的行为调节方式。想让客服机器人在不改变知识范围的前提下更耐心,或者让摘要更简洁,不必为每种风格各训一个模型,调一个强度和层号就行。相关方法有时被归入「表示工程」(Representation Engineering)的范畴,不同团队的叫法不完全一致。
对职场里的普通人,它解释了一件事:模型的「性格」是可以被临时拨动的,同一套权重能给出不同风格的回答。换句话说,你看到的输出不完全等于模型的「本意」,它也可能是被某根方向轴推了一把的结果。
需要提醒的是,具体实现细节、可用工具和开源实现差异很大,真要落地请以官方文档和论文页面为准。
