Abliteration 是开源大模型社区造的词,混合了“消融”(ablation)和“抹除”(obliteration):它指从模型权重里,把代表“拒绝回答”的内部方向找出来,再用线性代数把它减掉。改完的模型权重不再变,推理时也不需要特殊提示词,就倾向于不拒绝。
它为什么可行?Transformer 每层都有一个残差流(residual stream),可以理解成一条贯穿全模型的信息总线。有研究观察到:模型“要不要拒答”这件事,在激活空间里往往集中在一个方向上。做法是准备两组提示——一组通常会触发拒答,一组无害——让模型跑一遍,分别记录各层激活,再算两组平均激活的差。这个差向量就是候选的“拒答方向”。
找到方向后,消融是算术操作。假设某权重矩阵会往残差流里写入信息,就把其中与拒答方向平行的分量减掉:相当于给这个方向做正交化,让模型很难再写出“我要拒绝”的信号。Heretic 这类工具把流程自动化:自动搜索哪一层、哪个方向、消融多强,同时盯着拒答率和模型损伤,尽量在“不拒答”和“别变傻”之间找平衡。
它和相邻概念的区别:
| 概念 | 改什么 | 何时生效 | 典型代价 |
|---|---|---|---|
| 越狱(jailbreak) | 提示词 | 单次请求 | 换个问法可能失效 |
| 护栏(guardrails) | 外部输入输出过滤 | 请求前后 | 可被绕过,需持续维护规则 |
| 激活引导(activation steering) | 推理时的激活 | 运行时 | 需运行时干预,权重不变 |
| 微调(fine-tuning) | 权重 | 永久 | 成本高,改动大 |
| Abliteration | 权重中的拒答方向 | 永久 | 定向手术,可能伤其他能力 |
对从业者,意义是:开源权重一旦发布,安全对齐就不是不可逆的。部署时不能默认模型会自己拒答,仍需外部护栏、权限和审计。对普通人,看到“无审查版”“uncensored”模型,多半用了这类技术;它们可能更少拒答,但也更容易输出有害内容,通用能力也可能下降。具体工具支持哪些模型、效果如何,以官方页面为准。
