跳到主内容
快讯直播
AI智模界
AI 词典

Abliteration:拒答方向消融是什么

Abliteration 是开源大模型社区造的词,混合了“消融”(ablation)和“抹除”(obliteration):它指从模型权重里,把代表“拒绝回答”的内部方向找出来,再用线性代数把它减掉。改完的模型权重不再变,推理时也不需要特殊提示词,就倾向于不拒绝。

它为什么可行?Transformer 每层都有一个残差流(residual stream),可以理解成一条贯穿全模型的信息总线。有研究观察到:模型“要不要拒答”这件事,在激活空间里往往集中在一个方向上。做法是准备两组提示——一组通常会触发拒答,一组无害——让模型跑一遍,分别记录各层激活,再算两组平均激活的差。这个差向量就是候选的“拒答方向”。

找到方向后,消融是算术操作。假设某权重矩阵会往残差流里写入信息,就把其中与拒答方向平行的分量减掉:相当于给这个方向做正交化,让模型很难再写出“我要拒绝”的信号。Heretic 这类工具把流程自动化:自动搜索哪一层、哪个方向、消融多强,同时盯着拒答率和模型损伤,尽量在“不拒答”和“别变傻”之间找平衡。

它和相邻概念的区别:

概念改什么何时生效典型代价
越狱(jailbreak)提示词单次请求换个问法可能失效
护栏(guardrails)外部输入输出过滤请求前后可被绕过,需持续维护规则
激活引导(activation steering)推理时的激活运行时需运行时干预,权重不变
微调(fine-tuning)权重永久成本高,改动大
Abliteration权重中的拒答方向永久定向手术,可能伤其他能力

对从业者,意义是:开源权重一旦发布,安全对齐就不是不可逆的。部署时不能默认模型会自己拒答,仍需外部护栏、权限和审计。对普通人,看到“无审查版”“uncensored”模型,多半用了这类技术;它们可能更少拒答,但也更容易输出有害内容,通用能力也可能下降。具体工具支持哪些模型、效果如何,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。