一篇题为《Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering》的论文类内容出现在技术博客上。仅从标题看,它试图在"非破坏性"的前提下抑制大语言模型的拒绝行为,核心手段被命名为 Engram Steering。
在开源模型社区,abliteration(可理解为"消融式去拒绝")是一类已被讨论的做法:定位模型内部与拒绝响应相关的方向并加以削弱,使模型面对原本会拒答的请求时不再拒答。其争议点在于,与拒绝相关的内部表征往往与其他能力相互纠缠,直接改动权重可能连带影响模型的通用表现。标题中的 Non-Destructive 正是指向这一痛点。
Engram 通常指输入在模型内部留下的记忆性表征,Steering 则指在推理阶段对内部激活施加引导,而非永久修改权重。二者结合的字面含义是:动态地识别与拒绝相关的表征并施加引导,使"抑制拒绝"变成一个可控、可回退的过程。若这一思路成立,它会对模型微调、安全对齐评估与红队测试产生影响。
需要说明的是,目前可获得的信息只有标题与链接,页面未提供摘要,方法的具体实现、实验设置、评测结果与代码发布情况均无从判断,以上对技术路径的解读仅基于标题本身。
原文链接:<https://blog.madhukaraphatak.in/non-destructive-refusal-supression-using-engram>
