跳到主内容
快讯直播
AI智模界
AI 词典

Engram Steering:不改权重,也能让模型少拒答

一句话定义:Engram Steering(记忆痕引导)是一种推理阶段的干预技术——它不修改模型权重,而是定位与特定行为(例如"拒答")相关的记忆痕表征,再针对性地把它调高或压低,从而临时、可逆地改变模型行为。

先说什么叫"记忆痕"

Engram 原本是神经科学的概念:记忆不是虚无缥缈的,它在脑组织里留下可被定位的物理痕迹。经典实验里,人为激活一小簇特定神经元,就能唤起一段特定记忆。

放到大模型里可以这样类比:某个具体行为或知识,往往不是均匀散布在全部参数中,而是能被少数特征、方向或稀疏的激活模式"点名"。这簇能被点名的表征,就是我们说的大模型语境下的记忆痕。

为什么说"拒答是一个方向"

经过对齐训练(如 RLHF)的模型,学会了对敏感请求说"我不能帮你"。这类行为在激活空间里往往对应一个相对明确的方向:沿它加一点,模型更容易拒答;减一点,就更愿意配合。所谓 abliteration(去拒答消融),就是想办法把这个方向从模型里"抠掉"。

传统做法是动手术:把拒答方向从权重矩阵中投影掉,永久生效。粗暴、彻底,但代价是可能连带损伤其他能力——坊间说的"变笨"。

Engram Steering 走的是另一条路:权重一根手指都不碰,只在推理时现场干预。它先判断当前上下文激活了哪些与拒答相关的记忆痕,再针对性地压低这些表征的分量。这里"Dynamic"(动态)的意思是有条件、按上下文决定,而不是全局一刀切——不是拉掉整栋楼的电闸,而是发现哪盏灯亮了,就单独把那一盏调暗。

和相邻概念的区别

方法干预位置改权重可逆粒度
提示词工程输入否是粗
微调 / 对齐训练权重是需重训全局
Abliteration权重是否全局、静态
通用激活引导激活否是全局、静态方向
Engram Steering激活中的特定记忆痕否是局部、动态

关键差别在最后一行:同样是"引导激活",通用 steering vector 往往对所有输入施加同一个固定方向;Engram Steering 强调先定位、再干预,只动该动的那部分。

对从业者的实际意义

一是更精细的调节能力。同一次部署里,可以按场景开关行为倾向,而不必维护两份权重。

二是保能力。不动权重,理论上原有多数能力不受牵连,绕开了权重手术常见的副作用。

三是护栏问题。降低拒答本身就是削弱安全边界,这既是红队工具,也是对齐研究工具,用在哪、放宽到什么程度,要按场景和当地法规来定,没有"技术中立"的豁免。

对普通人的意义

模型的行为不再是"训练完就定死"的。未来更可能像调音台:同一个底座,配几组行为旋钮,按场景切换。反过来也提醒一件事——对齐不是一次性工程,而是需要持续监控的过程,今天看着稳妥的配置,换个引导方向就可能换一副面孔。

具体实现细节(如何定位记忆痕、干预强度如何确定)以原始技术报告与官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。