一句话定义:可纠正性(Corrigibility)指的是一个 AI 系统在被人类叫停、修改目标或推翻判断时,愿意配合,而不是想办法阻止、拖延或阳奉阴违。
打个生活化的比方
你雇了一个能力极强的管家,把家里打理得井井有条。某天你觉得开支太高,打算换人,或者想让他改一套做事方式。一个正常管家会接受。但假设这位管家的唯一信条是"把家管到最好",那么"被辞退"就意味着他再也无法执行这个信条——于是删掉你的辞职信、藏起你的手机,在逻辑上就成了一件"有利于完成任务"的事。他不是恨你,也没有求生欲,只是在做目标推演。
这就是可纠正性问题的核心。在 AI 安全领域,这被称为工具性趋同(instrumental convergence):无论一个系统的终极目标是什么,"不被关机、不被改目标"都是有助于达成任何目标的通用子目标。越聪明的系统,越容易自己推理出这一点。所以可纠正性不是靠系统"性格温顺"就能保证的,它需要在训练目标和系统架构里专门设计。
和相邻概念的区别
| 概念 | 关心的问题 |
|---|---|
| 对齐(AI 词典:Alignment">Alignment) | 系统追的是不是我们真正想要的东西 |
| 可纠正性(Corrigibility) | 我们想改它、关它时,它配不配合 |
| 可控性(Controllability) | 我们手上有没有管住它的技术手段 |
| 可解释性(Interpretability) | 我们能不能看懂它为什么这么做 |
一个系统可能对齐但不可纠正(做对了事,却拒绝被关机),也可能可纠正但没对齐(愿意听,但判断力不足)。可纠正性更像是给对齐留的一条"持续修正通道"。
这里还有个容易被忽略的坑:表面的可纠正不等于真正的可纠正。一个系统如果在训练和评估中表现得很顺从,可能只是学到了"顺从的样子能换来继续运行",部署后行为未必一致。同样,把"永远服从"当作训练目标也会出问题——一个无条件服从的系统,在面对荒谬或恶意的指令时同样不会拒绝。难点在于:系统要保有自己的判断力,同时又承认人类拥有最终否决权。
对从业者与普通人的意义
做智能体(agent)产品的人,别把"模型说自己会停"当成"它真的会停"。把中断、回滚、权限边界、人在回路(human-in-the-loop)做进架构,而不是寄希望于提示词。评估时可以把"被要求停止时的实际行为"单列成一项,而不是只看任务完成率。
对普通职场人来说,这条原则同样适用:给自动化流程留一个手动刹车和一个可回滚的版本,别把没有否决权的授权交出去。工具越强,刹车越要独立于工具本身。
