一句话定义
审慎对齐(Deliberative AI 词典:Alignment">Alignment)是一种训练语言模型处理安全问题的思路:让模型在给出答案之前,先把相关的安全规范(safety spec)明确回忆出来并推理一遍,再判断该拒绝、该满足、还是该换个方式回答,而不是一看到敏感词就条件反射地摆手。
它到底在做什么
传统的安全微调有点像给前台发一张"禁用词表":看到某些字眼就回一句"办不了"。这样做简单,但遇到边缘案例容易误伤——用户问"如何安全地处理实验室化学品泄漏",也可能被一刀切拒掉。
审慎对齐换了个做法:把规章制度的原文放到台面上,训练模型先"念条款"再"做判断"。面对一个请求,模型会先想:这条涉及哪项安全规则?规则允许什么、禁止什么?用户真正想做什么?有没有既帮上忙又不越界的回答方式?这个过程依托模型的思维链(Chain-of-Thought,CoT)能力,把推理显式地写出来,而不是藏在权重里。
落地时通常分两步:先用安全规范自动生成大量"带推理过程"的示范数据做监督微调,让模型学会"引用规则 → 推理 → 作答"的格式;再用强化学习奖励那些既守住规范、又真正有用的回答。安全规范本身是人工撰写的自然语言文档,可阅读、可修改、可版本化。
和相邻概念的区别
| 概念 | 核心机制 | 典型表现 |
|---|---|---|
| 传统安全微调 | 用正负样本教模型"该拒就拒" | 模式匹配式拒答,容易过度拒答(over-refusal) |
| RLHF | 用人类偏好打分塑造整体行为 | 安全与有用性一起学,但规则不可见 |
| 宪法 AI(Constitutional AI) | 让模型按一套原则自我批评、修订回答 | 靠原则自省,未必显式引用条款 |
| 审慎对齐 | 回答前显式回忆并推理安全规范 | 规则可查、判断可追溯 |
一句话概括:宪法 AI 强调"按原则改答案",审慎对齐强调"先把原则读出来再想"。
对从业者和普通人的意义
对做模型的人:安全规范变成可迭代的文档,改文档就能改行为,不必为了调整某条边界重新标注海量数据;安全判断的推理过程可读,方便审计和排查;对没见过的边缘请求泛化更好,能同时压低"乱拒答"和"该拒没拒"两种情况。
对普通人:少一些莫名其妙的"抱歉,我不能帮你",多一些"这件事你可以这样做,但要注意……"。安全边界更一致,被拒时也更容易理解原因。
限制也要说清楚:效果取决于安全规范写得清不清楚、有没有互相冲突;显式推理链本身可能被诱导或泄露,需要额外防护。这一思路由 OpenAI 提出并用于其推理模型,具体实现细节各家不同,以官方页面为准。
