跳到主内容
快讯直播
AI智模界
AI 词典

对齐税:模型变乖之后,为什么会变笨一点

一句话定义对齐税(AI 词典:Alignment">Alignment Tax)指为了让模型更安全、更听话、更符合人类偏好,而在对齐训练中付出的能力代价——某些通用能力、回答多样性或探索性会悄悄掉一截。

这笔税从哪来

预训练(Pretraining)的目标只有一个:预测下一个词。它像一块不加筛选的海绵,什么语料都吸收,能力最大化。对齐阶段则用微调">指令微调(SFT)、基于人类反馈的强化学习(RLHF)等手段,把模型的输出分布往"人类更喜欢"的方向推。麻烦在于,"人类更喜欢"和"能力最强"并不总是同一个方向。

打个比方:一家餐厅原本什么菜都做,包括一些看着奇怪但极考验手艺的菜。为了口碑稳定、流程可控,老板把它们从菜单上撤了,只留大众接受度最高的那些。好评率上去了,真正见功夫的部分却没了。给模型加约束是同一个道理。

常见表现有:回答模板化、多样性下降(模式坍缩)、对边界问题过度拒答、为迎合用户而附和(谄媚,Sycophancy),以及在需要"冒险推理"的任务上表现下滑。

几个容易混的概念

概念关注焦点
对齐税对齐目标带来的能力权衡
灾难性遗忘训练方式导致的能力整体退化
谄媚过度对齐的一种具体副作用
安全对齐是手段,对齐税是它的可能代价

它并非必然

对齐也可能带来"对齐红利":指令遵循更强、更会配合、更少胡言乱语。差别在于怎么对齐——数据是否干净、是否用可验证奖励、是否把对齐数据提前纳入预训练、是否采用更省税的算法。工程上的问题从来不是"要不要对齐",而是把税压到多低。

对从业者的意义

  • 评估别只看安全指标,要在同一套能力基准上做对齐前后的对照。
  • 分清是"能力掉了"还是"风格变了"——很多所谓变笨,其实只是变啰嗦。
  • 安全评测和产品评测分开跑,别用一次评测得出两个结论。

对普通人的意义

你觉得某个模型"最近变笨了",未必是错觉,也未必是厂商偷懒,很可能就是一次对齐权衡的结果。做安全总要付代价,好的团队只是把代价算清楚,并且尽量付得少。具体某个模型的能力表现与策略,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。