跳到主内容
快讯直播
AI智模界
AI 词典

宪法 AI(Constitutional AI):让模型照着一纸“家规”自我纠错

一句话定义:宪法 AI(Constitutional AI,简称 CAI)是一种训练 AI 助手的方法——先写下一套自然语言原则(即“宪法”),再让模型依据这些原则批评和修改自己的回答,并用 AI 生成的反馈替代大量人类偏好标注,使模型更符合“有用且无害”等目标。

它怎么工作

传统对齐常用 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):人给模型的两个回答打分,模型学会人更喜欢哪个。问题是,涉及安全、伦理、价值观的边界情况太多,人工标注又慢又贵,还难免前后不一致。

宪法 AI 换了个思路:把“我们希望模型遵守什么”写成一本员工手册,例如“不要协助伤害他人”“尊重隐私”“遇到不确定时选择更谨慎的回答”。训练时,先让模型对可能有害的回答做自我批评——“这违反了手册里的哪条原则”,再按原则重写;这些“批评—修订”样本用来微调模型。之后进入强化学习阶段,不再主要靠人排序,而是让模型自己按宪法对多个回答排序,用这些 AI 反馈训练奖励模型,即 RLAIF(Reinforcement Learning from AI Feedback)。人主要审原则和少量样本。

打个比方:带新人写文案。手把手改每一份当然好,但成本高。更可扩展的方式是给新人一份写作规范,让他先自评、重写,主管只抽查规范是否合理。宪法就是那份规范。

和相邻概念的区别

维度RLHF宪法 AI / RLAIF
反馈来源人类标注偏好AI 按宪法生成偏好,人类主要写原则
可扩展性受标注人力限制更易扩大规模
透明度偏好藏在标注数据里原则是自然语言,可阅读、可讨论
风险标注不一致、成本高原则可能带偏差,AI 反馈可能放大偏差

它也和“系统提示词”不同:提示词只在单次对话里约束模型,宪法 AI 是训练阶段塑造模型行为。它和“内容过滤”也不同:过滤是在输出后拦截,宪法 AI 更想在生成时就引导。

对从业者和普通人的意义

对从业者,这套方法能降低人工标注成本、提升行为一致性,尤其适合安全对齐场景;但原则怎么写、谁来审,是关键工程问题。对普通人,模型背后的书面原则越公开,越方便外部质疑和评估;同时也要意识到,原则由开发方制定,仍可能带来价值偏差。具体原则内容和最新做法,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。