一句话定义
护栏(Guardrails)是在大模型(LLM)的输入和输出两侧,加装规则、分类器和过滤层,用来限制模型“能说什么、能做什么”。它不修改模型本身,而是像马路边的护栏:车还是那辆车,但冲出车道时会被拦住。
它通常拦在哪几层
- 输入护栏:用户提问先进检查站。比如识别提示注入(Prompt Injection)、越权指令、要求生成违法内容等,直接拒掉或降级处理。
- 输出护栏:模型答完再检查一遍。过滤敏感信息、个人隐私、不靠谱的医疗建议、带漏洞的代码等。
- 执行护栏:如果模型能调用工具、查数据库、发邮件、下单,还要限制它能调哪些接口、额度多大、是否必须人工确认。
打个比方:模型像一位知识渊博但口无遮拦的顾问。输入护栏是门禁,看你能带什么进来;输出护栏是合规审稿,看它能写什么出去;执行护栏是财务审批,看它能不能真的动钱动数据。
和相邻概念的区别
护栏常被和“对齐”“系统提示”混着说,其实作用位置不同:
| 概念 | 在哪里起作用 | 类比 | 典型手段 |
|---|---|---|---|
| 对齐训练(Alignment) | 模型权重内部 | 驾校培训 | 指令微调、RLHF 等 |
| 系统提示(System Prompt) | 输入上下文 | 口头叮嘱 | “只回答……”“不要……” |
| 护栏 | 模型外部的输入输出管道 | 护栏、安检、审批 | 分类器、规则、过滤、限流、人工确认 |
关键区别:对齐训练让模型“倾向于”守规矩,系统提示是软约束,容易被绕过;护栏是外部硬拦截,模型改不了。内容审核(Content Moderation)更偏识别和处置违规内容,可以看成护栏的一部分。
对从业者和普通人的意义
对从业者,护栏是产品上线前的合规底线,但别把它当万能锁。它会被绕过,需要分层防御:输入过滤 + 输出检查 + 权限最小化 + 日志审计 + 红队测试(Red Teaming)。只靠一句系统提示,基本等于没护栏。
对普通人,遇到 AI 拒答或“我无法回答”,不一定是模型自己不想说,很可能是外部护栏触发。反过来,加了护栏也不等于绝对安全:它可能漏拦,也可能误伤正常问题。关键决策别完全交给模型,具体产品能力以官方页面为准。
