跳到主内容
快讯直播
AI智模界
AI 词典

护栏(Guardrails):给模型装一圈看不见的护栏

一句话定义

护栏(Guardrails)是在大模型(LLM)的输入和输出两侧,加装规则、分类器和过滤层,用来限制模型“能说什么、能做什么”。它不修改模型本身,而是像马路边的护栏:车还是那辆车,但冲出车道时会被拦住。

它通常拦在哪几层

  • 输入护栏:用户提问先进检查站。比如识别提示注入(Prompt Injection)、越权指令、要求生成违法内容等,直接拒掉或降级处理。
  • 输出护栏:模型答完再检查一遍。过滤敏感信息、个人隐私、不靠谱的医疗建议、带漏洞的代码等。
  • 执行护栏:如果模型能调用工具、查数据库、发邮件、下单,还要限制它能调哪些接口、额度多大、是否必须人工确认。

打个比方:模型像一位知识渊博但口无遮拦的顾问。输入护栏是门禁,看你能带什么进来;输出护栏是合规审稿,看它能写什么出去;执行护栏是财务审批,看它能不能真的动钱动数据。

和相邻概念的区别

护栏常被和“对齐”“系统提示”混着说,其实作用位置不同:

概念在哪里起作用类比典型手段
对齐训练(Alignment)模型权重内部驾校培训指令微调、RLHF 等
系统提示(System Prompt)输入上下文口头叮嘱“只回答……”“不要……”
护栏模型外部的输入输出管道护栏、安检、审批分类器、规则、过滤、限流、人工确认

关键区别:对齐训练让模型“倾向于”守规矩,系统提示是软约束,容易被绕过;护栏是外部硬拦截,模型改不了。内容审核(Content Moderation)更偏识别和处置违规内容,可以看成护栏的一部分。

对从业者和普通人的意义

对从业者,护栏是产品上线前的合规底线,但别把它当万能锁。它会被绕过,需要分层防御:输入过滤 + 输出检查 + 权限最小化 + 日志审计 + 红队测试(Red Teaming)。只靠一句系统提示,基本等于没护栏。

对普通人,遇到 AI 拒答或“我无法回答”,不一定是模型自己不想说,很可能是外部护栏触发。反过来,加了护栏也不等于绝对安全:它可能漏拦,也可能误伤正常问题。关键决策别完全交给模型,具体产品能力以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。