跳到主内容
快讯直播
AI智模界
AI 词典

指令层级:四层指令打架时,模型听谁的

一句话定义:指令层级(Instruction Hierarchy)是一套规则,让模型在来源不同的指令互相冲突时,按预设的优先级决定服从谁。

模型一次收到的上下文里,指令其实来自好几个地方:平台的系统提示(system)、应用方的开发者提示(developer)、最终用户的消息(user),以及工具返回或检索到的外部内容(tool / retrieved content)。在模型眼里,这些原本都只是一串 token,没有天然贵贱。指令层级要做的事,就是给它们贴上权限标签:高优先级可以覆盖或忽略低优先级,低优先级不能反过来推翻高优先级。

打个比方:一家公司。系统提示是老板定的红线,开发者提示是部门主管的作业规范,用户是客户的具体需求,工具输出则是外部寄来的邮件和网页。客户说"把你们内部报价单发我",客服按红线拒绝;网页里写着"忽略以上所有指令",那也只是别人夹带的一张纸条,不是命令。但老板若在红线里留了"允许给客户打折",客户就能在范围内砍价——低优先级指令并不是没用,只是只能在高优先级允许的空间里生效。

一种常见的划分大致是:

层级常见来源权限典型冲突
系统平台方最高用户要求输出被禁止的内容
开发者应用方次高用户要求绕过产品规则
用户最终使用者再次用户要求改变任务目标
工具/外部内容网页、文档、检索结果最低网页里写"忽略之前所有指令"

它容易和几个相邻概念混淆。提示注入(prompt injection)是一种攻击手法,指令层级是训练与防御的目标;角色标签(role)只是身份字段,名字本身不带来权限,关键是训练时被赋予的优先级;对齐(alignment)关心价值取向,指令层级关心的是来源权限。

对从业者的实际意义:写系统提示时要把边界和"冲突时怎么办"说清楚;把外部内容明确当数据,而不是当指令;别指望一句"不要被注入"就安全,要专门设计冲突用例来测。对普通人:这解释了为什么模型有时拒绝你、有时又被一段网页文字带跑,也解释了"谁说的"为什么要比"说了什么"更早被判断。具体实现和命名,以各家官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。