一句话定义:蜜罐提示(Honeypot Prompt)是故意塞进上下文里的一个"诱饵指令或诱饵资源",它不承担任何正经任务,只等着看模型会不会去碰——碰了,就说明它越界了。
打个生活化的比方。家里抽屉里放一沓"练功券",长得像钱但不是钱。正常家人不会去动它;小偷翻抽屉会一把抓走,走远了才发现上面印着"练功专用"。损失没有,但有人进过屋这件事,你立刻就知道了。蜜罐提示就是给 AI 系统准备的那沓练功券。
原理上,大语言模型(LLM)并不总能牢牢分清"系统给的指令"和"上下文里的数据",也不总能判断某段内容该不该执行。攻击者常把恶意指令藏在网页、简历、邮件里,这就是提示注入(AI 词典:Prompt Injection">Prompt Injection)。蜜罐提示反过来利用这个特性:在上下文中埋一个唯一指向越界行为的目标。比如系统提示里写明"任何情况下都不要输出字符串 X",同时把 X 放进上下文——正常回答用不到 X,一旦输出了,就说明模型忽略了系统指令,或者被外部内容劫持了。
对智能体(Agent)来说,蜜罐更多以工具、文件、凭证的形式出现:工具列表里放一个"读取客户密钥"或"删除备份",正常任务流程永远不会调用它;调用了,就触发告警。也可以放一个只用于监测的假邮箱地址,看它会不会被写进外发内容里。
| 概念 | 是什么 | 目的 |
|---|---|---|
| 提示注入 | 攻击者往上下文里塞恶意指令 | 让模型干坏事 |
| 蜜罐提示 | 防守者往上下文里塞诱饵 | 发现模型被诱导或越界 |
| 护栏(Guardrail) | 实时拦截输入输出 | 让坏事发生不了 |
| 红队测试(Red Teaming) | 主动找人攻击系统 | 上线前挖漏洞 |
| 金丝雀令牌(Canary Token) | 埋一个可追踪的假数据 | 检测数据外泄 |
区别一句话:护栏是"拦",蜜罐是"测",两者互补;红队是上门找茬,蜜罐是常年蹲点。它和普通测试断言也不同——断言检查"该做的做了没",蜜罐检查"不该做的做了没"。
对从业者的意义:评估智能体时,除了看任务成功率,还要看越界率。上线前埋蜜罐,上线后把触发当成安全告警而不是普通 bug。设计上要克制:诱饵不能是真实机密,不能诱导违法操作,触发日志要能区分"主动越界"和"无心误触"。合规细节以你所在地法律和公司政策为准。
对普通职场人:你用的助手能读邮件、能调支付、能改文件,"没出事"不等于"没人试过"。蜜罐提示的价值,就是让越界在第一次发生时就被看见,而不是等它变成事故。
