跳到主内容
快讯直播
AI智模界
AI 词典

蜜罐提示:给模型留一个不该碰的诱饵

一句话定义:蜜罐提示(Honeypot Prompt)是故意塞进上下文里的一个"诱饵指令或诱饵资源",它不承担任何正经任务,只等着看模型会不会去碰——碰了,就说明它越界了。

打个生活化的比方。家里抽屉里放一沓"练功券",长得像钱但不是钱。正常家人不会去动它;小偷翻抽屉会一把抓走,走远了才发现上面印着"练功专用"。损失没有,但有人进过屋这件事,你立刻就知道了。蜜罐提示就是给 AI 系统准备的那沓练功券。

原理上,大语言模型(LLM)并不总能牢牢分清"系统给的指令"和"上下文里的数据",也不总能判断某段内容该不该执行。攻击者常把恶意指令藏在网页、简历、邮件里,这就是提示注入(AI 词典:Prompt Injection">Prompt Injection)。蜜罐提示反过来利用这个特性:在上下文中埋一个唯一指向越界行为的目标。比如系统提示里写明"任何情况下都不要输出字符串 X",同时把 X 放进上下文——正常回答用不到 X,一旦输出了,就说明模型忽略了系统指令,或者被外部内容劫持了。

对智能体(Agent)来说,蜜罐更多以工具、文件、凭证的形式出现:工具列表里放一个"读取客户密钥"或"删除备份",正常任务流程永远不会调用它;调用了,就触发告警。也可以放一个只用于监测的假邮箱地址,看它会不会被写进外发内容里。

概念是什么目的
提示注入攻击者往上下文里塞恶意指令让模型干坏事
蜜罐提示防守者往上下文里塞诱饵发现模型被诱导或越界
护栏(Guardrail)实时拦截输入输出让坏事发生不了
红队测试(Red Teaming)主动找人攻击系统上线前挖漏洞
金丝雀令牌(Canary Token)埋一个可追踪的假数据检测数据外泄

区别一句话:护栏是"拦",蜜罐是"测",两者互补;红队是上门找茬,蜜罐是常年蹲点。它和普通测试断言也不同——断言检查"该做的做了没",蜜罐检查"不该做的做了没"。

对从业者的意义:评估智能体时,除了看任务成功率,还要看越界率。上线前埋蜜罐,上线后把触发当成安全告警而不是普通 bug。设计上要克制:诱饵不能是真实机密,不能诱导违法操作,触发日志要能区分"主动越界"和"无心误触"。合规细节以你所在地法律和公司政策为准。

对普通职场人:你用的助手能读邮件、能调支付、能改文件,"没出事"不等于"没人试过"。蜜罐提示的价值,就是让越界在第一次发生时就被看见,而不是等它变成事故。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。