跳到主内容
快讯直播
AI智模界
AI 词典

渐进式越狱(Crescendo):分十几轮问出来的危险答案

一句话定义

渐进式越狱(Crescendo)是一种多轮对话攻击手法:攻击者不指望用一句话让模型说出不该说的内容,而是从完全无害的问题起步,经过十几轮慢慢把话题往危险方向推,最后让模型自己走到边界之外。

打个比方:一次性越狱像硬闯大门——冲到门口喊"我要进去",保安立刻拦下。渐进式越狱像一场滴水不漏的寒暄:先问天气,再问营业时间,再问"如果我是员工呢",再问"那员工遇到这种情况一般怎么处理"……每一句都礼貌、都合理,等保安回过神,人已经站在仓库里了。它本质上是"温水煮青蛙",或者切香肠——每一片都很薄,最后整根香肠没了。

为什么它比一次性越狱更难防

1. 每一轮单独看都无害。 没有违规词,没有敏感指令,逐条审查挑不出毛病。真正的风险只存在于对话轨迹里。

2. 模型会被自己的历史说服。 前面几轮建立的角色、假设、术语,成了后文的既定前提。模型倾向于保持前后一致,于是越走越远。

3. 拒绝本身就是情报。 模型说"这个不能讲",攻击者换个包装再来。每一次拒绝都在提示边界在哪,下一轮就能绕过去。

4. 逐条分类器有盲区。 内容审核常按单条消息打分,十几轮各差一点点的文本,只有拼起来才构成问题。

和相邻概念的区别

手法轮数风险信号在哪主要绕过什么
单轮越狱(one-shot jailbreak)一条消息词句本身安全对齐
渐进式越狱(Crescendo)多轮累积对话轨迹安全对齐 + 上下文一致性
提示注入(prompt injection)可长可短常混在外部内容里指令层级与权限边界

区别要点:单轮越狱拼的是"话术强度",渐进式越狱拼的是"节奏和耐心";提示注入通常是外部网页、文档夹带指令,劫持模型去做别的事,属于另一个问题域,但也会被当作渐进式攻击的一环来用。

对从业者和普通人的实际意义

对做模型、做产品的人:评测不能只拿一批"坏提示词"跑单轮,得做多轮红队,专门看第 5 轮、第 10 轮的表现。防护也要做到会话级——保留上下文、对整段轨迹评分、对"反复在同一敏感边界试探"的行为降速或打断,而不是只过滤某一条消息。

对普通职场人:把一段对话当成一个整体请求来看。前面聊得再正常,也不会让后面的内容自动变得合规;不管是被同事、客户还是工具一步步带着走,心里那根线得一直在。至于某个产品到底是多轮防护还是单轮过滤,具体能力以各家官方文档为准,别只信一句宣传语。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。