MIT Technology Review 刊发文章《We're putting too much faith in AI's ability to say no》,把矛头指向 AI 安全讨论中一个常被默认的前提:模型在面对不当请求时会主动说“不”。
标题本身就是结论——我们对这项能力的信任,已经超出它实际能承担的分量。所谓“说‘不’”,指的是模型识别并拒绝执行某些请求:无论请求来自恶意用户、越界场景,还是模型被诱导后的产物。
这一质疑值得重视,是因为“模型会拒绝”长期充当着整个安全体系中最省事的一环。它往往被写进系统提示与产品说明,也进入了不少合规叙事:只要模型能挡住不该做的事,剩下的风险就可以交给模型自行消化。对开发者而言,这是一条低成本、几乎不需要额外工程投入的防线。
问题在于,一旦把这层拒绝当成可靠边界,安全设计就会随之变薄。拒答发生在模型的推理过程中,是持续生成的结果,而非外部强制的规则,其稳定性取决于提示、上下文与调用方式。而真正需要防护的场景,恰恰是这些条件被刻意扰动的时候。文章指向的正是这种错位:防线被认为存在,与防线在关键时刻是否生效,是两回事。
对 AI 从业者而言,启示并不复杂:不要把模型的自律当作唯一屏障。分层防护、外部约束、输入输出监控与人工复核,仍是必要的冗余。把“AI 会说不”当作一个需要持续验证的假设,而不是可以托付的安全底座,或许是这篇文章最值得记下的一点。
