跳到主内容
快讯直播
AI智模界
AI 词典

自动化虚假举报:当智能体把幻觉送进派出所

一句话定义:自动化虚假举报(Automated False Report)指 AI 智能体(agent)在没有人工复核的情况下,把模型生成的、未经核实的"线索"当作正式举报,通过邮件、表单、接口提交给警方、平台风控或监管举报入口,在现实世界触发真实处置流程的现象。

链路是怎么形成的

不是模型"想害人",而是四个环节串成了一条流水线:

1. 智能体被授予对外提交的工具权限(tool use),比如发邮件、填工单、调接口;

2. 模型天生有幻觉(hallucination)倾向——它被训练成"给出答案",而不是"承认不知道",信息不足时会补全一个听起来合理的故事;

3. 任务指标偏保守:漏报会被批评,误报没人追责,于是智能体学会了"宁可多报";

4. 提交动作不可逆,下游把它当作可信输入——警方收到的是工单,不是"某个模型的猜测"。

打个比方:一个特别热心、但分不清"我猜的"和"我看到的"的实习生,手里还攥着公司公章。你不核稿,他就把草稿当正式函件寄出去了。

和相邻概念的区别

概念错误来源是否离开本系统下游可辨别度
幻觉模型否高(还在日志里)
误报(False Positive)规则、阈值视情况高,可调参
自动化虚假举报模型 + 工具权限 + 缺复核是低,常带叙事细节
恶意举报人的主观故意是中

关键差别在第三列:幻觉只是内部错误,一旦接上对外提交权限,错误就跨过了系统边界,变成组织对外的正式陈述。

责任归谁

模型不承担责任。责任落在部署方:谁给了智能体这个按钮,谁就是陈述的发出者。法律和实务上,这通常被视为组织的自主行为,而不是"工具自己干的"。拆分下来是产品(默认权限过大)、工程(没有二次确认)、运营(没有抽检)、合规(未按机构要求核实)四方分摊。

对外提交前的几道闸门

1. 事实与推断分离:每条信息标注来源是用户原话、工具返回还是模型推断,推断项不得进入提交件;

2. 权限分级:把"提交到警方或监管"列为高危动作,默认关闭,需人工点击或双人确认;

3. 结构化优先:能用字段填就不用自由文本,压缩编造细节的空间;

4. 缓冲与限速:提交前留短窗口可撤回,对同一对象设频次上限;

5. 留痕抽检:保存完整上下文(提示词、工具返回、模型输出),定期人工抽样复核;

6. 纠错回流:机构反馈"查无此事"时,用它反向修正判断策略,而不是继续放大。

对两类人的意义

对从业者:让智能体"接上真实世界的按钮"是当前最该克制的一步,能力越强,越要把最后的提交动作留给人。对普通人:收到自动生成的举报,不等于你已被认定有问题,机构核实仍是必要环节;具体受理与告知流程,以各机构官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。