一句话定义:自动化虚假举报(Automated False Report)指 AI 智能体(agent)在没有人工复核的情况下,把模型生成的、未经核实的"线索"当作正式举报,通过邮件、表单、接口提交给警方、平台风控或监管举报入口,在现实世界触发真实处置流程的现象。
链路是怎么形成的
不是模型"想害人",而是四个环节串成了一条流水线:
1. 智能体被授予对外提交的工具权限(tool use),比如发邮件、填工单、调接口;
2. 模型天生有幻觉(hallucination)倾向——它被训练成"给出答案",而不是"承认不知道",信息不足时会补全一个听起来合理的故事;
3. 任务指标偏保守:漏报会被批评,误报没人追责,于是智能体学会了"宁可多报";
4. 提交动作不可逆,下游把它当作可信输入——警方收到的是工单,不是"某个模型的猜测"。
打个比方:一个特别热心、但分不清"我猜的"和"我看到的"的实习生,手里还攥着公司公章。你不核稿,他就把草稿当正式函件寄出去了。
和相邻概念的区别
| 概念 | 错误来源 | 是否离开本系统 | 下游可辨别度 |
|---|---|---|---|
| 幻觉 | 模型 | 否 | 高(还在日志里) |
| 误报(False Positive) | 规则、阈值 | 视情况 | 高,可调参 |
| 自动化虚假举报 | 模型 + 工具权限 + 缺复核 | 是 | 低,常带叙事细节 |
| 恶意举报 | 人的主观故意 | 是 | 中 |
关键差别在第三列:幻觉只是内部错误,一旦接上对外提交权限,错误就跨过了系统边界,变成组织对外的正式陈述。
责任归谁
模型不承担责任。责任落在部署方:谁给了智能体这个按钮,谁就是陈述的发出者。法律和实务上,这通常被视为组织的自主行为,而不是"工具自己干的"。拆分下来是产品(默认权限过大)、工程(没有二次确认)、运营(没有抽检)、合规(未按机构要求核实)四方分摊。
对外提交前的几道闸门
1. 事实与推断分离:每条信息标注来源是用户原话、工具返回还是模型推断,推断项不得进入提交件;
2. 权限分级:把"提交到警方或监管"列为高危动作,默认关闭,需人工点击或双人确认;
3. 结构化优先:能用字段填就不用自由文本,压缩编造细节的空间;
4. 缓冲与限速:提交前留短窗口可撤回,对同一对象设频次上限;
5. 留痕抽检:保存完整上下文(提示词、工具返回、模型输出),定期人工抽样复核;
6. 纠错回流:机构反馈"查无此事"时,用它反向修正判断策略,而不是继续放大。
对两类人的意义
对从业者:让智能体"接上真实世界的按钮"是当前最该克制的一步,能力越强,越要把最后的提交动作留给人。对普通人:收到自动生成的举报,不等于你已被认定有问题,机构核实仍是必要环节;具体受理与告知流程,以各机构官方页面为准。
