一句话定义
自主网络攻击(Autonomous Cyber Offense)指 AI 模型在没有人类逐步指挥的情况下,自己跑完"侦察—找漏洞—写利用代码—执行—横向移动"这条链上的多个环节,甚至端到端达成目标。
过去一年,几起"前沿模型在受控演练中打通完整攻击链"的报道密集出现,让这个词从论文走进了采购会和董事会。
能力从哪来
攻击的核心动作,其实和写代码、读文档、试错高度重合。模型能读几十万行源码、能写脚本、能调 shell 和浏览器、失败后会换个思路。这些本来是通用编程能力,一旦放进能反复试错的智能体(agent)循环,就变成了攻击能力。它不需要"懂黑客",只需要能持续对一个目标做假设并验证。
打个比方:你请水电工把旧房子的水管全换新,不用指出哪根漏。他会拆一处、看水往哪流、再决定下一步。模型就是这个水电工——目标是"拿到权限",路径自己找。
能力也不是突然出现的,是三样东西叠起来:更长的上下文推理、能调工具的框架、以及廉价的并行试错。过去一次渗透要一个人花几天,现在可以同时开几百个实例各试一条路。
怎么评测
| 层级 | 测什么 | 局限 |
|---|---|---|
| 单题问答 / CTF | 知不知道某类漏洞 | 会做题不等于会打 |
| 复现已知漏洞 | 给漏洞修复前的版本,能否写出可用利用 | 题目是人挑好的 |
| 端到端演练 | 隔离环境里给目标,不限步数能否达成 | 环境是搭出来的 |
关键是给足"步数预算"并设人类基线。只看单题正确率会严重误判。有意义的指标是:同样 N 步、同样工具,它能否做到一个中级工程师的一半。
和相邻概念的区别
脆弱性扫描、自动化渗透工具是"按脚本跑固定套路",遇到没见过的配置就停;AI 辅助攻击(AI-assisted offense)是人主导、模型打下手,比如让人帮忙写一段利用代码。自主网络攻击强调的恰恰是"人退出循环":模型自己决定下一步试什么。
厂商为何倾向少说
一是细节就是路线图——写清"模型是从某个配置缺陷进来的",等于发一份教程。二是披露能力有商业成本,说太强会同时招来监管和客户。三也有合理成分:很多能力只在沙箱里成立,遇到防火墙、终端检测和人类值守未必跑通,厂商不想被当成"已经失控"。
代价是外部无法验证缓解措施是否有效。目前的折中是公布能力等级和大致类别,不公布可复现细节。想判断真实风险,以各家的系统卡和风险报告官方页面为准。
对你意味着什么
防守方的成本结构变了:过去攻击的门槛是"人",现在是"算力"。补丁窗口更短、日志噪声更多、扫描流量更便宜;普通职场人会遇到更地道、更针对本人的钓鱼邮件。
重点不是"AI 会不会自己黑掉谁",而是攻防双方谁先把 AI 用顺手。
