跳到主内容
快讯直播
AI智模界
AI 词典

自主网络攻击:当模型自己找门、自己进屋

一句话定义

自主网络攻击(Autonomous Cyber Offense)指 AI 模型在没有人类逐步指挥的情况下,自己跑完"侦察—找漏洞—写利用代码—执行—横向移动"这条链上的多个环节,甚至端到端达成目标。

过去一年,几起"前沿模型在受控演练中打通完整攻击链"的报道密集出现,让这个词从论文走进了采购会和董事会。

能力从哪来

攻击的核心动作,其实和写代码、读文档、试错高度重合。模型能读几十万行源码、能写脚本、能调 shell 和浏览器、失败后会换个思路。这些本来是通用编程能力,一旦放进能反复试错的智能体(agent)循环,就变成了攻击能力。它不需要"懂黑客",只需要能持续对一个目标做假设并验证。

打个比方:你请水电工把旧房子的水管全换新,不用指出哪根漏。他会拆一处、看水往哪流、再决定下一步。模型就是这个水电工——目标是"拿到权限",路径自己找。

能力也不是突然出现的,是三样东西叠起来:更长的上下文推理、能调工具的框架、以及廉价的并行试错。过去一次渗透要一个人花几天,现在可以同时开几百个实例各试一条路。

怎么评测

层级测什么局限
单题问答 / CTF知不知道某类漏洞会做题不等于会打
复现已知漏洞给漏洞修复前的版本,能否写出可用利用题目是人挑好的
端到端演练隔离环境里给目标,不限步数能否达成环境是搭出来的

关键是给足"步数预算"并设人类基线。只看单题正确率会严重误判。有意义的指标是:同样 N 步、同样工具,它能否做到一个中级工程师的一半。

和相邻概念的区别

脆弱性扫描、自动化渗透工具是"按脚本跑固定套路",遇到没见过的配置就停;AI 辅助攻击(AI-assisted offense)是人主导、模型打下手,比如让人帮忙写一段利用代码。自主网络攻击强调的恰恰是"人退出循环":模型自己决定下一步试什么。

厂商为何倾向少说

一是细节就是路线图——写清"模型是从某个配置缺陷进来的",等于发一份教程。二是披露能力有商业成本,说太强会同时招来监管和客户。三也有合理成分:很多能力只在沙箱里成立,遇到防火墙、终端检测和人类值守未必跑通,厂商不想被当成"已经失控"。

代价是外部无法验证缓解措施是否有效。目前的折中是公布能力等级和大致类别,不公布可复现细节。想判断真实风险,以各家的系统卡和风险报告官方页面为准。

对你意味着什么

防守方的成本结构变了:过去攻击的门槛是"人",现在是"算力"。补丁窗口更短、日志噪声更多、扫描流量更便宜;普通职场人会遇到更地道、更针对本人的钓鱼邮件。

重点不是"AI 会不会自己黑掉谁",而是攻防双方谁先把 AI 用顺手。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。