一句话定义
Cyber 模型(cyber model,也叫安全专用模型,security-specialized model)是指在通用大模型基础上,专门用网络安全攻防语料继续训练或微调,并针对安全场景重新设计拒答策略、工具调用接口与评测方式的大模型。
它和通用模型差在哪
打个比方:通用大模型像一位博学但谨慎的全科医生,什么都懂一点,可你让他上手做急诊手术,他要么拒绝,要么只肯给你念教科书。Cyber 模型更像急诊科的值班医生——训练材料里全是伤口、出血和急救流程,见到「这个漏洞怎么利用」「这段流量是不是 C2 回连」这类问题,不会第一时间扭头就走,而是先判断你有没有站上手术台的授权。
它的语料通常包括漏洞公告与 CVE 描述、恶意样本分析报告、攻击技战术知识库、告警日志、逆向笔记、渗透测试记录、检测规则等。目标产出也很具体:把一串告警翻译成人话、生成一条检测规则、解释一段混淆脚本、给出排查步骤。
三个关键差异
拒答策略:从一刀切到看情境
通用模型对「写一段反弹 shell」「如何绕过 WAF」通常直接拒绝,因为它在公开互联网语料上做对齐,无法区分授权渗透测试与真实攻击。Cyber 模型试图做情境化判断:在明确授权、有工单号、有资产归属的上下文里给出可操作内容,同时保留对明显恶意意图的拒绝。这个边界很难画,也是这类模型最大的争议点。
工具调用:从查天气到动生产环境
通用模型的工具调用多是搜索、计算器、代码沙箱。Cyber 模型要对接 SIEM、EDR、威胁情报平台、工单系统,输出结构化的查询语句或处置剧本。关键设计是区分只读操作与有副作用的操作,后者通常要人工确认。
红队评测:从考试到实战演习
通用模型评测看知识问答和指令遵循。Cyber 模型要额外考三件事:会不会被提示注入(prompt injection)诱导输出攻击载荷;检测建议的误报漏报;以及在恶意使用下的抵抗能力。评测集常由攻防团队自己构造,因此还涉及一个敏感问题——训练数据里的真实受害者信息不能被模型背出来。
| 维度 | 通用模型 | Cyber 模型 |
|---|---|---|
| 拒答策略 | 涉攻击内容基本拒答 | 按授权与情境分级 |
| 工具调用 | 搜索、计算、沙箱 | SIEM、EDR、SOAR、情报平台 |
| 评测重点 | 问答、指令遵循 | 攻防实战、抗注入、误报率 |
| 输出形态 | 自然语言为主 | 自然语言加查询语句、规则、剧本 |
对从业者意味着什么
对安全团队,它最现实的价值是把告警初筛、报告翻译、规则草稿这类重复劳动压缩掉,但定位仍是副驾驶(copilot),关键动作要人确认。对 AI 从业者,这是一个典型的领域专用模型样本:不是把模型做小,而是把对齐策略和工具接口做窄、做深。对普通人,别指望它让安全一劳永逸——攻击者手里也有模型。具体能力边界,以各厂商官方页面为准。
