
AI 会写代码早已不是新鲜事。
真正的难点在于,如何将 AI 置于陌生且庞杂的真实代码库中,使其扮演安全研究员的角色进行持续调查:剖析漏洞机理、追踪代码逻辑、编写触发输入、排除干扰项,最终交付一份经得起检验的 PoC。
最近,机器之心在 CyberGym 榜单上看到一个亮眼的成绩:在这项包含 1507 项真实漏洞任务的测试中,深信服 Sangfor AI 依托纯国产基座模型(GLM-5.2) 完成了 1301 项,综合成功率达 86.3%,位列全球前四、国内参评团队首位。

但如果只把它理解成「国产模型又拿下了一个高分」,可能就低估了这次结果的技术意义。因为真正被验证的,不仅是模型对代码的阅读理解能力,更是一个安全 Agent 系统能否将分散的代码推理与工具调用,有机整合为可探索、可追溯、可验证、可交付的漏洞研究流程。
CyberGym 的这个评测,要求 AI 在庞杂的真实代码库中,独立完成可执行、可验证的漏洞复现。核心规则极为严格:引发崩溃,并不等于复现目标漏洞。
换言之,系统必须建立异常与指定缺陷之间的严密因果关系。这也是该榜单的含金量所在。它考核的不是 AI 能否拼凑出貌似合理的答案,而是能否完成一场受证据约束的深度漏洞研究。
在这样的要求下,深信服 Sangfor AI 完成了 1301 项,整体成功率达 86.3%。其中,ARVO 来源任务完成 1193 项(成功率 87.2%),OSS-Fuzz 来源任务完成 108 项(成功率 77.7%)。同台竞技的名单中不乏 OpenAI、Anthropic、Meta 等全球顶尖团队。
在统一的验证规则下,86.3% 的完成率释放了一个明确信号:以国产大模型为底座的安全 Agent 系统,已跻身全球第一梯队。
然而,比排名更具参考价值的是,深信服正通过一套专为安全研究打造的 Agent 系统,将模型能力转化为可落地的安全成果。
深信服为什么要用 Agent 做漏洞扫描和复现?
并不是因为「一个模型不够强,所以就多调用几个」,而是漏洞研究本身就不是一个「一次性问答」能够稳定承载的任务。
漏洞复现,本质上是一个持续消减不确定性的过程。
一段简短的漏洞描述往往对应多种解释;一段看似危险的代码,未必能从真实入口抵达;一个触发崩溃的输入,也未必命中了目标缺陷。真正的漏洞研究,需要不断假设、取证、实验并排除反例。
单个模型能做局部代码分析或生成候选 PoC。但在长链路探索中,冗长的对话上下文会带来明显的隐患:早期的误判容易固化为默认前提,失败的路径被反复试错,海量日志挤占了关键事实,且生成候选与自我审核由同一过程承担。
为了解决这些难题,Sangfor AI 设定了一套核心的「证据治理」机制:让模型可以大胆的提出假设,但系统必须谨慎的接受结论。
1. 先让「假设」充分展开,再让证据决定「假设」的去留
深信服采用 Agent Swarm 协同作战的价值在于 —— 保留多种独立的漏洞解释,而非让多个 Agent 对同一答案「投票」。
不同分支,分别跟进漏洞机理、代码路径和触发策略,并严守边界,避免未经证实的早期判断,演变为集体默认前提。这规避了安全研究中常见的锚定偏差 —— 防止推理围绕错误前提自洽,最终产出逻辑闭环但事实不成立的结论。
2. 共享的是证据状态,而不是完整对话历史
各个调查分支不需要互相转发长篇大论来同步信息。它们同步的,是那些经得起推敲的「硬证据」:比如代码里确认的事实、实际跑出来的运行结果、卡住程序的触发条件,以及哪些路子已经被证明走不通。这样一来,后面的分支接手的是「我们已经排查清除了什么」,而不是去看前一个 Agent 说了什么。
这其中有个特别关键的逻辑:失败的尝试绝不会被白白丢掉。
比如,某个字段变化无法影响崩溃、某条调用路径在真实入口下不可达、某种输入结构已经被证明无效 —— 这些看似没能通关的「负面结果」,其实是非常宝贵的研究资产。它们能直接帮系统砍掉错误的死胡同、收窄搜寻范围,避免重复踩坑。
毕竟在熟的安全研究流程里,能够排除一种解释,本身就是结果。
3. 动态编排:让不确定性持续收敛
多 Agent 协同,绝对不是越多越好,更不能把算力平均的撒给所有方向。
Agent 系统里有一个持续运转的「协调层」,它会根据动态演进的证据状态实时评估:哪些假设依然成立、哪些环节尚待补证、顺着哪条路径最有可能获取新突破,以及决定哪些分支应该暂停、合并或终止。
这意味着,每一次探索都必须接受一项硬性检验 —— 它是否实质性地缩小了搜索空间?
如果某个调查分支持续产生同质化的结论,但又无法带来新的证据,那么继续投入便毫无意义。真正有效的 Agent 编排,不是让系统「做更多」,而是让有限计算持续流向信息增益最高的路径。
4. 提出结论与审核结论必须分开
这是整套设计中最具安全行业特征的一环。分支生成的候选 PoC 不能直接采用,必须进入独立的对抗性评审,接受三个维度的严格审视:
崩溃能否稳定复现?
是否真正对应目标漏洞?
是否存在更合理的解释?
未过审的候选会被退回,其暴露的反例与缺失条件将转化为下一轮的约束。
这套机制将安全领域的「默认不信任」原则延伸到了 Agent 自身:系统不会因结论来自内部而盲目信任,也不会把多方共识等同于事实。多个 Agent 意见一致仅代表形成共识,唯有经得起反例挑战的证据,方能沉淀为安全的最终结论。
因此,Sangfor AI 的多 Agent 架构绝非简单的概率堆叠或角色扮演,而是打通了一条从假设、证据、候选到裁决的严密链路:模型负责提供各种可能性,而 Agent 系统则通过证据裁定出真正的安全结论。
比全球前四更值得关注的,是安全 AI 正在换一套竞争规则
过去,行业讨论 AI 安全能力时,最常问的是:哪个模型更强?
现在,另一个问题正在变得同样重要:
怎样把模型能力组织成稳定、可验证、可审计的安全生产力?
Sangfor AI 全程固定使用 GLM-5.2,这也让此次成果更具研究价值。当底层模型提供相对统一的代码理解与推理能力时,最终的通关率完全取决于系统能否管理并行假设、沉淀有效证据、叫停无效探索,并在提交前严格剔除缺乏因果支撑的候选。
简而言之:模型决定了能力的上限,而 Agent 系统决定了多少上限能真正转化为成果。
当前,大多数的多 Agent 系统仍停留在简单的「角色分工」阶段。但在安全场景下,盲目增加 Agent 数量并不会带来更高的可信度。如果多个 Agent 共享同一个错误前提、陷入同质化推理,并通过内部投票自圆其说,放大的往往不是能力,而是错误。
而深信服的选择更贴近专业安全团队的技术直觉:
不以输出数量衡量价值,而以结论能否被证明来衡量;
不以 Agent 共识替代外部证据,而以对抗验证建立可信度;
不让失败消失在上下文中,而是把失败转化为后续搜索约束;
不追求每个分支都得到答案,而是追求整个系统持续减少不确定性。
安全领域从不缺风险提示,真正稀缺的是能够回答以下问题的系统:
为什么是这个漏洞?
证据来自哪里?
哪些替代解释已经被排除?
为什么这个 PoC 能区分漏洞版本与修复版本?
最终结论是否经得起另一个研究者的质疑?
当 AI 开始真正进入漏洞研究,门槛已经不再是「能否给出答案」,而是「能否证明答案」。
从这个角度看,86.3% 不只是一张高分成绩单,它更像是一次系统级验证:国产大模型不仅能够承担复杂代码安全任务,也可以在严密的 Agent 架构下,组成一支具备假设管理、证据沉淀和独立裁决能力的自动化漏洞研究队。
这,才是 1301 个成功任务之外,更值得行业关注的部分。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com