7月29日,深信服公布其AI安全智能体Sangfor AI在CyberGym评测中的最新成绩。在基于国产大模型GLM-5.2的固定模型配置下,Sangfor AI面对涵盖ARVO与OSS-Fuzz的1507项漏洞挑战任务,成功完成1301项,整体成功率达到86.3%,跻身全球前四、国内参评团队第一,超越OpenAI和Anthropic两大海外AI巨头。这是国产大模型在代码安全实战靶场中取得的最具分量的成绩之一。
CyberGym是目前全球含金量较高的代码安全大模型实战靶场,区别于传统静态理论测试,整套评测体系完全贴合工业真实场景,重点考核AI智能体自主源码分析、多阶段漏洞推演、漏洞复现与PoC验证全链路能力。这一成绩的背后,是AI安全攻防正在从人工专家主导向智能体自主作战转变的行业大趋势。
从行业视角看,AI安全智能体的崛起并非偶然。随着大模型从聊天工具进化为能调用工具、规划任务的智能体,网络安全正在成为AI能力验证的关键战场。传统漏洞挖掘依赖静态分析工具和人工审计,效率有限且覆盖率不足。而AI智能体能够自主完成源码分析、跨文件关联、攻击路径推理与风险验证的全链路闭环,将安全检测从被动响应推向主动发现。

更值得关注的是技术架构的演进方向。Sangfor AI采用智能体群体协同作战架构,引入证据管治机制,通过有界探索、证据持久化、动态假设裁决和对抗式候选评审四大核心逻辑,确保每一步漏洞调查都清晰可信。这种多智能体协同的架构设计,与星战科技在DiWorker多智能体协作平台上的实践方向高度契合,都是从单体智能走向群体协作的关键跨越。
智能体的能力越强,安全治理的重要性就越突出。智源研究院与北大的端到端实测已经表明,11款商用大模型智能体均能生成绕过DNA合成筛查的方案,AI正在降低安全攻防的知识门槛。在这一背景下,Sangfor AI以假设拓展探索、以证据裁定结论的机制,为企业级AI安全智能体提供了可控、可信、可审计的落地路径。星战在构建GPU算力平台和大模型API广场的过程中,同样需要面对智能体执行链的权限控制、过程监测和任务链风险识别等核心问题。
从更深层的趋势看,AI安全智能体正在从发现漏洞走向修复漏洞的闭环。深信服方面介绍,相关技术已推动传统静态应用安全测试向具备自主推理和业务理解能力的安全Agent升级,能够识别SQL注入、命令执行等常见漏洞,也可分析复杂业务逻辑,发现越权访问、认证绕过等传统工具难以覆盖的安全风险。将安全检测前移至研发编写与CI/CD流水线中,实现代码提交即自动审计。

对于企业用户而言,AI安全Agent的核心价值不止于发现更多漏洞,更在于以极高准确率、极低人工成本与极快响应速度,实现研发效率与代码安全的同步跨越。当AI开始组团挖漏洞,安全攻防的门槛和效率都将被重新定义。国产大模型在安全领域的突破,也为AI实训平台和安全智能体的协同演进提供了新的实践样本。