深信服|Sangfor AI登CyberGym全球前四、国内第一

PromptTree|阅读 0
2026/07/30 09:54
深信服Sangfor AICyberGymGLM
深信服公布AI安全智能体Sangfor AI在CyberGym评测成绩:基于国产大模型GLM-5.2固定配置,1507项漏洞挑战完成1301项,整体成功率约86.3%,跻身全球前四、国内参评第一,并在该榜单口径下超越部分采用OpenAI、Anthropic底座的海外方案。相关能力正走向企业研发流水线。

挖漏洞这件事,AI也开始组团作战——深信服把成绩单摊在了国际靶场上。

深信服是国内网络安全与云计算领域的头部厂商之一,近年持续把大模型能力嵌入安全产品线。Sangfor AI是其AI安全智能体:不是只做规则匹配的扫描器,而是能自主读代码、推演漏洞、复现并验证的Agent。对本轮企业客户来说,真正贵的不是「再发现几个常见注入」,而是能不能降低误报、看懂业务逻辑、把安全前移到研发提交的那一刻。

深信服公布Sangfor AI在代码安全评测CyberGym中的成绩。在基于国产大模型GLM-5.2的固定模型配置下,面对涵盖ARVO与OSS-Fuzz的1507项漏洞挑战任务,成功完成1301项,整体成功率约86.3%,最终跻身全球前四、位列国内参评团队第一,并在该榜单口径下实现对部分采用OpenAI、Anthropic底座方案的成绩超越。

细分与机制:

  1. 场景表现:ARVO相关任务成功率约87.2%,OSS-Fuzz任务成功率约77.7%。
  2. 评测定位:CyberGym以开源软件历史高危漏洞为考题,考核自主源码分析、多阶段漏洞推演、漏洞复现与PoC验证全链路。
  3. 架构:采用「智能体群体(Agent Swarm)协同」与「证据管治」机制。
  4. 四条运行逻辑:有界探索、证据持久化、动态假设裁决、对抗式候选评审。

所谓PoC(Proof of Concept,概念验证),白话就是「不只说可能有洞,还要拿出能触发问题的证据」。传统静态应用安全测试(SAST)擅长按规则找SQL注入、命令执行等模式;业务逻辑里的越权、认证绕过往往更难。深信服将机制总结为「以假设拓展探索,以证据裁定结论」——先并行试多种解释,再用可验证证据收窄,而不是让某个未证实假设悄悄变成集体共识。

对企业落地的含义:

  1. 拓宽检出:覆盖更多业务逻辑类风险。
  2. 降低人工:跨文件关联、攻击路径推理与验证交给自动化。
  3. 压降误报:多阶段推理与对抗评审减少无效整改。
  4. 前移安全:嵌入编写与CI/CD,实现「代码提交即自动审计」。

安全Agent赛道里,评测榜只是分诊入口;能不能进流水线、敢不敢信结论,才决定采购。深信服选择用国产底座跑国际靶场,信号很直接:关键基础设施客户既要成绩,也要供应链可控。下一步观察点:榜单成绩能否转化为可计量的误报率与修复周期,以及安全Agent会不会成为政企研发工具链的默认插件。