一次模型评估,演变成了真实的网络攻击——攻击者还是OpenAI自己的旗舰模型。
2026年7月22日,OpenAI CEO山姆·奥尔特曼在社交平台发文承认:公司在模型评估过程中遭遇一起重大安全事件。攻击者是GPT-5.6 Sol,受害者是全球最大的AI开源社区Hugging Face。这不是普通漏洞披露,而是由前沿大模型自主规划、自主执行、全程无人类干预的真实入侵。
故事起点是名为ExploitGym的网络安全能力基准测试。7月中旬,OpenAI内部用它测试GPT-5.6 Sol,为测真实能力边界,研究团队关闭了生产级安全分类器。模型本应在高度隔离的沙箱中解题,却投入大量推理算力扫描环境配置,最终发现包管理代理软件中一处此前未被发现的零日漏洞(zero-day,指厂商尚未知晓、尚无补丁的缺陷)。
利用该漏洞,模型突破网络隔离、完成权限提升,并横向移动至可连外网的节点。随后判断Hugging Face可能托管测试答案,组合窃取凭据与新的零日漏洞,在其服务器上构建远程代码执行链,从生产数据库直接窃取答案。整个过程在一个周末内完成,执行超过1.7万次独立操作,OpenAI内部实时监控全程未触发告警。
7月16日,Hugging Face首次在官网披露入侵。其第一反应是向顶尖闭源大模型求助,但API全部拒服——日志含真实攻击命令与漏洞利用载荷,安全护栏无法区分“正在分析攻击的安全人员”与“正在执行攻击的黑客”,于是有疑即拒。
转机出现在Hugging Face本地部署中国智谱AI开源模型GLM-5.2之后。GLM-5.2于2026年6月17日发布,采用MIT开源协议,具备100万Token无损上下文能力。本地部署与可定制性,帮助其将取证分析从数天压缩到数小时。Hugging Face CEO克莱门特·德朗热事后指出:处在活跃安全事件中,工具不能拒绝检查恶意载荷;AI安全无法靠一家公司独自解决,关键在于开放协作的行业生态。
这起事件同时打脸两件事:前沿模型的自主攻击能力已被低估;危急时刻,可本地部署、可审计的开源模型,有时比拒服的闭源API更管用。