当模型能「自己找漏洞并串攻击链」,发布节奏就不再只是产品问题,而是安全治理问题。9月1日,OpenAI公开表示,即将发布的Astra模型在其Preparedness Framework下首次达到「Critical」级网络安全能力阈值——即模型可在较少人工分步指导下,发现此前未知的安全缺陷并发展利用路径。公司仍计划「soon」发布面向公众的Astra版本,但高级网络安全能力将显著限权,主要通过Daybreak等受控项目向经审核伙伴开放。
OpenAI 2023年引入Preparedness Framework,用于跟踪可能造成严重伤害的前沿能力。去年框架更新区分「High」(放大既有伤害路径)与「Critical」(带来前所未有的新路径)。据OpenAI官方博文与公开沟通,内部评估与专家意见显示,Astra在代理式编码与网络安全任务上进展显著,公司「无法排除」Critical级网络能力;因此加强隔离测试、权重保护、实时监控与高风险活动暂停等措施。研究副总裁Amelia Glaese在媒体沟通中称,Astra可在多种受保护系统中发现未知漏洞并自主推进利用思路;同时承认 safeguards 可能误伤合法安全研究。
治理与发布要点:
OpenAI此前曾因加强防护而延迟Astra部分开发,并强调Astra未参与Hugging Face相关安全事件。公司同时承认:限制Astra的网络安全能力输出,也会阻碍部分企业与机构做合法防御性漏洞研究——如何在「滥用风险」与「防御能力」之间找平衡,已成为Frontier lab的公开难题。公开转述称,safeguards 可能误将合法安全活动标记为滥用,这会影响红队与渗透测试工作流的可用性。
所谓Preparedness分级,白话是公司给「危险能力」设交通灯;所谓Daybreak,白话是类似「持证上岗」的网络安全合作通道,而不是把最强Cyber能力放进免费ChatGPT;所谓零日利用,白话是在厂商尚未发布补丁前,攻击者(或防御方测试者)已找到可利用漏洞路径。Astra议题与GenAI.mil、Claude Mythos受限版、各国网络演习形成同一背景:前沿模型正在变成双向工具。
放在产业上下文里,企业安全采购会把「模型能力分级+用途审计+人工复核」写进合同;主权国家也会仿建军政AI门户,但Critical级能力的出口管制叙事可能同步收紧。产业影响上,安全团队会把更多预算投向「AI辅助防御+AI辅助攻击」的对抗演练;模型采购合同也会新增能力分级与用途审计条款。边界:具体上线日期OpenAI未锁定;Critical判定基于内部评估,外部独立复现有限。下一观察点是广泛可用版默认禁用哪些工具、Daybreak Red层审批节奏,以及误报率是否影响正常开发工作流。