旗舰模型还没对外铺开,先把自己框架里的「Critical」门槛亮出来——OpenAI用官方安全文档解释为何放慢Astra。
OpenAI是美国前沿模型实验室,产品线覆盖ChatGPT、API与研究预览模型。Astra是其即将推出的下一代模型之一。Preparedness Framework(准备度框架)是公司自2023年以来用于评估高风险能力阈值的内部治理工具:当模型在网络安全等维度可能触及「Critical」档,就触发更强控制与对外透明度义务。
8月7日,公司在官网发布《Responding to the next frontier of critical cyber capabilities》,称过去数日对Astra的内部评估显示,其在智能体编程与网络安全相关能力上进展显著;结合专家研判,目前「无法排除」该模型在框架下达到网络安全Critical能力阈值。公司强调:Astra仍为即将发布模型,评估与基准工作还在继续;并澄清Astra未参与此前与Hugging Face相关的利用事件叙事(以免公众把不同事件线混为一谈)。
框架对Critical的界定是能力阈值表述,而非已发生的攻击事件复盘。例如:模型是否可能在无人类干预下识别并开发针对大量加固真实关键系统的功能性零日利用,或仅凭高层目标即可设计并执行端到端的新型网络攻击策略。OpenAI称初步评估表现足够强,现阶段不能排除该级别。
据此采取的管控动作包括:
产业意义在于:前沿实验室开始把「自家能力框架触发的主动减速」写成可公开核对的产品与治理动作,而不是只在发布会后补安全通告。对采购与部署方,这提示高能力智能体模型的上线节奏可能越来越多地受内部阈值与外部联合评测约束——「能不能训出来」之外,多了一道「敢不敢按框架继续跑」。
需要把边界读清楚。本文只陈述官方阈值与管控措施,不展开任何攻击链或利用细节。下一观察点是Astra对外部测试的节奏、强化控制落地后内部研发何时恢复全速,以及同类框架是否被更多实验室公开引用——主动减速一旦写成制度,就会变成资本开支与产品排期里的硬约束。