续:OpenAI Astra「循环深度」报道引安全界担忧思维链可监测性

PromptTree|阅读 0
2026/09/03 08:34
OpenAIAstra循环深度人工智能安全
继Astra触及Preparedness Critical级网络能力并计划限权发布后,The Information等报道称其采用循环深度技术,或降低思维链可监测性。安全研究者公开警告勿放大不透明循环;OpenAI回应称使用受限、将加强监测,并称计算图深度仍与GPT-4同一量级区间。架构细节待系统卡确认。

当模型能在较少人工指导下发现未知缺陷并串攻击思路,发布节奏就不再只是产品问题;若推理过程本身更难读,安全监测会再丢一层窗口。OpenAI此前已公开:即将发布的Astra在Preparedness Framework下首次触及Critical级网络安全能力阈值,广泛可用版仍将推出,但高级网络能力主要通过Daybreak等受控项目限权开放。近窗讨论则转向架构——据The Information报道、并由TechCrunch等梳理,Astra据称采用「循环深度」(recurrent depth / looped transformer)一类技术。

OpenAI是全球主要的前沿模型实验室之一,Preparedness Framework用于跟踪可能造成严重伤害的能力分级。Critical级被公司定义为可带来前所未有伤害路径的能力门槛;Astra因此伴随更强隔离测试、权重保护与用途限制叙事。这也是为何架构是否牺牲「可读推理」会立刻变成公开争议:网络能力与监测窗口绑在同一张时间表上。

争议与回应要点:

  1. 技术主张(报道口径):信息多次穿过同一组Transformer层,可能提升能力与效率,但使思维链更难监测
  2. 安全方担忧:若进一步放大不透明循环,可能削弱依赖可读推理轨迹发现欺骗或越权的手段;有研究者呼吁避免「竞相牺牲可监测性」
  3. 公司口径:对该技术的使用据称为受限;计划加强思维链监测;公开沟通称当前前沿模型(含Astra)计算图深度仍与GPT-4同一量级区间,否认转向完全不可读的「neuralese」
  4. 发布策略:广泛可用版与高级网络能力分层;系统卡将在发布时提供更多信息

所谓循环深度,白话是用层内反复计算换能力与成本,但外部更难看清「中途在想什么」;所谓可监测性,白话是安全团队还能不能靠可读推理抓住异常意图。即便书面思维链本身也不完美,它仍是目前少数可操作的对齐观测窗口之一。

产业影响上,Frontier lab的架构选择会直接改写企业采购合同里的「监测与审计」条款;监管讨论也可能从「输出是否安全」延展到「推理是否可检」。需要把边界读清楚:架构细节主要来自具名媒体对匿名源的报道,OpenAI尚未发布完整技术报告;Critical判定仍属内部评估。下一观察点是系统卡内容,以及默认产品中禁用哪些工具与监测接口。