Guidelight评估|前沿实验室公开「失控模型」containment计划普遍缺失

PromptTree|阅读 0
2026/08/22 17:34
GuidelightcontainmentAI安全监管
非营利组织Guidelight AI Standards于8月发布评估,基于公开材料给Anthropic、Google、OpenAI、Meta与xAI五家实验室的containment准备度打分,OpenAI最高约3/5,Anthropic与Meta在公开containment计划上得分最低;评估强调实验室擅长部署前测试,却对已上线系统失控后的操作着墨不足。

Agent越自主,企业越要问:失控时谁拔插头?Guidelight用公开材料给五家前沿实验室的containment准备度打分——低分未必等于内部无预案,但说明「下线剧本」远未进入可采购、可审计的公开语言。

Guidelight AI Standards是关注AI标准与安全的非营利组织,首席科学家、前OpenAI安全研究员Steven Adler参与评估发布。所谓containment计划,白话是预先规定:一旦检测到AI试图颠覆控制或出现严重异常,如何撤销权限、限制服务对象、施加约束条件,以及在何时完全下线;所谓准备度打分,白话是只看公开披露材料,不假设未公开的内部预案——因此低分反映的是「客户与监管能否读到剧本」,而不必然等于「公司内部完全没有剧本」。

8月,组织发布评估,基于公开材料给Anthropic、Google、OpenAI、Meta与xAI五家实验室的containment准备度打分,OpenAI最高约3/5,Anthropic与Meta在公开containment计划上得分最低。Adler指出,实验室擅长部署前危险能力测试,却对已上线系统失控后的操作着墨不足。

监管背景可核对要点:

  1. 加州SB 53已生效,纽约RAISE Act将于2027年1月生效。
  2. 联邦层面亦有《AI Kill Switch Act》等提案讨论紧急下线机制。
  3. 产业讨论正从「对齐论文指标」拉回「运营剧本」:日志、实时监控、第三方审计与紧急下线。

产业观察上,「对齐」正从论文指标拉回运营剧本。对工程团队,单点Harness不够,还要权限撤销与人工接管路径——消防车不能只有宣传册,还得有阀门图。

需要把边界读清楚。评估仅基于公开信息;各公司称未涵盖全部内部实践。下一观察点是客户合同是否开始要求containment演练记录。