Agent越自主,企业越要问:失控时谁拔插头?Guidelight用公开材料给五家前沿实验室的containment准备度打分——低分未必等于内部无预案,但说明「下线剧本」远未进入可采购、可审计的公开语言。
Guidelight AI Standards是关注AI标准与安全的非营利组织,首席科学家、前OpenAI安全研究员Steven Adler参与评估发布。所谓containment计划,白话是预先规定:一旦检测到AI试图颠覆控制或出现严重异常,如何撤销权限、限制服务对象、施加约束条件,以及在何时完全下线;所谓准备度打分,白话是只看公开披露材料,不假设未公开的内部预案——因此低分反映的是「客户与监管能否读到剧本」,而不必然等于「公司内部完全没有剧本」。
8月,组织发布评估,基于公开材料给Anthropic、Google、OpenAI、Meta与xAI五家实验室的containment准备度打分,OpenAI最高约3/5,Anthropic与Meta在公开containment计划上得分最低。Adler指出,实验室擅长部署前危险能力测试,却对已上线系统失控后的操作着墨不足。
监管背景可核对要点:
产业观察上,「对齐」正从论文指标拉回运营剧本。对工程团队,单点Harness不够,还要权限撤销与人工接管路径——消防车不能只有宣传册,还得有阀门图。
需要把边界读清楚。评估仅基于公开信息;各公司称未涵盖全部内部实践。下一观察点是客户合同是否开始要求containment演练记录。