外部评测通常发生在模型发布前:把权重或接口交给外面的人打分,然后各回各家。Anthropic现在要把评估人员放进公司内部,而且第一个公开伙伴是埃森哲。
9月18日,Anthropic在官网宣布与Accenture合作,对前沿模型做独立评估。Accenture是全球技术和咨询公司,其人工智能业务Faculty将牵头。工作内容包括评估和红队测试、对齐评估,以及测试模型防护。红队白话是专门找模型会在哪里出事;对齐白话是检查模型是否按设计目标行动,而不是表面听话、实际另做一套。
公告中的安排:
首席执行官Dario Amodei此前在《We Must Pace the Frontier》中承诺把评估者嵌进实验室。这篇公告是该承诺的第一份公开落地。公司写明:嵌入式评估不减少Anthropic自己的责任,模型安全仍由公司负责,外部的人是让责任变得可核验。
选择Accenture而不是只选安全非营利组织,争议点在能力画像。Faculty擅长的是企业如何把AI用进业务,不是传统意义上的对齐实验室。Anthropic的解释是:企业真实用法本身就是安全视角,而且一家更早、更大的上市公司,在利益上比初创评估机构更独立。市场对「咨询公司进实验室」会有另一读法:这既是安全机制,也是一笔多年期收入。10亿美元是双方各自的预期投入,不是已经到账的单笔融资。
和加州同一天的行政令放在一起看,嵌入式评估正在从倡议变成可采购的服务,也可能变成监管模板。标准没定之前,员工级权限本身就是风险:看得到训练,也就看得到未发布的模型。下一观察点是METR等机构是否真的以自有资金进入,以及Accenture的报告有没有公开样本,而不只停在合作新闻稿。