能力发布越密,治理席位也越敏感。9月9日,OpenAI宣布对齐研究者Paul Christiano加入其非营利基金会董事会,并进入安全与安保委员会(Safety and Security Committee),与主席Zico Kolter等工作;据Axios等报道,其亦以相关身份参与对营利实体的治理安排。OpenAI董事长Bret Taylor公开称,Christiano的工作以严谨方式聚焦能力提升带来的最难问题。
Christiano曾于2017–2021年在OpenAI领导对齐研究,是强化学习人类反馈(RLHF,用人类偏好信号训练模型更听话、更有用)等路径的重要推动者之一;此后创建Alignment Research Center,并担任美国商务部下属AI标准与创新中心(CAISI)高级技术顾问。把「写过对齐教科书级方法的人」拉回董事会,本身就是一则治理信号:安全不再只放在研究博客里。
治理信号要点:
所谓把对齐研究者拉进董事会,白话是把「安全反对意见」从外部评论区挪到内部表决与监督桌;所谓可外部验证,白话是声明不够,要看评估、熔断与披露是否真的变严。对OpenAI,这是治理可信度修复的一步;对同行,则可能迫使安全委员会从装饰性配置变成可对照的制度竞赛。
放在前沿实验室治理上下文里,过去一年能力产品与安全叙事经常「两张皮」:一边放模型,一边发原则。董事会席位若真能卡住高风险发布,意义大于再发一篇安全宪章;若只有头衔没有否决权,市场会迅速识破。
需要把边界读清楚:个人风险判断属研究者观点,并不等于监管已认定某一概率。下一观察点是安全委员会公开职权、第三方评估节奏,以及重大模型发布前的否决/延迟案例是否出现。