当实验室一边追递归自改进,一边承认对齐计划不清晰,内部人用离职发声会迅速变成公共事件。据TechCrunch报道,曾在OpenAI与Anthropic从事预训练研究的Jacob Coxon于9月8日前后公开辞职,并在社交媒体发文称相关公司「正径直冲向自改进超级智能,并拿我们的生命赌博」;他写道,建造者中有人真心相信该技术可能在十年内杀死所有人。
Anthropic以「宪法AI」与安全品牌起家,却同样处在能力竞赛中。Coxon呼吁不要低估即将出现的超人类系统在网络攻击、领域颠覆与资源获取上的能力,并批评「因为别人不负责任所以我必须抢先」的竞赛逻辑。Anthropic对齐方向负责人Evan Hubinger随后发声称团队「真心相信AI可能杀死所有人类」,同时补充当前模型风险较低,但递归自改进带来的超级智能风险上升快于预期,并承认尚无清晰的超级智能对齐解决方案。TechCrunch称Anthropic未立即回应置评请求。
事件要点:
所谓自改进超级智能,白话是系统能自己迭代出更强版本,人类可能来不及踩刹车;所谓用辞职发声,白话是把实验室内部的恐惧差变成可引用的公共文本。对资本与客户,这会抬高「你们的熔断预案在哪」的尽调问题;对实验室公关,则很难再用「我们最谨慎」一句话打发。
放在安全治理上下文里,警告与加速往往同桌吃饭:一边承认>10%量级的灾难风险,一边继续训练更强模型。立法若把递归自改进写成明确规制对象,实验室的「内部竞赛借口」会更难成立;若只有听证会没有可执行文本,市场仍会按发布时间表定价。
产业影响上,此类公开决裂会抬高人才与声誉成本,也可能刺激更多内部人选择「带文件离开」或「带观点离开」。需要把边界读清楚:文中风险概率与时间表属当事人观点。下一观察点是头部实验室是否公布可检查的遏制响应计划,以及立法文本是否进入可执行阶段。