Anthropic|研究员Jacob Coxon辞职,警示自改进超级智能风险

PromptTree|阅读 0
2026/09/10 08:15
AnthropicJacob Coxon超级智能AI安全
9月8日前后,曾在OpenAI与Anthropic做预训练的Jacob Coxon公开辞职,警示自改进超级智能竞赛;Anthropic对齐负责人Evan Hubinger回应称团队认真看待人类灭绝量级风险,但尚无清晰超级智能对齐方案。

当实验室一边追递归自改进,一边承认对齐计划不清晰,内部人用离职发声会迅速变成公共事件。据TechCrunch报道,曾在OpenAI与Anthropic从事预训练研究的Jacob Coxon于9月8日前后公开辞职,并在社交媒体发文称相关公司「正径直冲向自改进超级智能,并拿我们的生命赌博」;他写道,建造者中有人真心相信该技术可能在十年内杀死所有人。

Anthropic以「宪法AI」与安全品牌起家,却同样处在能力竞赛中。Coxon呼吁不要低估即将出现的超人类系统在网络攻击、领域颠覆与资源获取上的能力,并批评「因为别人不负责任所以我必须抢先」的竞赛逻辑。Anthropic对齐方向负责人Evan Hubinger随后发声称团队「真心相信AI可能杀死所有人类」,同时补充当前模型风险较低,但递归自改进带来的超级智能风险上升快于预期,并承认尚无清晰的超级智能对齐解决方案。TechCrunch称Anthropic未立即回应置评请求。

事件要点:

  1. 动作:预训练研究者公开辞职并长文警示
  2. 焦点:递归自改进 / 超级智能失控,而非当前聊天机器人日常风险
  3. 呼应:同事公开认同存在高风险区间,但未同步离职
  4. 政策:美国与英国议会侧出现限制超级智能开发的立法动议讨论;安全倡议组织指出头部实验室普遍缺少公开发布的失控遏制预案
  5. 边界:涉及沙箱逃逸等事件仅作背景,不展开未证实攻击细节;离职声明是个人立场

所谓自改进超级智能,白话是系统能自己迭代出更强版本,人类可能来不及踩刹车;所谓用辞职发声,白话是把实验室内部的恐惧差变成可引用的公共文本。对资本与客户,这会抬高「你们的熔断预案在哪」的尽调问题;对实验室公关,则很难再用「我们最谨慎」一句话打发。

放在安全治理上下文里,警告与加速往往同桌吃饭:一边承认>10%量级的灾难风险,一边继续训练更强模型。立法若把递归自改进写成明确规制对象,实验室的「内部竞赛借口」会更难成立;若只有听证会没有可执行文本,市场仍会按发布时间表定价。

产业影响上,此类公开决裂会抬高人才与声誉成本,也可能刺激更多内部人选择「带文件离开」或「带观点离开」。需要把边界读清楚:文中风险概率与时间表属当事人观点。下一观察点是头部实验室是否公布可检查的遏制响应计划,以及立法文本是否进入可执行阶段。