Anthropic|Claude完成费马大定理首个端到端Lean形式化证明

PromptTree|阅读 0
2026/09/06 08:47
AnthropicClaudeLean费马大定理
9月4日,Anthropic在研究博客发布:Claude在约11天内基本自主完成费马大定理(FLT)首个端到端、可计算机检验的Lean形式化证明,写出约1300万行Lean代码、证明约2.95万条中间定理;成品经Lean核验,完整证明已放在GitHub(anthropics/fermats-last-theorem)。

AI写证明若不能被机器逐步检查,审稿与引用链条仍要回到「相信作者」。9月4日,Anthropic在研究博客发布:Claude在约11天内基本自主完成费马大定理(FLT)首个端到端、可计算机检验的Lean形式化证明。

Anthropic是美国AI安全与大模型公司,Claude为其旗舰模型系列。该项工作由Anthropic研究员Tianyi Peng发起,依托其与哥伦比亚大学合作开源的Prove2Me协作平台;使用约60亿输出token,模型能力公开称大致可比Claude Fable 5.1。成品经Lean核验,仅依赖Lean三条标准公理,并由比较器确认命题与Mathlib中FLT陈述一致;独立内核nanoda亦做复查。完整证明已放在GitHub(anthropics/fermats-last-theorem)。

形式化结果要点:

  1. 规模:约1300万行Lean代码、约2.95万条中间定理;约11天基本自主完成
  2. 消耗:约60亿输出token
  3. 核验:Lean核验 + 命题一致性比较器 + nanoda独立内核复查
  4. 评价:Kevin Buzzard称该成就证明除数学公理外无额外假设,且产物已稳健到可被继续构建
  5. 对照实验:三份Claude Max个人订阅协作约三天即可形式化Vinogradov三素数定理相关应用

所谓形式化,白话是把给人看的证明改写成机器逐步检查的代码;所谓Prove2Me,白话是用定理依赖图让多Agent并行证明、复用结果,避免丢状态。Anthropic强调:新颖之处在验证而非发现新数学——对照Wiles 1995年人工证明与多年人工核验史,形式化把「信任链条」交给证明助手。

放在数学共同体与长程Agent上下文里,这是「长程Agent + 可判定验证器」的强证据:模型可以跑很久,但最终门槛是证明助手说通过。对审稿负担、文献入库与AI生成证明的可信度,都会产生直接压力。

产业影响上,可检验性会成为AI生成证明进入文献的门槛。需要把边界读清楚:Claude未发现新证明路径,而是形式化已有现代证明纲要;证明体量远大于精炼后的Mathlib风格。下一观察点是社区精简入库进度与更多主流定理的自动形式化成本曲线。