OpenAI与数学界的摩擦继续升级。继10月上旬公布内部前沿模型数学研究成果之后,10月6日,OpenAI将一个内部模型生成的722篇数学手稿批量推送至公开仓库,覆盖372个问题族系,单题约耗三小时ChatGPT Pro算力。这批手稿涉及黎曼猜想相关边界推进等重量级题目,随后引来菲尔兹奖得主陶哲轩的公开批评和多国数学家的联名抵制——这是该事件的最新进展。
先补齐背景。数日前,OpenAI曾公布内部前沿模型的数学研究进展并开放GitHub仓库,宣称模型在形式化证明等方向取得突破,当时已引发数学界关注。此次722篇手稿的批量发布,规模远超此前的单点披露,被外界视为OpenAI在数学能力上的一次集中「秀肌肉」。
反弹的焦点不在能力本身,而在发布方式。陶哲轩的批评直指「一次性倾倒」:即便每篇手稿质量过关,722篇的体量也远超人类数学家的消化与核验能力,解题本身只是工具,数学共同体的知识沉淀才是目的。多国数学家随后联名呼吁抵制此类AI论文的发布方式;有复现者指出部分手稿可复现率偏低,关键代码留空;克雷数学研究所方面也未认可其中与千禧年难题相关的声明。业界用「纯粹的疯狂」来形容这批产出——机器写得比人读得快,核验环节成了整个链条的瓶颈。
需要说明的是,事件中的部分细节仍存在不同口径,例如复现率的具体数字、联名声明的签署范围等,均有待进一步核实;OpenAI方面暂未就批评作出详细回应。
这件事的深层张力值得展开。AI批量产出数学证明的能力确实在快速抬升,形式化验证工具(如Lean)让部分结论可以机器核验;但数学成果的价值不止于「对不对」,还包括证明思想能否被人类理解、吸收并转化为新的研究纲领。当产出速度与理解速度严重脱节,就会出现「知识大通胀」——大量结论堆积无人消化,学术评价体系随之失灵。
接下来值得观察两点:一是OpenAI是否会调整发布机制,比如引入数学社区的同行评议或分级披露;二是各国的AI数学成果核验基础设施(形式化证明库、社区复核组织)会不会因此加速建设。数学界与AI公司的这一轮碰撞,很可能催生AI科研成果发布的新惯例。