AI叩开数学研究大门:当证明不再稀缺,数学步入混乱期?
2026年以来,数学领域接连爆出里程碑式突破:OpenAI发布的GPT-6 Astra将困扰学界近百年的孪生素数猜想上界从人类此前保持的246压缩至186,仅用时3天,而此前人类将上界从240推进到246耗费了整整12年;DeepMind推出的AlphaProof Nexus将大语言模型与Lean形式化验证深度结合,在353个开放的埃尔德什问题中自主解决了9个,其中最早一题已困扰学界56年,单题解题成本最低仅7.5美元;甚至北京协和医院博士后金山木通过自学数论,用GPT-5.6自主运行16小时,就解决了困扰数学界22年的克鲁瓦猜想。长期以来仅扮演高速计算器或证明检查器角色的计算机,正式叩开了数学研究的核心大门。
AlphaProof Nexus三天啃下困扰56年的数论硬骨头?
过去数十年,形式化证明始终是数学研究的辅助工具,需要研究者逐行编写逻辑严密的代码,效率极低。而新一代AI模型彻底改写了这一格局,Lean等证明助手的严格校验机制,让大模型常见的“看似合理实则错误”的幻觉问题无法蒙混过关。AlphaProof Nexus的突破正是这一趋势的集中体现:它不仅自主完成了从问题拆解到证明生成的全流程,还能通过形式化验证确保每一步逻辑无漏洞,单题最低7.5美元的成本,更是远低于人类数学家研究同类问题的投入。
不止是DeepMind,OpenAI、Anthropic等厂商同期也在数学领域取得大幅进展:GPT-6 Astra甚至实现了和Lean的实时联动,研究者可以通过对话直接生成形式化证明代码,浙江大学博士生马千里利用多种大模型写出2万行Lean代码,为百年前意大利数学家科隆博提出的行列式题给出了初版证明。过去因人力有限、技术难度过高而被搁置的数学问题,正在以极低的成本被批量攻克,“证明稀缺”的时代已经成为历史。
陶哲轩抛出“证明消化不良”:数学瓶颈从“做不出”变“看不懂”?
菲尔兹奖得主陶哲轩将这一变化概括为数学正从“证明稀缺”走向“证明丰裕”,他甚至宣布改变自己的工作习惯,不再试图实时跟进所有新产生的证明——AI生成证明的速度已经远超人类的消化能力,数学正在被自己的产出“撑爆”。
在陶哲轩的定义中,完整数学研究的链条可以分为五级阶梯:
- 证明生成:产出未经核验的证明;
- 证明验证:确认逻辑无漏洞;
- 阐释解读:将证明转化为人类可理解的数学思想;
- 同行评审接纳:通过学术共同体的审核;
- 融入标准理论:最终成为教科书级的经典内容。
此前AI的突破主要集中在第一、二级阶梯,大幅压缩了证明生成和验证的时间,但后续三级阶梯的处理能力完全没有提升:AI可以产出十万行完全正确但逻辑晦涩的形式化代码,却无法提炼出其中几页就能讲清楚的核心思想;可以批量解决难题,却无法判断哪个结果真正有研究价值、能和现有理论建立连接。
2026年9月OpenAI宣称其AI系统用88小时解决了千禧年难题之一——纳维-斯托克斯方程存在性与光滑性问题,公开了166页论文和Lean验证代码,但很快遭到25位菲尔兹奖得主联合声明反对:AI公司以解决数学难题作为能力基准,与数学界追求理解、提出新问题、培养人才的核心目标存在严重错位,大规模生产答案正在摧毁孕育思想的土壤。
陶哲轩将这种风险命名为“证明消化不良”:入口被AI打开的证明洪流,后续的阐释、评审、整合环节完全承接不住,最终只会