GPT-5.6证伪30年图论猜想,北大校友5天连破6题

58个单词,催命符式追问让GPT-5.6交出30年猜想的反例

一位名叫Dmitry Rybin的研究者,向GPT-5.6 Pro发起了挑战:验证一个名叫Dinitz-Garg-Goemans的图论猜想是否成立。这个猜想在1999年由三位学者提出,核心是单源不可分流问题——要求每批货物必须完整走一条路线,不能拆分,同时保证拥堵不超标。Rybin的整个“指挥”过程只有4条提示词,总计58个英文单词,外加一份附带文件。第一轮,他用大白话让模型帮忙寻找反例;GPT-5.6 Pro先建立线性规划验证方法,尝试超立方体、分层图等多种结构,筛查数千个实例,但失败。第二轮继续失败。直到第四轮,Rybin要求“用一个完整、无条件的反例收尾”,GPT-5.6 Pro终于端出一张由7个节点、9条有向边组成的小图,彻底证伪了这个坚持近30年的猜想。

GPT-5.6证伪30年图论猜想,北大校友5天连破6题

7节点9条边,一张小图卡死经典猜想

GPT-5.6 Pro构造的反例图结构极其精简:7个节点、9条有向边,一个共同起点和三个目的地,三批货物的需求量分别为15、10和15。猜想要求同时满足两个条件——负载不超道路上限,且成本不超过58。但AI列出所有可能的8种组合后发现:任意两批货物同时选择免费路线都会挤进同一段道路,使实际负载超过上限(如25超24、30超29、40超39);符合负载要求的方案最低成本为60,远高于猜想的58。这就形成了一个无法两全的局面。最终,GPT-5.6 Pro交付了四页证明证书、精确穷举验证程序、机器可读的反例数据和LaTeX源码,将猜想彻底击碎。

不到一小时,循环双覆盖猜想被AI攻克

就在同一天,OpenAI的另一款模型GPT-5.6 Sol Ultra利用64个子智能体,在不到一小时内独立完成了“循环双覆盖猜想”的完整证明。这一图论难题由Seymour、Tutte等大牛在1973年提出,悬而未决长达半个多世纪。AI的证明过程三页纸,逻辑严密,直接输出了一小时内从零到完成的完整论证。两个猜想一破一立,展现了GPT-5.6系列在数学推理上的惊人能力——不仅能用极简提示词推翻旧猜想,还能自主构造新证明。

答案比问题早30年,Erdős问题被标注为证伪

除了这两个直接成果,AI浪潮还波及了另一项经典问题。707号Erdős问题——一个比循环双覆盖猜想更早提出的数论/图论难题——被外界发现早已有答案,但直到最近才被正式标注为“Disproved”(被证伪)。这一发现部分得益于AI对大量文献的快速检索与模式匹配。短短一周内,从雅可比猜想到Dinitz-Garg-Goemans,再到循环双覆盖,AI寻找数学反例和构造证明的速度已经让学术界感到“离谱”。研究者们开始反思:当AI能在几小时内完成人类几十年未解的难题,未来数学家的角色将如何定义?