TL;DR:
这周数学圈彻底炸锅:GPT-5.6 Pro在4个半小时内证伪了一个30年的图论猜想,北大校友Shouqiao Wang用同款AI 5天连破6道Erdős难题。与此同时,OpenAI官方还展示了GPT-5.6 Sol Ultra用64个Agent 1小时内证明50年未解猜想。算力压顶,数学界开始悄悄讨论:这届菲尔兹奖,会不会是人类智力的绝唱?
如果你还在以为AI只能聊天、画图、写代码,那你可能错过了这个疯狂周末——AI突然从"文科偏科生"进化成了"数学奥林匹克金牌选手"。就在昨天,GPT-5.6 Pro用一张图、三句话,把图论领域一个30年的"老顽固"猜想直接证伪。而几乎同时,哥伦比亚大学博士生、北大数院校友Shouqiao Wang,也靠着GPT-5.6 Sol加Codex组合拳,在5天内攻克了6道悬而未决的Erdős问题。更别提OpenAI最新展示的"64个Agent联合作战",一小时拿下50年难题。
这不是科幻片,这是2026年7月24日的真实新闻。我们一个一个说。
三句话,怼翻30年猜想
故事的主角叫Dmitry Rybin,一个拿过国际大学生数学竞赛金牌、全国数学奥赛金牌,现在一家1亿美元AI创业公司当联创的狠人。他使用GPT-5.6 Pro,全程只说了三句话:
- "构造一个反例,你要做出突破,找一个结构化的反例。"
- "继续找,要有从问题结构的深层理解中得来的清晰策略。"
- "部分结果够了,我们直接给出一个完整的、无条件的反例。"
然后,AI就真给了一个反例,直接让Dinitz-Garg-Goemans猜想灰飞烟灭。1
先说说这个猜想是啥。1990年代,三位数学家Dinitz、Garg和Goemans证明了一个漂亮结论:只要网络中存在一个满足容量限制的分数流(可以按比例拆分数据),就一定存在一个不可分割流(数据不能拆分),且容量违规不超过"最大需求"。后来Goemans加了一个很自然的猜想:能不能在不增加容量违规的同时,成本也别上涨?这个"成本版"猜想一挂就是30年,2023年的论文里它还标注为"open",2026年1月的文献里依然open。几乎每个做图流的人都想过它。
Rybin的反例构造得极其精巧:三个终端,需求分别是15、10、15。每个终端都有一条"便宜路"(成本0)和一条"贵路"(成本30)。但三条便宜路两两冲突——也就是说,任何合法走法最多只能用一条便宜路,剩下两个终端必须走贵路,总成本至少60。而分数流可以按1/3、2/5、1/3的比例同时使用三条便宜路,成本只要58。58 < 60,猜想完蛋。
熟悉组合优化的朋友会立刻认出,这本质上就是一个三角形的稳定集不等式:整数解满足z₁+z₂+z₃≤1,而分数解是1/3+2/5+1/3=16/15>1。完美降维打击。
Rybin本人曾在证明和证伪两个方向上都花了几周思考,没想到AI在几句引导下就给出了反例。他把完整聊天记录公开,调侃说:这段人机对话本身就是个绝世好梗。2
北大扫地僧:5天6题,含陶哲轩未解题
如果说Rybin是"人类指挥AI",那Shouqiao Wang的故事更像一场人机合体的马拉松。这位13岁就拿下滑铁卢大学欧几里得数学竞赛世界第一,2016、2017年连拿中国数学奥林匹克(CMO)银牌,2017年全国高中数学联赛第一名,2018年进入北大数院的"满级人类",如今在哥伦比亚大学商学院攻读决策、风险与运营博士。他用GPT-5.6 Sol配合Codex,5天尝试了约13道标记为开放的Erdős问题,成功解掉6道,成功率46%。其中一道题连续跑了32个小时。3
他把方法拆成三条:
- 选题策略:只挑数学家本来就在讨论的题,排除那些跟重大猜想死死绑在一起的。
- 自己定义"胜利":精确重述问题、写清完整证明必须确立什么、列出哪些较弱的结论不算数、点名这道题特有的坑。
- 对抗审计:要求独立的对抗Agent去挑战每一个候选结论,让AI反复推翻自己、攻击自己的论证,直到再也挑不出实质问题。
整个过程就是一个死循环:尝试→失败→诊断→换路线→写证明草稿→对抗审计→修补。
值得一提的是,其中一道题目连数学大神陶哲轩都研究过,至今未解。Shouqiao Wang轻描淡写地说:"我有数学背景,但这套工作流不需要很深的数学知识。"——这话大概只有北大数院毕业的人才敢说。
从奥赛金牌到博弈论研究,这些数学天才正在用AI重新定义数学研究的玩法。他们的成果已经刷爆了AI圈和数学圈的X(推特)时间线。
AI数学家:64个Agent,1小时,50年难题
然而,真正让数学界后背发凉的是OpenAI官方展示的另一个成果。就在Rybin和Wang的成果被热议的同时,GPT-5.6 Sol Ultra用64个并发智能体,在不到一小时内生成了"循环双覆盖猜想"(Cycle Double Cover Conjecture)的完整证明。4 这可是图论中一个悬挂了50多年的核心难题,由数学家Szekeres和Seymour分别在1973年和1979年提出。
这个猜想的大白话版:在一个没有"桥"(独木桥)的道路网中,你能不能设计若干条公交环线,使得每条道路都恰好被两趟公交车覆盖?半个世纪以来,数学家们只能证明一些特殊情况,比如平面图成立、可3边着色的立方图成立……但完整的证明始终缺位。
OpenAI的方法是让64个AI智能体分散探索,拒绝千篇一律的策略。最终的证明路径堪称精妙:
- 化繁为简:先锁定立方图,因为只要证明立方图成立,所有图都成立。
- 引入8-流定理:利用Tutte的群流定理,给每条边分配一个有限域GF(3)上的非零元素标签,保证顶点进出向量和为零。
- 构建双元素集标签:AI独创一个引理——如果每条边能分配一个包含两个元素的集合,且每个顶点每个元素出现0次或2次,那么这个图就有循环双覆盖。这就像给每条道路发两块车牌,每个路口每块车牌成对出现。
- 线性代数降维打击:AI将拓扑问题硬生生转化为一个巨大的线性方程组,通过向量空间关系证明方程组永远有解。
整套推理人类数学家看了都叫好。英国数学家Thomas Bloom评价说:"这是一个非常漂亮的证明,方法简洁基础,如果当年有人想到,80年代就有可能完成。"5 他还指出,AI最大的优势不是提出全新思想,而是在不断尝试细微变化时拥有远超人类的耐心。
当然,这份证明尚未经过正式同行评审,整篇没有引用任何已有文献,也没用形式化验证工具。算力成本大约275到485美元,甚至比一顿米其林还便宜。数学界正以谨慎乐观的态度审查它。
菲尔兹奖:人类智力的"绝唱"?
4个半小时击碎30年悬案,5天连破6道难题,1小时征服50年猜想。这一连串的冲击波,恰逢新一届菲尔兹奖公布。圈内开始疯传一个说法:这可能是"人类最后一届"菲尔兹奖了。6
但与其说是绝唱,不如说是一个新纪元的开始。AI正在从"计算工具"进化为"科研搭档",能够真正拓展认知边界。从Rybin的三句引导,到Wang的对抗审计,再到OpenAI的64个Agent团队协作,我们看到了一种新模式:人类负责战略与审美,AI负责冲锋与细节。两者的结合,正在重塑数学研究的基本范式。
你觉得,AI距离拿下属于它的"菲尔兹奖"还有多远?也许不需要等到下一届。
参考资料:
(注:本文部分信息整合自新智元、IT之家、36氪等媒体报道)
-
Dmitry Rybin on X: "I disproved a 30-year-old graph theory conjecture..." (2026/7/24). https://x.com/DmitryRybin1/status/2079904005652893709 ↩︎ ↩︎
-
Shouqiao Wang on X: "Solved 6 open Erdős problems in 5 days with GPT-5.6 Sol and Codex" (2026/7/24). https://x.com/Qiaoqiao2001/status/2080003441821163958 ↩︎
-
50年未解的数学猜想,GPT-5.6不到一小时就证明·搜狐网·IT之家 (2026/7/12). https://m.sohu.com/a/1049346450_114760 ↩︎
-
GPT-5.6仅用1小时攻破50年数学难题,64个AI摘下图论皇冠·36氪 (2026/7/12). https://m.36kr.com/p/3896565258733189 ↩︎
-
新智元:GPT-5.6证伪30年图论猜想,北大校友5天连破6题 (2026/7/24). https://mp.weixin.qq.com/s/5xcVb3xaItceJ55yVFMh5A ↩︎