TL;DR:
OpenAI的新模型Astra只花2000美元(约等于一个研究生周末的津贴)就解决了10个困扰数学界几十年的难题,包括非sofic群这种“菲尔兹奖级别”的硬骨头。数学圈先沉默后炸锅,但质疑声也不少:这到底是真·突破还是大型营销现场?不管怎样,数学研究的“价格标”已经被打了下来。
2026年8月1日,OpenAI扔出了一枚核弹。它的下一代模型Astra(目前还是内部版本)一口气解决了10个至少十年没有进展的数学难题。成本?折算下来只要2000美元——平均一道题200美元,差不多是北美一个研究生周末的津贴。1
消息一出,数学圈的反应不是欢呼,而是长时间的沉默。然后集体“裂开”:“这AI是要拿菲尔兹奖吗?”
Anthropic研究员半年前的调侃——“下周颁发的菲尔兹奖,可能是最后一个颁发给人类的”——眼看就要被OpenAI兑现了。2
但等等,是真突破还是营销?我们先看看Astra到底做了什么。
十连杀:AI挑翻了哪些“硬骨头”?
这十道题覆盖高维几何、编码理论、群论、算子代数、量子复杂度、格密码学、极值组合学等多个领域。每一道都是开放超过十年、核心进展长期停滞的“钉子户”。3
最炸裂的是非sofic群的存在性构造。 1999年,阿贝尔奖得主Mikhail Gromov提出sofic群概念——简单说,就是问“无限复杂的群能不能用有限的置换去逼近?”这个问题牵动一大片数学领域,27年来无数顶尖数学家尝试找反例,全折了。1
Astra直接从数学工具箱里拎出“二元Leavitt代数的单位群”,把Kun-Thom扩展图理论和Thompson群V揉在一起,硬生生逼出一个矛盾。3——这操作,人类看了直呼内行。
同一赛道的另一记重拳:Connes刚性猜想被直接证伪。 1982年菲尔兹奖得主Alain Connes曾断言某些群由它们的von Neumann代数唯一决定。Astra不仅推翻了这个断言,还“下了一场暴风雪”——它构造了一整个可数无限的群家族,这些群彼此不同构,但它们的von Neumann代数完全一样。4
还有停滞了46年的高维球体堆积问题。 1978年苏联数学家给出一个密度上限(KL界)后,再没人能往前推一步。Astra精确计算了Cohn-Elkies线性规划的指数衰减率,首次突破了那个卡了半辈子的界。1
此外,它还解决了埃尔德什的三道经典问题、给出了算术电路新下界、量子博弈指数并行重复定理、格密码学多项式因子近似困难性……曼彻斯特大学数学家Thomas Bloom说,这批成果的整体分量比五个月前证伪单位距离猜想更重要。4
数学圈:沉默、震惊、然后开始“找茬”
Astra公布后,顶尖数学家的反应非常直接。罗格斯大学教授Alex Kontorovich只留了两个惊叹号:“!!”1 菲尔兹奖得主Timothy Gowers表示:“如果这些证明通过了同行评议,我们需要重新思考‘做数学’意味着什么。”1 牛津大学的Thomas Bloom感叹:“25年前我们还在用纸笔,现在AI直接证明了非sofic群。”4 数学家兼AI研究员Ilya Glazer说得更彻底:“数学家的定义被改写了。”1
AI圈同样震动。OpenAI首席科学家Noam Brown说:“测试时计算还远未见顶——我们低估了推理算力的价值。”1 微软研究院副总裁Sebastien Bubeck感慨:“我不敢相信我们真的做到了。非sofic群从‘几乎不可能被证明’的列表中被划掉了。”1 独立评估机构Epoch AI强调,他们确保这些题目没有出现在训练数据中——Astra展现的不是检索,而是真正的创造力。5
但在一片惊叹中,刺耳的质疑声同样响亮。认知科学家Gary Marcus泼了一盆冷水:这是“合成谬误”——把数学上的成功夸大成通用智能的跃迁。数学专长并不等于通用智能,Astra甚至不一定能可靠地读取PDF。1 Marcus还指出,数学之所以成为AI突破口,是因为它适合符号验证和大规模生成合成数据,但这不能外推到开放世界。6
冷静四点:先别急着“封神”
热闹归热闹,以下几点值得你冷静下来再看。
第一,Astra是未发布的内部模型。 OpenAI只展示了精选的10道题,我们不知道它试过多少、失败了多少。Noam Brown承认他们试过黎曼猜想,还没成功。1
第二,同行评议尚未完成。 目前这些结果还没经过传统期刊的同行评议。有数学家指出,Astra在国会山的演示更像“精心策划的营销事件”。从“攻破”到“被数学界确认”,还隔着一个完整的独立复核周期。1
第三,Lean验证通过不等于证明原创。 OpenAI在GitHub上公开了Lean形式化证明文件,sorry_count为0,说明推导在逻辑上没有漏洞。但形式化系统只能检查推理链是否合法,无法判断模型是否真的“理解”了题目,也无法评价证明的方法和创新性。1
第四,2000美元只是推理成本。 这个数字只计算Token消耗,按Sol API价格折算。模型训练成本(数十亿美元)、研发团队薪资、选题成本、数学家参与费用都没有计入。把“2000美元拿下菲尔兹奖级难题”挂在标题里,有点把毛利率当成本价的味道。1
真正的大招:数学的“经济学”被改写了
抛开狂热与质疑,Astra这次真正的意义可能不在“10道题”本身,而在三件更底层的事。
第一,它第一次把“提出论证、整理论证、机器验证”串成了一条流水线。 过去大模型在数学领域充其量是算得快的计算器,现在论证由模型自己生成,人类负责整理,模型再转化成Lean形式化证明——数学研究最核心的两个关口“想出来”和“确认没错”第一次被同一个模型同时攻破。1
第二,能力证明从“benchmark分数”换成了“解决真正没人解决过的问题”。 未解难题没有参考答案,没有泄露风险,Astra展现的是真正的创造力。但这也留下一个软肋:验证权在谁手里?独立验证之前,“解了10道题”只能算营销信号。1
第三,Altman优先在华盛顿做demo,透露了很多。 Astra的发布首先是给政策制定者看的,因为AI政策的走向取决于是否相信AI公司有能力管好风险。Astra预计将成为首批须经特朗普政府新版AI框架审查的产品。6
所以,Astra真正的意义不是“AI要拿菲尔兹奖了”——至少今天还不是。它真正触及的是数学研究的经济学根基。以前养一个团队五年攻一道题,现在可能几千美元就能批量扫出候选答案。OpenAI同期宣布向10万科学家免费开放最强模型——这显然是在抢下一代科研入口。1
陶哲轩在2026年国际数学家大会上说的那句话,已经提前命中了这个时刻:“从证明稀缺到证明过剩。”1 当一台中端笔记本就能批量生产被机器验证的数学证明,稀缺的将不再是“能不能证出来”,而是“我们还想问出什么值得被证的问题”。
2000美元可以买来10个定理的证明,但买不来那个“为什么要问这个问题”的瞬间。那个瞬间,依然属于人类。
引用
-
OpenAI Astra用2000美元拿下10道世纪难题,数学家的定义被改写了吗?·36氪/第一新声·贾玥(2026/8/3)·检索日期2026/8/3. https://mp.weixin.qq.com/s/zfB280vHYJT7wTE07UJdEA ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
-
突发!OpenAI下一代AI攻克10项菲尔兹奖级难题·新浪新闻(2026/8/3)·检索日期2026/8/3. https://k.sina.com.cn/article_5953190046_162d6789e06703nbnq.html ↩︎
-
突发!OpenAI下一代AI攻克10项菲尔兹奖级难题·文学城(2026/8/3)·检索日期2026/8/3. https://www.wenxuecity.com/news/2026/08/01/126728546.html ↩︎ ↩︎
-
OpenAI Astra用2000美元拿下10道世纪难题,数学家的定义被改写了吗?·虎嗅网(2026/8/3)·检索日期2026/8/3. https://www.huxiu.com/article/4880224.html ↩︎ ↩︎ ↩︎
-
OpenAI 的下一代AI 解決了10 道菲爾茲獎級數學問題·KuCoin(2026/8/3)·检索日期2026/8/3. https://www.kucoin.com/zh-hant/news/flash/openai-s-next-gen-ai-solves-10-fields-medal-level-math-problems ↩︎
-
OpenAI新一代模型“Astra”攻克悬而未决十年之久的十大数学难题·yellow.com(2026/8/3)·检索日期2026/8/3. https://yellow.com/zh/news/openai%E6%96%B0%E4%B8%80%E4%BB%A3%E6%A8%A1%E5%9E%8B%E2%80%9Castra%E2%80%9D%E6%94%BB%E5%85%8B%E5%8D%81%E5%B9%B4%E6%82%AC%E8%80%8C%E6%9C%AA%E5%86%B3%E5%8D%81%E5%A4%A7%E9%9A%BE%E9%A2%98 ↩︎ ↩︎