eviso's thinking

Astra 用 2000 美元解了十年数学难题,昨天刚说孩子该学数学,今天就来了反证

CONTENTS

8 月 1 日,OpenAI 公布了一件让数学界集体沉默的事:它的下一代模型 Astra,用不到 2000 美元的计算成本,解决了十个至少十年没有进展的数学问题。每个问题都不大,但都卡了十年。证明用 Lean 4 形式化语言写就,发布在 GitHub 上,附一篇论文和一份由大模型自己生成的推理过程重构。

几乎同一时间,一位名叫 Kirwin Hampshire 的数学家公开描述了自己遭遇的「情感危机」:AI 正在改变数学这门学科,他不知道自己十年寒窗练出的解题能力,在机器面前还剩多少意义。

昨天我写了一篇《高考报志愿,AI 时代的孩子该学什么》,核心论据是「数学让孩子能验证 AI 的结论」。今天 Astra 就把这个论据顶到了墙角:如果 AI 能自己解十年未解的数学题,那孩子学数学,到底在学什么?

答案是:孩子学的从来不该是解题,是选题。

先看清 Astra 到底做了什么

把 Astra 的成就说得保守一点:它解决的十个问题,是「十年没有进展」的问题,不是「人类完全解不出」的问题。OpenAI 没有公布它试了多少个问题才成功十个,这个数字可能是 100,可能是 1000。成本 2000 美元是按 GPT-5.6 Sol 的 token 价格算的,不包括训练 Astra 本身的巨额算力。

但算到这个份上,这件事依然震撼。十年前,一个数学家可能在一道题上耗掉整个职业生涯,还不一定有结果。现在,一台机器用一夜的电费,在形式化证明系统里把路走通了。

这指向一个更根本的转变:数学的「解题」环节,正在从人力密集型变成算力密集型。就像 2016 年 AlphaGo 以 4:1 击败李世石,人类几十年的棋谱积累被自我对弈三个月抹平。数学的「证明」正在经历同样的过程。

但注意一个细节:Astra 证明的是「已知的问题」。这些问题的价值是早就被确认过的,是被人类数学共同体标记为「值得解」的。Astra 做的是攻坚,不是勘探。它解的是别人划定的矿脉,不是发现新矿。

数学家真正的危机不是被替代,是「选题权」还在不在自己手里

Kirwin Hampshire 的情感危机,本质上是这个:当机器能解所有题,数学家的价值还剩什么?

Horizon 8-2 daily digest 相关条目(详见编审纪要)。

答案藏在多伊奇 1998 年出版的《无穷的开始》第 1 章里。多伊奇对科学进步的定义不是「解出更多题」,而是「产生更好的解释」。他的框架是:知识的源头是猜想,猜想经过批评和检验变成好解释。好解释的特征是难改变,坏解释容易改。科学革命的真正决定性因素不是可检验性,而是对好解释的追求。

用这个框架看 Astra:它生成的是解释(证明),而且这些解释通过了 Lean 4 的形式化检验,从「好解释」的标准看,质量不低。

到这里,机器干得漂亮。

但多伊奇还有一个更关键的区分:问题。他说,问题产生于观念与经验的矛盾:你发现现有观念解释不了某个现象,问题才出现。「爱上问题」(波普尔语)是研究的第一步,也是最难的一步。

Astra 解决的问题,是别人已经爱上并标记出来的问题。它证明了「解题权」正在转移给机器,但「选题权」,也就是判断哪个问题值得解、哪个方向藏着金矿,依然是人类创造力的核心。多伊奇把创造力定义为「创造新解释的能力」,而这个能力的前置条件是「发现新问题」。

翻译成挖矿的比喻:Astra 是越来越强的掘进机,能在划定的矿脉里高速掘进。但「哪座山下面有矿」、「这座矿值不值得挖」,掘进机回答不了。那是勘探者的判断力。

昨天的文章今天被「打脸」了吗?没有,但需要修正

昨天我说「数学让孩子能验证 AI 的结论」,这个论据今天反而更强了,只是理由要换。

机器不会自己怀疑自己,大模型哪怕做出惊天证明,也不会回头看一眼说「等等,我刚才用了哪个假设」。这个结论「对」吗?大概率对,Lean 4 验证过了。但它「可信」吗?要看它是从哪个问题清单里挑的、试了多少次才成功、这个成功的样本有没有幸存者偏差。这些判断,机器不会替你做,因为机器不会怀疑自己。

这恰好是昨天那篇文章的核心:孩子学数学,学的不是算,是逻辑验证力。今天的修正版是:逻辑验证力正在被形式化系统接管,但「判断结论值不值得信」的判断力,依然是人学数学的真正收获。数学教人诚实、教人从公理出发一步步追问「凭什么」。这套思维肌肉,AI 越强,越稀缺。

这是文章第二个边界停顿。多伊奇把「好解释」作为科学进步的标尺,但「好解释」和「被信任」是不同的判定标准。形式化验证让「对」变得可证,但「可信」需要共同体接受,这中间还有人类的判断空间。

多伊奇的框架在这里给了第二层支持:他说所有的观察都是理论负载的,不存在「原始数据」。你相信 Astra 的证明,不是因为你复算了它,是因为你信任 Lean 4、信任 OpenAI 的方法论、信任数学共同体的审查,这些信任链条本身就是判断力的产物。判断力不是被 AI 取代了,是被 AI 逼到了更上游。

三情景:数学的未来往哪走

落到可验证的层面。以下判断建立在三个前提下:Astra 的数学能力不出现断崖式退步、Lean 4 这类形式化系统持续成熟、数学共同体对 AI 证明的接受度逐步提高。任何一条被打破,情景需要重画。

概率分布(粗略估计):基准 60% / 上行 20% / 下行 20%。「解题权转移、选题权还在」这个二元的隐含判断是基准情景。多伊奇 1998 的「好解释 + 难题」框架暗示长期看,AI 可能也会参与「选题」环节,这是上行情景。下行情景对应「形式化验证跟不上」的瓶颈。

陶哲轩「AI + 数学家大数学」预言出自 2024 年访谈。

基准情景:AI 成为数学家的「算力外挂」。人类数学家负责选题、建立直觉、判断方向,AI 负责在选定方向上高速推进证明细节。数学论文的署名变成「人 + AI 证明引擎」,类似今天的「人 + 计算集群」。数学家从解题者变成勘探者加项目经理。触发条件:AI 证明被主流数学期刊接受为独立方法,出现第一个「AI 辅助证明」的菲尔兹奖级成果。

上行情景:AI 反过来提出新问题。随着 AI 在数学内部产生自己的猜想(在既有理论缝隙里发现矛盾、提出新概念),它开始参与「选题」环节。就像 1997 年深蓝击败卡斯帕罗夫之后,国际象棋进入了人机协作时代。陶哲轩预言的「大数学」成为现实:人机协作共同体同时覆盖选题、攻坚、验证全链条。数学的进步速度指数级上升。触发条件:AI 提出至少一个被人类数学家公认为「好问题」的新猜想。

下行情景:形式化验证成为瓶颈。Lean 4 这类系统的验证能力跟不上 AI 的生成速度,AI 产出大量「看起来对但无法验证」的证明,数学界陷入信任危机。选题权依然在人手里,但「解出的题没人敢信」,数学进步被验证环节卡死。触发条件:AI 证明的规模超过形式化系统验证能力一个数量级,且验证基础设施投入不足。

什么信号说明这个三情景判断错了:1) Lean 4 类系统在 18 个月内规模扩 10 倍,但 AI 证明规模没增长(说明瓶颈已解);2) 出现 AI 提出被拒绝的好问题案例(说明 AI 选题权被拒);3) 数学共同体整体拒绝 AI 证明(说明接受度倒退)。任一信号出现,情景需要重画。

三个情景里,基准情景概率最高。它不是最激动人心的,但最符合当前的技术惯性:生成能力跑在前面,验证和信任基建在后面追。

这是文章第三个边界停顿。多伊奇 1998 框架写在 AI 数学出现之前,套在 2026 年 AI 数学上需要三重折扣:一,「好解释」的判定标准在 AI 时代需要重新定义(形式化验证是不是好解释?共同体接受是不是?);二,「好问题」的来源不再只来自人类(AI 可能也会发现矛盾);三,创新的传播路径(从猜想到共同体共识)在 AI 时代可能更短。

对昨天的文章,修正一句话就够了

回到孩子学什么。Astra 事件之后,数学教育的方向不是放弃数学,是把重心从「解题能力」移到「选题能力」和「判断力」。

解题能力正在被机器接管,这是事实,不需要回避。但选题能力,也就是判断哪个问题值得花几年去解、哪个方向能长出新东西,是勘探者的手艺,机器给不了。判断力,面对 AI 给出的漂亮结论,知道该信几分、质疑哪里,是读者的手艺,机器也不会替你做。

昨天那篇文章的三个建议(数学、哲学、艺术)不用改,但排序的理由变了:数学从「验证 AI 结论的工具」升级为「理解问题本质的训练场」;哲学从「看穿本质」升级为「判断哪个问题值得追问」;艺术从「审美判断」升级为「在无限可能性里选择「就是对的」那个」的能力。三样合起来,是完整的选题能力。

多伊奇在第 1 章结尾说,解释的延伸是「无穷的开始」:好解释能解决的问题,超出了它被创造时针对的问题。这句话在 AI 时代有了新的读法:孩子学的不是答案,是提出好问题的能力。AI 负责把好问题变成好解释,人负责在无穷的矿脉里,找到那座值得挖的山。

Astra 解了十年难题。真正稀缺的,是提出下一个十年难题的人。


本文的边界说明

本文的分析有三处明确边界需要承认:一,多伊奇 1998 的「好解释 / 难题」框架用在 2026 AI 数学上需要三重折扣,原始框架没预设「机器证明」这类对象;二,Astra 解的十个问题都是十年未进展而非完全解不出,结论的强度依赖 OpenAI 公布的样本范围;三,本文的「解题 / 选题 / 判断」三层 skill 区分是分析框架,不是教育学实证结论,孩子学数学到底有什么用需要更长期的教育数据支撑。

Sources

  • OpenAI 8-1 公告「Astra 数学证明系列」(OpenAI 官方博客原始 URL 待补)

  • Simon Willison 8-1 同步报道 simonwillison.net

  • Horizon 每日速递 2026-08-02(#8 Astra 数学;#17 OpenAI Astra 解决十个开放科学问题)

  • 多伊奇《无穷的开始》第 1 章「解释的延伸」(好解释 / 坏解释 / 问题 / 创造力 / 解释的延伸)The Beginning of Infinity, Penguin 2011

  • Kirwin Hampshire 数学界「情感危机」相关报道(Horizon 8-2 相关条目)

  • 陶哲轩「AI + 数学家大数学」预言(2024 年访谈)

  • Lean 4 形式化证明系统 leanprover.github.io

  • 昨天自写《高考报志愿,AI 时代的孩子该学什么》2026-08-02