eviso's thinking

AI会找反例,还没证明自己

菲尔兹奖得主蒂莫西·高尔斯在 8 月 12 日写了一篇很克制的文章。他没有宣布大模型已经征服数学,也没有说大模型只会装饰门面,而是提出一个观察:OpenAI 宣布解决的十个数学与理论计算机难题里,最引人注目的成果几乎都落在反例或构造上,而不是人们通常称为重磅定理的那类证明。这个差别比「AI 能不能做题」更细,也更接近 AI 落地的真实边界。它记录的是 2026 年 8 月的能力切片,不是对未来的永久判断。

高尔斯特意补了一句,大模型并非只会找反例,它们也能证明困难命题。问题不在有无,而在分布。非 sofic 群的首次构造、多色 Ramsey 数的超指数增长,以及 Jacobian 猜想和单位距离猜想相关结果,这些成果集中在「给出一个对象,打破一个预期」的方向。换句话说,AI 最亮眼的成绩不是全面解释,而是精准击穿。

反例的力量来自它的验收结构。一个反例只要满足类型要求,又破坏目标性质,就能推翻全称命题;检验可以集中在对象和性质上,不必重走发现者的弯路。证明则相反,它要对所有相关对象负责,每一步都承接着前一步的必然性。反例是一个点突破,证明是一条链成立。搜索可以多线试错,链条不能有一处断裂。

这不是说反例没有技术含量。高尔斯在原文里反复强调,很多命题可以在逻辑上改写成存在命题或全称命题,单看量词形态分不出高下。数学社群称一个对象为反例,往往因为它推翻了专家原本有理由相信的判断。AI 擅长的可能不是「存在量词」,而是某种存在式搜索:先给候选,再让外部检查器判定。

高尔斯给出的机制解释也朴素。大模型知道大量数学,能调用相对标准的构造、随机方法和已知套路;作为计算机,它还能高速尝试大量失败路径。对人类来说低成功率的分支,模型可以负担。反例搜索恰好吃这两项优势:候选对象可以批量生成,候选是否合格往往有明确判据。

人类的相对优势则被高尔斯称为一种鼻子,也就是判断哪条路值得继续走的直觉。他说自己与 ChatGPT 讨论开放问题时,常看到听起来有希望、细想后希望变小的方案;模型也常把问题缩小成一个更精确的问题,听起来很有进展,连续五次之后却看不出接近终点。这不是修辞吐槽,是搜索树修剪能力的观察。

用搜索树看,反例和证明的差异更清楚。反例的终点可以是树中某个叶子,只要检查器确认,别的失败路径就可以作废。证明要穿过一棵深且多分支的树,且每一步都不能只在局部看似合理。模型可以横向撒网,人类更会纵向判断势。术是生成候选,道是决定哪条候选路径值得押上时间和声誉。

大卫·多伊奇在《无穷的开始》里把知识增长归因于猜想的提出和批评的筛选。这个框架放进当前 AI 数学,恰好解释了半边繁荣:模型极会制造猜想和候选,自动检查器、形式化工具和人类专家负责筛选。证明之所以更难,不只是筛选更严格,还因为它要求给出解释力足够的因果链,让后来者能沿着这条链继续前进。

解释力的边界也在这里。多伊奇的错误校正主要处理经验知识和科学理论,数学证明并不依赖实验反驳,AI 输出也不是天然的科学假说。把「反例、证明、验证」借到工程和工作流里有启发,但直接推出通用智能结论就越界了。框架能帮我们分清候选与接受,不能预测下一代模型会不会跨过概念性发现的门槛。

这个界限同样出现在智能体系统里。AI 可以生成十个方案、二十段代码、一百个实验假设,这是它的强项。系统敢不敢放行,取决于每个领域有没有稳定的检查器:代码靠测试、编译和运行时监控,数学靠形式化证明或专家审阅,业务决策靠事实链、口径和责任主体。候选生成越强,接受规则越要显性化。

企业里最危险的设计,是把「生成像答案」误当成「答案是结论」。一个模型给出的架构方案、投资论证或故障解释,在未被检验前只是一个候选世界。它可以启发人,但不能自动继承可信度。换句话说,AI 降低的是首稿成本,没有降低必然性成本。前者是表达,后者是让结论站得住的完整证据。

这也不是简单的人机对抗。高尔斯明确说,他不主张大模型永远不会拥有那种研究直觉,且按过去三年速度,跨越可能很快。真正的分歧是时间表和结构:如果能力来自广泛知识和高速尝试,模型会先吃掉标准套路;如果还需要在巨大搜索树中识别深度进展,人类仍会守住一段时间。

更公平的赛制应该奖励过程质量,而不只奖励终点答案。高尔斯提出过一个方向:训练时不只奖励解出,也惩罚大量无效探索或从文献中取巧。这个思路对企业智能体同样适用。一个 agent 若每次交出几十个低质候选,把筛选成本全部推给人,它的表面产出越高,系统实际越慢。

什么信号出现,说明本文判断错了?如果接下来一年,模型在公开难题上连续给出方法全新、事后被数学界认为自然且难以偶然碰到证明,而不只是找到打破猜想的构造,那么「候选强、证明弱」的边界就要重写。若形式化验证、自动检查和模型生成形成闭环,人类专家从审阅者变成纯策展人,这个判断也需要提前失效。

在那之前,不必急着宣布数学已被解决,也不必把 AI 的成绩贬成抽样运气。更稳的结论是:它已经证明自己很会找反例,还没有证明自己能稳定生产人类愿意继承的概念性证明。AI 的下一关,不是更长,而是更深。

Sources

  • Timothy Gowers,What sort of maths are LLMs good at?,2026-08-12
  • Techmeme RSS,Gowers 对 LLM 数学能力的转述,2026-08-16
  • 《无穷的开始》,猜想、批评与知识增长