菲尔兹奖得主用 ChatGPT 5.5 Pro 两小时干完博士级数学研究,连 prompt 都没怎么改
菲尔兹奖得主用 ChatGPT 5.5 Pro 两小时干完博士级数学研究,连 prompt 都没怎么改
如果今天只看一条 AI 新闻,建议看这条。
Timothy Gowers——剑桥三一学院院士、Collège de France 组合学讲席、1998 年菲尔兹奖得主——这两天在自己 博客 上记了件事:
他把数论学家 Mel Nathanson 一篇论文里的 open problem 直接丢给 ChatGPT 5.5 Pro。两小时之内,模型给了一个把现有 bound 从 exponential 改进到 polynomial 的非平凡新结果。
Gowers 自己定位这件事:
I didn’t even do anything clever with the prompts.
他没有做任何 prompt engineering。问题原文给过去,模型给答案回来。同时参与的一位 junior researcher 评价那个核心 idea ——「completely original」,完全是新的。
The Decoder 的报道 用了一个不算夸张的标题:「Fields Medalist says ChatGPT 5.5 Pro delivered PhD-level math research in under two hours with zero human help」。
好家伙,这事儿炸是有道理的。下面拆三个角度讲——发生了什么、它为什么炸、对程序员说了啥。
一、被解决的是一个什么问题
Mel Nathanson 是个搞加性数论的,研究的题目挺直觉化:给定整数集合,问它的”和集”(sumset)能有多大、有多小、用多少元素能精确构造出某种性质。
听起来抽象,但实际是数学里很经典的一类组合问题。维度上比初等数论难,但跟黎曼猜想那种”听不懂的难”还差好几个层级。研究者大致是数论 + 组合数学背景,PhD 二三年级能上手,资深研究者大半辈子都在啃。
Nathanson 在论文里留了几个 open problem——已知的 bound 是 exponential 的,问能不能更紧。这种”能不能更紧”的问题,是数学研究里最常见的一种:你有上界 2^n,问能不能改进到 n^c 这种 polynomial 级。改进 1 个量级在数学界就值一篇会议论文。
Gowers 把这个问题直接复制粘贴给了 GPT 5.5 Pro。
不到 2 小时,模型给出了一个新构造,把 bound 从 exponential 改进到 polynomial。这不是「降一个常数」,是「跳一个量级」。
他说他自己 zero mathematical contribution。意思是他没在思路上参与,他只是看着模型干活。
二、为什么这件事炸
这件事在数学圈炸的程度,跟 AlphaGo 击败李世石在围棋圈炸的程度,是一个量级的。
要理解为什么,得先理解数学研究是个什么活。
数学跟你写代码不一样。代码能跑就是对,跑不了就 debug。数学不一样——一个 proof 是不是对,每一步逻辑必须严格、自洽、闭合。你写错一个 quantifier 的位置,整个 paper 报废。中间任何一处用了未证明的 lemma,必须显式 cite。
这种「严格性」让数学成为 AI 最难攻克的领域之一。早期 LLM 写的”证明”经常看起来很对、读起来流畅,但仔细查每一步都能发现幻觉。
Gowers 这件事里关键不是 GPT 写得”流畅”,是它写得对。同行能跟着走完、能验证、能扩展。一个菲尔兹奖得主背书加上同行评议性质的 review,证明了这个结果不是 LLM 编的。
放到时间线上看,Terence Tao 在 2024 年底的预测是:「By 2026: AI will become a helpful assistant to mathematicians—a trustworthy partner.」这个时间点压上 Gowers 这次实测的「2026 年 5 月」,几乎是日程表对齐。
不再是”也许 AI 能帮上”,是「有顶级数学家拿真实未解问题做了对照实验,结果是 zero human help」。

三、对没在搞数学的我们说了啥
这条新闻乍看是数学圈的事,跟程序员关系不大。但仔细看,它打破了几个 AI 圈一直在传的迷思。
迷思一:「prompt engineering 是技能」。
这件事最反直觉的部分就是 Gowers 那句「I didn’t even do anything clever with the prompts」。一个菲尔兹奖得主完全不做 prompt 优化,效果就这么炸。
过去两年我们一直在听 AI 圈说「会用 AI 是新的核心技能」,「prompt engineering 决定上限」。这些话大半都对,但它们假设的是「当时的模型」。
GPT 5.5 Pro 这一代开始,模型自己已经会理解你想要什么了。粗糙的问题描述足以触发好结果。Prompt 优化的边际收益在收窄,模型自身能力的提升正在吃掉这一层。
意思不是 prompt engineering 死了,而是它的天花板正在降低。以前你勤练 prompt 能打过没勤练的人 10 倍,现在可能只打过 2 倍。再往后呢?
迷思二:「AI 不擅长严格领域」。
代码、法律、数学这种「错一个字就废」的领域,过去被认为是 AI 的弱区。LLM 输出长但容易幻觉,幻觉在数学里就是死罪。
Gowers 这件事直接打破了这个迷思。AI 不仅能在严格领域工作,还能输出「同行评说 completely original」级别的结果。
这件事的延伸是:严格领域的从业者可能比想象中更早被 AI 重构。律师、会计、数学家、formal verification 工程师——这些人一直拿”我们的领域容错率为零,AI 不可能进来”自我安慰。GPT 5.5 Pro 这一代正在拆这堵墙。
迷思三:「AI 只能做归纳,不能做创造」。
很多人对 AI 的判断停留在「它只能 interpolate 已有数据」。这是 GPT-3 时代的判断。
Gowers 那个 idea 同行评论是「completely original」。它不是在已有论文里找现成答案、不是在训练数据里 pattern match。它在做创造。
虽然这个创造的内核仍然可能可以解释为「在某种概念空间里的高维 interpolation」,但从结果上看,用户和评审看到的就是一个新构造。这种”新”有点子牛逼了——已经足够动摇 AI = 复读机这个判断。
四、给读者的实操建议
光感慨没用,给三个能直接抄进自己工作流的具体动作。
第一个:找一个你觉得”AI 应该做不出来”的真实问题,给 GPT 5.5 Pro 试试。
Gowers 这件事最值得抄的不是数学,是他的姿势——直接给问题,不优化 prompt。你脑子里一定有一些「AI 应该不行的事」(架构选型 / debug 一个老 bug / 写一个 spec),按 Gowers 的姿势喂过去,就丢原始问题,看模型怎么回。
比你想象的好很多的概率,是 50% 以上。
第二个:分清「思考型问题」和「执行型问题」。
Gowers 这种是典型的思考型——边界是「想出新东西」。这种问题 GPT 5.5 Pro 这一代最猛,因为它能调动训练里学到的高密度知识做拼接。
执行型问题——「把这段代码改成异步」、「把这个数据从 CSV 转 JSON」—— 反而是 Claude Code、Codex 这种 agentic 工具更猛,因为这些活儿需要工具链 + 长上下文 + 反复 iterate。
两类问题分到不同 model 上,效率会比一律用同一个模型高 30%。
第三个:建立你自己的 “我的菲尔兹奖时刻” 标尺。
Gowers 那个时刻是「问题 → 2 小时 → 新结果」。你的标尺是什么?
可能是「一个我憋了一个月的设计问题,AI 帮我突破了」。可能是「一个我以为只能扔给 senior 的 review,AI 给出比 senior 还细的反馈」。可能是「一个我从没想过能自动化的事,AI 一句话搞定」。
记下这种时刻。每个月凑出 3-5 个这种时刻,棒棒的你就有了对 AI 上限最准确的私人估计——比看任何评测、读任何 KOL 帖子都准。

五、说回 Gowers 自己
这条新闻最容易被忽略的细节,是 Gowers 自己的反应。
他不是在炫耀「我用 AI 出了个结果」,他是用一种相当克制、相当数学家的口吻在记录:「I had an experience with ChatGPT 5.5 Pro recently that I want to write down」。
他没说 AI 替代了他。他说的是「这件事有意思,值得记下来」。然后他就严格地记——把问题原始描述、模型的输出、自己的核对过程都写下来。最后给一个判断:「这值得整个数学圈认真对待」。
这种记录方式特别值得抄。当你看到 AI 干了一件超出你预期的事,第一反应不该是震惊,应该是记录。把上下文、prompt、输出、自己的核对过程都写清楚。
一是给自己留 baseline,将来对比 AI 又突破了什么。
二是这种记录本身就是社区财富。Gowers 这篇博客在 HN、X、各种数学家 mailing list 上炸圈,部分原因就是它写得严谨。同样的事让别人写就是个营销 tweet,他写就是研究文献。
我们这一代程序员 + AI 用户,正在经历类似的窗口。每个人手里都可能有自己的「Gowers 时刻」。问题只在于你有没有用 Gowers 那种姿势去记录它。
写在最后
Terence Tao 早在 2024 年底就预测 2026 年 AI 会成为数学家「靠谱搭档」,2030 年代后期可能产出菲尔兹奖级别的证明。
Gowers 这次实测 把那个「靠谱搭档」时间点提前了——已经到了。
数学是 AI 最难的领域之一,这个领域都被攻进来了,其它领域不会更慢。
我们用 AI 用得最累的时候,往往不是 AI 不够强,是我们假装它还跟一年前一样。今晚回家做一件事就好——找一个你最近抱怨过「AI 这事儿不行」的具体场景,重新试一次。
模型每三个月一代,你的判断也得每三个月更新一次。