25位菲尔兹奖得主联名警告:AI正在把数学变成「跑分场」,OpenAI 88小时解千禧难题引爆学术反弹(2026年9月)
9 月 11 日,陶哲轩、邓煜等 25 位菲尔兹奖得主联署《人工智能在数学中的严重错位》,反对 AI 公司把解数学难题当成模型跑分。五天前 OpenAI 宣称约 1 万个智能体用 88 小时给出纳维-斯托克斯方程的解,两天后便退出加州理工数学黑客松赞助。本文梳理完整时间线、两封公开信的分工、AI 在数学上真实的进展边界,以及三家前沿实验室的路线差异。
2026 年 9 月的第二周,AI 行业最激烈的一场争论没有发生在模型跑分榜上,而是发生在数学系里。
9 月 11 日,陶哲轩(Terence Tao)、邓煜、彼得·舒尔茨(Peter Scholze)、皮埃尔·德利涅(Pierre Deligne)等 25 位菲尔兹奖得主联署发表公开声明《人工智能在数学中的严重错位》(A Severe Misalignment of AI in Mathematics),直指 AI 公司把「解决数学难题」当成衡量模型能力的基准来推进的做法,正在损害数学研究本身与数学共同体。签署名单横跨了近半个世纪的菲尔兹奖历史——从 1978 年获奖的德利涅,一直排到 2026 年获奖的邓煜。陶哲轩把全文贴在了个人博客 What's new 上,另有专门站点 mathandai.org 承载并开放继续联署。
需要先说清楚的是:这不是一封反对 AI 的公开信。声明开篇就承认,过去几个月大语言模型的数学能力显著提升,已经能解决多个数学领域的重要未决问题;后文也明确认可 AI 在增强和加速真正数学研究上的潜力。数学家们不满的不是能力,而是成果的公布方式、以及背后那套激励结构。
要看懂这封信为什么恰好在这一天发出,得把 9 月 8 日到 9 月 12 日这五天串起来看。
一、五天时间线:从一条解题宣称,到两封公开信
| 时间 | 主体 | 动作 |
|---|---|---|
| 9 月 8 日 | OpenAI | 宣称内部模型以约 1 万个协同智能体、用时约 88 小时,给出了纳维-斯托克斯方程(七个千禧年大奖难题之一)的解 |
| 9 月 8 日 | 加州理工数学学者 | 联名公开信送达数学黑客松(Mathathon)主办方,反对赛事由 AI 公司赞助 |
| 9 月 10 日 | 加州理工数学共同体 | 公开信对外发布,签名数达 771 人,措辞直指 AI 公司「正在进行研究不端行为」 |
| 9 月 10 日 | OpenAI | 研究负责人 Dan Roberts 在 X 上确认:退出 Caltech Mathathon 的赞助与算力支持 |
| 9 月 11 日 | 25 位菲尔兹奖得主 | 发布《人工智能在数学中的严重错位》,并开放学术界继续联署 |
| 9 月 12 日 | 赛事赞助名单 | OpenAI 已从赞助商列表中消失;Anthropic、DARPA 的 expMath 项目、a16z、Y Combinator 等仍在列,赛事方称 10 月 30 日首轮照常举行 |
把时间线往前再拉三个月,会看到这件事并非突然爆发。2026 年 6 月,数学界发布《人工智能与数学莱顿宣言》,获国际数学联盟(IMU)支持,目前已有数千人联署;那份文件讨论的是 AI 对数学研究与学科未来的多重潜在威胁。9 月 11 日的这封 25 人声明,是同一个担忧在具体事件刺激下的升级版——陶哲轩在博客里解释,这份声明来自 25 位菲尔兹奖得主过去一周的密集讨论,因为认为情况紧迫,没有再走更广泛的协商流程。
二、宣言反对的不是 AI,是「先宣布、后补论文」
把声明读一遍,会发现它的诉求集中在三个层次,而且每一个都不涉及「AI 能不能做数学」这个技术问题。
第一,概念理解高于答案本身。在数学里,一个著名未解问题的价值不只是最后能得出「对」或「错」。它更像是学科地图上的地标——问题被解决,通常意味着研究者找到了新的洞见、方法或概念;这些成果还要经过数学家之间的报告、讨论与简化,最终才可能变成研究生甚至本科生能理解的教材。声明的原话是:「解决问题只是实现概念理解和洞察这一首要目标的工具和代理指标。」如果 AI 公司不断用「解决了多少此前未解的问题」来衡量模型进展,这个原本用来度量理解程度的指标,就会反过来变成被机器快速优化的目标。
第二,知识传承与学术规范受到冲击。商业 AI 系统公布结果时通常很仓促,来不及写出严谨论文、来不及梳理新方法、也来不及规范引用他人在先的工作。声明警告,这会在所有创造性职业里引发严重的归属与剽窃问题。同时,如果 AI 产出的思路缺乏人类数学家的后续消化与发展,就难以真正融入教学与后续研究,数学共同体内部那条靠人与人传递的知识链条可能被切断。
第三,这是智力劳动的共同课题。声明特别指出,商业算力的推进节奏与科学共同体真正目标之间的脱节,并非数学界独有,而是影响其他科学与创意职业、乃至整个社会的一部分。
值得注意的是,声明选用的核心词是 misalignment(错位/对齐失败)——这本是 AI 安全圈的专门术语。数学家用这个词来批评 AI 公司,等于把「对齐」问题从技术圈搬进了学科圈:不是模型能力不够,而是能力被导向了错误的目标。
三、导火索:纳维-斯托克斯的归属之争
真正点燃情绪的是那场解题宣称的后续。OpenAI 给出结果后,纽约大学数学家特里斯坦·巴克马斯特(Tristan Buckmaster)公开质疑:他本人正在与 Anthropic 研究员 Levent Alpöge 合作推进相关研究,OpenAI 是否读取了他使用 AI 工具的会话数据,才得以在算力冲刺中抢先完成?
OpenAI 否认直接访问特定用户数据,但同时表示无法排除去标识化的用户数据曾参与模型训练。就目前公开信息来看,两个方向的叙事都还没有定论,而且 OpenAI 给出的这份证明本身也尚未获得独立数学家的完整验证——这一点恰恰是数学家最在意的部分。
经济学上的后果很快就显现了。Caltech Mathathon 的第一轮安排在 10 月 30 日,赛制是学生团队用 40 小时、借助前沿大模型攻关公开的未解问题,每支队伍约 2 万美元的 token 额度由赞助商提供,OpenAI 与 Anthropic 合计承诺了约 200 万美元算力。OpenAI 退出后,其承担的份额变成悬空状态,主办方称已在与其他公司洽谈接续。Dan Roberts 的公开说法是:公司意识到 AI 在数学领域的快速进展带来了剧烈冲击,希望与数学共同体就如何整合这项技术展开更多沟通。
四、两封信,两种打法
这一周其实有两封公开信,语气和目标并不相同,放在一起看更能看清事态的性质。
- 第一封(proofsandprompts.com,771 人签名):由加州理工现任与前任数学学者发起,签署门槛是加州理工共同体成员或博士级以上研究数学家。它的措辞是整件事里最硬的——直接指控 AI 公司发动「科学虚假信息运动」,并写下「说白了,AI 公司正在进行研究不端行为」。它担心的具体后果包括:大量 AI 生成、看似可信但毫无推进的「垃圾数学」(slop mathematics)涌入,把同行评审的精力拖进海量排查;验证工作被无偿转嫁给研究者;以及赞助方可能把优秀本科生的真实成果据为己有。
- 第二封(mathandai.org,25 位菲尔兹奖得主):不点名任何公司,不评价具体赛事,讲的是学科价值与激励结构的长期错位。语气克制,但签署者的分量让它的传播力远超前一封。
两封信的分工恰好说明了一件事:争论已经从「某个成果的归属纠纷」,升级成「AI 实验室与科学共同体之间的机构级关系问题」——企业在这类合作中失去的,可能不只是赞助资格。
五、另一面:AI 在数学上确实做出了东西
如果只读批评的声音,容易得出「AI 做数学是纯炒作」的结论,这不符合事实。以下是过去两年公开可查、且相对受认可的一批进展(数据来自厂商口径与公开报道,具体证明的有效性以同行评审结果为准):
- 竞赛级能力已落地:DeepMind 的 AlphaProof 与 AlphaGeometry 组合在 2024 年国际数学奥林匹克(IMO)上达到银牌水平,相关成果发表于《自然》;AlphaProof 也是目前唯一拿到官方 IMO 评分金牌的数学专用系统。
- 反例搜索是当前强项:2026 年 5 月,OpenAI 的模型推翻了困扰学界约 80 年的埃尔德什平面单位距离猜想,长达 125 页的推理过程得到了独立数学家验证——这也是被 OpenAI 称为「AI 首次在科研领域自主产生重要成果」的一次。
- 成本在快速下降:同月,DeepMind 用 AlphaProof 系列系统集中攻下多道公开的埃尔德什难题,其中包含悬置数十年的问题,单个问题的推理花费被压到数百美元量级。
- 顶尖数学家自己在用:陶哲轩长期公开演示用大模型辅助证明,包括用 Gemini 的深度思考模式攻克埃尔德什问题。他提出的分工范式相当清晰:AI 负责把大型复杂难题拆成子问题、批量攻克低难度环节、输出可被 Lean 形式化验证的证明,人类数学家聚焦核心原创难题。他的说法是,数学正在从「证明稀缺」进入「证明过剩」时代。
把这些成果和声明的关切放在一起,边界就浮现出来了:当前 AI 在数学上的产出,高度集中在「问题表述已被人类充分形式化、求解空间清晰」的类型——构造反例、攻克已被圈定的猜想、形式化验证。AI 是在一个被人类划定好的战场里做高效搜索。至于那些还没被清晰定义、甚至还没被提出的问题,不在这一波射程之内。这不是贬低,而是理解「AI 攻占数学」这类叙事为什么会让数学家不适的关键。
六、为什么三家实验室的反应完全不同
这一周里,OpenAI、Google DeepMind、Anthropic 三家前沿实验室面对同一场争议,姿态差异非常明显。下面这张对比图把差异摊开看:
信息图:OpenAI / Google DeepMind / Anthropic 三家实验室在「AI 做数学与科研」上的路线对比——本周动作、成果公布方式、验证口径、开源态度、与数学界关系、当前主要争议六个维度。
差异背后的逻辑并不复杂。DeepMind 走的是「先发论文、再讲故事」的路径,数学成果发表在《自然》这类同行评审期刊上,还维护着开放的形式化猜想库,与数学家长期共同署名——所以它几乎没有出现在这轮批评里。Anthropic 的重心不在数学跑分上,争议更多集中在模型安全与研究伦理。而 OpenAI 选择了在内部未公开模型上跑出结果、先在社交媒体宣布的节奏,论文与形式化证明滞后,再加上用户数据口径答不干净,于是成了这轮反弹的焦点。
七、把「错位」这个词放回 AI 安全语境
数学家用 misalignment 这个词并非偶然。就在同一周,AI 安全圈也出现了几件指向同一判断的事:
- 刚离开 Anthropic 安全团队、即将加入独立评估机构 METR 的研究员 Joe Benton 公开写道,AI 公司正竞相打造比任何人类都聪明得多的机器,而我们可能无法在这场竞赛中幸存。
- 三天前辞职的 Jacob Coxon 措辞更硬,称他待过的 OpenAI 与 Anthropic 都没有负责任地行事,相关推文浏览量超过 1.66 亿次。
- Anthropic 发布迄今最详细的威胁情报报告,覆盖 2025 年 12 月至 2026 年 8 月期间检测并阻断的七类滥用场景,包括网络攻击、监控、影响行动与生物滥用等。
- 研究员 Damien Charlotin 维护的 AI 幻觉案例数据库同期突破 2000 起,多数发生在美国司法程序中,典型形态是引用根本不存在的判例、编造法律论证并作为真实材料提交。
这些事件的共同点是同一个:AI 的输出在没有被验证的情况下流入了真实系统——流进学术记录、流进司法文书、流进公共决策。数学家抗议的是学术记录这一支,法院在清理的是司法文书这一支,本质上是一件事的不同切面。
八、对 AI 工具使用者的五条实操建议
这场争论看起来离普通使用者很远,但如果你的工作里有任何「AI 生成内容会被别人当真」的环节,它就与你有关。以下是可立刻执行的做法:
- 把「可验证」放在「强不强」前面选型。需要推理链的工作,优先选能给出可核查中间步骤、支持形式化或引用的方案,例如 DeepSeek、Claude Fable 5.1、GPT-5.6 Sol 这类可穿插自检的推理模型,而不是只看总分。
- 绝不把 AI 生成的引文直接写进正式材料。引文是幻觉的重灾区。用 Scite 核对文献是否真实存在、被谁如何引用,用 Proofig 检查图片是否有拼接或重复使用痕迹——这正是学术界用来抓不端的工具,对内容团队同样适用。
- 让自己的产出可追溯。凡是 AI 深度参与的材料,保留提示词、模型版本、生成时间与人工修改记录。归属争议之所以难解,很大原因是过程没有留痕——这一点在 9 月这轮争论里被反复提及。
- 发布前跑一遍检测与人工复核。可以用 GPTZero、朱雀AI检测助手、Originality.AI 这类工具做交叉比对,把「疑似机器生成比例过高」的段落挑出来重写。注意检测结果只能当参考信号,最终判断必须靠人。
- 把 AI 放在「帮你理解」的位置,而不是「替你结论」的位置。读大量资料时,用 NotebookLM 做带出处的问题定位,用 Gemini Deep Research Agent 做多来源梳理,但结论要自己复核。想练工具链,Kaggle 上的公开竞赛与数据集是最好的低成本练习场。
九、冷静看:还有三个没解决的问题
- 归属与引用没有仲裁机制。AI 模型消化了海量在先工作,却无法回溯「这条思路来自谁」。目前既没有技术手段也没有制度安排来做这件事,而学术声誉体系恰恰建立在此之上。这个问题不解决,类似的争执只会换个题目重演。
- 验证劳动的成本没人承担。每一条爆炸性宣称,都意味着研究型数学家要花时间验证、传播,甚至推翻它,而这份工作既无报酬也无署名。Caltech 那封信里最实际的一条诉求就是这个:把验证成本外包给学术界,是当前模式无法持续的根源。
- 「解决问题=能力基准」短期内不会改变。对模型厂商而言,攻克著名难题是最有效的传播素材,这个激励不会因为一封公开信消失。可预期的走向是:公布方式逐渐规范化(论文与形式化证明同步放出),但「抢首发」的竞赛节奏仍会继续。
十、三句话总结
- 9 月 11 日,25 位菲尔兹奖得主联署《人工智能在数学中的严重错位》,反对的不是 AI 做数学,而是把解难题当成模型跑分、先宣布后补论文的做法。
- 导火索是 9 月 8 日 OpenAI 宣称 1 万个智能体 88 小时解出纳维-斯托克斯方程,随后 NYU 教授质疑数据来源、加州理工 771 位数学家联名抗议,OpenAI 于 9 月 10 日退出该赛事赞助。
- 对使用者的启示很朴素:AI 输出在被验证之前,不应该进入任何会被当真的地方——学术记录、司法文书、公开发布的内容都一样。
以上信息整理自各机构公开声明、陶哲轩个人博客、mathandai.org 与 proofsandprompts.com 公开信、以及公开媒体报道。涉及的具体指控与数据口径,请以各官方发布与后续同行评审结果为准。