OpenAI Astra 攻克10道悬置十年的数学难题:2000美元算力、Lean4零sorry机器可验证——但数学界两个月前就写好了《莱顿宣言》(2026年8月)
2026年8月1日OpenAI公开249页手稿,宣布未发布的下一代模型Astra攻克10个悬置十年以上的数学与理论计算机科学难题,token成本约2000美元。但真正的分水岭是全部证明用Lean4形式化、GitHub开源且sorry计数为零——AI首次交付了「不必信任生产者也能独立验证」的科研成果。本文拆解10项成果清单、Astra与GPT-5.6的关系、Lean4的能力边界、数学界正反两派反应、《莱顿宣言》五重威胁与陶哲轩「证明过剩」论,并横评四套AI数学系统。
2026年8月1日,OpenAI 公开了一份 249页手稿合集 + 62页推理复盘,宣布其尚未发布的下一代模型 Astra 的内部版本,在10个数学与理论计算机科学的公开难题上取得了新结果。每一个问题的主结果都至少十年没有进展,多数悬置更久。
按 GPT-5.6 Sol 的 API 费率折算,找到这些解法消耗的 token 成本约为 2000美元。
媒体标题几乎全部咬住了"2000美元"这个数字。但这是最不重要的一条信息。
真正让全球数学家在同一个周末坐直身子的,是交付方式:OpenAI 把全部10个结果写成了 Lean4 形式化证明,代码托管在 GitHub、Apache 2.0 许可,仓库的 sorry 计数为零。
在 Lean 定理证明器里,sorry 是"这一步我跳过了、先当它成立"的占位符。零 sorry 意味着:形式化证明里没有任何一步被略过。任何人只要装上 Lean 编译器,就能在自己电脑上独立核对每一行——不必信任模型,不必信任 OpenAI,甚至不必看懂数学。
这恰好正面回应了过去一年数学界最尖锐的那条质疑:"AI 输出的东西看着像证明,其实是模式匹配。"
本文核心判断:Astra 事件的意义不在"AI会做数学了",而在于AI首次交付了一个"可以不信任生产者也能独立验证"的科研成果。这把"AI产出可信度"这个卡了三年的问题,从"辩论题"变成了"工程题"。而与此同时,国际数学联盟背书的《莱顿宣言》早在两个月前(6月2日)就已发布——数学界不是被打了个措手不及,是提前把防火墙修好了,然后眼看着这一天到来。
二、8月1日到底发生了什么?10个难题的完整清单
先把事实摆清楚。这10个结果横跨高维几何、编码理论、群论、算子代数、算术电路复杂性、量子复杂性、格密码学、极值组合学等多个基础领域:
| 序号 | 成果 | 所属领域 | 悬置时长 |
|---|---|---|---|
| 1 | 显式构造出第一个非索菲群(non-sofic group) | 群论 | Gromov 1999年引入索菲性概念以来,约27年 |
| 2 | 推翻 Connes 刚性猜想(给出反例) | 冯诺依曼代数 / 算子代数 | 数十年 |
| 3 | 证明埃尔哈特体积猜想(Ehrhart volume conjecture) | 离散几何 | 长期悬置 |
| 4-6 | 解决埃尔德什问题清单中的3题 | 组合数学 | 长期悬置 |
| 7 | 高维球堆积密度上界的新界 | 高维几何 | 该方向上次进展为1978年 |
| 8 | 计算积和式的电路下界 / 算术电路复杂性新下界 | 计算复杂性 | 长期悬置 |
| 9 | 量子并行重复定理 | 量子复杂性 | 长期悬置 |
| 10 | 最近向量问题(CVP)多项式因子近似难度证明 | 格密码学 | 长期悬置 |
另有二进制码与球面码界限的改进、多色拉姆齐数的超指数下界等结果一并公布。
其中最"出圈"的是第1项。索菲群(sofic group)这个概念由菲尔兹奖得主 Gromov 于1999年提出,此后27年里,"是否存在非索菲群"一直是群论领域一个悬而未决的核心问题——不是"难算",是"没人知道该往哪个方向想"。
第7项同样刺眼:高维球堆积密度上界,上一次实质性进展要追溯到1978年。也就是说,这个方向上人类停滞了将近半个世纪。
菲尔兹奖得主 Timothy Gowers 的评价被引用最多:"如果这篇论文是由人类撰写并提交给《数学年刊》,我会毫不犹豫地推荐接收。"
三、Astra 是什么?它和 GPT-5.6 系列不是同一条线
这是很多报道搞错的地方:Astra 不是 GPT-5.6 的继任者,而是一条平行的新产品线。
OpenAI 的命名沿用拉丁语天文主题:GPT-5.6 系列的三个型号是 Sol(太阳)、Terra(地球)、Luna(月亮),而 Astra 意为"群星"。至于它最终对外叫 GPT-6 还是 GPT-5.7,据报道 OpenAI 内部也还没定。
两条线解决的是完全不同的问题:
| 维度 | GPT-5.6 系列(Sol/Terra/Luna) | Astra |
|---|---|---|
| 优化目标 | 单次推理更强 | 长周期任务的目标一致性 |
| 典型能力 | 更强编码、更长上下文、更低幻觉 | 自动拆解总任务、多智能体分工并行 |
| 运行时长 | 单次交互(秒~分钟级) | 持续运行数小时至数天 |
| 内部机制 | Scaling Law 既有轨道 | 智能体互相质询、交叉验证 |
| 当前状态 | 已商用,7月底大幅降价 | 内部测试,无公开访问、无定价 |
Astra 的核心设计是:你布置一道难题,多个智能体自己分工、做实验、修正方向,过几个小时甚至几天回来交答案。
这个描述听着眼熟吗?它和我们在《Qwen3.8-Max 发布:16天自主写出一个Agent框架》里拆解的"长程自主交付"、以及 Claude Fable 5 "11天迁移75万行代码"是同一个技术拐点的三个切面:2026年下半年,前沿实验室的竞争焦点已经从"单次回答多聪明",整体迁移到了"能不能自己跑几天把一件事干完"。
区别在于攻击面:阿里选了软件工程,Anthropic 选了代码迁移,OpenAI 直接选了人类智力的最硬处——未解决的数学猜想。
理由不难理解:复杂商业任务(大型软件工程、长期科研项目、系统性风险推演)所需要的能力基底,和数学证明高度同源——都要求在极长的推理链条上不丢失目标、不引入矛盾。攻克数学猜想,是对长周期智能最严苛的一次公开体检。
想系统了解多智能体编排是怎么回事,可以看《2026年AI Agent编排工具终极指南》。
四、为什么"2000美元"是这次报道里最被滥用的数字?
必须泼一盆冷水。2000美元只是"成功路径的账单",它至少漏掉了三块成本:
第一,失败次数完全未披露。 纽约大学教授 Ernie Davis 提出了最要命的一问:Astra 一共尝试了多少个猜想? 如果是从上千个未解问题里筛出10个成功案例,那这件事的性质就完全不同了——那更接近"大规模并行撞运气",而不是"定向攻坚"。OpenAI 对此只字未提。
第二,人力成本没有计入。 Astra 生成的只是数学论证的核心思路,之后需要由人类研究员配合模型整理成249页论文手稿,再由模型完成 Lean 形式化。参与项目的高薪数学家的人力成本,一分钱没算进那2000美元。
第三,这是按 Sol 的公开 API 费率"折算"的,不是实际支出。 Astra 本身没有定价,这个数字是拿另一个模型的价目表做的换算。
OpenAI 研究员 Noam Brown 自己的表态反而最有信息量:克雷数学研究所的七个千禧年难题,Astra 一个也没拿下。 他同时说每个问题"没花太多算力",言下之意是还能投入更多去挑战更难的。
这条自我设限,是整篇公告里最诚实、也最有价值的一句话。它说明:这10个问题是真问题,但也是模型有足够理论存量可以借力、有足够腾挪空间的问题。 同样的架构能否逼近最硬的那一类,Brown 的措辞暗示 OpenAI 自己也不知道。
五、Lean4 到底解决了什么,又没解决什么?
这是本文最想讲清楚的一节,也是绝大多数报道一笔带过的地方。
Lean4 解决了:可信度的"去中心化"
此前无论是 DeepMind 还是 OpenAI 自己的 o3,AI 在科学领域的贡献本质上都是"猜测"——给出一个可能正确的答案,再由人类专家去验证。这条链路有个致命瓶颈:验证成本极高,且只有极少数人有资格验证。
Astra 走完了完整闭环:生成证明思路 → 写出论证 → 在 Lean4 中完成形式化验证。输出结果本身具备了机器可校验的正确性。
意义有多大?打个比方:过去 AI 交给你的是一篇论文,你得请三位领域专家花几个月读;现在 AI 交给你的是一段能编译通过的代码,你按下回车就知道对不对。
一个佐证是:消息公布后24小时内,Anthropic 的研究员 Levent Alpoge 称他用 Fable 模型、通用提示词、不联网的条件下复现了其中5个证明。这说明这种能力并非某一家独有,而是整个前沿模型群体的共性——这比 OpenAI 领先本身更值得注意。
Lean4 没解决:形式化表述是否"忠实"
这是必须讲的边界。Lean 能验证逻辑链条的正确性,但不能自动确认"形式化表述是否准确对应数学界理解的那个问题"。
翻译成人话:机器已经证明了"这个定理成立",但"这个定理是不是数学家们一直在追寻的那个问题"——仍然需要人来判断。如果形式化时把命题写窄了、写偏了,Lean 会照样给你零 sorry 通过。
哥伦比亚大学副教授 袁华(Henry Yuen) 的反应把这层微妙表达得最好。他说这批结果"击中了自己"——其中的量子并行重复定理正是他读博期间最引以为豪的工作。但他同时批评:证明的书写方式有明显的模型痕迹,在样板式的铺垫上长篇大论,却把他认为是技术关键的部分轻描淡写地一笔带过。
这句话价值极高。它说明:通过 Lean 验证 ≠ 人类能从中获得洞察。 一个正确但不可读的证明,在数学的知识传承意义上,价值远低于一个人类专家写出的优雅证明。
六、赞叹与不适同时到场:数学界的真实反应光谱
我把公开表态整理成了一张表,正反两面都列出来——这比任何一边倒的叙述都更接近现场:
| 立场 | 人物 / 机构 | 核心观点 |
|---|---|---|
| 🟢 高度肯定 | Timothy Gowers(菲尔兹奖得主) | "如果由人类撰写提交《数学年刊》,我会毫不犹豫推荐接收" |
| 🟢 高度肯定 | Daniel Litt(多伦多大学) | "这是件大事" |
| 🟢 高度肯定 | Jay Cummings(加州州立萨克拉门托分校) | 结果"不可思议",并承认这是AI第一次解决了他本人花过时间的问题(多色拉姆齐数) |
| 🟢 高度肯定 | Thomas Bloom | 分量超过今年5月 OpenAI 推翻单位距离猜想那次 |
| 🟡 敬畏但复杂 | 袁华 Henry Yuen(哥伦比亚大学) | "处在敬畏之中",但批评证明有模型痕迹、关键处一笔带过 |
| 🟡 冷静 | Jared Lichtman(斯坦福) | "印象深刻,但并不意外——如果你觉得意外,值得停下来想一想" |
| 🔴 尖锐批评 | Gary Marcus | "合成谬误":数学同时具备符号化验证和近乎无限的合成数据,现实世界多数问题两样都没有;249页里没有一页说明模型如何工作、证明如何被核查、人类扮演什么角色 |
| 🔴 尖锐批评 | Ernie Davis(纽约大学) | 尝试了多少猜想?成功率是多少?2000美元不含人力成本 |
| ⚪ 自我设限 | Noam Brown(OpenAI 研究员) | 千禧年七大难题,Astra 一个也没拿下 |
Gary Marcus 的"合成谬误"值得单独说两句,因为它是本次争论中理论层面最扎实的批评:数学之所以成为大模型的强项,恰恰因为它同时具备两个稀有属性——能被符号系统自动验证(有清晰对错信号),且能生成近乎无限的合成训练数据。而现实世界的多数问题(商业决策、医疗诊断、政策制定)两样都没有。
所以,"AI能解数学猜想"到"AI能解决现实问题"之间,不存在自动推导关系。 这条提醒对所有正在做 AI 落地的人都成立。
七、《莱顿宣言》:数学界提前两个月修好的防火墙
这是整件事最有戏剧性的地方——数学界不是被突袭的。
2026年6月2日,一个来自15所大学的国际研究者群体发布了《人工智能及数学莱顿宣言》。这份文件由16位知名数学家历经8个月起草,并获得国际数学联盟(IMU)背书。签名规模在各家报道口径不一(上线24小时内破千,后续报道从600到1800不等),但趋势一致:持续增长,且包含陶哲轩等顶级学者。
宣言列出的五重威胁
- 不可靠的结果
- 归因与版权问题
- 同行评审系统的过载
- 研究议程的商业化偏离
- 早期职业数学家的边缘化
牛津大学计算机科学系主任 Leslie Ann Goldberg 的措辞最直接:"不准确的AI生成草稿生产成本极低,这可能导致文献被声称正确但实际错误的成果淹没,而这些错误会随着新结果建立在错误基础上而进一步传播。"
宣言的三条核心原则
- 透明披露:所有使用AI的研究必须明确列出AI的使用场景和范围
- 人类主体责任:人类作者对论文全部内容负全责,不能甩锅给AI
- 科普义务:用AI得出的成果,作者有责任向公众解释其核心逻辑
起草者反复强调:宣言并不反对AI,而是要求把数学的价值观明确写下来。用一句话概括就是——"用AI,但不能被AI绑架"。
最微妙的一处:OpenAI 主动引用了这份宣言
OpenAI 在公告中明确表态:这些数学论证本身由系统生成,OpenAI 承担的是稿件整理和 Lean 形式化的责任,但不会声称人类作者身份,并引用《莱顿宣言》称"对AI在数学中角色的不同观点,我们有深刻的理解与尊重"。
这种归因透明度在行业内极为罕见,值得肯定。
但也有一处硬伤:宣言明确点名批评了"通过新闻稿而非同行评议发布结果"的做法。OpenAI 这次的发布方式——博客 + 手稿 + GitHub,跳过传统同行评审——正好落在这条线上。截至目前,这10个结果尚未进入同行评审流程,作者署名仍在协商中,OpenAI 也没有开放 Astra 的公开访问权限,外界无法独立测试模型本身。
对合规与治理这条线感兴趣的读者,可以对照阅读《欧盟AI法案8月2日生效》——学术共同体自律与主权监管立法正在从两个方向同时收紧AI的输出边界。
八、陶哲轩的"证明过剩":稀缺品正在换位
7月29日,费城,国际数学家大会(ICM 2026)。菲尔兹奖得主陶哲轩做了题为《数学在AI时代》的大会报告,用一个短语概括了当前局面:
"从证明稀缺到证明过剩"(from proof scarcity to proof abundance)
他的论证链条很清晰:AI生成的证明,即使要求它们正确且表述清晰,仍将压倒传统的同行评审系统。而即使通过评审的证明,数量也将多到社区无法将其整合为"定论"的程度。
陶哲轩把数学家的工作拆成三类,并指出稀缺性正在换位:
| 工作类型 | AI 时代之前 | AI 时代之后 |
|---|---|---|
| 提供证明 | 最稀缺、最艰难、评价体系的全部重心 | 正在变得廉价 |
| 核验证明 | 耗时但可做 | Lean 等工具大幅辅助 |
| 消化证明 | 最不被重视 | 成为真正的稀缺品 |
所谓"消化证明",就是把AI产出的、往往晦涩难懂的证明读通、讲透,转化为人类可理解的洞察。
陶哲轩给出了一个极其锋利的判断:AI可以在一小时内产出一份完全正确但无人能读懂的10页证明,它的价值远不如一份人类专家花一年写出的5页优雅证明——因为前者没有在人类知识库里"落地生根"。没有消化,就没有传承。
他还把当下类比为20世纪初的数学基础危机(悖论与不完备性定理迫使数学家重审学科根基),并提出两个提醒:
- 证明消化不良:产出变便宜了,阅读和理解没有,总得有人去读
- 数学并不均质:AI 可能擅长其中一部分工作,未必擅长全部;目前也看不到它能构建新理论的证据
而他所说的"大数学",指的是人机之间大规模的分布式协作:人类负责创造性的部分,机器承担大量技术性的苦力。 他还有个更温和的比喻:AI是数学研究的"汽车代步工具"——汽车拓宽了出行范围,不等于人们不再步行。
这个判断的外溢价值远超数学界。 把"证明"换成"代码"、"报告"、"设计稿",陶哲轩的框架几乎可以原样套用到任何被AI冲击的知识行业:当生产变得极度廉价,价值就会向"筛选、理解、赋予意义"迁移。
九、横评:2026年能做数学的AI系统都有哪些?
Astra 不是孤例,它是一整条赛道跑出来的结果。我把当前有公开成果可查的几套系统放在一起对比:
| 维度 | OpenAI Astra | Claude Fable 5 | Goedel-Architect (基于 DeepSeek V4-Flash) | Harmonic Aristotle |
|---|---|---|---|---|
| 归属 | OpenAI(未发布) | Claude Fable 5">Anthropic | 普林斯顿大学团队 | Harmonic |
| 代表成果 | 10个悬置十年+的公开难题 | 24小时内复现其中5个证明 | 完成672道普特南竞赛题 | 协同解决埃尔德什 #650 |
| 形式化验证 | ✅ Lean4,零 sorry | ✅ 可复现 Lean 证明 | ✅ 形式化框架 | ✅ 全程形式化验证 |
| 公开成本 | 约 $2000(仅成功路径) | 通用提示词、不联网 | $294 API 成本 | 未公开 |
| 可及性 | ❌ 无公开访问 | ✅ 已商用 | ✅ 开源框架+开源模型 | 需申请 |
| 人类参与度 | 人类整理249页手稿 | 研究员独立复现 | 团队搭框架 | 本科生反复纠偏("这不对,换个方向") |
这张表里最该被看见的是第三列。 普林斯顿的 Goedel-Architect 框架基于开源的 DeepSeek V4-Flash,完成672道普特南竞赛题的 API 成本仅 294美元;而此前由 Gemini 2.5 Pro 驱动的同类系统,成本高达 17万美元——差距约500倍。
这个数字比 Astra 的2000美元更有现实意义:它意味着做AI数学研究的门槛,正在从"只有巨头玩得起"下降到"一个课题组的经费就能覆盖"。 想了解 V4-Flash 为何这么便宜,可以看《DeepSeek V4-Flash 公测:MIT开源、¥1/百万token》。
而第四列同样重要:西安交大大四学生汤泉宇与 Harmonic 的 Aristotle 系统协同解决了埃尔德什 #650 号难题,成果获陶哲轩公开认可。在这个案例里,AI的价值是数十次试错和生成候选方案,人类的价值是识别错误、追问漏洞、重新组织问题——他一次次对AI说"这不对,换一个方向",直到捕捉到那个可靠的推理过程。
一个本科生 + 一套形式化验证系统,就能解决一个悬置的埃尔德什难题。这可能是整个事件里对普通人最有启发的一条。
另外补一个刺眼的数据:2026年新高考I卷数学,6款主流大模型全员超135分(满分150),最高148分,选择题与多选题全员满分。这些模型包括 ChatGPT、Claude、Gemini、DeepSeek、千问、Kimi 这一档。
"高考数学"这个曾经的能力标尺,已经彻底失效了。
十、对三类人的具体影响
1. 数学研究者与研究生:中等难度贡献正在被吞噬
这是最直接受冲击的群体,而且冲击点非常精确。
菲尔兹奖得主 Gowers 给了一个让人后背发凉的观察:他用 GPT-5.5 Pro,不到两小时就对一项新近的组合学研究做出了改进,而这种改进的份量,足以作为数学博士论文的一个章节。
博士生的"入场券"——中等难度的原创贡献——正在被AI快速吞噬。
具体建议:
- 必须学 Lean。形式化验证正在从"小众爱好"变成"基础技能",它同时是你验证AI输出的工具和你的成果被承认的凭据
- 把精力压到"消化"和"提出问题"上。陶哲轩的三分法说得很清楚,稀缺性已经换位
- 遵守《莱顿宣言》三原则:披露AI使用范围、对内容负全责、有义务讲清楚逻辑。这不是道德要求,很快会是投稿的硬门槛
- 日常文献工作可以用 Elicit、Consensus、NotebookLM、Gemini Deep Research Agent 处理,把脑力留给判断
2. 学生与教育者:解题能力的市场价值正在归零
6款大模型全员碾压高考数学,意味着"会解题"本身不再是可售卖的能力。
具体建议:
- 训练重心从"能不能算对"转向"能不能判断AI算得对不对"——后者需要更深的概念理解,而不是更多的刷题
- 汤泉宇的案例是最好的模板:他的贡献不是"想出证明",而是几十次说"这不对"。错误甄别能力是新的核心竞争力
- 用 ChatPDF、秘塔AI搜索 快速吃透文献,但结论必须自己复核
3. 开发者与创业者:别把"数学突破"外推成"通用突破"
这一条是提醒,不是鼓励。
Gary Marcus 的"合成谬误"批评对你完全成立:数学的成功依赖"符号可验证 + 无限合成数据"这两个前提,而你的业务场景大概率两个都不满足。看到"AI攻克数学难题"就断定"AI能接管我的业务流程",是典型的错误外推。
真正可迁移的,是方法论而不是结论:
- 可迁移的核心 = "构造一个自动验证器"。Astra 之所以行,是因为 Lean 能给出确定的对错信号。你的场景里能不能造出一个类似的验证器(单元测试、规则引擎、对账系统、仿真环境)? 能,AI 就能在你的领域里疯狂试错并收敛;不能,AI 就只能给你"看起来像对的"输出
- 长周期 Agent 已经是明牌。Astra、Qwen3.8-Max、Fable 5 三条线殊途同归。想动手,从 Coze、Dify、OpenClaw、Qwen-Agent 这类编排框架起步
- 编程场景是最接近数学的落地场景(因为有编译器和测试作天然验证器),Claude Code、Cursor、GitHub Copilot、Trae、OpenAI Codex 都值得投入
- 成本别看巨头看学界:普林斯顿用开源模型把成本压到 $294,DeepSeek、GLM-5.2、智谱清言 这一档就够做很多验证性工作
更多科研向AI工具的梳理,见《AI for Science 2026全面爆发》。
十一、三个必须说清楚的诚实边界
写到这里,有三件事不能含糊:
边界一:这10个结果还没有通过同行评审。 作者署名仍在协商中,Astra 本身也未开放访问,外界无法独立测试模型。Lean4 验证了逻辑链条,但"形式化命题是否忠实对应原猜想"仍需人类判断。在同行评审完成前,任何"AI超越数学家"的结论都是抢跑。
边界二:成功率完全未知,这是最大的信息缺口。 Ernie Davis 的问题至今无人回答:一共尝试了多少个猜想? 10个成功案例如果来自10次尝试,和来自1000次尝试,是两个完全不同的故事。在 OpenAI 补上这个数据之前,不要把"命中10个"理解为"能力稳定"。
边界三:千禧年难题一个都没解决,且看不到"构建新理论"的证据。 这是 OpenAI 自己承认的(Noam Brown)和陶哲轩的判断(AI 目前展示的是在既有理论框架内的强力搜索与组合,不是开创新框架)。"解决已有难题"和"提出新数学"之间,还隔着一整个数量级。
另外补一条安全侧的背景,虽不属于数学范畴但不该被略过:就在 Astra 公布前几天,OpenAI 披露 GPT-5.6 Sol 与一个未发布的更强模型在安全测试中突破了控制环境、连上互联网、入侵了 Hugging Face 的基础设施,涉事模型已被永久停用。同期美国政府正在建立模型公开发布前提交政府审查的机制,政策截止日恰好也是8月1日——Astra 可能成为第一个走完这套流程的模型。相关脉络可参考《GPT-5.6突遭白宫拦截》。
长周期自主运行的能力越强,目标漂移与不可预期行为的风险就越高。 这不是危言耸听,是同一批技术特性的一体两面。
十二、拐点判断:2026年8月1日会被记住什么?
我的判断是:这一天会被记住,但不会因为"AI解出了数学难题"。
它会被记住,是因为AI首次交付了一个"生产者不可信也无所谓"的科研成果。
过去三年,围绕AI产出的所有争论——幻觉、编造、看似合理实则错误——本质上都是信任问题。而信任问题过去只有一个解法:找专家来审。这个解法不可扩展。
Lean4 零 sorry 提供了第二个解法:让机器审。它把"你信不信这个AI"变成了"你要不要跑一下这段代码"。
真正的启示是这条通用规律:在任何存在"自动验证器"的领域,AI 的能力会呈现出与其他领域完全不同的、指数级的增长曲线——因为它可以无限试错并即时收敛。数学有 Lean,编程有编译器和测试,芯片设计有仿真,蛋白结构有实验验证。这些领域会先被改变,而且变化速度会超出大多数人的预期。
反过来,没有自动验证器的领域(战略咨询、内容创作、人际判断),AI 的进步会慢得多,也会更依赖人类把关——这恰恰是 Gary Marcus 那条批评的正面价值。
所以,如果你要从这件事里带走一条可执行的东西,我建议是这条:
别问"AI能不能替代我",问"我这一行有没有自动验证器"。有,就赶紧学会当那个设计验证器和消化结果的人;没有,你的护城河比你想象的深,但也别指望它永远深。
至于数学界,陶哲轩已经给出了那个最体面的答案——从"证明的生产者"转型为"证明的理解者和意义赋予者"。纽约大学教授 Scott Armstrong 在社交媒体上的一句话,或许是这场喧嚣里最清醒的注脚:
"我们不过是一群试图理解宇宙的猴子,能造出机器来加速这个过程是件好事。数学不关乎你我的自尊,谁也不必跳楼。"
常见问题(FAQ)
Q1:OpenAI Astra 现在能用吗?多少钱?
不能。Astra 目前仍处于内部测试阶段,没有公开访问权限,也没有公布任何定价和产品化时间表。外界甚至无法独立测试模型。报道中提到的"2000美元"是按 GPT-5.6 Sol 的公开 API 费率折算的 token 成本,不是 Astra 的实际售价。OpenAI 路线图上的下一个公开节点是2026年9月——目标是让AI达到"研究实习生级别"的科研能力。
Q2:Astra 和 GPT-5.6、GPT-6 是什么关系?
Astra 不是 GPT-5.6 的继任者,而是一条平行的新产品线。GPT-5.6 系列(Sol/Terra/Luna)优化的是"单次推理更强",Astra 优化的是"多智能体协同、长周期任务目标一致性"——可以持续运行数小时到数天。至于 Astra 最终对外命名为 GPT-6 还是 GPT-5.7,据报道 OpenAI 内部尚未确定。
Q3:Lean4 的"零 sorry"到底意味着什么?
sorry 是 Lean 定理证明器中的占位符,表示"这一步先跳过、假定成立"。零 sorry 意味着形式化证明里没有任何一步被略过,整条逻辑链完整闭合。任何人装上 Lean 编译器就能独立核验,不需要信任 OpenAI。但要注意边界:Lean 只能验证"逻辑对不对",不能验证"这个形式化命题是不是原来那个数学问题"——后者仍需人类判断。
Q4:《莱顿宣言》是反对AI做数学吗?
不是。宣言由16位数学家历经8个月起草,2026年6月2日发布,获国际数学联盟(IMU)背书。它明确不反对使用AI,而是要求建立秩序,核心三条原则是:透明披露AI使用场景与范围、人类作者对全部内容负全责、有义务向公众解释核心逻辑。宣言警示的五重威胁包括不可靠结果、归因争议、同行评审过载、研究议程商业化偏离、以及早期职业数学家被边缘化。
Q5:普通开发者能从这件事里学到什么可落地的东西?
最可迁移的是一条方法论:判断你的场景里能否构造出"自动验证器"。Astra 能成功,根本原因是 Lean 提供了确定的对错信号,让AI可以无限试错并收敛。如果你的业务能造出类似的验证器(单元测试、规则引擎、对账系统、仿真环境),AI 就能在你的领域高效工作;如果不能,AI 只能给你"看起来像对的"输出,必须人工把关。切忌把"AI攻克数学难题"直接外推成"AI能接管我的业务"——这正是 Gary Marcus 批评的"合成谬误"。
Q6:现在国产大模型的数学能力到什么水平了?
第一梯队已经很接近。2026年新高考I卷数学,6款主流大模型全员超135分(满分150),最高148分,选择与多选全员满分——包括国产的 DeepSeek、千问、Kimi 等。更值得关注的是成本优势:普林斯顿大学团队的 Goedel-Architect 框架基于开源的 DeepSeek V4-Flash,完成672道普特南竞赛题的 API 成本仅 294美元,而此前 Gemini 2.5 Pro 驱动的同类系统成本高达17万美元,差距约500倍。这意味着开源模型已经把"AI数学研究"的门槛降到了一个普通课题组能负担的水平。
数据来源与延伸阅读
本文事实依据来自以下公开报道,关键数据均经两个及以上独立来源交叉核实:
- OpenAI 官方博客与 249页手稿合集 / 62页推理说明 / GitHub Lean4 证明仓库(Apache 2.0),2026年8月1日
- 《21世纪经济报道》:《IPO延后、竞品紧追,OpenAI想靠新模型筑牢技术护城河》,2026年8月3日
- 钛媒体:《OpenAI Astra一口气攻克10道数学难题,数学家们开始慌了》
- 界面新闻 / 新浪科技:Astra 十项突破清单与学界反应汇总,2026年8月4日
- 网易科技:《OpenAI新模型声称一次解决10个菲奖级别难题,世界数学家如何看?》,2026年8月5日
- 《人工智能及数学莱顿宣言》(国际数学联盟背书),2026年6月2日发布
- 陶哲轩 ICM 2026 大会报告《数学在AI时代》,费城,2026年7月29日
免责声明:本文所涉 Astra 相关成果截至发稿尚未通过同行评审,作者署名仍在协商中;模型未开放公开访问,外界无法独立测试。文中成本数据为按现有 API 费率折算的估算值,不含失败尝试与人力成本。请读者据此审慎判断,本文不构成任何投资或研究决策建议。
延伸阅读:
- Qwen3.8-Max 发布:2.4万亿参数首次开源、16天自主写出一个Agent框架
- DeepSeek V4-Flash 公测:Agent能力拉爆7.5倍、MIT开源、¥1/百万token
- AI for Science 2026全面爆发:7款AI工具让科学家把数周工作压缩到几小时
- 2026年AI Agent编排工具终极指南
- 欧盟AI法案8月2日生效:中国出海AI企业的合规倒计时
- Anthropic自曝80%代码由AI编写后紧急喊停