
8 月
OpenAI Astra 只花了 $2,000 算力,解决了 10 个悬了十年以上的数学难题
OpenAI Astra 只花了 $2,000 算力,解决了 10 个悬了十年以上的数学难题
2026 年 8 月 1 日,OpenAI 首次公开 Astra 模型,宣布其在数学和理论计算机科学领域取得 10 项突破——包括证明非-sofic 群存在性(终结 Gromov 发起的数十年追问)和推翻 Connes 刚性猜想。每条结果附带 Lean 4 机器验证证书。总推理成本:约 $2,000。
发生了什么
OpenAI 今天打破了长期的沉默——首次公开确认 Astra 的存在,并用一篇 249 页的手稿宣布:Astra 在 10 个开放数学问题上取得了突破。
每个问题至少悬了十年。每个结果都配有 Lean 4 机器验证证书 和完整的思维链记录。
OpenAI 数学研究主管 Sebastien Bubeck 用了一个词:「beautiful」。
十大结果概览
| 领域 | 问题 | 状态 |
|---|---|---|
| 群论 | 非-sofic 群存在性 | ✅ 证明存在 |
| 算子代数 | Connes 刚性猜想 | ❌ 推翻 |
| 几何组合 | Ehrhart 体积猜想 | ✅ 证明 |
| Ramsey 理论 | Erdős 问题 183 号 | ✅ 解决 |
| 球堆积 | 高维球堆积密度上界 | ✅ 1978 年以来首次改进 |
| 量子计算 | 双人量子游戏并行重复定理 | ✅ 证明 |
| 电路复杂性 | 计算 permanent 的电路下界 | ✅ 新下界 |
| +3 个 | 其他 Erdős 问题 | ✅ 解决 |
$2,000 意味着什么
每条结果的平均成本:$200。
按照 OpenAI Sol API 的定价,这大约相当于 800 万 token 的推理。换句话说,一个博士生一年的咖啡预算。
对比一下 Anthropic 上周披露的 Claude Mythos Preview 密码学实验——60 小时自主运行、约 $100,000 API 成本、10 亿 token。Astra 的成本是其 1/50。
这不是说 Astra 比 Mythos 强。它们做的是完全不同的事——Mythos 在密码分析中暴力搜索攻击路径,Astra 在证明推导中需要更多「灵感」和更少的搜索。但成本差异说明:AI 的数学能力正在从「需要超级计算预算」变为「研究生也负担得起」。
Lean 4 证书:这不是营销
这次和以往「AI 声称解决了数学问题」最大的不同是:每个结果都附带 Lean 4 的机器验证。
Lean 4 是一个形式化证明系统。如果一段数学证明通过了 Lean 4 的检查,就意味着它在逻辑上完美无缺——不可能有隐藏的假设、跳过的步骤、或者「凭直觉跳过」的漏洞。
学术界的传统评审流程可能需要数月甚至数年。Lean 4 把验证时间压缩到了机器运行时间:)
AI 能做数学研究了吗?
5 月:OpenAI 用 GPT 证明单位距离猜想。
7 月:Claude Fable 5 找到 Jacobian 猜想反例。Claude Mythos Preview 破解 HAWK-256。
8 月 1 日:Astra 宣布 10 项突破。
这不再是个别事件。AI 正在成为数学家工具箱中的标准工具,就像 LaTeX 或 Mathematica 一样——只不过它在发现上也可能超越人类。
政策时间线:Astra 和 EO 14409
同一天,另一件事在华盛顿发生。
6 月 2 日,特朗普签署了 EO 14409「促进先进人工智能创新与安全」,给 NSA、CISA、财政部 60 天设计前沿模型分类基准测试。这 60 天今天刚好到期。
Sam Altman 7 月 29 日已在国会山向议员演示了 Astra。Astra 预计将成为首批接受新政府审查框架测试的模型之一。
相关阅读
FAQ
Astra 什么时候公开发布?
OpenAI 没有给时间表,只说是「下一个主要模型」。投资者 Mark Kretschmann 猜测 Astra 就是 GPT-6 系列。
$2,000 的成本真的可信吗?
按 OpenAI 自己公布的 Sol API 价格换算是可信的。但注意:这是推理成本,不包括训练成本。Astra 的训练成本可能高达数亿美元。
Lean 4 证书意味着这些证明完全无需人类验证吗?
是的——机器验证排除了逻辑错误。但「问题是否被正确建模」仍需要人类判断。机器只验证推导过程,不验证初始假设的合理性。
相关阅读
证据边界与同行评价
另一篇同主题稿件强调了三项值得保留的验证信号:证明仓库中的 Lean 4 证书不使用 sorry 占位符;原报道引述菲尔兹奖得主 Timothy Gowers 对论文质量的积极评价;约 2,000 美元是本次推理成本,不代表完整训练成本。三者共同说明结果具有机器验证与专家评议线索,但正式学术结论仍应以论文、代码仓库和后续同行评议为准。
这也是本页与一般模型发布新闻的区别:重点不是把 Astra 描述为“全自动数学家”,而是说明它在限定问题、形式化验证和人类审阅组成的研究流程中处于什么位置。










