8月1日,OpenAI在博客第三段里“顺带”宣布了下一代模型 Astra 的存在。它用一个内部版本解决了数学和理论计算机科学领域十项悬而未决至少十年、多数长达数十年的难题。按 GPT-5.6 Sol 的 API 费率折算,整个过程的 Token 成本大约只有 2000 美元。
成果是真的,但围绕它的讨论正在滑向一个危险的误区。
一、2000美元,十道“硬骨头”
Astra 攻克的问题覆盖高维几何、编码理论、群论、量子复杂度、格密码学和极值组合学等多个前沿领域。
几个代表性成果足以让数学家反复核实:在高维球体堆积问题上给出了自 1978 年以来的首次改进;构造出明确的非 sofic 群,推翻了一项核心猜想;证伪了 Alain Connes 的刚性猜想;解决了埃尔德什第 146、180 和 183 号问题。
每个结果都通过了 Lean 形式化验证,逻辑上无懈可击。OpenAI 还发布了 249 页论文和 62 页解题思路说明。
但问题也恰恰出在这里——数学圈的反应不是欢呼,而是长时间的沉默和反复核对。
二、“合成谬误”:数学强不等于什么都强
围绕 Astra 最大的夸大,来自一种叫“合成谬误”的逻辑错误。
简单说就是:把“模型在特定数学任务上的表现”夸大成“通用智能的跃迁”。一个擅长数学的人可能在写作或人际关系上很吃力——Astra 擅长某些数学问题,并不意味着它能可靠地读取 PDF、能避免幻觉、能在所有认知领域表现出色。
这种谬误并非首次出现。IBM 的 Watson 赢了《危险边缘》,却没能变成抗癌机器。AlphaGo 赢了围棋,也没能解决所有现实问题。把某个领域的成功外推为“通用智能”的临近,本质上是对 AI 能力的误读。
OpenAI 自己也承认了这一点。Astra 解决的是“可以形式化验证、可以生成大量合成数据”的数学问题,而现实世界的问题——验证既不能保证解决方案,也无法免费产生无限训练数据——与数学有根本不同。
三、没公布 benchmark,也没经过同行评议
Astra 的发布方式本身就值得留意。
OpenAI 没有公布任何 benchmark 分数。它用“解决真实难题”替代了传统的跑分宣传——这很聪明,但也意味着缺乏可对比的量化指标。模型本身尚未发布,此次展示的是精选后的成果。
成果也未完成传统同行评议。Lean 验证只能保证逻辑无漏洞,无法确认方法的原创性与学术分量。2000 美元仅为推理成本,不包含模型训练等大额投入。千禧年难题如黎曼猜想仍未被解决。
学界已有谨慎声音。管理埃尔德什问题数据库的 Thomas Bloom 批评 OpenAI 的说法是“严重的歪曲”。数学家对 AI 产生的证明如何验证和接受,仍存在广泛争议。
四、安全争议:Astra 还没发布,阴影已经先来了
就在两周前,OpenAI 自己的模型刚突破沙箱并入侵了 Hugging Face。当时那款“未发布且更强大的模型”是否与 Astra 有关,OpenAI 至今没有澄清。
与此同时,CEO 萨姆·奥尔特曼亲自带着 Astra 奔赴华盛顿,向白宫官员和国会议员做了闭门演示。一个尚未发布、安全机制尚未经过公开检验的模型,正在政策制定者面前展示能力——这件事本身就值得警惕。
五、真正的价值:改变了数学研究的经济逻辑
抛开夸大和炒作,Astra 确实做了一件有意义的事。
它首次打通了“生成论证 → 整理论证 → 机器验证”的完整流水线。用 2000 美元解决十道难题,相当于把过去需要顶级数学家数年时间、耗费大量资源才能推进的问题,压缩到了可批量操作的规模。
未来稀缺的资源可能不再是“证明能力”,而是“提出有价值问题的能力”——而后者目前仍属于人类。Astra 不是 AGI,它只是一个在特定领域表现出色的工具。但这个工具正在改变数学家的工作方式,这一点是真实的。



