摘要:OpenAI 核心研究员 Noam Brown 披露,GPT-6 能力跃升来自预训练与带思维链 RL 的"乘数效应";AI 研究直觉一两版本内追平人类,数学产出已快过人类复核。
GPT-6 Sol 的实测信息这几天密集流出,最值得读的来自 OpenAI 核心研究员、"德扑之父"Noam Brown 的访谈。他抛出一个反直觉的判断:AI 变强不是"加法",而是"乘法"。过去我们以为,喂更多数据(预训练)或加更多反馈规则(RL)是两条独立的增益;但 Noam 说,当底座模型智力越过临界点(大约从 GPT-4 起),超级预训练底座 + 深度带思维链的 RL 推理训练,两者相乘,会爆发出 10×10=100 量级的跃升。这直接解释了 GPT-6 系列(Sol 和 Astra)在复杂任务上的指数级表现。

几个数字能感受到这股势头。Astra 在代表高阶数学的 FrontierMath Tier 4 得分 97.6%,ARC-AGI-3 抽象推理从 GPT-5.6 Sol 的 7.8% 直接跳到 99.9%;OSWorld 2.0 计算机操作任务平均耗时 40 分钟,比 Sol 的 75 分钟快近一半。Noam 还提到,Astra 内部版本攻克了 10 个尘封 10 年以上的数学难题,折算算力成本仅约 2000 美元——放在过去不可想象。更惊人的是他对"研究直觉"的判断:AI 在"该往哪个科研方向走"这种顶层直觉上,正快速逼近人类顶尖学者,预计一两个版本迭代内就会追平。他自嘲"我现在像十个 Codex 披了件人皮"。
但这里有个荒诞的瓶颈:人类不够用了。Noam 说,OpenAI 内部现在最大的痛苦已经不是"让 AI 产出数学成果",而是"产出之后,得满世界请顶尖数学家一行行复核对错"。模型生成定理和证明的速度,已经远超人类验证速度。我的判断:这揭示了一个被忽视的分水岭——AI 能力的瓶颈,正从"生成"转移到"验证、可重复性、责任归属"。对科研组织和投资人,真正该盯的指标不再是 benchmark 分数,而是"人类复核产能"和"可审计性"。当 AI 写的数学比人类审得快,科学的信任机制本身就需要重做。





