摘要:Anthropic 披露 Claude 主导公司26%研发工作、参与约90%员工任务;OpenAI 被传逼近又一道千禧年数学难题,AI 自我改进能力加速显现。

"AI 自己改进自己"这个听起来像科幻的命题,今天有了可量化的进展。Anthropic 披露的一组 AI 发展指标很惊人:Claude 主导了公司26%的研发工作(年初还是0),参与了约90%员工的工作。与此同时,OpenAI 被传即将攻克又一道千禧年大奖数学难题——继此前用下一代模型和1万个协调智能体在88小时内给出纳维-斯托克斯方程的解析证明与 Lean 形式化之后,自我改进能力正在从概念走向产能。

14-递归自我改进Claude主导研发.jpg

这和此前 Noam Brown 确认的"RSI(递归自我改进)是 OpenAI 头号任务"、以及五级 RSI 框架论文相互印证:我们可能正处在 RSI 从 B0(任务内改进)往 L1(执行人类定义的持久改进)爬坡的临界点。当模型不仅能写大部分代码,还能主导研发流程、攻坚数学难题,"人类亲手打造的最后一个 AI"这句话的份量就重了。

我的判断:这类进展同时带来效率和安全的双重命题。效率上,研发模式会被颠覆——AI 主导26%研发意味着单位人力的产出曲线陡然上扬;安全上,"能力失控"的担忧从假设逼近现实,也解释了为什么 Anthropic 要引入第三方评估、为什么全球监管框架明显滞后于技术。对投资人和从业者,真正该盯的指标不再是 benchmark 分数,而是"人类复核产能"和"可审计性"——当 AI 写的数学比人类审得快,科学的信任机制本身就需要重做。递归自我改进不是终点,它是一把双刃剑,刀刃朝向哪里,取决于我们在工程护栏上投了多少真功夫。