摘要:Noam Brown 确认 RSI 是 OpenAI"明显第一"的任务;RSI 五级框架论文厘清"真自我改进"与一次性的区别,Headroom-Closed Index 量化离上限还有多远。

"人类亲手打造的最后一个 AI"——这篇约 75 页的论文(arXiv 2609.11873)标题够狠,但真正值钱的是它给一个被滥用的词下了可验证的定义。论文提出以自主性为中心的 RSI(递归自我改进)五级框架:B0 基线(任务内 AI 改进,如按报错改代码、会话结束归零);L1 执行人类定义的持久改进;L2 AI 自己决定改进策略;L3 AI 自主规划该学什么经验;L4 在真实部署中持续适应;L5 才是真正的"递归元改进"——AI 持续修改"负责未来改进的机制本身"。

13-递归自我改进AI研究.jpg

区分标准很硬:一次性性能提升不算递归进化。要算"真 RSI",必须满足两条——新改进机制被保留进下一轮,并且在同等预算、独立评估下确实造出更强的后继者。论文还提了 Headroom-Closed Index(HCI),量化现有 LLM 离"自身可达上限"还差多少:研究生级科学已达 85.8,但软件工程只有 52.6,工具 Agent 仅 39.9。这个指数把"离自我改进还有多远"变成了一把可量的尺,而不是一句"奇点快到了"。

今天为什么必读?因为 Noam Brown 刚确认,RSI 是 OpenAI 优先级"明显第一"的任务,而且前面提到的"模型自己写大部分代码"已经发生了。论文框架和产业实践正在互相印证:我们可能正处在 RSI 从 B0 往 L1 爬坡的临界点。但冷静看,Anthropic 的"Model 2 写代码"顶多算 B0–L1 的自动化,离真正的递归元改进还差两个大台阶。我的判断:这篇论文最大的价值是方法论——把"自我改进"从口号变成可审计的实验设计。接下来监管者和投资人要问的,不是"你进化了吗",而是"你在第几级、HCI 还有多少 headroom、改进有没有被独立评估确认造出更强后继者"。