摘要:开发者抓包发现 Claude Code 已路由至 Opus 5.2,新版生成更快、输出更精简、自动进入"严酷循环"迭代代码;曝 Anthropic 大部分代码已由未发布 Model 2 跑 Agent 写出。

Anthropic 的版本号玩法向来让人猜不透,这次更直接跳过了 5.1。开发者在 Claude Code 里抓包发现,调用 Opus 5 时已被悄悄路由至 Opus 5.2,说明灰度测试已经开启。实测反馈集中在三点:生成速度明显加快、输出更精简、不再中途弹"按继续",而是会自动进入持续迭代完善代码的循环——社区戏称为"严酷循环"(cruel loop)。对一个写代码的主模型来说,这几项改进直击痛点:过去 Agent 写长任务容易"偷懒"或半途停下等人工确认,新版显然在往"一口气干完"的方向调。

10_Claude-Opus自我改进.jpg

更炸裂的信息来自此前曝光、今天仍被反复引用的内部风险报告:Anthropic 大部分代码已由未发布模型 Model 2 跑 Agent 写出,RSI(递归自我改进)模型据称可替代研究团队 85% 的工作。这里要打个大大的问号——这些来自开发者社区与媒体转述,Anthropic 尚未发布正式模型卡,且"替代 85%"这种数字更像内部激励话术而非可验证结论。但方向与前面那篇 RSI 五级框架论文(arXiv 2609.11873)能对上:如果前沿系统真在 B0–L1(任务内/执行人类定义的改进),那"用 Agent 写代码"只是 B0 级的自动化,离 L5 的"递归修改改进机制本身"还远。

我的看法:Opus 5.2 的灰度值得跟进,因为它可能定义下一代编码 Agent 的体验标准——快、不中断、能自我纠错。但把"内部用 Agent 写代码"等同于"模型在自我进化",是典型的过度解读。真正的 RSI 要看的是"新改进机制能否被保留进下一轮、并在同等预算下造出更强的后继者",这需要用独立评估去验证,而不是看内部效率提升。建议等正式模型卡和第三方 benchmark 出来再下结论,现在的技术爆料里水分不小。对一个正在冲 IPO 的公司来说,"自我改进"既是技术叙事也是资本叙事,读这类消息时把"工程进展"和"融资话术"分开,能少踩很多坑。

从工程体验角度,Opus 5.2 最值得期待的其实是"不中断"这件事本身。编码 Agent 过去最大的摩擦力,不是写不出代码,而是写一半停下来等人类确认、或者在长任务里丢失上下文。如果 5.2 真能做到自动进入迭代循环、跑通编译和测试再交差,那它改变的是"人盯 Agent"到"Agent 自己盯自己"的工作范式,单位人效可能上台阶。当然,这也带来新的风险面:一个会自我迭代、自我纠错的 Agent 一旦跑偏,纠错成本会比"半途停下"高得多。所以"严酷循环"听着很爽,落地时仍需人在环(human-in-the-loop)的熔断点——否则效率提升会以可控性为代价。