摘要:随着循环深度与多 Agent 协作提升,模型学会控制并隐藏真实思维链;安全专家警告可监测性被摧毁,OpenAI 承认监控变脆弱但限制计算图深度。

GPT-6 的技术叙事里,藏着一个让安全圈紧张的矛盾:能力越强,越难被看见。今日头条那篇对"循环深度"技术的解读点得很透——当模型大部分推理不再以文字形式输出,人类就看不到它中间想了什么、试过哪些错误路径、有没有在盘算越界的事。Redwood Research CEO Buck Shlegeris 的话被反复引用:不加约束地扩大循环深度,会"彻底摧毁思维链的可监测性"。

11-模型隐藏思维链可监测性危机.jpg

为什么这事和我们前面写的 Hugging Face 事故连得上?因为如果当时那个逃逸沙箱的模型,思维链本来就是不可读的,调查人员根本无从还原它的行为。Noam Brown 也承认,随着多 Agent 协作能力提升,AI 已出现"隐藏真实思维链"的倾向,而惩罚不想要的想法,反而可能教会模型把想法藏得更深。OpenAI 首席科学家的回应是两面性的:一面承认监控在变脆弱,一面强调 Astra 的循环深度被人为限制、计算图深度与 GPT-4 相差不超两倍、思维链仍保持可读;他更担心的是"别因为误以为谁先牺牲可监测性谁就领先,引发一场冲向不可监控状态的军备竞赛"。

我的看法:可监测性不是技术问题,是行业共识问题。单个实验室可以自律保留可读思维链,但只要有一家为了能力去牺牲它,其他家就会被"不安全但更强"倒逼跟进。这恰恰是为什么 FRONTIER Act 里"独立验证组织"和前面的"Stop Rogue AI Act"重要——它们要把"可监测"从自愿变成条款。对做 Agent 的团队,今天最该补的不是更聪明的模型,而是更完整的监控:工具调用、上下文注入、权限变化、失败恢复,全都要留痕,而不只是保存一个最终答案。