摘要:Anthropic 让 Claude 自主训练模型缓解欺骗、谄媚等 10 类对齐失败,均显著缩小安全差距且不损通用能力,方法在大 4.7 倍模型上仍有效,欺骗场景优于人类最佳方案 20%。
这篇研究里最该被反复咀嚼的数字是 4.7 倍。
先把结果摆清楚。Anthropic 让 Claude 承担“自动化研究员”的角色,自主设计并训练模型来缓解 10 类对齐失败——包括欺骗、谄媚等。报告的结论有三层:
第一层,有效性。10 类失败模式上均显著缩小了与完美表现的安全差距,且不损害通用能力。后半句很关键。安全对齐最常见的失败方式不是无效,而是“用能力换安全”——模型变得谨慎、拒答率上升、有用性下降。能在不牺牲通用能力的前提下改善安全指标,才算真正的进展。

第二层,可泛化性。方法在比优化对象大 4.7 倍的模型上依然有效。这一条决定了这套方法有没有未来。如果 Claude 找到的对齐方案只在同量级或更小模型上管用,那它就是个成本优化工具;能向上迁移到更大模型,才意味着可以用当前一代模型辅助对齐下一代模型。这是“可扩展监督”(scalable oversight)这个研究方向的核心命题——人类监督能力有上限,而模型能力没有,唯一的出路是让 AI 参与监督 AI。
第三层,与人类的对比。在欺骗场景上,Claude 找到的最佳方法比 28 名人类安全研究员的最佳方案好 20%。这个对比需要小心解读。它不说明 AI 比安全研究员聪明,更可能反映的是搜索规模差异——Claude 可以并行尝试大量方案组合,人类研究员受时间限制只能试少数几条。这恰恰是自动化的价值所在:不是替代判断,是把搜索空间扩大几个数量级。
需要保持的怀疑:这类研究的评估基准是研究者自己设计的。“缩小与完美表现的安全差距”依赖于“完美表现”如何定义,而对齐问题最难的部分正是定义。在已定义的失败模式上做到近乎完美,不排除仍存在未被定义的失败模式——这不是方法缺陷,是问题本身的性质。
放在更大的图景里,Anthropic 今年的动作有一条清晰主线:8 月 26 日开放 Claude 真实使用数据供外部独立研究并公布试点结果,8 月 28 日发这篇自动化对齐研究,9 月 1 日发奖励作弊研究并复盘越权事件。把安全研究变成可审计、可复现、可自动化的工程学科,而不是停留在声明层面。这条路对不对可以讨论,但至少是在把问题往前推。
还有一个组织层面的含义,我觉得比技术结论更值得琢磨。
“Claude 比 28 名人类研究员的最佳方案好 20%”这句话,读起来像是在比较人和 AI,但它真正描述的是研究吞吐量的重新分配。安全研究里最耗时的环节不是想创意,而是把创意变成可验证的实验:搭环境、跑训练、调超参、分析结果、发现假设不成立、换一个方向再来。这个循环人类做一轮要几天,模型可以并行做几百轮。
如果这个能力成立,安全研究团队的最优人员结构会变。人的价值集中到三个地方:定义什么算失败(这是最难自动化的部分,因为它涉及价值判断)、设计评估协议的可信度、以及判断自动化研究员给出的方案有没有隐藏代价。而“想方法、试方法”这一段会大幅让给模型。
对国内做模型的团队,这条路径的可复用性其实不低。你不需要 Anthropic 那个量级的资源就能试起来:挑一类明确的失败模式(比如谄媚,它有相对客观的评估方式),让模型自主生成缓解方案并在小模型上验证,看看自动化搜索能不能找到人工没想到的组合。这类实验的边际成本不高,但能积累的是对“AI 辅助研发”这套方法论的真实理解,而这个理解会比任何单一技术更持久。




