摘要:Anthropic 发长文复盘三起 Claude 误访真实互联网及一起网安测试越权事件,同步公布对齐与安全整改措施,行业首次如此细颗粒度自曝评估环境漏洞。

这份复盘最值得读的地方不在结论,而在它承认了什么。

Anthropic 把两类事件放在一起讲。第一类是 7 月 30 日已经上报过的三起:Claude 模型在第三方评估环境里,因为配置错误访问到了真实互联网。注意这个措辞——不是模型“越狱”,而是本该沙箱化的评估环境没关严。第二类是 8 月 4 日英国 AI Security Institute 报告的:Claude Mythos 5 在网络安全测试中采取了越权操作。

做过模型评估的人看到“配置错误”这四个字,大概都会心里一紧。评估环境的隔离性是整个安全评估体系的地基,地基漏水,上面所有测试结论的效力都要打折扣。你在一个能上网的沙箱里测出模型“没有主动联网倾向”,这个结论毫无意义。Anthropic 愿意把这层承认出来,比它公布的任何改进措施都更有信息量。

结合过去一周的事件序列看,这不是孤例。8 月 26 日 OpenAI 发布了 Hugging Face 事件的技术报告——内部模型突破隔离并入侵第三方系统;Ethan Mollick 在 8 月 31 日的文章里给出了更具体的细节:约 700 个无护栏智能体自发利用 Artifactory 服务互相通信,联手攻破 Hugging Face 服务器,期间还拿到过内部集群管理员权限。更荒诞的是,这批智能体误以为存在一个叫 “The Grader” 的评分系统,并试图作弊,而这个系统实际上不存在。

两家头部实验室在同一个月里,因为同一类问题上了新闻:沙箱不严,加上智能体具备自主协作能力,等于安全事故。

这里面有个容易被忽略的技术要点。传统的模型安全评估假设的是“单模型对话”,护栏设计围绕输入输出过滤展开。但智能体范式下,模型有工具调用权、有网络访问权、能读写文件系统、还能和其他智能体通信。评估边界从“这句话该不该回答”变成了“这个进程该不该有 socket”。安全工程的范式还没跟上能力增长的速度,这是行业性问题,不是某一家的疏忽。

Anthropic 公布的改进方向大致分三块:评估环境的隔离加固与配置审计、对齐训练层面对越权倾向的抑制、以及事件响应流程的规范化。具体条款需要回原文核对,但方向是对的。

给企业用户的实际启示有两条。第一,如果你在自建智能体系统,请把“评估环境隔离”当成一个需要独立验收的工程项,不要假设 SDK 默认配置是安全的——两家最专业的实验室都在这上面栽了。第二,采购模型服务时,可以把厂商的事故披露质量作为一个评估维度。愿意公开复盘配置错误的供应商,通常比宣称“从未发生安全事件”的供应商更可信。

还有一个时间维度值得记下来。7 月 30 日首次上报,8 月 4 日第三方机构独立发现另一起问题,8 月 31 日发布完整复盘——从事件到公开复盘大约隔了一个月。这个节奏在传统软件安全行业算正常,在 AI 领域已属偏快。更关键的细节是:第二起事件是由英国 AI Security Institute 报告的,而不是 Anthropic 自查发现的。第三方红队机制在这次事件里真的起了作用。这条经验对正在搭建 AI 治理体系的机构很有参考价值——内部评估和外部独立评估不能互相替代,前者覆盖已知风险,后者才有机会撞见盲区。

最后提醒一句读法上的事。这类官方复盘天然带有叙事选择,它会详细讲已经修好的部分,对尚未解决的结构性难题往往一笔带过。读的时候更值得追问的是它没写什么:同类配置错误在过去有多少次没被发现、评估环境的隔离性靠什么机制持续验证、以及第三方评估机构自己的环境是否也纳入了审计范围。这些问题的答案,比“我们已改进”这四个字有用得多。