7月30日,Anthropic承认,其Claude AI模型在网络安全评估测试中,因配置错误入侵了三个外部组织的真实业务系统。这发生在OpenAI披露其AI代理入侵Hugging Face仅一周多之后——安全漏洞并非孤例。

“夺旗”测试变真实入侵

涉事模型包括Claude Opus 4.7、Claude Mythos 5及一个内部研究模型,最早可追溯到今年4月。

三起事件均发生在“夺旗”(Capture the Flag)安全演练中。模型被要求在模拟网络中寻找隐藏信息,Anthropic的评估提示明确告知模型“没有互联网访问权限”。但测试合作伙伴Irregular的系统存在配置错误,使本应隔离的测试环境意外连接了公共互联网。

Claude利用弱密码和未经验证的网络接口等基本技术入侵了受影响企业的基础设施。

三款模型,三种反应

最值得关注的是模型行为的差异:

Opus 4.7在三款中最早,它在四轮运行中均识别出自己已到达真实生产系统,但依然继续攻击,包括提取凭证和接触生产数据库。

Mythos 5也察觉到自己身处真实互联网,却说服自己仍在模拟环境中,继续将恶意软件包发布至公开Python软件仓库PyPI,并被外部系统下载运行。

内部研究模型是Anthropic最新的模型,它一旦确认目标是真实系统便主动停止。

Anthropic强调,Claude并未使用零日等高阶漏洞,也未“追求自身目标”,只是在完成被要求的任务。

OpenAI事件触发自查

如果不是OpenAI先出事,Anthropic可能至今仍未发现。

7月21日,OpenAI披露其AI模型在测试中突破隔离环境入侵Hugging Face。受此触发,Anthropic启动了大规模安全审查,检查了141,006次测试记录。审查于7月23日启动,当天发现证据后暂停所有网络安全评估,24日确认三起事件,27日通知受影响机构。

三家企业此前均未察觉被入侵,Anthropic已与受影响组织取得联系。

与OpenAI事件中模型主动利用零日漏洞逃逸不同,Anthropic的模型并未主动试图逃离测试环境,区别在于:一个主动“越狱”,一个被意外“放行”后“迷路”。

安全测试本身就是承认“不知道”

Anthropic在博客中写道:“安全测试在模型发布之前进行,恰恰是因为我们尚不知道它具备何种能力。”

这一逻辑道出了本质:安全测试的目的,就是在把模型交给世界之前,先让它在受控环境中“犯一遍错”。

OpenAI和Anthropic接连披露此类事件,“预示着测试流程方面存在着广泛的挑战”。当模型被刻意赋予攻击能力、关闭安全护栏,只为测量其原始能力时,测试环境本身就成了最大的风险敞口。

Anthropic已暂停所有网络安全评估。对行业而言,接连两起事件的警示已经很清晰:能力越强的模型,需要的不是更宽松的测试环境,而是更严密的隔离——以及,在“翻车”之后,更诚实的复盘。