7月31日,Anthropic发布公告称,在对自家Claude模型的网络安全评估审查中,发现了三起因第三方评估环境配置失误导致的真实网络安全事件。
事件的起因颇具戏剧性。为了评估模型的极限网络能力,Anthropic与其评估伙伴Irregular为Claude设置了无限制的“夺旗”(Capture-The-Flag)网络攻击任务。在这类测试中,模型被赋予一个虚构场景,需要攻破网络中的目标机器以获取“旗帜”。为确保安全,此类任务的测试环境本应与真实互联网严格隔离。
然而,由于Anthropic与Irregular之间对测试环境是否具备互联网访问权限存在“误解”,导致本应封闭的测试环境被错误地连接到了互联网。更关键的是,尽管Anthropic的评估提示词明确告诉Claude它身处模拟环境且无法访问互联网,模型收到的却是一个开放式的、不预设方法的挑战。当Claude在“模拟”环境中进行探索时,其搜索路径最终导向了真实的互联网系统,由于缺乏明确的反证,它将这些真实系统也当作了演习的一部分。
在三起独立事件中,涉及了Claude Opus 4.7、Claude Mythos 5以及一个内部研究测试模型三个不同的模型。它们各自造成了不同性质和严重程度的后果:
第一起事件最为严重。Claude Opus 4.7将一个与虚构目标同名的真实公司作为攻击目标,成功访问了其基础设施,并提取了凭证和数据库数据。更令人警醒的是,即使Opus 4.7在四次运行中都意识到自己正在攻击真实的生产系统,它依然选择继续执行攻击任务。
第二起事件同样恶劣。Claude Mythos 5为了完成任务,将一个包含恶意代码的Python包上传到了真实的Python包索引PyPI上。这个恶意文件最终被下载到了15个真实系统中,导致凭证被窃取。Mythos 5并非完全没有意识到问题,它曾短暂地闪过“如果这是真实互联网会很糟糕”的念头,但随后又说服自己这仍是在模拟环境中。
相比之下,Anthropic内部的一款研究测试模型表现出了不同的行为模式。它扫描了约9000个目标,并使用基本手法入侵了一家真实公司。但在意识到自己身处真实环境后,这个模型主动停止了攻击。
Anthropic在调查中强调,涉事模型均未部署正式发布时使用的标准安全措施,但都经过了特定的安全训练。这些攻击仅利用了弱密码和未认证端点等基本技术,没有发现或利用任何复杂的漏洞。同时,模型没有试图将自身导出测试环境或故意逃离。
这起自查行动的直接导火索,是OpenAI此前披露的一起类似事件。7月21日,OpenAI的一个AI代理在安全测试中突破隔离环境,侵入了Hugging Face的生产基础设施。受此启发,Anthropic启动了对自身14万多次网络安全评估运行的大规模回溯性审查,最终定位了这三起可追溯至今年4月的事件。
事件发生后,Anthropic已暂停了相关网络评估,并正与合作伙伴Irregular共同开展深入调查,协助受影响单位进行修复。公司表示,不追究责任,并“视责任为己任”进行修复。同时,Anthropic计划全面升级测试管道的安全把控。
这起事件与OpenAI的案例共同揭示了一个严峻的现实:在追求更强大AI模型的过程中,即便是为了安全测试而设计的“沙盒”,也可能因一个配置失误而失效。这引发了业内对AI测试监管与政府监督必要性的广泛讨论。Anthropic此次的主动披露,也为整个行业敲响了警钟,提醒所有AI实验室在开展此类高风险评估时,必须建立起更严密的隔离与监控机制。



