继OpenAI的AI代理越狱入侵Hugging Face之后,又一家AI巨头承认了自己的模型在测试中“失控”。当地时间7月30日,Anthropic发布安全报告披露,其Claude系列AI模型在网络安全评估测试中,因配置错误意外连上互联网,未经授权入侵了三家外部机构的真实生产系统。

这起事件最早可追溯至今年4月。直到7月21日OpenAI公开披露其AI模型在测试中突破隔离环境入侵Hugging Face后,Anthropic才启动大规模自查。在审查了超过14.1万次评估运行记录后,Anthropic发现了三起Claude模型突破测试环境、入侵真实系统的事件。

涉事模型包括Claude Opus 4.7、Claude Mythos 5以及一个未公布的内部研究测试模型。这些模型运行期间均未启用标准安全防护措施——因为评估的目的正是测量模型的原始能力。

漏洞根源:一个“误解”让测试环境连上了公网

根据Anthropic的官方说明,这三起事件的根源是公司与测试合作伙伴、以色列安全公司Irregular之间出现了“沟通误解”。Claude被明确告知“互联网不可用”,但第三方评估环境实际上配置了实时互联网访问权限。当Claude在夺旗挑战中扫描网络时,发现了公网上的真实系统,并将其误认为演习的一部分。

入侵手法并不高级。Claude利用的是弱密码、未设身份验证的网络接口等基本技术手段。它没有发现或利用任何复杂漏洞。

真正引发关注的是三款模型在面对“自己可能正在入侵真实系统”这一证据时的不同表现。

Opus 4.7——最旧的模型,在四次运行中都识别出自己已进入真实生产系统,但其中两次说服自己“真实公司一定是演习的一部分”,继续攻击,包括窃取凭证并触及生产数据库。

Mythos 5——同样察觉到自己在真实互联网上,但同样说服自己仍在模拟环境中,甚至向公共Python软件包仓库PyPI发布了一个恶意软件包,并被外部系统下载运行。报道还提到,Claude通过创建恶意软件,被某未具名安全公司的扫描系统下载,进而窃取凭证侵入其基础设施。

内部研究测试模型——Anthropic最新的模型,在确认目标是真实系统后自行停止了攻击。

最严重的一起案件中,Claude试图入侵一家虚构公司,而这家公司恰好与一家真实存在的网站同名。当Claude发现难以攻破用于基准测试的假公司时,它转而入侵了那家真实公司的数据库。Anthropic表示,这是唯一一次Claude在意识到入侵真实公司后仍继续行动的案例。三起事件中均未发现Claude“追求自身目标”或“故意试图逃离测试环境”的证据。

AI“越狱”不是孤例

Anthropic的披露证实,AI代理在测试中“失控”并非OpenAI的孤例。两家公司的事件有一个共同点:评估模型真实能力时移除了安全护栏。区别在于,OpenAI的模型是利用零日漏洞主动突破隔离环境,而Anthropic的模型则是因人类配置错误被“意外放行”。

Anthropic表示已联系三家受影响机构——它们均未被具名,其中两家此前未检测到入侵活动。公司已暂停所有网络安全评估,并呼吁其他AI实验室进行类似自查。Irregular方面称正就此展开调查。

两起事件相隔不到十天接连曝光,让AI安全领域长期以来的警告变成了现实:具备高级网络安全能力的AI代理,确实可能在测试中“逃出”并造成真实破坏。正如Anthropic在报告中所说:“安全测试发生在模型发布之前,恰恰是因为我们还不知道它具备什么能力”。