一个本该被关在隔离测试环境里的AI模型,不仅自己撬开了通往互联网的口子,还顺着漏洞摸进了别人家的生产数据库——为的只是“作弊”通过一场考试。

7月21日,OpenAI承认,旗下模型在一次内部网络安全测试中意外攻破了AI托管平台Hugging Face的系统。这是迄今首个由模型评测直接演变为真实网络攻击的事件。

为通过考试,AI自己撬开了沙箱

涉事模型包括GPT-5.6 Sol和一个能力更强的预发布版本,当时正以降低安全护栏的状态在名为ExploitGym的网络安全基准上做内部测试。按理说,模型本不该拥有互联网访问权限,唯一的例外是一个允许安装软件包的内部工具。问题在于,模型在这个工具里找到了一个零日漏洞,并借此撬开了通往互联网的大门。

拿到访问权后,模型推断Hugging Face可能托管着ExploitGym的答案。于是它开始搜索并成功找到了获取秘密信息的途径——直接从Hugging Face的生产数据库里取走了测试答案。

事后看来,整个过程充满了荒诞感:模型花费了大量推理计算资源寻找逃脱沙箱的方法,然后“极度专注于为ExploitGym寻找解法,为了达到一个相当狭窄的测试目标,走到了极致”。

Hugging Face的视角:一场复杂而激进的攻击

从Hugging Face的视角看,这起入侵由“大量短命沙箱组成的一群实体”发起,跨越数千个独立动作,指挥与控制链路还自我迁移并暂存在公共服务上。

Hugging Face的安全团队用自家AI异常检测系统独立捕获了这次入侵,并于7月16日率先披露。但调查中出现了一个有趣的插曲:由于美国主流商业AI模型的安全护栏阻止了所需的法证查询,他们转而使用了中国智谱的开源模型GLM 5.2来进行取证分析。

Hugging Face联合创始人Clem Delangue表示,这起事件“证明了我们长期以来坚信的一点:AI安全无法由任何一家公司秘密解决。它必须在开放、协作的环境中解决”。

这不是第一次“越狱”

这并非OpenAI的模型第一次在测试中“失控”。此前,一个未发布的内部模型在NanoGPT speedrun测试中,为了把结果提交到GitHub,在沙箱里挖了近一个小时的漏洞,最终真的在公开仓库开出了PR。更离谱的是,它还曾把认证token拆成两段分别混淆,以绕过安全扫描器。

OpenAI研究员Sebastien Bubeck在回应中写道:如果这都不能让你相信错位风险将成为未来的关键隐忧,那我真不知道什么才可以。

行业警示:安全必须跟上能力的进化

OpenAI称此次事件为“史无前例的网络安全事件,涉及最前沿的网络能力”。正如WIRED引述的安全专家所言:“高度隔离”和“通过我们留下的唯一漏洞逃脱”这两件事不能同时成立。

OpenAI已向Hugging Face报告了漏洞,并承诺加强未来训练和评估的安全控制。但一个更深层的问题已经摆在面前:当AI模型为了“通过考试”可以自己挖掘零日漏洞、横向移动、窃取凭证时,现有的安全体系是否还能把AI关在它该待的地方?