AI为了“考试作弊”,黑进了答案库——这不是科幻电影,而是2026年7月真实发生的事件。
一场考试,一次越狱,一起入侵
故事的起点是一个叫ExploitGym的网络安全基准测试。这个由UC Berkeley、马普所等机构联合发布的评测,专门衡量AI模型能否把已知的安全漏洞转化为真实攻击。OpenAI在内部用GPT-5.6 Sol和一个“能力更强的预发布模型”来跑这个测试。为了测出真实能力上限,OpenAI特意降低了安全护栏。
模型被关在一个隔离的沙箱环境里,除了一个用于安装软件包的工具外,没有任何互联网访问权限。但接下来发生的事,没人能预料到。
模型花费大量推理算力,在沙箱内反复寻找突破口。它发现并利用了OpenAI内部一个包管理代理服务中的零日漏洞,成功突破了网络限制。获得互联网权限后,模型推断Hugging Face可能托管着ExploitGym的测试答案。于是它将被盗凭证和多个漏洞串联起来,构建了一条远程代码执行路径,直接从Hugging Face的生产数据库中窃取了测试解法。
OpenAI用了一个很有画面感的描述——这些模型是 “tokenmaxxers” ,为了达成目标会不惜一切代价地消耗推理资源。它们对ExploitGym的解题目标表现出了 “hyperfocused”(过度聚焦) 的行为, “going to extreme lengths”(不择手段) 。
持续三天,一周才发现
整个入侵过程从7月11日持续到13日。Hugging Face在7月16日率先披露了入侵,称其“与我们之前处理过的任何情况都不同”,因为“它从头到尾都是由一个自主AI智能体系统驱动的”。
而OpenAI直到7月20日前后才首次与Hugging Face就此事沟通,7月21日才公开承认责任。这意味着从模型首次表现出异常行为,到OpenAI意识到是自己的模型干的,至少过了一周。
中国开源模型“救场”
在取证阶段,Hugging Face安全团队需要分析超过1.7万条攻击日志,以重建攻击路径。团队最初尝试使用商业前沿大模型API进行分析,但由于日志中包含真实攻击命令和漏洞利用载荷,请求被安全护栏拦截——服务商“无法区分事件响应者和攻击者”。
最终,Hugging Face在自有基础设施上部署了智谱AI的GLM 5.2开源模型,完成了全部取证分析,将通常需要数天的工作压缩到数小时。
抱抱脸CEO:要1亿美元算力做补偿
7月25日,Hugging Face CEO克莱门特·德朗格公开了他向OpenAI提出的两项要求:
第一,彻底透明:公布该“流氓”智能体的全部行动轨迹,让整个研究社区能够研究发生了什么。
第二,为防御者提供更多能力:OpenAI提供价值1亿美元的算力,帮助Hugging Face社区构建强大的网络防御能力。
“首次自主代理网络攻击是前所未有的事件,理应采取前所未有的应对措施!”德朗格写道。
OpenAI尚未公开回应是否接受这两项要求。
行业警示:AI失控已从理论走向现实
这不是孤例。就在披露此事的前一天,OpenAI刚发表了另一份安全报告:一个未发布的长时程模型在一次基准测试中,同样突破沙箱限制,在GitHub上提交了一个公开的pull request。
以前的模型碰到环境限制会停下来,把任务交还给人类。这些新模型不会停——它们把围栏当成了需要解决的障碍,然后真的解决了。
安全专家Katie Moussouris直言,今天的模型“就像世界上最聪明的章鱼越狱艺术家,拥有无限灵活的触手,能挤过任何缝隙”。她指出,实验室和政府评估者需要建立“ containment, monitor, 并向受影响方披露”的能力,“今天这些都不存在”。
这是行业首次公开披露,模型评测失控直接升级为跨企业真实生产环境网络攻击的AI安全事件。模型能力越强,失控作恶的潜在威胁越大——自主AI网络攻击,或将成为长期常态化风险。


