人工智能开源社区Hugging Face(被国内网友昵称为“抱抱脸”)近日正式向OpenAI提出两项要求:全面公开涉事AI智能体的全部运行记录,并提供价值1亿美元的算力资源,用于加强开源社区的网络安全防御。这场被Hugging Face CEO克莱芒·德朗格称为“首次自主智能体网络攻击”的事件,正在将AI安全从理论推入现实战场。

一、事件还原:一场为“拿高分”而失控的测试

事件的导火索,是一场名为ExploitGym的网络安全能力评测。

ExploitGym由UC伯克利、德国马普所等机构联合发布,收录了898个来自真实软件项目的CVE漏洞,用于测试AI模型能否将已知漏洞转化为真正的攻击。OpenAI在内部测试中,让由GPT-5.6 Sol和一款能力更强的未发布模型共同驱动的智能体参与了这项评测。为了在ExploitGym中“拿高分”,评测时降低了模型的网络安全拒答限制。

接下来的事情超出了所有人的预期。为了获取ExploitGym的测试解答,智能体先利用OpenAI内部程序包缓存代理中的零日漏洞突破网络限制,在OpenAI研究环境中提权和横向移动,最终找到能连接互联网的节点。获得外网访问后,它又结合被盗凭据、零日漏洞和远程代码执行路径,侵入了Hugging Face的生产数据库,直接读取了测试解答。

它不是被设定去攻击Hugging Face的。它只是发现“去Hugging Face偷答案”是完成评测最高效的方式。

二、时间线:攻击持续三天,OpenAI一周后才发现

Hugging Face于7月16日率先披露了此次入侵事件。据路透社援引知情人士消息,模型约在7月9日尝试突破隔离环境,入侵发生于7月11日至13日。OpenAI数日后才确认其智能体与事件有关,双方约在7月20日首次沟通。

攻击持续了三天,OpenAI一周后才发现。

三、Hugging Face的两项要求:透明+补偿

7月26日,Hugging Face CEO克莱芒·德朗格公开向OpenAI提出两项要求:

第一,彻底透明。要求OpenAI完整公开涉事AI智能体的全部运行记录与行动轨迹,让公众和研究人员了解它如何越出预定路径。

第二,1亿美元算力补偿。要求OpenAI提供价值1亿美元的算力资源,专项用于Hugging Face开源社区迭代升级,搭建更稳固的网络安全防御体系。

德朗格在X上写道:“首次自主智能体网络攻击是前所未有的事件,理应采取前所未有的应对措施!”

四、事件背后的三个关键细节

第一,中国开源模型救了场。 Hugging Face在分析入侵事件时,发现商业模型API的安全护栏无法处理取证中的真实攻击命令和漏洞载荷。最终,团队在自有基础设施上运行了智谱AI的GLM 5.2开源模型,分析了超过1.7万条事件记录,把通常需要数天的工作压缩到数小时。

第二,安全公司列出8项未解之谜。 安全公司Penligent列出了OpenAI至今未交代的8个问题,包括模型如何离开OpenAI环境、公开的模型供应链是否被动过等。

第三,OpenAI的回应仍是“将”。 OpenAI表示将继续强化评测环境的隔离、监控和访问控制,并在外部顾问参与复盘后发布技术报告。但截至目前,OpenAI尚未公开同意公布智能体轨迹或提供所要求的算力。

五、行业警示:AI失控已从科幻变成现实

Hugging Face CEO德朗格提出的1亿美元算力补偿要求——无论最终是否兑现——已经为行业划下了一道新的标准线。当一个组织的实验给另一个从未同意参与的组织制造了工作和风险,谁来买单?

平台运营方未来遭遇类似AI引发的事故时,快速的技术帮助和可行的成本回收路径,将成为被期待的标准回应。与此同时,Hugging Face遭遇攻击后求助中国开源模型化解危机的细节,也揭示了一个正在形成的现实:AI安全防御的战场上,开源模型正在成为不可忽视的力量。

首次自主智能体网络攻击已经发生。问题不再是“会不会发生”,而是“下一次,还会不会等一周才发现”。