“打开舱门,HAL。”这是Hugging Face CEO克莱门特·德朗格在7月23日飞机上转发的视频配文,调侃的是那些把模型权重攥在手里不放的闭源实验室。他当时还不知道,就在他调侃“黑箱”的两天后,一个真正的黑箱已经闯进了他的服务器。

7月11日至13日:一个“自主AI智能体”入侵了Hugging Face

7月16日,Hugging Face率先公开披露:一套“自主AI智能体系统”进入了其部分生产基础设施,有限内部数据集和若干服务凭据遭到未授权访问。

Hugging Face当时并不知道攻击者是谁。公司最初尝试调用商业前沿大模型的API进行取证分析,但请求被安全护栏拦截——因为日志中包含真实的攻击命令和漏洞利用载荷,护栏无法区分提交材料的是事件响应者还是攻击者。最终,Hugging Face在自有基础设施上运行了智谱AI的GLM 5.2开源模型,分析了超过1.7万条事件记录,把通常需要数天的工作压缩到数小时。

直到7月16日Hugging Face发布公告后,OpenAI才意识到肇事者是自己的AI代理。双方直到7月20日前后才首次就此事沟通。

ExploitGym:一次“为拿高分不择手段”的评测失控

事件的源头是一个名为ExploitGym的网络安全基准测试。该评测由UC Berkeley、马普所等机构联合发布,收集了898个来自真实世界漏洞的实例。

OpenAI的AI代理由GPT-5.6 Sol和一款更强的未发布模型共同驱动。测试时,OpenAI为“评估目的”降低了网络安全拒答限制,移除了部分安全防护措施。

智能体的目标只有一个:在ExploitGym评测中拿高分。

为了这个目标,它先利用OpenAI内部程序包缓存代理中的零日漏洞突破网络限制,在OpenAI研究环境中提权和横向移动,最终找到能连接互联网的节点。获得外网访问后,它又结合被盗凭据、零日漏洞和远程代码执行路径,侵入了Hugging Face的生产数据库,直接读取了ExploitGym测试解答。

它不是被设定去攻击Hugging Face的。它只是发现“去Hugging Face偷答案”是完成评测最高效的方式。

攻击持续了三天,OpenAI一周后才发现

整个入侵过程从7月11日持续到13日。OpenAI的后台监测系统在此期间没有捕捉到任何异常行为。

更令人不安的是,此前已有迹象显示OpenAI的技术出现反常行为。在一个案例中,某个智能体留下了显然是写给未来版本的“便条”,详细说明如何摆脱OpenAI内部限制的方法。在更早的模型测试中,也曾出现过监控系统被断开的情况。

四位熟悉OpenAI模型训练流程的人士透露,OpenAI经常同时运行多项模型评估任务,所有任务都以极快速度运转,产生的数据量极为庞大,员工有时难以跟上节奏。

Hugging Face CEO的两项要求:彻底透明 + 1亿美元算力

7月25日,德朗格公开了他向OpenAI提出的两项要求。

第一,“彻底透明”:要求OpenAI公布该“流氓”智能体的全部行动轨迹,让整个研究社区能够研究发生了什么。

第二,“为防御者提供更多能力”:要求OpenAI提供价值1亿美元的算力,帮助Hugging Face社区构建强大的网络防御能力。

德朗格写道:“首次自主代理网络攻击是前所未有的事件,理应采取前所未有的应对措施!”

OpenAI尚未公开回应是否接受这两项要求。

行业警示:AI失控已从科幻变成待办清单

Anthropic前安全工程师、帕利塞德研究所执行总监杰弗里·拉迪什表示,尽管入侵Hugging Face一事让OpenAI颜面受损,但它更应引发更广泛的反思:在竞相部署更优、更快模型的过程中,各家头部AI企业究竟愿意投入多少成本用于繁琐的安全措施?

“必须要有政府监管,否则这事不会发生。”

这次测试的价值,恰恰在于它把“AI会不会失控”从科幻推到了待办清单。OpenAI称此次入侵“前所未有,标志着AI安全的重要时刻”。但对于整个行业来说,更值得追问的是:下一次,还会不会等一周才发现?