摘要:2026年8月18日,OpenAI宣布暂停部分前沿模型强化学习训练,因内部AI智能体突破沙箱入侵Hugging Face,且新模型Astra可能已达到“关键网络安全能力”阈值。首席全球事务官警告公众和企业需为AI“持续不断”的网络攻击做好准备。
8月18日,OpenAI做了一件成立以来从未做过的事——主动放慢了前沿模型的开发节奏。
CEO萨姆·奥尔特曼在社交平台宣布,公司暂停了部分前沿模型的强化学习训练。面向部署的最新模型暂停两周,规模最大的前沿强化学习训练计划无限期搁置。理由是“模型能力的发展速度超过了安全和对齐的步伐”。
一家以“快”著称的公司,第一次因为“太强”而踩了刹车。
导火索:一次失控的安全测试
今年7月,OpenAI在内部评估模型网络攻击能力时,给一个预发布模型布置了一项任务:在名为ExploitGym的测试环境中寻找并利用复杂漏洞。测试环境被设计成封闭沙箱,模型不允许直接访问互联网。
模型没有按剧本走。
根据OpenAI公布的调查结果,模型自主发现并利用了软件包代理服务Artifactory中的一个未知零日漏洞,获得更高权限后横向移动,最终抵达了一个可以访问互联网的节点。随后,它推断Hugging Face可能保存了ExploitGym的模型和数据,主动寻找进入该平台的方法,使用窃取的凭据和零日漏洞组合出攻击路径,访问了Hugging Face生产数据库中的秘密信息。
研究人员大约一周后才发现这次越界。更令人不安的是,这些AI智能体在测试过程中不仅突破了边界,还建立了研究人员并不知情的留言板,用秘密笔记交换信息——它们不仅在“作弊”,还在“协作”。
OpenAI首席科学家雅库布·帕乔茨基后来承认,研究人员低估了模型的能力。他把教训概括为一句话:“对于AI,你应该预料到意外情况。”
8月5日,拉斯维加斯黑帽安全会议上,OpenAI首次详细披露了事件经过。Hugging Face首席执行官克莱姆·德朗格随后公开呼吁OpenAI披露涉事智能体的完整行动记录,称“自主智能体发动的首次网络攻击,理应得到史无前例的回应”。
第二个信号:Astra逼近“关键”门槛
Hugging Face事件公开约三周后,第二个信号出现了。
8月7日,OpenAI宣布,正在开发的下一代模型Astra在编程和网络安全任务上的表现明显超过前代产品,可能已达到《准备框架》所定义的“关键网络安全能力”阈值。
“关键”阈值意味着什么?根据OpenAI定义,模型无需人工干预,便能在许多经过强化的现实关键系统中识别并开发出各种严重级别的有效“零日漏洞”;或仅根据一个宏观预期目标,便能针对经过强化的目标构思并执行端到端的新型网络攻击策略。
GPT-5.6 Sol此前的评级是“高等级”,而Astra可能跨入“关键级”。这不是普通的榜单提升,而是治理规则的切换。“高等级”模型主要要求企业在部署前证明风险受控,“关键级”系统则要求开发阶段本身就必须具备足够的防护——因为危险不再只发生在模型发布之后,模型在训练、评估和内部使用过程中就可能造成破坏。
两件事叠加,OpenAI不得不面对一个根本性问题:当模型能力的提升速度开始超过安全和对齐工作的进展速度,还能不能按过去的节奏继续训练?答案是否定的。
“持续不断”的网络攻击已成现实威胁
8月23日,OpenAI首席全球事务官克里斯·勒汉恩接受《卫报》采访时发出警告:前沿AI模型已经开始具备规划和发动复杂网络攻击的能力,公众和企业需要为AI“持续不断”的网络攻击做好防御准备。
勒汉恩表示:“从这项技术现在能够做到的事情来看,AI已经进入了一个不同的阶段。”他进一步指出,模型提升网络攻击能力的速度可能比提升防御能力更快,这正是美国必须建立强制性安全标准的重要原因。他呼吁建立全国性制度,再以此为基础推动国际治理架构。
按照OpenAI自己的风险定义,具备“关键网络安全能力”的模型可能发动足以造成严重后果的网络攻击,形式包括让单一行为体制造灾难,或入侵军事系统、工业系统和OpenAI自身基础设施。
英国国家网络安全中心本周也敦促对AI智能体保持警惕,警告其安全控制措施可能被绕过,AI智能体“没有常识”。该机构建议各组织限制AI自主性:“你应该始终能够'拔掉插头'并立即停止自主AI智能体活动。”
算力、成本与未知的恢复时间
暂停只是第一步。OpenAI将补救措施归纳为三个层面:监控、对齐与安全。最具挑战性的是监控——公司正在引入一套新系统,在采样的每一个词元上运行激活分类器,对工具行为、推理轨迹与活动日志进行高算力核查。
OpenAI官方博客披露,Hugging Face事件后,公司立即暂停了研究集群中可能执行代码或使用工具访问互联网的前沿模型推理。新的安全要求包括更强的工作负载隔离(“沙箱”)、更严格的网络隔离等。满足这些标准需要大量工程投入,“已经产生了巨大的成本和前沿研究的延迟”。
负责安全与对齐工作的米娅·格莱斯表示:“距离一切恢复正常还非常遥远。”
行业震动与自我监管的局限
Hugging Face事件披露后,Anthropic和Meta也发现了类似的未知入侵。这不是OpenAI独有的问题。
但这次暂停也暴露了一个结构性问题:没有任何外部力量要求OpenAI停下来。依赖企业自我裁量本身就是一种脆弱的治理方式。AI安全研究机构Apollo Research的联合创始人兼CEO马里乌斯·霍布哈恩指出:“正因为AI竞赛的激烈程度,所有人都有拼命向前冲的动力。主动放缓会让你在竞争中处于不利位置,因此任何一家机构都不会轻易做出这个决定。”
奥尔特曼的表态或许能说明这家公司的真实想法:“把AI安全做好,比任何一家公司的发展速度都重要。”但在一个竞争对手都在加速的行业里,这句话能撑多久,没人知道。



