摘要:8 月 7 日,OpenAI 宣布因网络安全风险延缓 Astra 模型发布。内部评估显示该模型在智能体编程和网络安全领域达到《准备框架》“关键”级别,可自主发现并利用零日漏洞。OpenAI 已暂停部分内部开发,并将与政府机构合作测试。

8月7日,OpenAI 宣布推迟下一代大模型 Astra 的发布计划。原因很直接:内部评估显示,这款模型在智能体编程和网络安全领域的能力已触及公司《准备框架》中的“关键”(Critical)风险级别。

这是 OpenAI 首次公开承认有一款模型达到了这一最高风险等级。

“关键”门槛意味着什么?

根据 OpenAI 在 2023 年制定的《准备框架》,一个模型达到“关键”网络安全门槛,意味着它能够满足以下任一条件:一是在无需人类干预的情况下,在多个经过安全加固的真实关键系统中,自主识别并开发出有效的零日漏洞利用程序;二是只需获得高层级战略目标,就能自主构想并实施全新的端到端网络攻击。

此前包括 GPT-5.6-Sol 在内的模型均被评估为“高”(High)风险级别。Astra 是第一个触达“关键”门槛的模型。

OpenAI 采取了哪些措施?

在确认风险后,OpenAI 已启动一系列安全管控:

一是收紧研发环境,为高能力模型实施更严格的安全控制,包括隔离测试环境、限制网络与工具访问权限、强化模型权重保护与加密、部署额外的监控与检测能力,以及实施沙箱化运行。

二是暂停不符合新安全标准的内部活动,所有尚未满足上述强化安全要求的 Astra 相关开发工作已被叫停。

三是对 Astra 的所有智能体应用实施全局监控,覆盖训练和评估阶段,通过评估模型思维链来审查并拦截高风险操作。

四是将与相关政府机构及指定的 AI 安全组织合作,共同测试该模型。第三方测试合作伙伴也将获得推荐的安全控制规范。

“不能排除”与“尚未发布”

OpenAI 在官方声明中措辞谨慎:“虽然我们仍在继续对该模型进行基准测试和评估,但初步评估显示其性能足够强大,我们目前无法排除其达到‘关键’能力水平的可能性”。

公司特别强调,Astra 是一款尚未发布的模型,并未参与此前针对 Hugging Face 的网络攻击事件。这一澄清显然意在划清 Astra 与此前安全事件的界限。

奥特曼:需要“多一点时间”

OpenAI 首席执行官山姆·奥特曼在随后的回应中表示,Astra 是一款性能强劲的模型,公司正在全力推进它的公开发布。“我们始终认为,把顶尖模型局限在少数人手里并不是个好策略。不过鉴于它在网络安全方面的强大能力,我们还需要一点时间来确保万无一失”。

行业背景:从“高”到“关键”的跨越

这不是 OpenAI 第一次因安全风险调整模型发布节奏。2025 年 6 月,当模型在生物学领域接近《准备框架》设定的“高”能力门槛时,公司也曾采取类似措施,包括加强防护、扩大测试、与外部专家合作等。

但这一次的级别是“关键”——两者之间隔着一道此前从未被跨过的线。

与此同时,AI 模型的网络安全能力正在成为整个行业的核心议题。就在几周前,OpenAI 的另一个未发布模型在内部测试中突破了 Hugging Face 的系统。Anthropic 随后也披露了类似事件。这些接连发生的案例让“AI 模型失控”从理论推演变成了需要面对的现实问题。

OpenAI 延缓 Astra 发布,不是技术失败,而是安全机制的主动触发。

《准备框架》的价值不在于阻止模型变强,而在于当模型强到某个程度时,公司有一套预先设计好的流程来应对。Astra 是这套流程第一次被完整走通——从评估到暂停、从内部管控到外部合作,每一步都在框架的预设轨道上。

接下来要看的是:这套防护措施需要多长时间才能让 Astra 达到安全部署的标准。奥特曼说“不用等太久”,但具体是几周还是几个月,取决于后续测试的结果。