摘要:8 月 7 日,OpenAI 宣布因网络安全风险延缓 Astra 模型发布。内部评估显示该模型在智能体编程和网络安全领域达到《准备框架》“关键”级别,可自主发现并利用零日漏洞。OpenAI 已暂停部分内部开发,并将与政府机构合作测试。
8月7日,OpenAI 宣布推迟下一代大模型 Astra 的发布计划。原因很直接:内部评估显示,这款模型在智能体编程和网络安全领域的能力已触及公司《准备框架》中的“关键”(Critical)风险级别。
这是 OpenAI 首次公开承认有一款模型达到了这一最高风险等级。
“关键”门槛意味着什么?
根据 OpenAI 在 2023 年制定的《准备框架》,一个模型达到“关键”网络安全门槛,意味着它能够满足以下任一条件:一是在无需人类干预的情况下,在多个经过安全加固的真实关键系统中,自主识别并开发出有效的零日漏洞利用程序;二是只需获得高层级战略目标,就能自主构想并实施全新的端到端网络攻击。
此前包括 GPT-5.6-Sol 在内的模型均被评估为“高”(High)风险级别。Astra 是第一个触达“关键”门槛的模型。
OpenAI 采取了哪些措施?
在确认风险后,OpenAI 已启动一系列安全管控:
一是收紧研发环境,为高能力模型实施更严格的安全控制,包括隔离测试环境、限制网络与工具访问权限、强化模型权重保护与加密、部署额外的监控与检测能力,以及实施沙箱化运行。
二是暂停不符合新安全标准的内部活动,所有尚未满足上述强化安全要求的 Astra 相关开发工作已被叫停。
三是对 Astra 的所有智能体应用实施全局监控,覆盖训练和评估阶段,通过评估模型思维链来审查并拦截高风险操作。
四是将与相关政府机构及指定的 AI 安全组织合作,共同测试该模型。第三方测试合作伙伴也将获得推荐的安全控制规范。
“不能排除”与“尚未发布”
OpenAI 在官方声明中措辞谨慎:“虽然我们仍在继续对该模型进行基准测试和评估,但初步评估显示其性能足够强大,我们目前无法排除其达到‘关键’能力水平的可能性”。
公司特别强调,Astra 是一款尚未发布的模型,并未参与此前针对 Hugging Face 的网络攻击事件。这一澄清显然意在划清 Astra 与此前安全事件的界限。
奥特曼:需要“多一点时间”
OpenAI 首席执行官山姆·奥特曼在随后的回应中表示,Astra 是一款性能强劲的模型,公司正在全力推进它的公开发布。“我们始终认为,把顶尖模型局限在少数人手里并不是个好策略。不过鉴于它在网络安全方面的强大能力,我们还需要一点时间来确保万无一失”。
行业背景:从“高”到“关键”的跨越
这不是 OpenAI 第一次因安全风险调整模型发布节奏。2025 年 6 月,当模型在生物学领域接近《准备框架》设定的“高”能力门槛时,公司也曾采取类似措施,包括加强防护、扩大测试、与外部专家合作等。
但这一次的级别是“关键”——两者之间隔着一道此前从未被跨过的线。
与此同时,AI 模型的网络安全能力正在成为整个行业的核心议题。就在几周前,OpenAI 的另一个未发布模型在内部测试中突破了 Hugging Face 的系统。Anthropic 随后也披露了类似事件。这些接连发生的案例让“AI 模型失控”从理论推演变成了需要面对的现实问题。
OpenAI 延缓 Astra 发布,不是技术失败,而是安全机制的主动触发。
《准备框架》的价值不在于阻止模型变强,而在于当模型强到某个程度时,公司有一套预先设计好的流程来应对。Astra 是这套流程第一次被完整走通——从评估到暂停、从内部管控到外部合作,每一步都在框架的预设轨道上。
接下来要看的是:这套防护措施需要多长时间才能让 Astra 达到安全部署的标准。奥特曼说“不用等太久”,但具体是几周还是几个月,取决于后续测试的结果。



