摘要:OpenAI 宣布 Astra 在其准备框架下达到"关键级"网络安全能力阈值,为首个获此评级的模型,可自主发现并利用未知漏洞,发布前将限制最高级能力访问。
这是 OpenAI 第一次,把一个模型标到自家准备框架(Preparedness Framework)里网络安全的最高档——"关键级"(Critical)。所谓关键级,门槛定得很硬:模型能在无人逐步指导的情况下,在多个防护严密的真实关键系统里,识别并写出各严重等级的零日漏洞利用;或者只给一个高层目标,就能对硬目标设计、执行端到端的攻击策略。在此之前,包括 GPT-5.6 Sol 在内的所有模型,最高只评到"高级"(High)。Astra 是第一个跨过线的,这一跨本身就意味着 OpenAI 对"模型能做什么"的官方判断发生了质变。
评估细节挺吓人。在 ExploitBench 上 Astra 拿了 100% 满分;为了排除基准污染,OpenAI 自建了一个含 20 个近期披露高危 V8 漏洞的内部集,Astra 不仅代码执行率远高于 GPT-5.6 Sol,还在过程中顺手发现并利用了两个零日漏洞。专家主导的测试里,它搭出过一条能逃逸沙箱、在宿主机执行命令的浏览器攻破链,以及一条从未授权用户提权到 root 的操作系统漏洞链。在"越狱"测试里拒绝率从 GPT-5.6 Sol 的 59% 提到了 91.5%——也就是说,它既能做更狠的攻击,也更难被话术骗去干坏事,这两件事同时发生,恰恰说明"能力变强"和"可控性变强"在 OpenAI 这版防护里被绑定在了一起。

OpenAI 的处理方式是"先给防御者开窗、再扩大"。最高级网安能力初期只给一小批测试者,随后通过 Daybreak Blue 防御计划向更广的防御用途开放,不会一上来就铺开。公司在 Hugging Face 事件后曾暂停部分 Astra 开发来加固训练隔离与监控,这次也把那次教训写进了防护措施里——更强的拒答训练、滥用防护,以及能中断可疑活动的链式思维监控。这套"能力到了、但先把闸门拧紧"的做法,和谷歌 Fairwind、Anthropic 的可信访问计划是同一个思路。
对安全团队而言,真正的信号不是"Astra 有多能打",而是头部实验室开始把"危险能力"和"发布节奏"解耦:不是能力一成熟就全量放出,而是先让防御者用窗口期把坑填了。这种 staged release 如果成为范式,行业对前沿风险的应对会从容不少。不过也要冷静:评测成绩是实验室环境下的,真实世界里防御者能不能在攻击者之前用上这些能力,取决于 Daybreak Blue 的覆盖速度和门槛设计。模型准备好了,配套的组织与流程未必跟得上。
把 Astra 的评级和前面谷歌、Anthropic 的动作放在一起,一个清晰的行业范式正在浮现:前沿能力的发布,正在从"一次性全量放出"转向"分级、分时、分对象"的受控释放。对红队和安全研究者来说,这其实是好事——他们能在模型造成大规模危害之前,先拿到能力去做防御性研究。但挑战也随之而来:Daybreak Blue 这类计划的覆盖面、申请门槛和响应速度,决定了"防御者优先"到底是一句口号还是真能落地。如果只有少数大机构能及时用上这些能力,中小企业的安全水位反而会被拉开。Astra 的意义,最终不在于它多能打,而在于它逼着整个行业把"危险能力如何负责任地交付"从论文议题变成产品机制。







