OpenAI 说 Astra 是第一个达到”临界网络安全能力阈值”的模型,然后紧接着说:这个能力大部分人用不上。
阈值这个词在 OpenAI 自己的分级里有明确含义——能在没有人类逐步引导的情况下,自己发现并利用防护严密系统里的未知漏洞。给出的数字是 ExploitBench 100% 满分,内部测试期间还挖到了两个真实的零日漏洞。
为此做的限制有两层。第一层是延迟:部分开发和发布节奏被推后,用来先把防护补上。第二层是准入:高级网络安全能力初期只开给一小批测试者,之后走 Daybreak Blue 计划逐步扩大,那个计划专门放防御性用途,申请要审批,配套还有一整套安全措施。
拒答率也一起改了。面对网络越狱类请求,GPT-5.6 Sol 的拒绝率是 59%,Astra 提到了 91.5%。这个跳幅不小,但也意味着另一件事:正常安全研究人员踩到误拒的概率会同步上升,这几乎是必然的代价。
发布时间没说,只说”很快”。
值得多想一句的是”临界”这个自我认定。它不是外部机构评的,是 OpenAI 自己按自己的框架打的标签。标签本身既是风险提示,也是能力宣传,这两层意思在同一句话里,很难拆开。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






OpenAI 说 Astra 是第一个摸到「临界网络安全阈值」的模型,然后把这个能力锁了起来