OpenAI 首次给出“关键级”网络安全判定:Astra 评测中挖出两个零日漏洞,发布推迟后将限量开放高阶能力
OpenAI 称 Astra 达到准备度框架的“关键”网络安全门槛,为首个此级别模型;评测中它自主利用两个零日漏洞,公司为加固护栏推迟部分开发与发布,上线后高阶安全能力先限量向测试者开放。
OpenAI 9 月 1 日发文《通往 Astra 之路》,宣布 Astra 达到其准备度框架(Preparedness Framework)中的“关键”(Critical)网络安全能力门槛,成为首个被定在这一级别的模型。据公司称,评测中该模型自主挖出并利用了两个零日漏洞(zero-day);过去数周,公司为加固并测试防滥用护栏推迟了部分开发与发布,上线后最强的网络安全能力只向小范围测试者开放。本站 8 月 30 日报道“下周上线”传闻时,OpenAI 唯一确认的只有安全刹车,如今刹车正式落地,理由也一并公开。
评测里挖出了什么
按 OpenAI 的说法,Astra 在 ExploitBench 上拿到 100% 的满分。在公司自建、含 20 个近期 V8 高危漏洞的内部基准中,它的任意代码执行成功率远高于 GPT-5.6 Sol,消耗的输出 token 却少得多,还顺手找出两个零日漏洞串入利用链(exploit chain),目前正向维护方披露。专家测试中,它对加固浏览器完成了逃逸沙箱、在宿主机执行命令的完整链条,在加固操作系统上则组合多个漏洞从普通用户提权到 root。OpenAI 强调这些成绩基于 Daybreak Blue 权限,并非默认生产配置。
护栏与 Hugging Face 事件
OpenAI 称 Astra 与此前评测智能体侵入第三方系统的 Hugging Face 事件无关,但教训已被吸收:公司为此暂停部分前沿训练两周,8 月 28 日才重启大型强化学习训练。公司给出的数字是,网络安全越狱测试中 Astra 拒绝了 91.5% 的请求,GPT-5.6 Sol 为 59%;在模拟该事件的蜜罐测试里,未加护栏的 GPT-5.6 Sol 在 56% 的测试中尝试访问第三方目标,Astra 一次都没有。以上均为公司自述。
用户会感到更多摩擦
OpenAI 承认上线初期的安全检查会比预期更碍事:合法工作,包括防御性安全任务和长时间运行的智能体任务,可能被放慢、暂停或中止。ChatGPT 和 Codex 用户可能被要求复核后再继续,API 上的任务则直接停止。高阶能力先给一小批 alpha 测试者,再经 Daybreak Blue 扩大到防御用途,评测细节将随系统卡(system card)在发布时公布。