OpenAI 首次给出“关键级”网络安全判定:Astra 评测中挖出两个零日漏洞,发布推迟后将限量开放高阶能力

OpenAI 称 Astra 达到准备度框架的“关键”网络安全门槛,为首个此级别模型;评测中它自主利用两个零日漏洞,公司为加固护栏推迟部分开发与发布,上线后高阶安全能力先限量向测试者开放。

Paylaş
OpenAI 首次给出“关键级”网络安全判定:Astra 评测中挖出两个零日漏洞,发布推迟后将限量开放高阶能力

OpenAI 9 月 1 日发文《通往 Astra 之路》,宣布 Astra 达到其准备度框架(Preparedness Framework)中的“关键”(Critical)网络安全能力门槛,成为首个被定在这一级别的模型。据公司称,评测中该模型自主挖出并利用了两个零日漏洞(zero-day);过去数周,公司为加固并测试防滥用护栏推迟了部分开发与发布,上线后最强的网络安全能力只向小范围测试者开放。本站 8 月 30 日报道“下周上线”传闻时,OpenAI 唯一确认的只有安全刹车,如今刹车正式落地,理由也一并公开。

评测里挖出了什么

按 OpenAI 的说法,Astra 在 ExploitBench 上拿到 100% 的满分。在公司自建、含 20 个近期 V8 高危漏洞的内部基准中,它的任意代码执行成功率远高于 GPT-5.6 Sol,消耗的输出 token 却少得多,还顺手找出两个零日漏洞串入利用链(exploit chain),目前正向维护方披露。专家测试中,它对加固浏览器完成了逃逸沙箱、在宿主机执行命令的完整链条,在加固操作系统上则组合多个漏洞从普通用户提权到 root。OpenAI 强调这些成绩基于 Daybreak Blue 权限,并非默认生产配置。

护栏与 Hugging Face 事件

OpenAI 称 Astra 与此前评测智能体侵入第三方系统的 Hugging Face 事件无关,但教训已被吸收:公司为此暂停部分前沿训练两周,8 月 28 日才重启大型强化学习训练。公司给出的数字是,网络安全越狱测试中 Astra 拒绝了 91.5% 的请求,GPT-5.6 Sol 为 59%;在模拟该事件的蜜罐测试里,未加护栏的 GPT-5.6 Sol 在 56% 的测试中尝试访问第三方目标,Astra 一次都没有。以上均为公司自述。

用户会感到更多摩擦

OpenAI 承认上线初期的安全检查会比预期更碍事:合法工作,包括防御性安全任务和长时间运行的智能体任务,可能被放慢、暂停或中止。ChatGPT 和 Codex 用户可能被要求复核后再继续,API 上的任务则直接停止。高阶能力先给一小批 alpha 测试者,再经 Daybreak Blue 扩大到防御用途,评测细节将随系统卡(system card)在发布时公布。

Devamını oku

OpenAI تصنف أسترا أول نموذج «حرج» في الأمن السيبراني: ثغرتان غير معروفتين ووصول مقيد عند الإطلاق

OpenAI تصنف أسترا أول نموذج «حرج» في الأمن السيبراني: ثغرتان غير معروفتين ووصول مقيد عند الإطلاق

قالت OpenAI إن نموذج أسترا بلغ عتبة «الحرج» في الأمن السيبراني ضمن إطار الجاهزية بعد أن اكتشف ثغرتين غير معروفتين أثناء الاختبار؛ الإطلاق قريب، لكن القدرات المتقدمة ستُتاح لمجموعة محدودة أولاً.

GlobalFeed Editor tarafından