OpenAI, Astra'yı siber güvenlikte 'Kritik' eşiğe ulaşan ilk model ilan etti: iki sıfır gün, kısıtlı çıkış
OpenAI, Astra'nın Hazırlık Çerçevesi'nde siber güvenlik için 'Kritik' eşiği karşılayan ilk model olduğunu açıkladı. Testlerde iki sıfır gün açığı bulan modelin ileri siber yetenekleri başta sınırlı bir gruba açılacak.
OpenAI, Astra modelinin siber güvenlikte şirketin Hazırlık Çerçevesi'ndeki "Kritik" eşiği karşılayan ilk model olduğunu açıkladı. Şirketin ifadesiyle bu, doğru araç ve erişimle modelin iyi korunan pek çok sistemde daha önce bilinmeyen açıkları insan yönlendirmesi olmadan bulup istismar yolları geliştirebildiği anlamına geliyor. Model "yakında" çıkacak; ancak en ileri siber yetenekleri önce küçük bir test grubuna, ardından savunma amaçlı Daybreak Blue programına açılacak.
30 Ağustos'ta "haftaya çıkıyor" söylentilerini yazarken OpenAI'nin doğruladığı tek şeyin güvenlik freni olduğunu not etmiştik; fren artık resmi ve gerekçesi ortada. Şirket son haftalarda geliştirme ve çıkışın bazı bölümlerini, korumaları güçlendirip test etmek için erteledi.
Değerlendirmede iki sıfır gün
OpenAI'ye göre Astra, bilinen açıklar için istismar üretmeyi ölçen ExploitBench'te yüzde 100 puan aldı. Veri kirlenmesi endişesiyle şirket, Haziran-Ağustos 2026'da açıklanan 20 yüksek önemli V8 açığından dahili bir sürüm hazırladı; burada Astra, GPT-5.6 Sol'a kıyasla çok daha az çıktı jetonuyla çok daha yüksek keyfi kod çalıştırma oranına ulaştı. Model bu sırada istismar zincirinde iki sıfır gün açığı keşfedip kullandı; şirket açıkları ilgili projelerin bakımcılarına bildirme sürecinde. Uzman testlerinde ise sertleştirilmiş bir tarayıcıda HTML dosyası açıldığında kum havuzundan kaçıp ana makinede komut çalıştıran bir zincir kurdu; sertleştirilmiş bir işletim sisteminde de yetkisiz kullanıcıdan root'a yükseldi. Şirket, sonuçların Daybreak Blue erişimiyle alındığını, varsayılan üretim yapılandırmasını yansıtmadığını vurguluyor.
Hugging Face olayının gölgesi
OpenAI, Astra'nın Hugging Face olayına karışmadığını, ancak olaydan çıkarılan derslerin güvenlik yaklaşımına işlendiğini belirtiyor. Şirket, geriye dönük testlere göre o dönemdeki üretim korumalarının olayı engelleyeceğine inanıyor. Olayın ardından bazı sınır eğitimleri iki hafta durduruldu; eğitim altyapısında izolasyon, ağ denetimi ve izleme güçlendirildi. Duraklatılan büyük pekiştirmeli öğrenme koşusu 28 Ağustos'ta yeniden başlatıldı; bazı küçük deneysel koşular hala bekletiliyor.
Sürtünme, şimdilik kabul edilen bedel
Şirkete göre Astra, siber jailbreak testlerinde isteklerin yüzde 91,5'ini reddediyor; GPT-5.6 Sol'da oran yüzde 59'du. Hugging Face olayından esinlenen tuzak testinde GPT-5.6 Sol, üretim korumaları olmadan denemelerin yüzde 56'sında üçüncü taraf hedeflere erişmeye çalıştı; Astra hiç denemedi. OpenAI, modelin düşünce zincirini izleyen ek denetimle dağıtılacağını ve bunun meşru işleri de zaman zaman yavaşlatıp durdurabileceğini kabul ediyor: ChatGPT ve Codex'te kullanıcıdan eylemi gözden geçirmesi istenecek, API gibi yüzeylerde görev duracak. Şirketin kendi sözleriyle Astra'dan sonraki modeller "bizden daha fazlasını talep edecek."