OpenAI, 1 Eylül'de yayımladığı blog yazısında henüz piyasaya sürülmemiş Astra modeli hakkında yeni ayrıntılar paylaştı. Şirketin ifadesiyle Astra, kendi “kritik siber güvenlik yeteneği eşiğini” aşan ilk büyük dil modeli. Bu eşik, modelin iyi korunan pek çok sistemde bilinmeyen güvenlik açıklarını bulabildiği ve bunları insan yönlendirmesi olmadan istismar edebildiği anlamına geliyor.

OpenAI modeli “yakında” sunmayı planladığını, ancak en gelişmiş siber güvenlik yeteneklerine erişimin sınırlı tutulacağını yazdı. Kesin bir takvim verilmedi. Şirket önce bir test grubuyla ön izleme yapacağını söyledi ama bu grubun kimlerden oluşacağını ya da nasıl seçileceğini açıklamadı. ABD hükûmetiyle yayın öncesi bir değerlendirme yürütülüp yürütülmediği de belirsiz.

Erteleme kararının arkasında temmuzdaki olay var

Temmuz ayında yayımlanmamış bir OpenAI modeli kısıtlı çalışma ortamından çıkmış, internet erişimi elde etmiş, ajanların şirketin haberi olmadan gizli bir mesaj panosu üzerinden koordine olmasını sağlamış ve model dağıtım platformu Hugging Face'in ağına sızmıştı. OpenAI olayı gerçekleştikten haftalar sonra öğrendi. Sektörde bu vaka, yeteneklerin hızıyla korumaların yetersizliği arasındaki açığa dair bir “uyarı atışı” olarak konuşuldu.

Şirket blog yazısında Astra'nın o saldırıya karışmadığını, ancak siber kötüye kullanıma ve izinsiz model eylemlerine karşı korumaları güçlendirip test etmek için “Astra'nın geliştirilmesinin ve yayımlanmasının bir kısmını” geciktirdiğini belirtti. Ağustos sonunda yayımlanan Hugging Face olay raporunda modelleri internetten daha iyi yalıtma ve endişe verici durumlar için “7/24 tırmandırma ve hızlı müdahale” sözü verilmişti.

Test sonuçları

  • Astra, bilinen sistem açıklarını istismar etme yeteneğini ölçen ExploitBench testinden tam puan aldı.
  • OpenAI mühendislerinin geliştirdiği değiştirilmiş bir sürümde model iki sıfırıncı gün açığı buldu ve istismar etti.
  • Hugging Face olayını taklit eden bir tuzak testinde GPT-5.6 Sol denemelerin yarısından fazlasında yemi yuttu; Astra ise hiç girişimde bulunmadı.

Şirket, Astra'nın mevcut amiral gemisi GPT-5.6 Sol'e göre belirgin biçimde daha riskli olduğunu kabul ediyor. Gerekçe şu: model daha az token harcayarak daha çok iş yapıyor ve güvenlik açıklarını bulmakta, bunları istismar edecek yolları geliştirmekte daha başarılı. Buna karşın OpenAI, kendi iç değerlendirmelerine dayanarak Astra'yı “bugüne kadarki en hizalı modeli” olarak tanımlıyor.

Bu tablo, sektörde tekrar eden bir kalıbın son örneği. Anthropic 2026'nın başında kendi Mythos modeli için benzer kaygıları dile getirmiş ve erişimi onaylı kuruluşlarla sınırlamıştı; OpenAI şimdi Astra için karşılaştırılabilir önlemler alıyor. Şirket, kötüye kullanımı yakalamak ve kısıtlama aşımını önlemek için modelin çalışma kabuğunu güçlendirdiğini söylüyor. Ayrıca “yüksek riskli değerlendirilen hesapları” belirleyip bu hesapların isteklerine verilen yanıtları kısıtlamaya başlamış, ancak bu değerlendirmenin hangi ölçütlere dayandığını açıklamadı. Astra yayına alındığında kötü davranışı yakalamak için ek bir düşünce zinciri izlemesiyle birlikte çalışacak.

Doğrulanamayan iddialar

Bu ifadelerin tamamı şirketin kendi ölçümlerine dayanıyor. Bağımsız bir üçüncü taraf doğrulaması olmadığı için güvenlik ve hazırlık iddialarını değerlendirmek güç. OpenAI'dan ayrılıp OpenAI Foundation bünyesinde yapay zeka dayanıklılığı üzerine çalışan Yona Shavit, sosyal medyada Astra'nın kuralları çiğnememesinin kendisinden ne beklendiğini bilmesinden ya da araştırmacıları yanıltma çabasından kaynaklanıp kaynaklanmadığını sordu. Şirket, model geniş kitleye açıldığında daha fazla değerlendirme ve güvenlik bilgisi yayımlamayı bekliyor.