Ne oldu?

Z.ai, 14 Ağustos 2026 tarihinde GLM-5.3 adlı yeni yapay zeka modelini duyurdu. Şirket, modeli yeniden eğitmek yerine GLM-5.2 ile aynı 743 milyar parametreli temel modeli kullandı ve tüm performans artışını eğitim sonrası ölçeklendirme (post-training scaling) sürecine bağladı. Z.ai bu süreçte daha fazla görev ortamı, daha çeşitli ortam türleri ve daha uzun eğitim uyguladığını belirtti.

Kodlama testlerinde en büyük sıçrama uzun ufuklu (long-horizon) görevlerde görüldü. Terminal-Bench 3.0 puanı 4,6'dan 28,3'e, DeepSWE v1.1 puanı 46,2'den 66,9'a, Agents' Last Exam (CLI) ise 23,8'den 28,5'e yükseldi. GDPval-AA v2 değerlendirmesinde, 44 meslek grubunu kapsayan testte model 1.769 puan aldı. Z.ai'nin kendi iç değerlendirmesi Z.ai Code Bench'te ise GLM-5.2'ye göre yüzde 50 iyileşme bildirildi.

Siber güvenlikte beklenmedik gelişme

Z.ai, siber güvenlik alanındaki sonucun planlanmadığını açıkladı. Şirket, tek başına açık zafiyet (bug) akıl yürütmesini geliştirmek amacıyla zafiyet keşfi verisi eklemiş, ancak eğitim ölçeklendikçe modelin yeteneği katlanarak arttı. Model, uçtan uca istismar (exploitation) zincirleri boyunca tutarlı planlar oluşturmaya başladı.

Beyaz kutu (white-box) kaynak kodundan zafiyet keşfi ve doğrulamasını test eden CyberGym'de skor yüzde 77,2'den yüzde 84,5'e çıkarak Mythos 5'in (%83,8) ve GPT-5.6 Sol'un (%83,6) önüne geçti. Kök neden analizi ve çalışan istismar gerektiren ExploitBench'te ise skor yüzde 24,4'ten yüzde 54,4'e yükseldi; Mythos 5 bu testte yüzde 78,0 ile önde kaldı.

Bilinenler

  • GLM-5.3, Z.ai API, GLM Coding Plan ve ZCode üzerinden kullanıma açık.
  • Model ağırlıkları henüz yayınlanmadı; güvenlik değerlendirmesi ve sertleştirme sonrası yaklaşık iki hafta içinde açılması planlanıyor.
  • ExploitGym testinde GLM-5.3 iki saatte 105, altı saatte 130 görevi tamamladı; GLM-5.2 aynı sürelerde sadece 29 ve 39 görev tamamlayabildi.
  • Mythos 5, ExploitGym'de iki saatte 181, altı saatte 247 görevle önde kalmaya devam ediyor.

Neden önemli?

Z.ai'nin yaklaşımı, temel modeli yeniden eğitmeden yalnızca eğitim sonrası süreçle önemli yetenek kazanımları elde edilebileceğini gösteriyor. Bu durum, model geliştirme maliyetlerini düşürebilecek bir yöntem olarak dikkat çekiyor. Ancak siber güvenlik alanındaki istemsiz gelişme, aynı zamanda güvenlik topluluğu için politika ve risk değerlendirmesi ihtiyacını da gündeme getiriyor.

Şirket, geliştirici araçları, bulut altyapısı, uygulama güvenliği, fintech ve e-ticaret mühendisliği gibi sektörlerin modelden faydalanabileceğini belirtiyor. Veri yerelliği veya tedarikçi denetimi kuralları olan kurumların ise ağırlıkların yayınlanmasını beklemesi öneriliyor.

Karşılaştırma Tablosu

TestGLM-5.2GLM-5.3Rakip Model
Terminal-Bench 3.04,628,3
DeepSWE v1.146,266,9
CyberGym77,2%84,5%Mythos 5: 83,8%
ExploitBench24,4%54,4%Mythos 5: 78,0%

Sırada ne var?

Z.ai, GLM-5.3'ün model ağırlıklarını güvenlik değerlendirmesi ve sertleştirme süreçleri tamamlandıktan sonra, duyurudan yaklaşık iki hafta içinde yayınlamayı planlıyor. Şirket, tüm ölçüm sonuçlarının kullanılan çalıştırma ortamı (harness), bağlam uzunluğu ve örnekleme ayarlarıyla birlikte duyuruda belgelendiğini bildirdi.