Z.ai, GLM-5.3 modelini duyurdu. Model şu an yalnızca kodlama planında; API'ye yakında, açık ağırlıklarla Hugging Face'e ise iki hafta içinde geleceği belirtiliyor.
Puanlardaki artış dikkat çekici. Model birçok ölçütte Moonshot AI'ın Kimi K3'ünü geçiyor, bazılarında Claude Fable 5 ya da GPT-5.6 Sol'un önüne çıkıyor. Bu, onu ajan tabanlı kodlama ölçütlerinde aşağı yukarı öncü sıraya yerleştiriyor.
Asıl rakam: 750 milyar
Sonucu çarpıcı kılan şey puanın kendisi değil, hangi ölçekte alındığı. GLM-5.3 bunu yaklaşık 750 milyar parametreyle yapıyor — Kimi K3'ün üçte biri.
Z.ai'nin blog yazısı da bunu doğrudan açıklıyor ve iddialı bir cümleyle başlıyor: "GLM-5.3 için yaptığımız tek şey eğitim sonrasını ölçeklendirmekti." Model, GLM-5.2 ile aynı temel modeli kullanıyor; fark tamamen genişletilmiş eğitim sonrası aşamadan geliyor.
Kaba bir genelleme pahasına: Z.ai'nin gücü eğitim sonrasında görünüyor, Kimi ise daha çok bir ön eğitim başarısı.
"Damıtma" açıklaması neden yetmiyor
Sürümün ardından tartışma tanıdık bir soruya döndü: Çin nasıl bu kadar iyi yetişiyor? Bu kadar küçük bir model önde gelen kamuya açık Amerikan modelleriyle nasıl başa baş gidebiliyor? Sonuçlar gerçek mi?
Yaygın cevap damıtma — yani büyük bir modelin çıktısıyla küçük bir modeli eğitmek. Analizi yazan Nathan Lambert bu açıklamayı başlıca etken saymıyor.
Ona göre en basit açıklama başka: Z.ai yaptığı işte gerçekten iyi. Ve bu ekibin bu model hattı üzerinde sektördeki hemen herkesten daha uzun süredir çalıştığını hatırlamakta fayda var.
On yıla yakın bir hat
GLM ailesinin geçmişi bunu somutlaştırıyor:
- 2019: Zhipu AI kuruldu
- Mart 2021: GLM — Tsinghua Üniversitesi'nin veri madenciliği grubu THUDM tarafından yayımlandı
- Ağustos 2022: GLM-130B, ölçeklenmiş sürüm
- Mart 2023: ChatGLM, ilk sohbet sürümü
- Haziran ve Ekim 2023: ChatGLM2 ve ChatGLM3
- Ocak 2024: GLM-4; haziranda açık ağırlıklı GLM-4-9B
- Şubat 2026: GLM-5, son büyük kuşak
Haziranda çıkan GLM-5.2 de kendi başına önemliydi. Yazara göre sürümden haftalar sonra bile tanıdığı araştırmacılar modeli kullanmaya devam ediyordu — hızı için (bazıları kamuya açık servislerden daha hızlı olsun diye kendi kümelerinde çalıştırıyor) ve sadeliği için.
Rahatsız edici olan kısım
Yazının en dürüst bölümü, yazarın kendi şüphesini anlattığı yer: "Bunu nasıl yapmaya devam ediyorlar? Modeller göründükleri kadar iyi olamaz" diye düşündüğünü söylüyor.
Ve asıl rahatsız edici tespiti şu: Amerikan şirketlerinin kaynak üstünlüğü ezici, ama yetenekte arayı açamıyorlar. Kaynak farkı ile sonuç farkı arasındaki bu kopukluk, sektörün en az konuşulan meselelerinden biri.
Açık ağırlık farkı
İki hafta içinde açık ağırlıklarla yayımlanacak olması, bu tartışmayı kapatabilecek tek şey. Kapalı bir modelin puan iddiası ancak sahibinin ölçümüne dayanır; ağırlıkları indirilebilen bir model başkası tarafından, başka donanımda, başka testlerle sınanabilir.
GLM-5.2'nin araştırmacılar arasında sürümden haftalar sonra bile kullanılmaya devam etmesi de bu yüzden anlamlı: o kullanım, bir duyuruya değil deneyime dayanıyor.