Alibaba'nın Qwen ekibi, Qwen3.8-Flash-Next adlı çok kipli bir uzman karışımı modeli tanıttı. Model, gelecek nesil Qwen4'ün mimari önizlemesi olarak sunuluyor ve amacı açık: çok daha büyük modellerin sonucunu, eğitim maliyetinin küçük bir kısmıyla yakalamak.
Mimari
Model 125 milyar toplam parametreye sahip ama jeton başına yalnızca 6 milyarını etkinleştiriyor. Bu, uzman karışımı mimarisinin temel fikri: modelin tamamı bellekte durur, her jeton için yalnızca ilgili uzmanlar çalışır.
Asıl yenilik başka yerde. Modelde 51 milyar parametrelik yeni bir n-gram gömme katmanı var — Qwen4 için planlanan mimari yeniliklerden biri. Bu katman sık kullanılan kelime gruplarını bir tür "ifade sözlüğünde" bağımsız girdiler olarak saklıyor. Kritik ayrıntı şu: bu katman grafik işlemcisi yerine sıradan sistem belleğinde durabiliyor, üstelik "görece düşük ek maliyetle."
Bunun pratik anlamı, modelin en pahalı kaynağı olan grafik işlemcisi belleğinden 51 milyar parametrelik bir yükün kaldırılması.
Maliyet iddiası
Qwen ekibine göre model, selefi Qwen3.7-Plus'tan daha iyi sonuç veriyor — üstelik yaklaşık dokuzda bir eğitim maliyetiyle. En büyük kazanım kodlama ve ofis görevlerinde.
Karşılaştırma anlamlı, çünkü Qwen3.7-Plus 397 milyar parametreye sahip ve jeton başına 17 milyarını çalıştırıyor — yeni modelin etkin parametre sayısının neredeyse üç katı.
Kıyaslama sonuçları
Alibaba'nın yayımladığı ölçümlerde model, kendisinden çok daha büyük ya da çok daha pahalı rakiplerle karşılaştırılıyor ve test edilen görevlerin çoğunda önde çıkıyor. Ağırlık açıkça ajan tabanlı kodlamada — yapay zekanın gerçek yazılım projelerinde hataları kendi başına bulup düzeltmesini gerektiren testlerde.
- Ajan tabanlı kodlama — iki ayrı testte hem daha büyük bir Çin modelini hem de bir batılı sınır modelini geçiyor.
- Ofis ve üretkenlik — aradaki fark daha da büyük. Bir iş akışı testinde aldığı puan, selefinin neredeyse iki katı.
- Bilimsel akıl yürütme ve yarışma programlama — burada modeller birbirine yakın; belirgin bir üstünlük yok.
Bu dağılım tesadüf değil. Model açıkça ajan iş yükleri için ayarlanmış görünüyor; genel bilgi gerektiren alanlarda fark kapanıyor.
Erişim ve fiyat
Teknik rapor ve ağırlıklar yayımlandı. Üretim sürümü Qwen3.8-Flash adıyla şirketin bulut hizmetinden sunuluyor ve fiyatlandırma milyon girdi jetonu için 0,16 dolar, milyon çıktı jetonu için 0,47 dolar.
Neden önemli
Bu sürümün asıl mesajı kıyaslama tablosunda değil, maliyet tarafında. Sektör iki yıldır aynı yolu izliyordu: daha büyük model, daha çok veri, daha çok hesaplama. Dokuzda bir eğitim maliyetiyle daha iyi sonuç almak, o yolun tek yol olmadığını gösteriyor.
Mimari tercihleri de aynı yöne bakıyor: az etkin parametre, sistem belleğine taşınabilen katman, denetlenebilir hesaplama. Hepsi çıkarım maliyetini düşürmeye dönük.
Bu, Çinli laboratuvarların son dönemdeki stratejisiyle tutarlı. Sınırda en iyi modeli yapmak yerine, yeterince iyi modeli çok daha ucuza sunmak. Pazar payı açısından ikincisi çoğu zaman daha etkili bir hamle.