Alibaba'nın yapay zeka ekibi Qwen, Qwen3.8 model ailesinin ağırlıklarını açık olarak yayımladı. Sürüm, açık ağırlıklı model tarafındaki rekabetin hangi hızda ilerlediğini gösteren bir başka adım.
Çekirdek model: 27 milyar parametre
Ailenin çekirdeğinde Qwen3.8-27B var: 27 milyar parametreli, çok kipli ve yoğun (dense) bir model. Qwen'in kendi beyanına göre model, kodlama ve ofis görevlerinde kendisinden daha büyük olan Qwen3.7-Plus'ı geride bırakıyor.
Ekip ajan yeteneklerinde de iyileşme olduğunu belirtiyor: modelin daha bağımsız plan yaptığı ve görevleri daha güvenilir biçimde tamamladığı söyleniyor. Bu iddialar şirketin kendi ölçümlerine dayanıyor; bağımsız doğrulama henüz yok.
Bağlam ve kipler
Model teknik tarafta şunları sunuyor:
- Doğal olarak 262.000 jetonluk bağlam penceresi
- YaRN yöntemiyle bir milyon jetona kadar ölçeklenebilme
- Metnin yanında görüntü ve video işleme — diyagramlar, belgeler ve saatler süren videolar dahil
- Varsayılan olarak açık, sorgu bazında kapatılabilen esnek bir düşünme kipi
Düşünme kipinin sorgu başına açılıp kapanabilmesi pratik bir ayrıntı: basit görevlerde gereksiz akıl yürütme hem gecikme hem maliyet demek.
Lisans ve erişim
Ağırlıklar Apache 2.0 lisansıyla dağıtılıyor. Bu, ticari kullanıma açık ve görece az kısıtlı bir lisans; açık ağırlıklı model yayımlayan bazı rakiplerin tercih ettiği özel lisanslardan daha serbest.
Qwen ayrıca çok daha büyük olan ve Max seviyesinde çalışmak üzere tasarlanan Qwen3.8-2.4T-A95B modelinin ağırlıklarını da yayımladı. Her iki model de Hugging Face ve ModelScope üzerinden indirilebiliyor.
Bir milyon jetonluk bağlamla barındırılan sürüm ise yakında Alibaba'nın yapay zeka servisi Qwen Cloud üzerinden kullanıma açılacak.
Neden önemli
Açık ağırlıklı modeller, kapalı API'lere bağlı kalmak istemeyen ya da veriyi kendi altyapısında tutmak zorunda olan ekipler için tek gerçekçi seçenek. 27 milyar parametrelik bir modelin kendisinden büyük bir modeli belirli görevlerde geçmesi, boyutun tek başına belirleyici olmadığını bir kez daha gösteriyor — ve bu, kendi donanımında model çalıştırmak isteyenler için doğrudan maliyet farkı anlamına geliyor.
İki model, iki farklı ihtiyaç
Sürümün iki ayrı modelle gelmesi tesadüf değil. 27 milyar parametrelik yoğun model, tek bir sunucuya ya da güçlü bir iş istasyonuna sığacak ölçekte; kendi donanımında model çalıştırmak isteyen ekiplerin hedefi bu. Max seviyesinde çalışmak üzere tasarlanan Qwen3.8-2.4T-A95B ise bambaşka bir sınıf — ağırlıkları açık olsa da çalıştırmak ciddi bir altyapı gerektiriyor.
Açık ağırlık her zaman "herkes çalıştırabilir" demek değil. Ağırlıkların indirilebilir olması denetim, ince ayar ve bağımsız değerlendirme imkânı veriyor; ama bir modeli üretimde çalıştırmanın maliyeti donanımda duruyor. Küçük modelin belirli görevlerde büyüğü geçmesi tam da bu yüzden önemli.
İddialar kimin ölçümüne dayanıyor
Kodlama ve ofis görevlerindeki üstünlük ile gelişmiş ajan yetenekleri, şu an için Qwen'in kendi beyanı. Bağımsız kıyaslama sonuçları henüz yayımlanmadı. Açık ağırlıklı modellerin bir avantajı da bu: iddialar kısa sürede dışarıdan sınanabiliyor, çünkü modeli çalıştırmak için şirketin iznine ihtiyaç yok.