Ox Alpha adlı gizemli bir yapay zeka modeli, internetin belirli köşelerini kimin ürettiğine dair bir tahmin yarışına sürükledi.
Ücretsiz model perşembe günü OpenRouter üzerinde yayımlandı. Listelemede "kodlama, sürdürülebilir ajan çalışması ve üretim iş yükü için tasarlanmış bir akıl yürütme modeli" olarak tanımlanıyor. Stripe'ın üst yöneticisi Patrick Collison — şirketi OpenRouter'ı satın alma sürecinde — modeli "çok etkileyici" diye niteledi.
Kimse bilmiyor, herkes tahmin ediyor
OpenRouter listelemesi modeli "gizli model" olarak tanımlıyor ve "bu önizleme boyunca anonim kalmayı seçen üçüncü taraf bir sağlayıcı tarafından geliştirildiği ve işletildiği" bilgisini veriyor.
Tahminlerin büyük bölümü Çin çevresinde dönüyor, ama uzlaşma yok:
- İlk tahmin — yapay zeka analisti Andrew Curran'a göre başlangıçta odak Çinli Z.ai şirketinin geliştirdiği GLM modellerindeydi, ancak sonrasında "insanlar hiçbir şeyden pek emin görünmüyor."
- Değişen kanaat — Wccftech'teki bir yazı önce kanıtların GLM'e işaret ettiğini öne sürdü, sonraki güncelleme Ox Alpha'nın Microsoft'un yayımlanmamış bir MAI sürümü olabileceğini yazdı.
- Bölünmüş topluluk — Reddit'te bir gönderi Ox Alpha'nın "Çinli olamayacağını" ilan ederken, bir diğeri Çinli olduğuna dair "yüksek güven" belirtiyor.
Gizli sürüm neden yapılıyor
Bir modelin adı açıklanmadan yayımlanması yeni bir uygulama değil. Sağlayıcı açısından mantığı açık: model, üreticisinin adının yarattığı beklenti olmadan değerlendiriliyor. Kullanıcılar onu marka sadakatiyle ya da önyargıyla değil, verdiği çıktıyla yargılıyor.
Aynı yöntem gerçek kullanım koşullarında geniş ölçekli sınama imkânı da veriyor. Bir laboratuvar, henüz duyurmak istemediği bir modeli binlerce geliştiricinin gerçek işlerinde çalıştırıp geri bildirim toplayabiliyor — üstelik resmî bir sürüm taahhüdü altına girmeden.
Üçüncü bir sebep daha var: rekabet. Bir laboratuvar yeni bir yeteneği duyurduğu anda rakipleri onu ölçmeye başlıyor. İsimsiz bir önizleme, modelin gerçek gücünü rakiplerin dikkatini çekmeden sınamayı mümkün kılıyor. Sonuç beklendiği gibi çıkarsa duyuru yapılıyor; çıkmazsa model sessizce kaldırılıyor ve kimse bir başarısızlık kaydetmiyor.
Neden önemli
Bu olayın anlattığı şey modelin kendisinden çok, sektörün bulunduğu noktayla ilgili. Birkaç yıl önce bir modelin hangi laboratuvardan çıktığı çıktısına bakılarak tahmin edilebiliyordu; üslup, hatalar ve yetenek profili imza gibiydi.
Şimdi deneyimli gözlemciler bile kararsız. Bu, sınırdaki modellerin birbirine yakınsadığının işareti: benzer mimariler, benzer eğitim yöntemleri ve büyük ölçüde örtüşen veri kaynakları, ayırt edici imzayı siliyor.
Bu yakınsama, bağımsız değerlendirmenin neden zorlaştığını da açıklıyor. Modeller birbirine benzedikçe, aradaki farkı ölçmek için kullanılan kıyaslama testleri de ayırt etme gücünü kaybediyor; puanlar birkaç ondalık basamakta toplanıyor.
Kullanıcı açısından ise farklı bir soru doğuyor. Anonim bir sağlayıcının modelini kullanmak, verinin nereye gittiğini bilmemek anlamına geliyor. Ücretsiz sunulan bir önizlemede bu soru daha da ağırlaşıyor: bedeli ödenmeyen bir hizmetin karşılığı çoğu zaman kullanım verisi oluyor.