Artificial Analysis, Optima adlı bir platform tanıttı: kullanıcılar kendi verilerinden ve kendi iş akışlarından özel kıyaslamalar kurabiliyor. Modeller yalnızca kalite üzerinden değil, görev başına maliyet ve süre üzerinden de karşılaştırılıyor.
Genel kıyaslamaların sorunu
Model sıralamaları standart sınav kümeleriyle çalışıyor: matematik problemleri, kodlama soruları, genel kültür testleri. Bu kümelerin ortak bir zayıflığı var — sizin işinizle ilgisi olmayabiliyor.
Bir modelin matematik sınavında yüksek puan alması, sizin sözleşme metinlerinizi doğru özetleyeceği anlamına gelmiyor. Türkçe belgelerle çalışıyorsanız, İngilizce ölçülmüş bir sıralama daha da az şey söylüyor.
Bir başka sorun daha var: popüler kıyaslama kümeleri yıllardır yayında ve eğitim verisine sızmış olabiliyor. Modelin bir soruyu bilmesi ile o soruyu daha önce görmüş olması arasındaki farkı dışarıdan ayırt etmek mümkün değil.
Kendi verinle ölçmek
Optima'nın yaklaşımı bu iki sorunu birden hedefliyor. Kendi belgelerinizden, kendi sorularınızdan ve kendi doğru cevaplarınızdan bir küme kuruyorsunuz; modeller o küme üzerinde ölçülüyor.
Kümenin dışarıda olmaması, sızma sorununu da ortadan kaldırıyor. Kimsenin görmediği bir sınavda ezber işe yaramıyor.
Maliyet ve süre neden önemli
Platformun ikinci katkısı, karşılaştırmaya görev başına maliyet ve süre eklemesi. Bu, ajan uygulamalarında kalite kadar belirleyici.
Sebebi şu: jeton fiyatı tek başına maliyeti göstermiyor. Ucuz ama yetersiz bir model bir görevi tamamlamak için daha çok deneme yapıyor, daha çok adım atıyor ve sonuçta daha pahalıya geliyor. Pahalı ama isabetli bir model tek denemede bitirebiliyor.
Doğru soru şu: bu görevi tamamlamak ne kadara mal oluyor? Jeton başına fiyat bu sorunun yalnızca bir bileşeni.
Kimin işine yarar
Bu tür bir araç, yapay zekayı üretimde kullanan her ekip için doğrudan karşılık taşıyor:
- Model değiştirmeden önce farkın kendi işinizde ne olduğunu görmek.
- Bir sürüm yükseltmesinin kaliteyi bozup bozmadığını ölçmek.
- Aynı işi daha ucuz yapan bir model olup olmadığını sınamak.
Bu ölçümleri elle kurmak mümkün ama zahmetli; bir platformun sunduğu asıl şey, o zahmeti tekrar tekrar ödememek.
Kıyaslamanın değişen anlamı
Bu tür araçların yaygınlaşması, model sıralamalarının ağırlığını azaltacak gibi görünüyor. Genel sıralamalar bir modelin var olup olmadığını ve kabaca hangi ligde oynadığını gösteriyor; ama seçim kararını verecek olan artık kendi ölçümünüz.
Bu, sağlıklı bir yön. Tek bir sıralamanın belirleyici olduğu bir pazarda, model üreticileri o sıralamada iyi görünmek için eniyileme yapmaya başlıyor — ve bir ölçüt hedefe dönüştüğünde ölçüt olmaktan çıkıyor.
Küçük ekipler için
Kendi kıyaslamanızı kurmanın maliyeti çoğu zaman abartılıyor. Otuz-kırk soruluk, cevabı bilinen bir küme, çoğu iş için yeterli bir sinyal veriyor. Önemli olan kümenin büyüklüğü değil, sizin gerçek işinizi temsil etmesi.
Bir kez kurulduğunda bu küme kalıcı bir varlık hâline geliyor: her model değişikliğinde, her sürüm yükseltmesinde yeniden çalıştırılıyor ve cevabı birkaç dakikada veriyor.