Bir sınavda soruları önceden bilen öğrencinin tam puanı hiçbir şey ifade etmez. Google DeepMind, yapay zeka modellerini değerlendirmedeki temel sorunu böyle tarif ediyor: kıyaslama kirlenmesi. Model, test sorularını eğitim sırasında zaten görmüşse elde ettiği sonuca ancak bir yere kadar güvenilebilir.
Şirket buna karşı, kapalı bir sınır modelinin ilk çift kör değerlendirmesini başlattığını duyurdu. Dış testler şifreli bir "kutu" içinde kilitli kalıyor; böylece model o soruları sonradan alıp kendini özellikle o teste göre iyileştiremiyor.
Çözmeye çalıştığı takas
DeepMind'a göre hassas dış değerlendirmeler bugüne kadar bir ödün gerektiriyordu. İki seçenek vardı ve ikisi de birine zarar veriyordu:
- Değerlendirici testlerini veriyor. O zaman model sağlayıcısı soruları önceden görüyor ve kirlenme kapısı açılıyor.
- Sağlayıcı model ağırlıklarını veriyor. O zaman fikri mülkiyetini riske atıyor.
Bu ikilemin yakın bir örneği var: Anthropic'in Fable 5 modelinin ARC-AGI kıyaslamasındaki değerlendirmesi gecikmişti, çünkü şirket en güçlü modelleri için 30 günlük bir veri saklama politikası uyguluyor.
Nasıl çalışıyor
Çift kör değerlendirme bu takası ortadan kaldırmayı amaçlıyor. Google bunun için kendi bulut altyapısındaki Confidential Space'i kullanıyor. Kurulum, hem dış test verisinin hem modelin kendi sahibine özel kaldığını kriptografik olarak doğruluyor: değerlendirici Gemini ağırlıklarını hiç görmüyor, Google da test komutlarını hiç görmüyor.
Pilot çalışma Gemini Flash Lite ailesinden bir modelle, gizli tutulan kıyaslamalara karşı yürütülüyor. Şirket yöntem ve sonuçların ayrıntılarını teknik bir raporda anlatıyor.
Bugüne kadar dış komutların gizliliği kayıt tutmama protokolleri ve sözleşme güvenceleriyle korunuyordu. Şirkete göre buna teknik ve kriptografik bir koruma eklenmesi, güvenli model değerlendirmesi açısından önemli bir adım.
Yöntemin bir sınırı da var: çift kör kurulum, testin sonradan sızmasını engelliyor ama modelin eğitim verisinde o soruların benzerlerinin bulunmadığını garanti etmiyor. Kirlenmenin bir kısmı sınav anında değil, aylar önce internet taranırken oluyor.
Neden özellikle hassas alanlarda önemli
DeepMind, yöntemin asıl karşılığını hassas değerlendirmelerde gördüğünü söylüyor: siber güvenlik testleri ya da devlet kurumlarının yürüttüğü denetimler gibi. Bağımsız kuruluşlar, veri egemenliğinden ya da güvenlikten ödün vermeden ileri modelleri sıkı biçimde sınayabilir.
Buradaki asıl mesele şu: model değerlendirmesi giderek düzenleyici bir işleve dönüşüyor. Bir modelin siber saldırı yeteneğini ölçen test, artık akademik bir merak değil; bir devletin o modele izin verip vermeyeceğine dair karara girdi oluyor. Böyle bir testin sorularının sızması, testi anlamsızlaştırmakla kalmıyor, kararı da anlamsızlaştırıyor.
Ne değişir
Google, çabanın model denetiminde yeni bir standart oluşturmasını ve sektörün daha güvenilir sistemler kurmasına yardım etmesini umduğunu söylüyor. Bir şirketin kendi denetimini kolaylaştıran bir yöntemi standart diye önermesi doğal olarak soru işareti doğuruyor.
Ama teknik iddia denetlenebilir: kriptografik kurulum ya iki tarafı da gerçekten kapatıyor ya kapatmıyor, ve bu bağımsız olarak incelenebilir bir şey. Yöntemin değeri, kimin önerdiğinden çok kimin uygulayabildiğine bağlı olacak.