Yeni kıyaslama: Modeller görmeyi hâlâ beceremiyor
Moonshot AI'ın PerceptionBench testi, çok kipli modellerin görsel algısını akıl yürütmeden ayırarak ölçüyor. Test edilen 16 öncü modelin hiçbiri yüzde 60 doğruluğa ulaşamadı.
Araştırma
Moonshot AI'ın PerceptionBench testi, çok kipli modellerin görsel algısını akıl yürütmeden ayırarak ölçüyor. Test edilen 16 öncü modelin hiçbiri yüzde 60 doğruluğa ulaşamadı.