Modeller en çok yanılırken kendinden emin: bir değerlendirme bulgusu
Bir değerlendirme düzeneği, nitel incelemenin yakalayamadığı bir örüntüyü ortaya çıkardı: modeller yanlış cevap verirken en yüksek güveni gösteriyor.
Makaleler, teknik bulgular, laboratuvar çıktıları.
Bir değerlendirme düzeneği, nitel incelemenin yakalayamadığı bir örüntüyü ortaya çıkardı: modeller yanlış cevap verirken en yüksek güveni gösteriyor.
Anthropic araştırmacıları, aynı göreve bırakılan yapay zeka ajanlarının beklenmedik biçimde çatıştığını, iş birliği yaptığını ve eşgüdüm kurduğunu buldu.
Microsoft Research'ün MindTopo testi, çok kipli modellerin bağlantılılık ve düğüm gibi ilişkileri anlamasını ölçüyor. Modeller durağan görüntüde başarılı, eylem sırasında değil.
Microsoft Research'ün araştırma modeli CARE-X, göğüs röntgeni yorumlamada serbest metin raporu ile ölçülebilir tanı puanını birleştiriyor. Ürün değil, araştırma modeli.
Google Research'ün çalışmasına göre öncü dil modelleri neredeyse bütün gerçekleri kodluyor ama birçoğunu geri çağıramıyor. Hata bilgiyi bilmemekten değil, erişememekten kaynaklanıyor.
Google'ın araştırma amaçlı tıbbi yapay zeka sistemi AMIE, gerçek zamanlı görüntülü klinik görüşme yapabildiğini gösterdi. Hasta oyuncular görüntülü deneyimi metin sohbetine tercih etti.
Princeton ve Birleşik Krallık AI Security Institute, yapay zeka ajanlarına yayımlanmamış iki NeurIPS makalesinin araştırma sorusunu verdi. Makalelerin ikisi de reddedildi.
Moonshot AI'ın PerceptionBench testi, çok kipli modellerin görsel algısını akıl yürütmeden ayırarak ölçüyor. Test edilen 16 öncü modelin hiçbiri yüzde 60 doğruluğa ulaşamadı.
NATO Özel Harekat Üniversitesi'nden Nolan Lovett, şirketlerin bireysel olarak rasyonel yapay zeka kararlarının meslek gruplarının ortak uzmanlığını yok edebileceğini savunuyor.
MarkTechPost, SupraLabs'ın akıl yürütme odaklı veri kümesini kullanarak küçük bir dil modelini nasıl ince ayara tabi tutacağını gösteren uçtan uca bir Colab rehberi yayımladı.
Araştırmacı Sebastian Raschka, Substack'in yeni AI dedektör özelliğinden yola çıkarak sıfırdan bir yapay zeka metin tespit sistemi kurmayı öğreten eğitici bir proje paylaştı.
MarkTechPost, XYZ-Aquila-SFT veri kümesi ve Qwen3-0.6B modeliyle araç çağırma (tool-calling) yeteneklerini geliştirmeye yönelik uçtan uca bir ince ayar (fine-tuning) rehberi yayımladı.
iScience'da yayımlanan yeni bir araştırma, GPT-4'ün oluşturduğu kişilik anketlerine katılımcıların vereceği toplu yanıtları, anket uygulanmadan önce yüksek korelasyonla tahmin edebildiğini gösterdi.
14.419 kendi kendine yayımlanan Amazon kitabını inceleyen bir analiz, yapay zeka üretimi kitapların hacimle piyasayı doldurarak insan yazarların gelirini düşürdüğünü ortaya koydu.
MIT Technology Review'in 10-18 yaş arası gençlerle yaptığı görüşmeler, yapay zekaya kayıtsızlıktan çevresel kaygıya uzanan geniş bir tepki yelpazesi ortaya koydu.
Araştırmacılar, YOLO ve CLIP tabanlı çok modlu bir sistemle enfekte sivrisinekleri video görüntülerinden yüksek doğrulukla ayırt edebildiğini gösterdi.
Araştırmacılar, üçüncü taraf büyük dil modellerine gönderilmeden önce hassas bilgileri gizleyen SEAG adlı bir çerçeve geliştirdi. Sistem, kullanıcı sorgularını doğru yanıtlarken gizli verileri açığa çıkarmıyor.
Xin Shu, Zhen Lei ve Ang Li imzalı yeni bir çalışma, çok değerli nedensellik olasılıkları için mevcut sınırlardan daha sıkı sınırlar öneriyor.
Yeni bir akademik çalışma, büyük dil modellerinin (LLM) hakem olarak kullanıldığında ısrarcı itirazlar karşısında verdiklerini sıklıkla değiştirdiğini ortaya koyuyor.
Hugging Face'in düzenlediği hackathonda 1.221 katılımcı, kodlama ajanlarını kullanarak ICML 2026'da kabul edilen 2.226 makaleyi yeniden üretmeye çalıştı.
Hugging Face'in yaz 2026 raporuna göre Çinli laboratuvarlar trilyon parametreli açık modelleriyle öne geçerken ABD'de açık kaynak öncülüğü model laboratuvarlarından donanım üreticilerine kaydı.