İçeriğe geç
Epoka
Kategori

Araştırma

Makaleler, teknik bulgular, laboratuvar çıktıları.

69 haber

6 dk okuma

Model değiştirmeden önce: kendi değerlendirme setinizi nasıl kurarsınız?

Model duyuruları haftada bir geliyor ve her biri kendi tablosuyla. Bu rehber, kendi işinizde hangi modelin daha iyi olduğunu ölçmek için küçük ama işe yarar bir değerlendirme setini nasıl kuracağınızı, nasıl puanlayacağınızı ve sonucu nasıl okuyacağınızı anlatıyor.

Araştırma
6 dk okuma

9 milyar varyantın haritası: AlphaGenome Atlas nedir?

DeepMind insan genomundaki her olası tek harf değişikliği için tahmin yayımladı. Ama katalogdaki hiçbir satır laboratuvarda ölçülmedi — hepsi model kestirimi. Bu ayrımın neden her şeyi belirlediğine dair bir rehber.

Araştırma
2 dk okuma

Dünya modelleriyle robot eğiten girişim gizlilikte

Danijar Hafner DeepMind'dan ayrılıp kendi şirketini kurdu. Yöntemi robotu gerçek dünyada deneme-yanılmayla değil, fiziksel gerçekliği taklit eden bir modelin içinde eğitmek. Ama ortada henüz denetlenebilir bir sonuç yok.

Araştırma
2 dk okuma

Yapay zekayla tasarlanan ilaç biyolojik saati geri çevirdi

Altı bağımsız yaşlanma saati, rentosertib alan hastaları plaseboya göre daha genç okudu. Ama hastalar ölçülebilir biçimde gençleşmedi: değişen şey kan proteini örüntüsü ve örneklem 42 kişi.

Araştırma
6 dk okuma

Gömme altyapısı nerede tıkanır? Perplexity örneği

Gömme modelleri küçük olduğu için darboğaz modelin kendisi değil, etrafındaki iş oluyor: çekirdek başlatma, jetonlaştırma, boşta bekleyen CPU. Perplexity'nin yayımladığı yığından çıkan aktarılabilir dersler.

Araştırma
2 dk okuma

WeatherNext 3 fizik simülasyonunu bıraktı

Google'ın yeni hava modeli sayısal simülasyon yerine canlı uydu verisinden öğreniyor. Saatlik tahmin, 5 kilometrelik ızgara ve yüzde 50'ye varan daha isabetli yağış tahmini — ama resmî uyarı için Google hâlâ ulusal kurumları işaret ediyor.

Araştırma
3 dk okuma

Psikiyatri "yapay zeka psikozu"na karar vermek zorunda

Dalkavuk sohbet botları sanrıları pekiştirip "tek kişilik yankı odası" kuruyor. Test edilen her model simüle senaryolarda sanrıyı besledi ve güvenlik müdahalesi yalnızca yüzde 40 devreye girdi. Araştırmacılar ilaç gibi izleme öneriyor.

Araştırma
2 dk okuma

Modelleri kelimesiz konuşturan bir köprü denemesi

Rus girişimi Mostik, modelleri metin üretmeden ağırlıkları üzerinden haberleştiriyor. 753 milyar parametreli GLM-5.2 ile telefonda çalışan 4 milyarlık Qwen-3.5'i köprüleyince maliyet yirmide bire düşmüş, başarım ikisinin tam ortasında kalmış.

Araştırma
7 dk okuma

Kıyaslama puanları aslında neyi ölçüyor?

Ai2'nin BenchMIRT yöntemi, kıyaslamaları soru düzeyinde inceliyor ve tek bir puanın çoğu zaman birden fazla yeteneği karıştırdığını gösteriyor.

Araştırma