DeepMind'ın Co-Scientist'i artık laboratuvar cihazını kendisi çalıştırıyor
Hipotez üreten sistem deney planlayan, fırın süren ve makale yazan bir ortağa dönüştü. Ama hekim değerlendirmesi kıyaslama puanını doğrulamadı.
Hipotez üreten sistem deney planlayan, fırın süren ve makale yazan bir ortağa dönüştü. Ama hekim değerlendirmesi kıyaslama puanını doğrulamadı.
Üreticiler modelin bıraktığı izleri tanımayı öğrendi: tıslama, aynı anda kekeleyen katmanlar. Ama kanıt zor, suçlama kolay. Kültürü adım adım açıyoruz.
Bir dakikalık video 90 dolara iniyor, insanlı çekimin onda biri. Bazı oyuncular kovulmadan önce sesini ve yüzünü teslim etmek zorunda kalıyor.
Model gerçekten öğrenmiyor ama her turdan sonra kendine daha iyi talimat yazıyor. Gemini 3.5 Flash'ın ortalaması %49,5'ten %68,1'e çıktı.
On hizalama kıyaslamasının onunda da iyileşme sağlandı, genel performans düşmeden. Makale insan araştırmacıyla karşılaştırmadan da çekinmiyor.
Yürümek, tekme atmak, düştükten sonra kalkmak — her hareket benzetimde eğitilmiş bir sinir ağı politikası. Ödül fonksiyonları da GitHub'da.
Kalıcı taban yüzde 25 yükseliyor ama şu an yürürlükteki yüzde 50'lik geçici artış 14 Eylül'de bitiyor. İki rakamın farkı kesinti demek.
Ne ne kadar süreceğini kestirebiliyorlar ne de ne kadar çalıştıklarını. Kendi işlerinin kalitesini de ortalama 20 puan fazla veriyorlar.
Şikâyetler işini kaybetme korkusundan ibaret değil. En kuşkucu grup Z kuşağı kadınlar: olumlu yorum oranı yüzde 21.
Rekabet çipten trafik yönetimine kaydı. Veriyi doğru anda ekran kartına ulaştırmak, daha fazla işlem döngüsünden değerli hâle geldi.
Bocconi'de 1.053 öğrenciyle yapılan deney notları yükseltti. Ama puanlama ölçütü, gerçek düşünmenin işaretlerini cezalandırıyordu. Tartışmayı açıyoruz.
Şirket gerekçeyi açıkça söylüyor: insanlar profilin gerçek sanıp sonradan öğrenmekten hoşlanmıyor. Etiketi kullanan cezalandırılmıyor.