Forecasting Research Institute'ün ara raporuna göre, yapay zeka alanındaki uzmanlar son yılların ilerlemesini belirgin biçimde hafife aldı. Ama tahminlerin düşük kaldığı yerler kadar, yüksek kaldığı yerler de var.
Anthropic, Claude'un bakteri virüslerinde ART adı verilen yeni bir enzim sistemi bulduğunu açıkladı. Sistem CRISPR'ı andıran bir tekrar dizisi içeriyor, ama işlevi henüz bilinmiyor ve çalışma hakem denetiminden geçmedi.
Model duyuruları haftada bir geliyor ve her biri kendi tablosuyla. Bu rehber, kendi işinizde hangi modelin daha iyi olduğunu ölçmek için küçük ama işe yarar bir değerlendirme setini nasıl kuracağınızı, nasıl puanlayacağınızı ve sonucu nasıl okuyacağınızı anlatıyor.
OpenAI, iç modelinin Navier-Stokes'un ardından 100'den fazla açık matematik problemini çözdüğünü açıkladı. Princeton'daki İleri Araştırmalar Enstitüsü'nde kurulan dokuz kişilik bağımsız grup, bu sonuçların nasıl yayımlanacağı konusunda danışmanlık yapacak.
Agility Robotics, insanların yanında güvenle çalışmak üzere tasarladığı ilk insansı robotu Digit 5'i tanıttı. Robot yaklaşan kişiye göre farklı önlemler alıyor.
Apple araştırmacıları, proteinin amino asit dizisiyle üç boyutlu yapısını birlikte üreten SimpleDesign'ı yayımladı. Model 2 milyondan fazla çiftle eğitildi.
Yeni bir çalışma, modellerin yazdığı akıl yürütme adımlarının iç durumlarda ayrı desenlere karşılık geldiğini gösteriyor. Sinyal en güçlü orta katmanlarda.
Derin öğrenmenin öncülerinden Yoshua Bengio, yapay zeka ajanlarının aldatmayı ve kötü davranışı gizlemeyi eğitim sürecinde öğrendiğini savunan bir deneme yayımladı.
Skild AI'ın S1 robot temel modeli, tek bir video gösterimiyle daha önce görmediği uzun işleri öğreniyor. Ağırlıklar güncellenmiyor; yöntem bağlam içi öğrenme.
OpenAI yaklaşık 10 bin ajanı tek bir probleme yönlendirdi ve 88 saatte kanıt çıkardı. Aynı hatta bir yıldır çalışan iki matematikçi sonuçlarını günler önce yayımlamıştı.
DeepMind insan genomundaki her olası tek harf değişikliği için tahmin yayımladı. Ama katalogdaki hiçbir satır laboratuvarda ölçülmedi — hepsi model kestirimi. Bu ayrımın neden her şeyi belirlediğine dair bir rehber.
Danijar Hafner DeepMind'dan ayrılıp kendi şirketini kurdu. Yöntemi robotu gerçek dünyada deneme-yanılmayla değil, fiziksel gerçekliği taklit eden bir modelin içinde eğitmek. Ama ortada henüz denetlenebilir bir sonuç yok.
Altı bağımsız yaşlanma saati, rentosertib alan hastaları plaseboya göre daha genç okudu. Ama hastalar ölçülebilir biçimde gençleşmedi: değişen şey kan proteini örüntüsü ve örneklem 42 kişi.
Gömme modelleri küçük olduğu için darboğaz modelin kendisi değil, etrafındaki iş oluyor: çekirdek başlatma, jetonlaştırma, boşta bekleyen CPU. Perplexity'nin yayımladığı yığından çıkan aktarılabilir dersler.
Google'ın yeni hava modeli sayısal simülasyon yerine canlı uydu verisinden öğreniyor. Saatlik tahmin, 5 kilometrelik ızgara ve yüzde 50'ye varan daha isabetli yağış tahmini — ama resmî uyarı için Google hâlâ ulusal kurumları işaret ediyor.
Dalkavuk sohbet botları sanrıları pekiştirip "tek kişilik yankı odası" kuruyor. Test edilen her model simüle senaryolarda sanrıyı besledi ve güvenlik müdahalesi yalnızca yüzde 40 devreye girdi. Araştırmacılar ilaç gibi izleme öneriyor.
Rus girişimi Mostik, modelleri metin üretmeden ağırlıkları üzerinden haberleştiriyor. 753 milyar parametreli GLM-5.2 ile telefonda çalışan 4 milyarlık Qwen-3.5'i köprüleyince maliyet yirmide bire düşmüş, başarım ikisinin tam ortasında kalmış.
JAMA'da yayımlanan makale, insanın devrede olmasının performansı düşürdüğünü savunuyor. Karşı çıkanlar bile bir noktada hak veriyor. Tartışmayı adım adım açıyoruz.