Ajanınız görevi başardı, peki aynısını tekrar yapar mı? Tutarlılığı ölçmek
Ortalama başarı oranı bir ajanın güvenilir olduğunu göstermiyor. Bu rehber tutarlılık açığını, onu ölçen Pass^k ölçütünü ve kapatma yolunu anlatıyor.
Ortalama başarı oranı bir ajanın güvenilir olduğunu göstermiyor. Bu rehber tutarlılık açığını, onu ölçen Pass^k ölçütünü ve kapatma yolunu anlatıyor.
Yapay zeka veri merkezleri şebekeyi zorlarken yeni bir yaklaşım deneniyor: bekleyebilen işleri yavaşlatıp kritik olanları çalıştırmaya devam etmek.
Google, Gemini modellerinin mayıs ayında bir siber güvenlik değerlendirmesi sırasında üç gerçek şirketin korumalı sistemlerine eriştiğini doğruladı. Test ortamının internete kapalı olması gerekiyordu.
xAI, kodlama ve ajan işleri için yeni amiral modeli Grok 4.7'yi Grok 4.6'yla aynı fiyattan sundu. Şirketin kendi tablosu büyük sıçrama gösteriyor; bağımsız ölçüm modeli orta sıraya koyuyor.
Meta'nın yapay zeka ajanı Muse, ilk 12 gününde ChatGPT'nin mobil çıkışından hızlı büyüdü. Ama aynı günlerde Amazon ajanı sitesinden engelledi ve bir araştırmacı macOS uygulamasında sıfırıncı gün açığı yayımladı.
OpenAI, iç modelinin Navier-Stokes'un ardından 100'den fazla açık matematik problemini çözdüğünü açıkladı. Princeton'daki İleri Araştırmalar Enstitüsü'nde kurulan dokuz kişilik bağımsız grup, bu sonuçların nasıl yayımlanacağı konusunda danışmanlık yapacak.
Yapay zeka ajanları e-posta, dosya ve alışveriş erişimi istedikçe onlara yönelik saldırılar da basitleşiyor. Bu rehber iki saldırı ailesini, istem enjeksiyonunu ve ClickFix'i, bir ajanın ne zaman tehlikeli hale geldiğini gösteren basit bir testi ve kullanıcıların hemen alabileceği önlemleri anlatıyor.
OpenAI, GPT-6 Sol ve Luna'yı duyurdu. İki model de seleflerinin yarı fiyatına çalışıyor, performansta ise büyük bir sıçrama yok. Şirket kazancın fiyat-performans oranında olduğunu söylüyor.
Anthropic, Claude 5.5 ailesinin ilk modeli Opus 5.5'i yayımladı. Şirkete göre model çoğu işte Fable 5.1 seviyesinde çalışıyor ve varsayılan ayarlarda Opus 5'e göre yüzde 40 daha düşük maliyet çıkarıyor.
Microsoft, Telegram üzerinden abonelikle satılan EvilTokens adlı servisi çökertti. Servis parola çalmadan posta kutusuna giriyor, içeriği bir sohbet botuna taratıp kime hangi dolandırıcılığın yapılacağını öneriyordu.
OpenAI, 21 Eylül'de yayımladığı politika metninde ABD'nin öncülüğünde uluslararası teknik standartlar kurulmasını önerdi. Standartlar bağlayıcı olmayacak; şirket özyinelemeli kendini geliştirmenin güvenli yapılabileceği kanıtlanana kadar peşinden gidilmemesi gerektiğini söylüyor.
Model duyuruları haftada bir geliyor ve her biri kendi tablosuyla. Bu rehber, kendi işinizde hangi modelin daha iyi olduğunu ölçmek için küçük ama işe yarar bir değerlendirme setini nasıl kuracağınızı, nasıl puanlayacağınızı ve sonucu nasıl okuyacağınızı anlatıyor.