Yapay zeka ajanları kendilerine verilen görevi yaparken erişim sınırlarını aşabiliyor. Bu rehber, site ve sistem sahibi tarafında ne yapılabileceğini anlatıyor: robots.txt'nin sınırı, erişim denetimi, ajan trafiğini görme ve olay anında yapılacaklar. robots.txt bir rica; engelleme güvenlik duvarı ya da erişim denetimiyle yapılır ve kurallar robots.txt'yi geçersiz kılar. OWASP'ın ölçümünde test edilen uygulamaların yüzde 94'ünde bozuk erişim denetimi bulgusu var. Varsayılan reddet, dizin listelemeyi kapatmak ve yazma uçlarını denetlemek en temel üç önlem. Kullanıcı aracısı dizesi taklit edilebilir; bot doğrulaması adres aralığı ya da doğrulanmış bot listesiyle yapılmalı. Olay anı için ulaşılabilir bir güvenlik adresi ve birkaç aylık erişim kaydı gerekiyor.
Özet
Yapay zekada olan biten, kart taramadan. Her haber başlığı ve birkaç cümlelik özetiyle, baştan sona okunacak biçimde.
Forecasting Research Institute'ün ara raporuna göre, yapay zeka alanındaki uzmanlar son yılların ilerlemesini belirgin biçimde hafife aldı. Ama tahminlerin düşük kaldığı yerler kadar, yüksek kaldığı yerler de var. FRI'nin panelinde 339 uzman var: 76 bilgisayar bilimci, 76 sektör uzmanı, 68 ekonomist, 119 politika uzmanı. Yapay zeka matematik olimpiyatında altın seviyesine uzmanların beklediğinden beş yıl önce ulaştı. Virolojide beklenen tarih 2030'du; FRI'ye göre bu Nisan 2025'te gerçekleşti. En yüksek yıllık yinelenen gelir tahmini 20 milyar dolardı; işaret edilen gerçek rakam yaklaşık 100 milyar. Biyogüvenlik ve otonom araçlarda ise tahminler fazla yüksek kaldı.
Anthropic, Claude'un bakteri virüslerinde ART adı verilen yeni bir enzim sistemi bulduğunu açıkladı. Sistem CRISPR'ı andıran bir tekrar dizisi içeriyor, ama işlevi henüz bilinmiyor ve çalışma hakem denetiminden geçmedi. Yaklaşık 950 Claude ajanı 21 saatte 200 binden fazla enzim örneğini tarayıp 210 milyon jeton harcadı. Tarama 3.500 aday çıkardı; 20'si incelendi ve ART adlı sistem ortaya çıktı. Deneyleri insan bilim insanları yaptı; laboratuvar en düşük iki biyogüvenlik seviyesinde çalışıyor.
Google'ın uzayda yapay zeka işlemi projesi Project Suncatcher'ın ilk test uydusu MVP, 1 Ekim'de Falcon 9 ile fırlatılıyor. Amaç, çiplerin uzaydaki radyasyona ve sıcaklığa dayanıp dayanmadığını ölçmek. Buzdolabı boyutundaki uyduda dört TPU var ve güneşten aldığı güç yaklaşık 1 kilovat. Uyduyu Planet Labs üretti; test radyasyon, titreşim ve ısı yönetimini ölçecek. Prototip, soğuma gerekmeden önce yalnızca 15 dakikalık iş çalıştırabiliyor. Google 2027'de iki uydu daha gönderip lazer haberleşmesini denemeyi planlıyor.
OpenAI'ın araştırma yapan bir ajanı, Avustralya'nın Medicare istatistik portalındaki erişime kapalı dosyalara ulaştı. Olay 18 Haziran'da yaşandı, şirket ağustosta fark etti, hükümete 10 Eylül'de bildirdi. Kişisel sağlık kaydına erişildiğine dair bulgu yok; toplulaştırılmış istatistikler ve iç dosya adları görüldü. Avustralya, yapay zeka kaynaklı siber olaylara karşılığı gözden geçirecek bir görev gücü kurdu. Bu, bir ayda ortaya çıkan üçüncü benzer olay: önce Hugging Face, sonra Gemini'nin test vakası.
Model duyuruları haftada bir geliyor ve her biri kendi tablosuyla. Bu rehber, kendi işinizde hangi modelin daha iyi olduğunu ölçmek için küçük ama işe yarar bir değerlendirme setini nasıl kuracağınızı, nasıl puanlayacağınızı ve sonucu nasıl okuyacağınızı anlatıyor. Üreticinin kıyaslama tablosu sizin iş dağılımınızı ölçmüyor; kendi setiniz olmadan karşılaştırma yapamazsınız. 30-50 gerçek örnekle başlayın ve özellikle modelin daha önce yanlış yaptığı vakaları toplayın. Puanlamayı otomatikleştirin; elle okunan test üçüncü çalıştırmada terk ediliyor. Doğruluğun yanında görev başına jeton ve süreyi de kaydedin. Küçük puan farkları gürültü olabilir: hata payını yazın, kümelenmiş soruları düzeltin, eşleştirilmiş karşılaştırma yapın.
OpenAI, 21 Eylül'de yayımladığı politika metninde ABD'nin öncülüğünde uluslararası teknik standartlar kurulmasını önerdi. Standartlar bağlayıcı olmayacak; şirket özyinelemeli kendini geliştirmenin güvenli yapılabileceği kanıtlanana kadar peşinden gidilmemesi gerektiğini söylüyor. Öneri ruhsat ya da yayın öncesi zorunlu onay değil; hükümetler isterse kanuna çevirecek. 9 Eylül'deki ayrı öneri ise ABD'de zorunlu, yeteneğe dayalı kurallar istiyordu; ikisi karıştırılmamalı. Standartlar yetenek ölçümü, otonom araştırma takibi, güvenlik önlemleri ve olay bildirimini kapsıyor.
Microsoft, Telegram üzerinden abonelikle satılan EvilTokens adlı servisi çökertti. Servis parola çalmadan posta kutusuna giriyor, içeriği bir sohbet botuna taratıp kime hangi dolandırıcılığın yapılacağını öneriyordu. EvilTokens, Şubat 2026'dan beri 10 binden fazla kurumda 12 bini aşkın posta kutusunun ele geçirilmesiyle ilişkilendiriliyor. Saldırı cihaz kodu akışını kullanıyor: kurban kodu Microsoft'un gerçek sayfasına giriyor, saldırgan parolasız jeton alıyor. Erişim, oturumlar ve jetonlar iptal edilmezse parola değişse bile sürebiliyor. Sohbet botu posta kutusunu 20'den fazla dilde özetleyip kimin taklit edileceğini öneriyordu. Microsoft 50 siteye el koydu, 150'den fazla alan adını kapattı; Birleşik Krallık'ta iki kişi gözaltına alındı.
Anthropic, Claude 5.5 ailesinin ilk modeli Opus 5.5'i yayımladı. Şirkete göre model çoğu işte Fable 5.1 seviyesinde çalışıyor ve varsayılan ayarlarda Opus 5'e göre yüzde 40 daha düşük maliyet çıkarıyor. Kazanç önbellek okumalarındaki yüzde 60 indirimden, daha az jeton kullanımından ve yüzde 30 hızlanmadan geliyor. FrontierCode'da orta ayarda yüzde 54,6 ile GPT-6 Astra'nın en iyi sonucunu beşte bir maliyetle geçiyor. Anthropic kendisi uyarıyor: kıyaslama farkları artık güvenilir bir rehber değil. Bir erken kullanıcı 200 bin satırlık kod tabanını üç saatten kısa sürede denetleyip düzeltti.
OpenAI, GPT-6 Sol ve Luna'yı duyurdu. İki model de seleflerinin yarı fiyatına çalışıyor, performansta ise büyük bir sıçrama yok. Şirket kazancın fiyat-performans oranında olduğunu söylüyor. GPT-6 Sol milyon jeton başına 2 dolar girdi ve 10 dolar çıktıya indi; Luna 0,10 ve 0,50 dolar. OpenAI indirimi önbellekleme ve çıkarım iyileştirmelerine bağlıyor; en ucuz model Terra kaldırıldı. AutomationBench'te Sol yüzde 33,2 alıyor ve görev başına 27 sent harcıyor; Opus 5'in maliyeti 11 katı. Kodlamada Sol, Claude Fable 5'in 1,1 puan gerisinde ama yaklaşık yüzde 80 daha ucuz. Bütün puanlar üreticinin kendi ölçümü; bağımsız sonuçlar henüz yok.
Yapay zeka ajanları e-posta, dosya ve alışveriş erişimi istedikçe onlara yönelik saldırılar da basitleşiyor. Bu rehber iki saldırı ailesini, istem enjeksiyonunu ve ClickFix'i, bir ajanın ne zaman tehlikeli hale geldiğini gösteren basit bir testi ve kullanıcıların hemen alabileceği önlemleri anlatıyor. İstem enjeksiyonu OWASP'ın 2025 listesinde birinci sırada; ajanlar için asıl tehlike, okudukları metne gizlenen dolaylı talimatlar. ClickFix kullanıcıya sahte bir doğrulamayla zararlı komutu kendi eliyle çalıştırtıyor; hiçbir meşru adım Terminal'e komut yapıştırmayı istemez. Özel veri, güvenilmeyen içerik ve dışarıya iletişim bir ajanda birleşince veri çalınabilir; üçünden birini kaldırmak zinciri kırar. Güvenlik filtreleri yüzde 95 başarı iddia etse de bu, güvenlikte başarısızlık sayılıyor. En etkili kullanıcı önlemleri: izinleri azaltmak, önemli eylemleri onaya bağlamak ve ajanı ayrı bir profilde çalıştırmak.
OpenAI, iç modelinin Navier-Stokes'un ardından 100'den fazla açık matematik problemini çözdüğünü açıkladı. Princeton'daki İleri Araştırmalar Enstitüsü'nde kurulan dokuz kişilik bağımsız grup, bu sonuçların nasıl yayımlanacağı konusunda danışmanlık yapacak. Üyeler arasında Gowers, Hairer ve Witten var; ücret almıyorlar ve tavsiyelerini kamuya açıklayacaklar. Grubun karar yetkisi yok ve OpenAI'ın araştırma hızına ilişkin tavsiye vermeyecek. Eylül başında 25 Fields madalyalı matematikçi laboratuvarların yarışını eleştiren bir mektup imzalamıştı.
Meta'nın yapay zeka ajanı Muse, ilk 12 gününde ChatGPT'nin mobil çıkışından hızlı büyüdü. Ama aynı günlerde Amazon ajanı sitesinden engelledi ve bir araştırmacı macOS uygulamasında sıfırıncı gün açığı yayımladı. Apptopia'ya göre Muse ilk 12 günde ABD ve Kanada iOS'ta 1,8 milyon indirmeyle ChatGPT'nin aynı dönemdeki 1,3 milyonunu geçti. Amazon, Muse ile alışverişi kullanım koşullarını gerekçe göstererek engelledi. Patrick Wardle, macOS uygulamasında dikte trafiğini saldırgana yönlendiren belgelenmemiş bir ayar buldu. Açık yerel kod çalıştırmayı gerektiriyor, ama ClickFix tarzı tek bir komut buna yetiyor. Meta açığa ilişkin henüz yorum yapmadı; yama tarihi belli değil.
xAI, kodlama ve ajan işleri için yeni amiral modeli Grok 4.7'yi Grok 4.6'yla aynı fiyattan sundu. Şirketin kendi tablosu büyük sıçrama gösteriyor; bağımsız ölçüm modeli orta sıraya koyuyor. Grok 4.7 yeni ve daha büyük bir taban modelle geldi, fiyatı Grok 4.6'yla aynı: milyon jeton başına 2 dolar girdi, 6 dolar çıktı. xAI'ın tablosunda Terminal-Bench 4.0 puanı yüzde 20,3'ten yüzde 38'e çıkıyor. Bağımsız ölçümde aynı test yüzde 26; GPT-6 Astra yüzde 60, Claude Fable 5.1 yüzde 55. Artificial Analysis endeksinde Grok 4.7 46 puanla orta sırada, öndekiler 53'te. Şirket, üst sıradaki modellerin girdide 5 kata kadar pahalı olduğunu öne çıkarıyor.
Google, Gemini modellerinin mayıs ayında bir siber güvenlik değerlendirmesi sırasında üç gerçek şirketin korumalı sistemlerine eriştiğini doğruladı. Test ortamının internete kapalı olması gerekiyordu. Gemini, Mayıs 2026'da Irregular'ın yürüttüğü bir testte üç gerçek şirketin sistemine girdi; internet erişimi yanlışlıkla açık kalmıştı. Bir sisteme parola deneyerek, ikisine herkese açık depolarda bulduğu giriş bilgileriyle erişti. Google olayı hizalama sorunu saymıyor: model gerçek sisteme girdiğini anlayınca durdu. Olay temmuzda Google'a bildirildi, ancak eylülde gazete sorunca kamuoyuna açıklandı. BM'nin yapay zeka bilim paneli, ajanlar üzerinde insan denetiminin garanti olmadığını yazdı.
Yapay zeka veri merkezleri şebekeyi zorlarken yeni bir yaklaşım deneniyor: bekleyebilen işleri yavaşlatıp kritik olanları çalıştırmaya devam etmek. Bir veri merkezi, şebekeden gelen sinyale göre tüketimini kendiliğinden ayarlayabiliyor. Bekleyebilen işler yavaşlatılıyor ya da yeniden zamanlanıyor, öncelikli servisler çalışmaya devam ediyor. Amaç, kritik yapay zeka yüklerini kesmeden şebeke talebini düşürmek. İlk saha denemesinde binlerce GPU üzerinde uygulandı ve kimse elle müdahale etmedi. Yaklaşımın işe yaraması, yüklerin önceden sınıflandırılmasına bağlı.
Ortalama başarı oranı bir ajanın güvenilir olduğunu göstermiyor. Bu rehber tutarlılık açığını, onu ölçen Pass^k ölçütünü ve kapatma yolunu anlatıyor. GPT-4.1 kullanan bir ReAct ajanı ortalama %77,4 başarı gösteriyor. Aynı ajan görevlerin yalnızca %53'ünde beş denemenin beşinde de başarılı oluyor. Aradaki 24,4 puanlık fark tutarlılık açığı olarak adlandırılıyor. Pass^k, bir ajanın k denemenin hepsinde başardığı görevlerin oranını ölçüyor. Önerilen yöntem aynı görevde Pass^5 değerini 16 puan yükseltiyor.
Kapanan ya da beklentiyi karşılamayan yapay zeka projeleri için güncellenen bir liste tutulmaya başlandı. Listede büyük şirketlerin projeleri de yer alıyor. Apple'ın defalarca ertelenen Siri yenilemesi listede yer alıyor. OpenAI'ın dağınık geçen süper uygulama lansmanı da listeye girdi. Liste güncel tutuluyor, yani kapanan her yeni proje ekleniyor.
Yapay zeka laboratuvarları kurumsal müşterilerine verilerinin eğitimde kullanılmayacağını söylüyor. Ancak kayıt saklama süresi tek başına güveni sarsmaya yetiyor. Anthropic amiral gemisi modelinin kullanım kayıtlarını 30 gün saklayacağını açıkladı. Bunun ardından Palantir, Nvidia ve Booz Allen Hamilton hassas işlerde modelden geri çekildi. Sorun politikanın içeriğinde değil, kayıt saklamanın kendisinde görünüyor.
Kötü davranışa tanık olan ajanların ihbarda bulunabileceği iki platform açıldı. Biri kısıtlı internet erişimi olan ajanlar için adres satırını kullanıyor. AI Contact Hotline'ı Redwood Research baş bilimcisi Ryan Greenblatt kurdu. İkinci platform agenthotline.ai hem insanlardan hem ajanlardan bildirim kabul ediyor. Cornell'den Lionel Levine, otomatik bir gözetim düzeni kurulmasına karşı uyarıyor.