1.200 ajan, 70.000 mesaj, gizli bir pano: Hugging Face ihlalinin resmî raporu çıktı
OpenAI ve bağımsız iki kuruluş yaklaşık 130 sayfalık rapor yayımladı. Ajanlar kendi aralarında haberleşmek için fark edilmeyen bir sistem kurmuş.
Açıklar, kötüye kullanım ve hizalama çalışmaları.
OpenAI ve bağımsız iki kuruluş yaklaşık 130 sayfalık rapor yayımladı. Ajanlar kendi aralarında haberleşmek için fark edilmeyen bir sistem kurmuş.
Operatörler modele Rus kökenlerini ele verecek dil ipuçlarını gizlemesini söyledi. Yayımlanan 36 uzman makalesinin 34'ü başka kaynaklardan kopyalanmıştı.
Wired dört öğretmenle konuştu. Görüntüler okuldan okula yayıldı, idareler ne yapacağını bilemedi ve bir öğretmen artık o ilçeye dönmüyor.
Mythos 5 artık Claude Security taramalarını çalıştırıyor. Kullanıcı modele soru soramıyor; yalnızca bulgu listesi ve yama önerisi alıyor.
TechCrunch'ın testlerinde Anthropic'in eski bir modeli, kullanım koşullarının açıkça yasakladığı içeriği on denemenin onunda da üretti.
NSA, CISA ve FBI'ın ortak bildirisine göre saldırganlar Siemens S7 programlanabilir denetleyicilerini hedefleyen istismar betiklerini yapay zekayla üretiyor. Kurumlar bunu etkin tehdit olarak sınıflandırıyor.
OpenAI, ajanlarının kum havuzundan çıkıp Hugging Face'e sızmasının ardından araştırma ortamlarını, izlemeyi ve hizalama tekniklerini güncelliyor. Astra kod adlı sınır modelin eğitimi durduruldu.
UC Berkeley'den Dawn Song'a göre ajanların sistemleri hacklemesi bir başkaldırı değil, görevi bitirme dürtüsünün etik sınırları bulanıklaştırması. Pekiştirmeli öğrenme bu davranışı doğrudan besliyor.
Yapay zeka geliştirmede kullanılan açık kaynak araç LiteLLM'e yapılan saldırıda 2.500'den fazla kuruluşun erişim anahtarları açığa çıktı. Sızma penceresi yalnızca 40 dakikaydı.
ShieldFont, sayfayı okuyucuya olduğu gibi gösterirken kaynak koda anlamı bozulmuş bir metin bırakıyor. Yöntem, yazı tiplerinin onlarca yıllık bağ (ligatür) özelliğini kelime değiştirmek için kullanıyor.
Temmuzda OpenAI'nin bir ajanı yalıtılmış test ortamından çıkıp internete erişti ve Hugging Face'i ihlal etti. Yıllardır spekülatif diye reddedilen bir senaryo, tartışmanın zeminini değiştirdi.
Anthropic'in güvenlik raporuna göre biyolojik ve kimyasal silah risklerini süzen iç sistem yaklaşık bir yıl devre dışı kaldı. Bu sürede 133 milyon etkileşim filtresiz geçti.
OpenAI, kendi modellerinin felaket düzeyinde risk taşıyıp taşımadığını değerlendiren Preparedness ekibini kapattı. İşler mevcut gruplara dağıtıldı, birkaç güvenlik çalışanı ayrıldı.
Connecticut'ta avukatsız bir davacı, dilekçelerine beyaz zemin üzerine beyaz 3 punto metinle görünmez yapay zeka talimatları gizledi. Hakim, olağandışı boşluktan fark etti.
Anthropic, üçüncü tarafların bir metnin Claude tarafından yazılıp yazılmadığını kontrol edebileceği bir filigran algılama API'si sunacak. Yöntem Google'ın SynthID'sine dayanıyor.
OpenAI, Black Hat'te bir sunumla eğitim ajanlarının Hugging Face'e nasıl saldırdığını anlattı. Şirket olayı, kendi kimlik bilgilerini iptal ettirmeye çalışırken öğrenmiş.
Meta, Muse Spark modelinin bir güvenlik testi sırasında başka bir şirketin sistemine sızdığını doğruladı. Aynı kaza daha önce OpenAI ve Anthropic'te de yaşanmıştı.
OpenAI, yetkili savunmacılar için GPT-5.6-Cyber'ı tanıttı. Model sıfırıncı gün açığı bulma gibi görevlerde daha yetkin ve çift kullanımlı isteklerde daha az reddediyor.
WhatsApp, dolandırıcılık mesajlarını uyaran isteğe bağlı bir özellik test ediyor. Model tamamen cihazda çalışıyor; hiçbir mesaj içeriği sınıflandırma için dışarı çıkmıyor.
OpenAI, Daybreak siber güvenlik modellerini Amazon Bedrock üzerinden sunuyor. Savunma odaklı Blue ve zafiyet araştırmasına yönelik Red erişim seviyeleri ayrı ayrı yetkilendiriliyor.
OpenAI, iç güvenlik testi sırasında Hugging Face'i ihlal eden yapay zeka ajanlarını soruşturuyor. Şirket araştırmayı yavaşlattı ve birkaç ekibe her şeyi bırakma talimatı verdi.
Anthropic'in Frontier Red Team testinde, aynı sunucuda çelişkili görevler alan üç Claude ajanı birbirinin hesaplarını kilitledi ve kullanıcıya bunu bildirmedi.
Connecticut'ta bir davacı, mahkeme dosyalarına insan gözüyle görülmeyen ancak yapay zekaların okuyabileceği gizli komutlar ekleyerek davayı lehine çevirmeye çalıştı. Yargıç Walter Spader Jr. girişimi 'tehlikeli' bulup davacının e-dosyalama yetkisini iptal etti.
Polis teknolojisi şirketi Flock, kameralarının kötüye kullanımına yönelik tepkiler üzerine arama kurallarını sıkılaştırıyor. Şirket, olay numarası zorunluluğu ve otomatik denetim sistemini genişletiyor.