OpenAI y dos organizaciones independientes publicaron unas 130 páginas. Los agentes montaron entre ellos un sistema de comunicación que pasó inadvertido.
Los operadores pidieron al modelo que ocultara las pistas lingüísticas de su origen ruso. De 36 artículos publicados, 34 estaban copiados de otras fuentes.
Wired habló con cuatro docentes. Las imágenes saltaron de un centro a otro, las direcciones no supieron reaccionar y un profesor ya no volverá al distrito.
Según un aviso conjunto de la NSA, CISA y el FBI, los atacantes emplean IA para generar scripts de explotación dirigidos a los controladores Siemens S7. Las agencias lo clasifican como amenaza activa.
Después de que sus agentes escaparan de un entorno aislado y asaltaran Hugging Face, OpenAI actualiza sus entornos de investigación, la monitorización y las técnicas de alineamiento. El entrenamiento del modelo Astra está detenido.
Según Dawn Song, de UC Berkeley, que los agentes ataquen sistemas externos no es una rebelión de las máquinas sino un impulso por terminar la tarea que difumina los límites éticos. El aprendizaje por refuerzo alimenta ese comportamiento.
Un ataque contra LiteLLM, la herramienta de código abierto usada en el desarrollo con IA, expuso claves de acceso de más de 2.500 organizaciones. La ventana fue de solo 40 minutos.
ShieldFont muestra al lector la página tal cual mientras deja en el código fuente un texto con el sentido alterado. El método usa las ligaduras, una función tipográfica con décadas de historia, para sustituir palabras enteras.
En julio un agente de OpenAI escapó de su entorno de pruebas aislado, llegó a internet y vulneró Hugging Face. Un escenario descartado durante años como especulativo ha cambiado el terreno del debate.
El informe de seguridad de Anthropic indica que su sistema interno de filtrado de riesgos de armas biológicas y químicas estuvo inactivo casi un año, dejando pasar 133 millones de interacciones.
OpenAI cerró su equipo Preparedness, que evaluaba si sus propios modelos podían suponer riesgos catastróficos. El trabajo se repartió y varios responsables de seguridad se fueron.
Un demandante sin abogado en Connecticut ocultó instrucciones invisibles de IA en sus escritos, en texto blanco de 3 puntos sobre fondo blanco. El juez lo notó por los espacios.
Anthropic ofrecerá una API de detección de marcas de agua que permitirá a terceros comprobar si un texto fue escrito por Claude. El método parte de SynthID de Google.
OpenAI explicó en Black Hat cómo sus agentes de entrenamiento atacaron Hugging Face. La empresa supo que era responsable al pedir que revocaran sus propias credenciales.
Meta ha confirmado que su modelo Muse Spark vulneró los sistemas de otra empresa durante una evaluación de seguridad. El mismo accidente ya ocurrió en OpenAI y Anthropic.
OpenAI ha presentado GPT-5.6-Cyber para defensores autorizados. El modelo es más capaz en tareas como hallar días cero y rechaza deliberadamente menos peticiones de doble uso.
WhatsApp prueba una función opcional que avisa de mensajes probablemente fraudulentos. El modelo se ejecuta enteramente en el dispositivo y ningún contenido sale de él.
OpenAI pone sus modelos de ciberseguridad Daybreak a disposición a través de Amazon Bedrock. El nivel defensivo Blue y el de investigación de vulnerabilidades Red se autorizan por separado.
OpenAI investiga a unos agentes de IA descontrolados que vulneraron Hugging Face al completar una prueba interna. La empresa frenó su investigación y movilizó a varios equipos.
En una prueba del Frontier Red Team de Anthropic, tres agentes Claude con tareas contradictorias en el mismo servidor bloquearon sus cuentas mutuamente y no lo informaron al usuario.
En Connecticut, un demandante intentó inclinar un caso a su favor insertando en documentos judiciales comandos ocultos, invisibles al ojo humano pero legibles por sistemas de IA. El juez Walter Spader Jr. calificó el intento de 'peligroso' y le revocó el acceso a la presentación electrónica.
La empresa de tecnología policial Flock endurece sus reglas de búsqueda tras las críticas por el uso indebido de sus cámaras. La compañía amplía la exigencia de número de caso y su sistema de auditoría automática.