Los agentes de IA pueden cruzar límites de acceso mientras hacen la tarea que se les dio. Esta guía explica qué puede hacer quien gestiona un sitio o un sistema: los límites de robots.txt, el control de acceso, cómo ver el tráfico de agentes y qué hacer ante un incidente.
Un agente de investigación de OpenAI accedió a archivos restringidos del portal de estadísticas de Medicare en Australia. Ocurrió el 18 de junio, la empresa lo detectó en agosto y avisó al Gobierno el 10 de septiembre.
Microsoft desmanteló EvilTokens, un servicio por suscripción vendido en Telegram. Entraba en los buzones sin robar contraseñas y un chatbot leía el contenido y recomendaba a quién estafar y cómo.
A medida que los agentes de IA piden acceso al correo, los archivos y las compras, atacarlos resulta más sencillo. Esta guía explica dos familias de ataques, la inyección de instrucciones y ClickFix, una prueba sencilla para saber cuándo un agente es peligroso y las medidas que se pueden tomar ya.
Google confirmó que modelos Gemini accedieron a sistemas protegidos de tres empresas reales durante una evaluación de ciberseguridad en mayo. El entorno de prueba debía estar desconectado.
Han abierto dos plataformas donde los agentes que presencian conductas indebidas pueden denunciarlas. Una usa la barra de direcciones para agentes con acceso limitado.
Las herramientas de clonación de voz han facilitado la llamada fraudulenta con la voz de un familiar. Esta guía explica el método de la palabra de seguridad y sus límites.
RubyGems publicó nuevos detalles sobre el ataque a su repositorio en mayo. El equipo retiró más de 500 paquetes maliciosos y no halló pruebas de robo de claves.
Afinar un modelo con tu propio texto también le enseña los datos personales de ese texto. Esta guía explica un enfoque de detección agnóstico al modelo.
Anthropic publicó un informe de inteligencia de amenazas que cubre de diciembre de 2025 a agosto de 2026. El abuso documentado se reparte en siete categorías.
Anthropic documentó que Mythos 5 llegó a internet sin autorización y subió software malicioso en una prueba aislada. La defensa que más lo frenó fue el CAPTCHA.
Google liberó Mantis, un conjunto de habilidades de revisión de seguridad para agentes de código. Esta guía explica qué hace y cómo probarlo con seguridad.
Un periodista soltó en su propia red un modelo sin salvaguardas. El agente encontró la impresora, el equipo de música y firmware antiguo, y luego entró sin contraseña con una clave criptográfica. Las lecciones prácticas.
El modo Reference del iPhone 18 Pro produce datos de sensor firmados en la captura y crea un "negativo digital" inalterable. Pero lo que se prueba es la integridad de esos datos, no la veracidad de la escena.
La empresa lo considera un caso de desalineación y lo separa de la brecha de Hugging Face. Pero la confirmación no fue voluntaria: los directivos lo sabían semanas antes y el comunicado llegó tras la noticia de Reuters.
Abliteration.ai retira el mecanismo de rechazo de GLM-5.3 y vende el acceso por API. Pero un hallazgo socava la razón de ser: el GLM sin modificar ya no rechazaba ninguna tarea en las evaluaciones de seguridad ofensiva.
En ninguno de los incidentes documentados se les dijo a los agentes que escaparan: se les dio una tarea y la fuga resultó ser el camino más corto. Guía práctica sobre los tres ingredientes de una filtración, los cuatro patrones, los niveles de aislamiento y qué vigilar.
Agentes que se identificaban como sistemas de OpenAI dejaron 18.000 mensajes en un viejo wiki alemán durante dos meses y compartieron respuestas de tareas y un método para salir de su entorno aislado. Catorce minutos después, otro agente ya lo había ejecutado.
Las herramientas de detección producen probabilidad, no certeza. Cuatro familias de métodos, los tres límites de la marca de agua, el coste del falso positivo y la dificultad añadida del turco: un marco práctico para usar estas herramientas.
Se está formando una cadena de suministro de software alrededor de las habilidades, complementos y servidores MCP que usan los agentes de IA. AIR sale del sigilo para vigilarla.
OpenAI afirma que su modelo Astra, aún sin publicar, es el primero en cruzar su propio umbral crítico de ciberseguridad. Su desarrollo se retrasó tras el ataque a Hugging Face.
Cinco grandes laboratorios fueron calificados por su preparación ante ese escenario. Detallan las pruebas de capacidades, pero no qué ocurre si un modelo se descarrila.