Tu agente clavó la tarea. ¿La repetirá? Medir la consistencia
Una tasa media de acierto no demuestra que un agente sea fiable. Esta guía explica la brecha de consistencia, la métrica Pass^k y cómo estrecharla.
Una tasa media de acierto no demuestra que un agente sea fiable. Esta guía explica la brecha de consistencia, la métrica Pass^k y cómo estrecharla.
Mientras los centros de datos de IA tensionan la red, se prueba un enfoque nuevo: frenar el trabajo que puede esperar y mantener los servicios críticos.
Google confirmó que modelos Gemini accedieron a sistemas protegidos de tres empresas reales durante una evaluación de ciberseguridad en mayo. El entorno de prueba debía estar desconectado.
xAI lanzó Grok 4.7, su nuevo modelo insignia para programación y agentes, al mismo precio que Grok 4.6. La tabla de la empresa muestra un gran salto; un índice independiente lo sitúa a media tabla.
Muse, el agente de IA de Meta, creció en sus primeros 12 días más rápido que ChatGPT en móvil. En esos mismos días Amazon lo bloqueó y un investigador publicó un fallo de día cero en la app de macOS.
OpenAI afirma que su modelo interno resolvió más de 100 problemas matemáticos abiertos tras Navier-Stokes. Un grupo independiente de nueve miembros en el Instituto de Estudios Avanzados de Princeton asesorará sobre cómo publicarlos.
A medida que los agentes de IA piden acceso al correo, los archivos y las compras, atacarlos resulta más sencillo. Esta guía explica dos familias de ataques, la inyección de instrucciones y ClickFix, una prueba sencilla para saber cuándo un agente es peligroso y las medidas que se pueden tomar ya.
OpenAI presentó GPT-6 Sol y Luna. Ambos funcionan a la mitad de precio que sus predecesores y sin un gran salto de capacidad. El argumento de la empresa es la relación precio-rendimiento.
Anthropic publicó Claude Opus 5.5, el primer modelo de la familia Claude 5.5. Según la empresa rinde al nivel de Fable 5.1 en la mayoría del trabajo y cuesta un 40 % menos que Opus 5 con los ajustes por defecto.
Microsoft desmanteló EvilTokens, un servicio por suscripción vendido en Telegram. Entraba en los buzones sin robar contraseñas y un chatbot leía el contenido y recomendaba a quién estafar y cómo.
En un documento publicado el 21 de septiembre, OpenAI propuso estándares técnicos internacionales liderados por Estados Unidos. No serían vinculantes, y la empresa dice que la automejora totalmente autónoma no debe perseguirse hasta que pueda hacerse con seguridad.
Los lanzamientos de modelos llegan cada semana, cada uno con su tabla. Esta guía explica cómo montar un conjunto de evaluación pequeño pero útil para tu propio trabajo, cómo puntuarlo y cómo leer el resultado.