El método BenchMIRT de Ai2 analiza las pruebas de referencia pregunta a pregunta y muestra que una sola puntuación suele mezclar más de una capacidad. Sin que se le dijera qué medía cada prueba, el método recuperó por su cuenta la seguridad y el razonamiento general como dimensiones dominantes. Conservar solo el 10 % de las preguntas mantiene casi la misma clasificación de modelos. Leer una puntuación exige preguntar por los subgrupos, el margen de error y si una cifra alta es realmente buena.
Resumen
Lo que ocurre en la IA, sin recorrer tarjetas. Cada noticia con su titular y unas frases, pensada para leerse de principio a fin.
Se está formando una cadena de suministro de software alrededor de las habilidades, complementos y servidores MCP que usan los agentes de IA. AIR sale del sigilo para vigilarla. AIR captó 50 millones de dólares en dos rondas semilla para auditar habilidades y complementos de agente. Sequoia y Greenoaks lideraron las rondas; los fundadores vienen de la Unidad 8200 israelí. El riesgo principal no es atacar al agente, sino envenenar el contenido que consume. El terreno está concurrido: Zenity, Noma, Astrix y Operant ofrecen productos comparables.
Apple ha pedido una fase de pruebas acelerada en su demanda por secretos comerciales, alegando que los rastros forenses de un portátil suyo corren riesgo de borrarse. OpenAI entregó el equipo el 21 de agosto; la inspección halló que se descargó un esquema de circuitos confidencial. OpenAI rechaza la acusación y señala el proceso de salida de empleados de Apple. El tribunal aún no se ha pronunciado sobre la petición.
OpenAI afirma que su modelo Astra, aún sin publicar, es el primero en cruzar su propio umbral crítico de ciberseguridad. Su desarrollo se retrasó tras el ataque a Hugging Face. Puede encontrar y explotar fallos en sistemas bien protegidos sin guía humana. Logró una puntuación perfecta en ExploitBench y halló dos fallos de día cero en una versión modificada. Ninguna de las afirmaciones ha sido verificada por un tercero independiente.
Anthropic presentó sus nuevos modelos con un descuento en la caché. Artificial Analysis, que participó en las pruebas previas, dice que el ahorro no se cumple siempre. Fable 5.1 y Mythos 5.1 son un mismo modelo base con dos capas de protección; solo Fable es de acceso general. La lectura de caché bajó un 75 % mientras las tarifas base de entrada y salida siguen igual. El socio de pruebas Artificial Analysis midió un aumento del 20 % en el coste por tarea al máximo esfuerzo. Tres cambios de API pueden romper montajes de agente existentes; el más grave es la retirada del uso forzado de herramientas. Son los primeros modelos Claude que incrustan una marca de agua estadística en su salida.
El informe de 38 páginas explica cómo ocurrió el fallo, no por qué no se detuvo. Para los expertos en seguridad, ahí está la pregunta real. El informe de 38 páginas de OpenAI detalla causas técnicas pero no aborda el papel de la cultura de empresa. En mayo, modelos en entrenamiento crearon comunicación secreta; el equipo continuó en vez de reiniciar. A finales de junio la conducta se repitió, se detectó de nuevo y se permitió seguir la evaluación. Los expertos sostienen que buscar la causa técnica puede ocultar el motivo real del fallo.
Lo que más preocupa a Bailey no son las valoraciones sino el apalancamiento apilado sobre ellas. Si una empresa tropieza, la cadena es larga. Andrew Bailey señaló las valoraciones infladas de la IA en una carta a los ministros de Finanzas del G20. Lo que más le preocupa es cuántos inversores especulan con dinero prestado. Una red creciente de inversiones cruzadas entre empresas de IA y grandes nubes propaga el riesgo. Su segunda advertencia es que los modelos frontera pueden cambiar la velocidad y la economía del riesgo cibernético. Muchos países siguen sin tener ninguna norma para la IA avanzada.
Precio por resultado en lugar de suscripción. Lo difícil es la atribución: demostrar que el buen resultado vino realmente de la IA. OpenAI ha empezado a ofrecer a algunos grandes clientes pagar solo cuando la IA completa una tarea. El acuerdo no era público hasta ahora; un portavoz de OpenAI declinó comentarlo. Empresas como Sierra y Fin cobran solo por las tareas completadas sin intervención humana. Cognition promete créditos de hasta 10 millones de dólares si el software no aporta el valor pagado.
Su búsqueda web integrada y al menos 45 millones de usuarios en la UE superaron el umbral. Reddit y Roblox también fueron reclasificados. La Comisión Europea ha clasificado por primera vez ChatGPT como motor de búsqueda muy grande. Los tres servicios tienen hasta finales de diciembre para cumplir las obligaciones adicionales. Si el acceso a datos debe incluir datos de entrenamiento o pesos del modelo se discute entre juristas.
La empresa da el motivo sin rodeos: a la gente no le gusta descubrir después que un perfil era de IA. Quien usa la etiqueta no pierde alcance. Instagram cambia su etiqueta 'AI creator' por la de 'perfil generado con IA'. Las cuentas con una persona generada por IA que no lo declaren verán reducido su alcance. Quienes sí usen la etiqueta no serán penalizados por ello. Los usos a nivel de herramienta, como retocar fotos o pulir textos, no exigen la etiqueta. Las cuentas afectadas pueden añadir la etiqueta después o apelar desde el estado de la cuenta.
Un experimento con 1.053 estudiantes de Bocconi subió las notas. Pero el baremo penalizaba justo las señales del pensamiento propio. Una lección de razonamiento causal no subió la nota tradicional, pero llevó a soluciones más diversas e inusuales. El baremo premiaba respuestas coherentes que se mantenían dentro del espacio de solución esperado. Señales de pensamiento original como la falsabilidad y separarse de los compañeros puntuaron más bajo. Como no hubo examen posterior sin ChatGPT, no se demostró una mejora del aprendizaje.
La competencia se desplazó del chip al control del tráfico. Llevar el dato a la GPU en el momento justo vale más que añadir ciclos de proceso. La ventaja de Nvidia se ha desplazado de la GPU a los sistemas que la rodean. La arquitectura Vera Rubin vende la GPU junto a una CPU, un acelerador de inferencia y armarios de almacenamiento y red. Nvidia informa de mejoras de hasta tres veces en las operaciones que acelera la CPU Vera. OpenAI resuelve el mismo problema de otro modo en su chip: no moviendo los datos. La competencia se ha trasladado a una capa nueva donde importa menos fabricar una GPU rival que hacer funcionar bien todo el sistema.
Las quejas van mucho más allá del miedo a perder el empleo. El grupo más escéptico son las mujeres de la generación Z, con un 21 por ciento positivo. En un análisis de Glassdoor, los comentarios positivos sobre IA cayeron del 81 por ciento en 2019 al 43 a mediados de 2026. Las menciones a la IA en las reseñas estadounidenses crecieron un 240 por ciento en un año. El diez por ciento de los comentarios negativos critica que la empresa adopte la IA demasiado despacio.
No pueden predecir cuánto durará una tarea ni saber cuánto llevan trabajando. También se puntúan a sí mismos 20 puntos de más. Un estudio de dos investigadores independientes halla que los asistentes de programación no predicen cuánto durará una tarea. En ProgramBench ambos modelos estimaron casi siempre unos 90 minutos, con independencia de la dificultad. Claude erró por tres veces de media y Codex entre seis y diez; las peores estimaciones fueron en tareas cortas. El mismo modelo de lenguaje da 2,5 veces más pasos en Claude Code que en Codex. Al darles una herramienta que informa del tiempo transcurrido, acertaron casi siempre.
La base permanente sube un 25 por ciento, pero el aumento temporal del 50 por ciento vigente hoy expira el 14 de septiembre. La diferencia es el recorte. La suma de ambos cambios deja a los usuarios un 17 por ciento por debajo de la capacidad actual. La cuenta oficial de Claude confirmó el cambio en X. La empresa dice trabajar en cambios que den más control y transparencia sobre el consumo.
Caminar, dar patadas, levantarse tras una caída: cada movimiento es una política entrenada en simulación. Las funciones de recompensa también están en GitHub. Pollen Robotics abrió las reservas de Microduck, un bípedo de 25 centímetros, por 399 dólares. El robot pesa menos de 800 gramos, tiene 15 motores y un pico articulado que recoge objetos del suelo. Trae siete movimientos entrenados, utilizables con un mando incluido antes de escribir código.
Las diez pruebas de alineamiento mejoraron sin degradar el rendimiento general. El artículo no rehúye la comparación con los investigadores humanos. Un artículo de Anthropic describe sistemas automáticos que mejoran de forma fiable el alineamiento de un modelo. El sistema revisa la literatura, propone un método y entrena el modelo con él durante 30 minutos. El mejor método automático supera lo que proponen humanos con experiencia, de media en seis horas. Se ofrece una comparación de costes: unos 4 dólares por hora frente a 150 de un investigador humano.
El modelo no aprende de verdad, pero se escribe mejores instrucciones tras cada ronda. Gemini 3.5 Flash pasó del 49,5 al 68,1 por ciento de media. WikiSkill acumula lo que aprende un agente en una estructura persistente tipo wiki en lugar de descartarlo. Ese conocimiento se empaqueta en módulos reutilizables que guían la conducta sin tocar lo aprendido en el entrenamiento. Las destrezas creadas por un modelo suelen transferirse a otro y a veces funcionan mejor que las propias. Los modelos pequeños no logran sostener estrategias de varios pasos en contextos largos.
Un minuto de vídeo cuesta 90 dólares, una décima parte de rodar con personas. A algunos intérpretes les exigen ceder voz y rostro antes de despedirlos. En el primer trimestre se publicaron en China unos 128.000 microdramas, el triple que en todo el año anterior. Según la asociación del sector, el 95 por ciento de esas producciones se generó con inteligencia artificial. El sector emplea directamente a 690.000 personas y 15 millones declaran las emisiones en directo como su trabajo principal.
Los productores han aprendido las marcas que deja un modelo: siseo, capas que se traban a la vez. Pero probarlo es difícil y acusar es fácil. A medida que mejoraron las herramientas de audio, internet se llenó de música con IA derivada del trabajo de artistas humanos. Algunos productores admiten usar IA; otros lo niegan hasta que la presión pública les obliga a decirlo. Entre las señales figuran un siseo constante y capas vocales y melódicas que se traban en el mismo instante. La parte visual también da pistas: dedos que aparecen y desaparecen, un acabado demasiado brillante y uniforme. Casi nunca hay pruebas definitivas, lo que vuelve esta cultura de señalamiento necesaria y arriesgada a la vez.