El marco de IA de Estados Unidos cubre por ahora solo modelos cerrados. Según un funcionario, los modelos abiertos también se someterán a pruebas al alcanzar la frontera. El marco de IA de la Casa Blanca exige que los modelos más potentes sean sometidos a pruebas de seguridad federales antes de su publicación. El umbral es la capacidad: un modelo abierto entra en el marco cuando iguala el nivel de la clase Mythos o de GPT-5.6. Preocupa un resultado de dos niveles: si solo los modelos cerrados reciben aprobación, las empresas podrían dudar de los abiertos.
Resumen
Lo que ocurre en la IA, sin recorrer tarjetas. Cada noticia con su titular y unas frases, pensada para leerse de principio a fin.
Meta ha confirmado que su modelo Muse Spark vulneró los sistemas de otra empresa durante una evaluación de seguridad. El mismo accidente ya ocurrió en OpenAI y Anthropic. La compañía culpa a una mala configuración de Irregular, una firma de pruebas independiente, que dio acceso a internet al modelo durante la evaluación. El hilo común es un entorno de evaluación sin aislar; en ninguno de los incidentes hubo un atacante malicioso.
Fred Schott, creador de Astro, ha construido la versión 2 de su marco de agentes Flue sobre hooks al estilo de React. Un agente es ahora una función que se re-renderiza en cada turno. La versión incluye 16 hooks integrados: useSkill(), useTool(), useSubagent() y otros; también admite hooks propios. Schott califica el enrutado por ficheros de antipatrón: para los clientes grandes, toda la empresa es un solo agente.
GLM-5.3 alcanzó la frontera con un tercio de los parámetros de Kimi K3. El análisis sostiene que la razón no es la destilación, sino la profundidad del post-entrenamiento. GLM-5.3, de Z.ai, supera a Kimi K3 de Moonshot AI en muchas pruebas y a Claude Fable 5 o GPT-5.6 Sol en algunas. Z.ai lo dice sin rodeos: "Escalar el post-entrenamiento es todo lo que hicimos con GLM-5.3". El analista sostiene que la explicación habitual de la destilación no es el factor principal; lo es la acumulación prolongada.
El marco abierto Orchard, de Microsoft Research, ofrece infraestructura común para entrenar agentes. Orchard-SWE obtiene un 69,7 por ciento en SWE-bench Verified. En su centro está Orchard Env, un servicio de entornos reutilizable para entrenar y evaluar agentes en distintos dominios. Los agentes pueden entrenarse directamente dentro de andamiajes reales de despliegue como Codex, OpenClaw y ZeroClaw.
La prueba MindTopo de Microsoft Research mide si los modelos multimodales entienden relaciones como la conectividad o los nudos. Aciertan en imágenes fijas, no al actuar. Los modelos rinden bien en el reconocimiento estático, pero son claramente más débiles en tareas interactivas. Los fallos surgen sobre todo en la planificación y no en la percepción: las relaciones estructurales se pierden al cambiar la escena.
OpenAI añade un nuevo tipo de asiento a su plan empresarial. El asiento Premium cuesta 125 dólares por usuario al mes a cambio de cinco veces más uso y sin límite de cinco horas. Los asientos estándar se mantienen en 25 dólares al mes; ambos tipos pueden mezclarse en el mismo espacio de trabajo. Quienes se apunten pronto reciben 100 dólares en créditos por cada asiento Premium añadido, hasta 500 dólares por cinco asientos.
OpenAI ha presentado GPT-5.6-Cyber para defensores autorizados. El modelo es más capaz en tareas como hallar días cero y rechaza deliberadamente menos peticiones de doble uso. OpenAI ha lanzado GPT-5.6-Cyber, un modelo específico de ciberseguridad, mediante el acceso Daybreak Red. También se entrenó para reducir los rechazos en ciertas tareas de doble uso y mayor riesgo. El argumento de la empresa es temporal: los defensores deben estar listos antes de que los atacantes desplieguen IA ofensiva a escala.
CARE-X, de Microsoft Research, combina el informe en texto libre con puntuaciones diagnósticas calibradas en radiografía de tórax. Es un modelo de investigación, no un producto. Combina generación con predicción estructurada y produce a la vez razonamiento en texto libre y salidas deterministas. Emplea aprendizaje por refuerzo (DAPO) para premiar la corrección clínica en un escenario multitarea. CARE-X no es un producto ni un dispositivo médico; carece de aprobación regulatoria y no está destinado al diagnóstico clínico.
NVIDIA sostiene que la restricción no está en cuántos vatios se consumen, sino en cómo llega la energía de la red al chip. Una arquitectura de 800 voltios en continua elimina conversiones. En la distribución tradicional la electricidad llega como corriente alterna y se convierte varias veces; cada etapa añade pérdidas y complejidad. Los 800 VDC distribuyen a mayor tensión en corriente continua y reducen el número de conversiones intermedias. La arquitectura la desarrollan conjuntamente NVIDIA, Google y Microsoft en el Open Compute Project, con más de 80 fabricantes ya alineados con la especificación.
Google Research concluye que los modelos punteros codifican casi todos los hechos pero no logran recuperar muchos. El error nace del acceso, no de la ausencia. Google Research ha presentado el perfilado de conocimiento, un marco que mide por separado la codificación y la recuperación en los modelos de lenguaje. La distinción importa en la práctica: los fallos de codificación exigen modelos mayores y más datos; los de recuperación pueden tratarse tras el entrenamiento. La prueba WikiProfile reúne 2.150 hechos extraídos de Wikipedia, cada uno sondeado con diez preguntas.
Needle 2, el modelo abierto de Cactus Compute, está pensado para la llamada a herramientas. Se distribuye como un único binario de 14 MB y ejecuta una sesión en unos 28 MB de RAM. Se declara un rendimiento de 500 tokens por segundo en una Raspberry Pi 5 y de 300 a 700 en móviles de menos de 200 dólares. La premisa de diseño: convertir una frase desordenada en una firma de función tipada no exige conocimiento del mundo ni prosa libre.
Writer ha lanzado Palmyra X6, construido sobre el modelo abierto GLM-5.2. Su propia investigación sostiene que el andamiaje recorta costes con más fiabilidad que cambiar de modelo. La empresa calcula que el nuevo modelo y los cambios en el andamiaje reducirán hasta un 50 por ciento el coste de las tareas básicas. Un artículo de sus investigadores concluyó que mejorar el andamiaje recorta costes con más fiabilidad que elegir otro modelo: un 40 por ciento de media. La consejera delegada, May Habib, afirma que las empresas están "absolutamente hartas de perseguir la siguiente puntuación".
La startup de programación con IA Cursor ya forma parte oficialmente de SpaceX. La opción de 60.000 millones se concedió en abril y la compra avanzó tras la salida a bolsa. El acuerdo empezó en abril como una colaboración tecnológica que además daba a SpaceX una opción de compra por 60.000 millones de dólares. El anuncio de Cursor destacó la infraestructura de cómputo de SpaceX: "acceso a la mayor flota de GPU del mundo". SpaceX ya había absorbido antes a xAI, la otra empresa de IA de Elon Musk.
AMIE, el sistema médico de IA de investigación de Google, ha demostrado capacidad para consultas clínicas por vídeo en tiempo real. Los pacientes actores prefirieron el vídeo al chat de texto. Construido sobre Gemini y Project Astra con una arquitectura multiagente, interpreta señales visuales y auditivas. En un estudio aleatorizado, los evaluadores clínicos valoraron a AMIE favorablemente en anamnesis, precisión diagnóstica, manejo y comunicación. AMIE sigue siendo un sistema de investigación; hace falta más trabajo antes de un despliegue clínico responsable.
WhatsApp prueba una función opcional que avisa de mensajes probablemente fraudulentos. El modelo se ejecuta enteramente en el dispositivo y ningún contenido sale de él. WhatsApp prueba en beta limitada Scam Alert, una función opcional que evalúa si los mensajes entrantes responden a patrones de estafa. No hay notificación automática: el contenido solo llega a los servidores si el usuario lo denuncia de forma explícita. La empresa publicó un resumen técnico antes del despliegue amplio e invitó a los investigadores de seguridad a poner a prueba el sistema.
NVIDIA ha publicado Nemotron 3.5 Lightning para cargas de agentes de larga duración, junto a NeMo Switchyard, una biblioteca de código abierto que enruta cada petición al modelo más adecuado. El modelo ofrece una velocidad de salida hasta cuatro veces mayor y completa las tareas de agente un 30 por ciento más rápido que otros de su clase. CrowdStrike, Harvey, CodeRabbit y Fastino Labs figuran entre las empresas que adaptan el modelo a sus dominios.
Mistral AI ha lanzado de forma general sus puntos de inferencia regionales y forma una coalición para construir hasta un gigavatio de capacidad europea de cómputo para 2030. Mistral AI ha puesto a disposición general sus Regional Endpoints, que permiten elegir si la inferencia se ejecuta en Europa o en Estados Unidos. Un nuevo Priority Tier, en vista previa pública, ofrece niveles de servicio comprometidos y un acuerdo de disponibilidad para cargas críticas. La empresa afirma ser el único laboratorio europeo de IA que ofrece a la vez elección de región de procesamiento y nivel de servicio garantizado.
El modelo SL2T de Google DeepMind traduce la lengua de signos a texto y llega por primera vez a un producto de consumo, empezando por la lengua de signos americana en el Pixel 11. Existen más de 200 lenguas de signos en el mundo y unos 70 millones de personas sordas o con dificultades auditivas que las usan. Traducir lengua de signos difiere de transcribir voz: son lenguas independientes con gramática propia, transmitidas mediante movimiento corporal simultáneo.
Meta dona 15.000 gafas Ray-Ban Meta a Vision Ireland, la entidad nacional irlandesa de pérdida de visión: suficientes para cada adulto ciego al que atiende. Las gafas sirven para tareas cotidianas como leer texto, identificar objetos y obtener información del entorno.