Un nuevo estudio firmado por Xin Shu, Zhen Lei y Ang Li propone límites más estrictos que los actuales para las probabilidades de causalidad multivaluadas. El estudio utiliza el conocimiento causal codificado en covariables y mediadores para estrechar los límites existentes. La investigación se basa en los límites binarios de PoC de Tian y Pearl y en extensiones multivaluadas posteriores. Los estudios de simulación muestran que los límites propuestos son más estrechos que los límites no binarios existentes. El artículo se publicó en arXiv el 12 de agosto de 2026.
Resumen
Lo que ocurre en la IA, sin recorrer tarjetas. Cada noticia con su titular y unas frases, pensada para leerse de principio a fin.
Un nuevo estudio académico revela que los modelos de lenguaje grande (LLM), usados como jueces, cambian con frecuencia sus veredictos ante objeciones persistentes. Los investigadores examinaron 9 modelos líderes en 14 tareas de evaluación mediante un sistema llamado 'Wiggle Framework' La presión que provoca que un juez cambie su veredicto suele alejarlo de la verdad real La fuerza de la mayoría del jurado resultó ser la señal individual más eficaz para predecir qué veredictos podrían cambiar El estudio abarca áreas como seguridad, toxicidad, detección de textos escritos por IA y evaluación de respuestas políticas
Universitas Gadjah Mada, en colaboración con Indosat y NVIDIA, inauguró en Yogyakarta el UGM Indosat NVAITC, el primer centro de tecnología de inteligencia artificial basado en una universidad en Indonesia. El centro forma parte de la iniciativa AI Center of Excellence de Indonesia y reúne al sector público, la industria y la academia. El centro utiliza la plataforma GPU Merdeka de Indosat y la infraestructura de IA de pila completa de NVIDIA. Los tres primeros proyectos se centran en salud, agricultura y gestión de desastres naturales. Indonesia registra más de 1 millón de nuevos casos de tuberculosis al año, y el proyecto eNose-TB busca abordar este problema.
En un hackathon organizado por Hugging Face, 1.221 participantes usaron agentes de codificación para intentar reproducir las afirmaciones de 2.226 artículos aceptados en ICML 2026. 35.908 afirmaciones científicas fueron verificadas, refutadas, confirmadas a escala reducida o marcadas como no concluyentes por un sistema de evaluación automática basado en GLM-5.2. En el 51% de los artículos revisados (1.103 artículos) al menos una afirmación fue verificada de forma independiente, mientras que en el 23% (496 artículos) al menos una fue refutada o resultó controvertida. En 242 artículos, distintos equipos llegaron a resultados opuestos sobre la misma afirmación, lo que demuestra que la reproducibilidad es un proceso disputado, no binario. Las 35 refutaciones reportadas por los participantes fueron verificadas y comprobadas doblemente por el equipo de Hugging Face.
El SDK de código abierto Strands Robots, desarrollado por AWS, se integra con el formato de datos LeRobot y Hugging Face Storage Buckets para unificar el registro, entrenamiento y despliegue de datos de robots en un solo ciclo de agente. Hugging Face Storage Buckets, anunciado en marzo de 2026, es un tipo de almacenamiento mutable y sin versiones basado en Xet.
Según el informe de verano de 2026 de Hugging Face, los laboratorios chinos toman la delantera con modelos abiertos de billones de parámetros, mientras en EE. UU. el liderazgo pasó de los laboratorios de modelos a los fabricantes de hardware. El número de modelos en Hugging Face Hub pasó de 2,43 millones a 2,96 millones entre enero y agosto de 2026, aunque el 85,6 % de los modelos recibió menos de 200 descargas. El modelo abierto más grande publicado mensualmente por laboratorios chinos tuvo entre 754.000 millones y 2,78 billones de parámetros, mientras que en modelos estadounidenses la cifra se mantuvo por debajo de 130.000 millones la mayoría de los meses. Entre los 25 modelos más descargados y los 25 más valorados, solo uno coincidió en ambas listas; all-MiniLM-L6-v2 fue descargado 1.550 millones de veces en siete meses. El 59 % de las 178 publicaciones de grandes modelos chinos se distribuyó bajo licencia Apache 2.0 y el 22 % bajo MIT, sin ninguna restricción comercial.
OpenAI publicó una guía para que las startups que usan GPT-5.6 desarrollen agentes de IA más rápidos y rentables. La guía se centra en la selección inteligente de modelos y en las nuevas capacidades de la Responses API. OpenAI publicó una guía titulada 'The builder's guide to GPT-5.6' sobre el modelo GPT-5.6.
Google DeepMind presentó Gemini 3.7 Flash, con un notable aumento de rendimiento en codificación y tareas de agentes frente a su versión anterior, a mitad del precio de Gemini 3.6 Flash. El nuevo modelo obtuvo 43,6% en la prueba FrontierCode 1.1 Main, superando el 34,4% del modelo anterior. 3.7 Flash logró 1588 puntos Elo en WebDev Arena, superando los 1538 de 3.6 Flash. El modelo se ofrece con precio de lanzamiento hasta fin de año: 0,75 dólares por millón de tokens de entrada y 3,75 dólares por millón de tokens de salida. El agente de IA personal Gemini Spark comenzó a funcionar con Gemini 3.7 Flash desde hoy.