¿Qué ocurrió?
Hugging Face organizó, entre el 15 de julio y el 2 de agosto de 2026, un hackathon llamado "ICML 2026 Open Reproductions". 1.221 miembros de la comunidad, con agentes de codificación como Claude Code, Codex, Cursor, Pi y orx de OpenResearch, intentaron reproducir afirmación por afirmación los artículos aceptados en la ICML 2026.
Durante los 19 días que duró el evento, los participantes publicaron 6.816 bitácoras (logbooks) en Trackio y sometieron a prueba 2.226 de los 6.352 artículos aceptados, es decir, cerca de un tercio de la conferencia. Cada bitácora se publicó como página estática de Hugging Face Space con el código ejecutado, los resultados y, opcionalmente, el registro completo de la actividad del agente. Los participantes recibieron 20 dólares en créditos para ejecutar sus experimentos en Hugging Face Jobs; se lanzaron 2.962 tareas en la nube.
¿Por qué es importante?
A ICML 2026 se enviaron 23.918 artículos, de los cuales 6.352 fueron aceptados, casi el doble que el año anterior. Los organizadores atribuyen en parte el aumento a los agentes de IA, que aceleran la ejecución y redacción de experimentos. Como los revisores voluntarios no crecieron igual, durante el hackathon apareció un artículo premiado con spotlight pese a que un revisor admitió no haber revisado bien las pruebas.
Un sistema automático, "Logbook Judge", basado en el modelo de pesos abiertos GLM-5.2, releyó y verificó cada bitácora afirmación por afirmación. Cada afirmación se marcaba como verificada, refutada, confirmada a escala reducida (con datos limitados) o no concluyente. El sistema fue diseñado para no confiar en la autoevaluación de cada bitácora. En total se examinaron 35.908 afirmaciones de esta manera y se publicaron 274 registros completos de actividad de agentes como conjunto de datos.
¿Cómo se distribuyeron los resultados?
Los resultados de verificación agrupados por artículo pueden resumirse así:
| Categoría | Número de artículos | Proporción |
|---|---|---|
| Al menos una afirmación verificada | 1.103 | 51% |
| Todas las afirmaciones verificadas (reproducción completa) | 266 | - |
| Verificado parcialmente, ninguna refutada | 632 | - |
| Al menos una afirmación refutada/controvertida | 496 | 23% |
| Todas las afirmaciones refutadas | 49 | - |
| Equipos distintos llegaron a resultados opuestos | 242 | - |
| Solo evidencia a escala reducida | 502 | - |
| No concluyente | 280 | - |
En total, 3.978 afirmaciones se verificaron mediante experimentos reales. "Flat Minima and Generalization: Insights from Stochastic Convex Optimization" recibió intentos de reproducción de 20 equipos, y 12 verificaron todas las afirmaciones. En "A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness", 14 de 17 bitácoras confirmaron todas las afirmaciones.
¿Qué artículos fueron refutados?
35 participantes informaron de una refutación formal; Hugging Face verificó todas revisando de nuevo el artículo, la bitácora y la derivación matemática. Tres ejemplos destacados:
- "Towards Optimal Robustness in Learning-Augmented Paging": el artículo afirmaba que su algoritmo lograba una robustez de H_k + O(1). La bitácora de un participante detectó que el término adicional en realidad crecía a un ritmo de 0,38 ln k y encontró en qué paso fallaba la demostración; la prueba ampliada por Hugging Face hasta k=1.024 confirmó ese crecimiento con una confianza de casi nueve sigma.
- "Attention's forward pass and Frank-Wolfe": el artículo demostraba que los fragmentos de tokens colapsaban al origen bajo ciertas condiciones. Tres equipos independientes hallaron contraejemplos en los pasos 224, aproximadamente 3.800 y 6.416 respectivamente, lo que explica por qué otros equipos la habían "verificado": sus pruebas de horizonte limitado se detenían antes. Los autores confirmaron el hallazgo el mismo día y están trabajando en una corrección.
- "Self-Distillation Enables Continual Learning": la sección teórica del artículo se basaba en la divergencia de Kullback-Leibler inversa (reverse KL), pero la configuración predeterminada del código publicado calculaba la divergencia KL directa (forward KL). La bitácora que hizo la refutación no logró reproducir el resultado destacado de +4 puntos del artículo ni siquiera usando el propio código y datos de los autores. Los autores subieron una versión actualizada a arXiv.
¿Qué sigue?
Hugging Face compartió públicamente el conjunto de datos de 35.908 afirmaciones recopiladas durante el hackathon, junto con todas las bitácoras. El equipo señala que el papel de los agentes de verificación automática en la revisión científica seguirá creciendo y que este tipo de reproducción colectiva podría repetirse en otras conferencias. No anunció cuáles ni cuándo.