¿Qué pasó?
Z.ai anunció el 14 de agosto de 2026 su nuevo modelo de inteligencia artificial llamado GLM-5.3. En lugar de reentrenar el modelo, la empresa utilizó el mismo modelo base de 743.000 millones de parámetros de GLM-5.2 y atribuyó todo el aumento de rendimiento al proceso de escalado post-entrenamiento (post-training scaling). Z.ai señaló que en este proceso aplicó más entornos de tareas, tipos de entornos más diversos y un entrenamiento más prolongado.
En las pruebas de programación, el mayor salto se observó en tareas de largo horizonte (long-horizon). La puntuación de Terminal-Bench 3.0 subió de 4,6 a 28,3, DeepSWE v1.1 pasó de 46,2 a 66,9, y Agents' Last Exam (CLI) aumentó de 23,8 a 28,5. En la evaluación GDPval-AA v2, que abarca 44 profesiones, el modelo obtuvo 1.769 puntos. En su propia evaluación interna, Z.ai Code Bench, la empresa reportó una mejora del 50% respecto a GLM-5.2.
Un avance inesperado en ciberseguridad
Z.ai explicó que el resultado en el área de ciberseguridad no estaba planificado. La empresa había añadido datos de descubrimiento de vulnerabilidades únicamente para mejorar el razonamiento sobre vulnerabilidades aisladas, pero a medida que se escaló el entrenamiento, la capacidad del modelo aumentó de forma exponencial. El modelo comenzó a generar planes coherentes a lo largo de cadenas completas de explotación (exploitation).
En CyberGym, que evalúa el descubrimiento y verificación de vulnerabilidades a partir de código fuente en caja blanca (white-box), la puntuación subió del 77,2% al 84,5%, superando a Mythos 5 (83,8%) y GPT-5.6 Sol (83,6%). En ExploitBench, que requiere análisis de causa raíz y explotación funcional, la puntuación pasó del 24,4% al 54,4%, aunque Mythos 5 se mantuvo por delante con un 78,0%.
Lo que se sabe
- GLM-5.3 ya está disponible a través de Z.ai API, GLM Coding Plan y ZCode.
- Los pesos del modelo aún no se han publicado; se planea liberarlos en aproximadamente dos semanas, tras completar la evaluación de seguridad y el endurecimiento.
- En la prueba ExploitGym, GLM-5.3 completó 105 tareas en dos horas y 130 en seis horas; GLM-5.2 solo logró 29 y 39 tareas en los mismos tiempos.
- Mythos 5 sigue liderando en ExploitGym con 181 tareas en dos horas y 247 en seis horas.
¿Por qué importa?
El enfoque de Z.ai demuestra que se pueden lograr avances significativos de capacidad solo con el proceso post-entrenamiento, sin reentrenar el modelo base. Esto llama la atención como un método que podría reducir los costos de desarrollo de modelos. Sin embargo, el avance no intencional en ciberseguridad también plantea la necesidad de políticas y evaluación de riesgos para la comunidad de seguridad.
La empresa señala que sectores como herramientas para desarrolladores, infraestructura en la nube, seguridad de aplicaciones, fintech e ingeniería de comercio electrónico pueden beneficiarse del modelo. Se recomienda que las organizaciones con normas de localización de datos o auditoría de proveedores esperen a la publicación de los pesos.
Tabla comparativa
| Prueba | GLM-5.2 | GLM-5.3 | Modelo competidor |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 | 28,3 | — |
| DeepSWE v1.1 | 46,2 | 66,9 | — |
| CyberGym | 77,2% | 84,5% | Mythos 5: 83,8% |
| ExploitBench | 24,4% | 54,4% | Mythos 5: 78,0% |
¿Qué sigue?
Z.ai planea publicar los pesos del modelo de GLM-5.3 una vez completados los procesos de evaluación de seguridad y endurecimiento, aproximadamente dos semanas después del anuncio. La empresa indicó que todos los resultados de las mediciones están documentados en el anuncio junto con el entorno de ejecución (harness), la longitud de contexto y los ajustes de muestreo utilizados.