¿Qué ocurrió?
La empresa china de inteligencia artificial Z.ai anunció el 14 de agosto de 2026 su nuevo modelo de lenguaje GLM-5.3. El modelo utiliza la misma arquitectura base que GLM-5.2 (743 mil millones de parámetros); las mejoras se lograron íntegramente mediante escalado posterior al entrenamiento (post-training scaling). Según lo compartido en X por Lou, representante de desarrolladores de Z.ai, GLM-5.3 detectó rápidamente una vulnerabilidad 'potencialmente grave' en Cursor, la startup de programación adquirida por SpaceX.
Por ahora, el modelo solo es accesible a través del GLM Coding Plan de Z.ai y del entorno de programación ZCode. La empresa indicó que el acceso vía API y los pesos abiertos se ofrecerán tras completarse las evaluaciones de seguridad, aproximadamente dos semanas después del lanzamiento.
¿Por qué es importante?
Z.ai señaló que durante el entrenamiento las capacidades de ciberseguridad de GLM-5.3 evolucionaron más rápido de lo esperado. Según la propia empresa, el modelo progresó desde la detección de fallos hasta la construcción de cadenas de explotación (exploitation chains) completas. Esto plantea una tensión: las capacidades de agentes de largo alcance (long-horizon agent capabilities) resultan útiles para la ingeniería de software, pero esas mismas capacidades podrían emplearse en operaciones de seguridad ofensiva.
Según datos proporcionados por Z.ai, el trabajo conjunto con equipos de seguridad en China arrojó 2.436 hallazgos de vulnerabilidades en 269 proyectos, tras revisión de expertos, filtrado y depuración. De estos, 1.097 se clasificaron como críticos o de alta severidad; 53 se divulgaron públicamente y 2.383 permanecían bajo embargo en la fecha de publicación.
Resultados de benchmarks
| Prueba | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4,6 | 28,3 |
| DeepSWE v1.1 | 46,2 | 66,9 |
| AutomationBench | 26,2 | 48,2 |
| CyberGym | 77,2 % | 84,5 % |
| ExploitBench | 24,4 % | 54,4 % |
Según las propias comparaciones de Z.ai, GLM-5.3 queda por detrás de rivales como GPT-5.6 Sol y Claude Fable 5 en algunas pruebas, aunque en su métrica interna Code Bench alcanzó una mayor tasa de finalización de tareas consumiendo menos tokens. Cabe destacar que estos resultados fueron reportados por la propia empresa y no han sido verificados de forma independiente.
¿Qué sigue?
- Se espera que los pesos del modelo se publiquen en código abierto tras completarse las evaluaciones de seguridad, unas dos semanas después del lanzamiento.
- Z.ai está implementando un mecanismo de control llamado 'acceso confiable' (trusted access) para las capacidades más avanzadas.
- Los desarrolladores que usan las aplicaciones actuales de GLM deberán actualizar sus llamadas a la API, ya que no podrán desactivar el parámetro 'thinking' antes de migrar a GLM-5.3.
- Cursor aún no ha compartido públicamente una confirmación oficial sobre la vulnerabilidad reportada.