Z.ai entrenó GLM-5.3 para programar mejor. El modelo aprendió de paso a ser mucho mejor en ciberseguridad
La empresa Z.ai ha logrado un avance significativo en el campo de la inteligencia artificial con su modelo GLM-5.3, diseñado inicialmente para mejorar la programación, pero que ha demostrado un potencial inesperado en el ámbito de la ciberseguridad. Este modelo no solo escribe código con mayor precisión, sino que también ha mejorado notablemente en la identificación y explotación de vulnerabilidades.
GLM-5.3 no se basa en un nuevo modelo de inteligencia artificial, sino que es una evolución de su predecesor, GLM-5.2. Las mejoras se deben al post-entrenamiento, donde Z.ai amplió los entornos y diversificó las tareas, dedicando más recursos de cómputo para entrenar al sistema en trabajos complejos. Este enfoque ha permitido que el modelo no solo detecte vulnerabilidades, sino que también intente explotarlas, superando las expectativas de la propia compañía.
El modelo ha sido probado en varios entornos, como CyberGym, ExploitBench y ExploitGym, donde ha demostrado una mejora significativa respecto a GLM-5.2. En CyberGym, pasó de un 77,2% a un 84,5% de éxito, mientras que en ExploitBench avanzó de un 24,4% a un 54,4%. En ExploitGym, completó 105 tareas con un presupuesto normalizado de dos horas, mucho más que las 29 tareas logradas por su predecesor.
Comparado con Mythos 5 de Anthropic, GLM-5.3 muestra un rendimiento competitivo en las primeras fases del análisis de vulnerabilidades, aunque todavía queda por detrás en la conversión de estas en ataques funcionales. Sin embargo, Z.ai ha llevado parte de este trabajo más allá de los benchmarks, colaborando con equipos de seguridad para identificar miles de vulnerabilidades en proyectos reales.
El avance de GLM-5.3 no solo es un hito tecnológico, sino que también acorta la brecha entre los modelos de inteligencia artificial abiertos y cerrados. Según el UK AI Security Institute, GLM-5.2 ya era el modelo open-weight más capaz en ciberseguridad, y se espera que GLM-5.3 continúe esta tendencia, acercando capacidades avanzadas a modelos descargables.