Z.ai desarrolló GLM-5.3 para resolver tareas de programación cada vez más complejas, pero el entrenamiento también disparó sus capacidades para detectar y explotar vulnerabilidades. El salto llevó a la compañía china a retrasar la publicación de los pesos del modelo por razones de seguridad.
La evolución de los modelos de inteligencia artificial vuelve a mostrar una característica cada vez más relevante: una capacidad desarrollada para un objetivo puede terminar potenciando otras habilidades no previstas originalmente. Es lo que ocurrió con GLM-5.3, el nuevo modelo de Z.ai, que fue entrenado principalmente para mejorar su desempeño en programación y tareas agénticas, pero que también registró un salto considerable en ciberseguridad.
El caso resulta particularmente significativo porque la mejora no provino de crear un modelo específicamente orientado a seguridad informática. Z.ai utilizó el mismo modelo base de GLM-5.2 y amplió su post-entrenamiento, sometiéndolo a entornos de programación más extensos, variados y realistas.
El resultado fue un modelo mucho más competente para trabajar durante períodos prolongados con código y herramientas. Y, como efecto colateral, también mejoró de manera importante su capacidad para encontrar vulnerabilidades y avanzar en cadenas de explotación.
Un salto importante sin cambiar el modelo base
Una de las particularidades de GLM-5.3 es que Z.ai no necesitó desarrollar una arquitectura completamente nueva para conseguir la mejora.
El modelo parte de la misma base de GLM-5.2, con una arquitectura Mixture of Experts (MoE) de unos 743.000 millones de parámetros. La diferencia está principalmente en el entrenamiento posterior: más tareas, más entornos ejecutables y procesos de aprendizaje por refuerzo orientados a resolver trabajos complejos durante períodos prolongados.
Esta estrategia, que Z.ai denomina environment scaling, busca que el modelo aprenda no solamente a responder una consulta, sino a desarrollar una tarea completa, ejecutar código, detectar errores, corregirlos y continuar trabajando.
En programación, esto significa pasar de pedirle a una IA que escriba una función concreta a darle un proyecto más complejo y permitirle trabajar de manera relativamente autónoma.
Y esa capacidad de razonamiento secuencial terminó teniendo una consecuencia inesperada en seguridad informática.
La ciberseguridad fue el gran salto
Los resultados difundidos por Z.ai muestran una diferencia particularmente marcada entre GLM-5.2 y GLM-5.3.
En CyberGym, una prueba orientada a determinar si un modelo puede analizar código, encontrar vulnerabilidades y confirmar que son reales, GLM-5.3 alcanzó 84,5%, frente al 77,2% de su antecesor.
Pero el salto fue todavía mayor en ExploitBench, que evalúa una etapa más avanzada: transformar una vulnerabilidad identificada en una explotación funcional.
Allí GLM-5.3 pasó del 24,4% al 54,4%. Es decir, más que duplicó su rendimiento respecto de GLM-5.2.
La diferencia permite entender por qué el desarrollo llamó la atención del sector: el modelo no solamente se volvió mejor para detectar errores en software, sino también para razonar sobre cómo aprovecharlos.
Todavía por detrás de los modelos más avanzados
El salto no significa que GLM-5.3 haya superado a los mejores modelos especializados en todas las tareas de ciberseguridad.
La comparación con Mythos 5, un modelo de Anthropic con capacidades de ciberseguridad y acceso restringido, muestra una fotografía más matizada.
En CyberGym, GLM-5.3 obtuvo el 84,5%, ligeramente por encima del 83,8% reportado para Mythos 5. Pero en ExploitBench quedó bastante más atrás: 54,4% contra 78%.
Algo similar ocurre en las pruebas de desarrollo de exploits. Con un presupuesto normalizado de dos horas, GLM-5.3 completó 105 tareas en ExploitGym, mientras que Mythos 5 alcanzó 181.
Además, las cifras fueron difundidas por Z.ai y no fueron verificadas de manera independiente, por lo que las comparaciones deben tomarse como resultados declarados por la compañía.
La paradoja: una IA mejor programando también puede atacar mejor
El caso de GLM-5.3 ilustra uno de los principales desafíos de la evolución de los modelos agénticos.
Un sistema capaz de trabajar durante más tiempo sobre código necesita desarrollar capacidades como planificación, depuración, uso de herramientas, identificación de errores y adaptación ante resultados inesperados.
Esas mismas capacidades pueden resultar extremadamente útiles en ciberseguridad.
Un modelo que aprende a localizar un error en un programa puede utilizar ese conocimiento para ayudar a un desarrollador a corregirlo. Pero, si adquiere además la capacidad de desarrollar una cadena de explotación, esa misma tecnología puede utilizarse para intentar comprometer un sistema.
Es el clásico problema de doble uso de la inteligencia artificial: una misma capacidad puede beneficiar a defensores y atacantes.
Z.ai decidió retrasar los pesos
La evolución de GLM-5.3 llevó a Z.ai a modificar su estrategia de lanzamiento.
La compañía había previsto publicar los pesos del modelo, pero decidió retrasar su disponibilidad general para completar evaluaciones de seguridad y reforzar los mecanismos de protección. El lanzamiento se realizará de manera escalonada y las funciones más sensibles de ciberseguridad quedarán inicialmente restringidas mediante un sistema de acceso para usuarios verificados.
La decisión resulta llamativa porque los modelos de pesos abiertos permiten que empresas y desarrolladores descarguen el sistema y lo ejecuten sobre su propia infraestructura, sin depender necesariamente de una API externa.
Una vez publicados los pesos, sin embargo, el fabricante pierde buena parte del control sobre cómo se utiliza el modelo, cómo se modifica y con qué herramientas se combina.
Ese es precisamente uno de los motivos por los que la publicación se está tratando con mayor cautela.
Una oportunidad para la ciberseguridad latinoamericana
El desarrollo también tiene implicancias para América Latina, donde empresas, organismos públicos y universidades enfrentan una creciente necesidad de automatizar tareas de seguridad informática con presupuestos generalmente más limitados que los de grandes compañías tecnológicas internacionales.
Un modelo capaz de analizar grandes cantidades de código, identificar vulnerabilidades y asistir en auditorías podría convertirse en una herramienta útil para automatizar revisiones de seguridad, detectar fallas en software y acelerar tareas de respuesta ante incidentes.
Pero el acceso a modelos cada vez más capaces también eleva la exigencia de protección. La disponibilidad de sistemas capaces de encontrar vulnerabilidades a gran escala puede reducir el costo y el tiempo necesarios para realizar determinadas operaciones ofensivas.
Por eso, el desafío para los desarrolladores latinoamericanos no será solamente incorporar IA a la ciberseguridad, sino hacerlo dentro de esquemas de gobernanza, control de acceso, auditoría y supervisión humana.
El nuevo límite de la IA ya no es sólo programar
GLM-5.3 deja una señal importante para la industria: mejorar el razonamiento de una IA sobre tareas complejas puede producir capacidades emergentes en otros dominios.
Z.ai quería conseguir un modelo mejor programando. En el proceso obtuvo un sistema mucho más competente para analizar vulnerabilidades y desarrollar exploits.
La compañía ahora debe resolver el segundo problema que generó su propio avance: cómo poner una tecnología cada vez más potente a disposición de desarrolladores y defensores sin facilitar, al mismo tiempo, su utilización con fines ofensivos.
Ese equilibrio entre apertura, innovación y seguridad será uno de los principales debates de la próxima generación de modelos de inteligencia artificial. Y GLM-5.3 acaba de convertirse en uno de sus casos más interesantes.
