GLM-4.7 es el modelo GLM que convirtió la programación en la capacidad estrella de la familia. Llegó con generación de código mejorada, razonamiento multipaso estable, mejor gestión de tareas de agentes complejas, un diálogo más natural y una estética de front-end visiblemente mejor; esto último importa más de lo que parece, porque un modelo que escribe código de interfaz creíble ahorra una categoría de trabajo manual que los benchmarks puramente de back-end nunca capturan.
Se sitúa justo antes de la serie 5 en el linaje, y buena parte de lo que se elogia de la serie 5 empezó como una mejora de 4.7. Es también la generación que produjo el nivel GLM-4.7-Flash de 30B, que sigue siendo la respuesta de la familia para equipos que necesitan un modelo realmente pequeño sin salir de la misma licencia MIT y los mismos alojamientos de pesos. Leídos en conjunto, los dos lanzamientos 4.7 son el punto en que la familia dejó de ser una línea de investigación interesante y pasó a ser algo que podías poner razonablemente detrás de un producto.
Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.
La respuesta aparecerá aquí...
Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.
La mayoría de evaluaciones de programación miden si un parche hace pasar un test. Eso deja fuera toda una categoría de trabajo: producir código de interfaz que una persona acepte sin reescribirlo. Un layout que se sostiene, espaciados sensatos, componentes que siguen las convenciones del framework en uso; todo eso se juzga visualmente, no con un runner de tests, y un modelo que lo hace mal genera trabajo en lugar de ahorrarlo. La mejora de GLM-4.7 en ese terreno, junto con su diálogo más natural, lo hizo utilizable como compañero diario para trabajo de aplicación y no solo para tareas algorítmicas aisladas. Esa misma generación también afinó el razonamiento multipaso estable, que es lo que permitió a la línea GLM-5 concentrarse en la longitud del horizonte en vez de en la fiabilidad básica de ejecución.
La tabla comparativa publicada cubre GLM-5.2 y GLM-5.1. La columna inferior es la de GLM-5.1, el punto de referencia publicado más próximo a la generación posterior a GLM-4.7. No se ha publicado ninguna columna de benchmarks para GLM-4.7.
No existe fila de GLM-4.7 en el conjunto de comparación publicado, así que aquí no se cita ninguna. La columna de referencia muestra lo que logró la generación siguiente en programación: 58.4 en SWE-bench Pro, 50.9 en ProgramBench y 42.7 en NL2Repo para GLM-5.1, frente a 62.1, 63.7 y 48.9 de GLM-5.2. Si necesitas rendimiento de programación medido y no posicionamiento, esas son las dos columnas que merece la pena leer.
Comparación en ProgramBench, según los autores del modelo.
ProgramBench es la evaluación publicada más cercana a la fortaleza declarada de GLM-4.7. La frontera lidera (Claude Opus 4.8 con 71.9 y GPT-5.5 con 70.8), con GLM-5.2 en 63.7, GLM-5.1 en 50.9 y DeepSeek-V4-Pro en 47.8. El campo de pesos abiertos abarca más de quince puntos en esta fila, un recordatorio útil de que «modelo abierto» no es un nivel de rendimiento: el lanzamiento concreto que elijas importa mucho más que la licencia que lleve.
GLM-4.7 sigue a GLM-4.5-Air y precede a GLM-5. Su hermano ligero, GLM-4.7-Flash, es un modelo de 30B de la misma generación, y toda la línea converge hoy en GLM-5.2. Si estás eligiendo ahora un modelo GLM para trabajo de programación, el buque insignia incorpora todas las mejoras de la generación 4.7 más la ventana de contexto de 1M y una columna de benchmarks publicada. La forma útil de entender el linaje es que la capacidad se acumuló mientras la licencia se mantenía constante: todo lo que va del nivel 4.5 hacia arriba es MIT con pesos en los mismos alojamientos públicos, así que subir en la familia es una decisión de cómputo y nunca una decisión legal.
El buque insignia con contexto de 1M tokens. Es el estado del arte de código abierto en programación y evaluaciones de largo recorrido, con niveles de esfuerzo explícitos Non-Thinking, High y Max.
El nivel ligero de 30B. Eficiente y lo bastante rápido para inferencia local, y según lo publicado supera a modelos abiertos de escala similar.
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.