GLM-5 es el lanzamiento que abrió la generación actual de la familia de modelos GLM. Llegó con fundamentos de programación notablemente más sólidos que la línea 4.x, una ejecución multipaso más fiable y un comportamiento claramente mejor en tareas de agentes complejas, donde un plan tiene que sobrevivir al contacto con la salida real de las herramientas. Todo aquello por lo que hoy se conoce a la serie 5 (razonamiento de largo recorrido, ingeniería agéntica y pesos abiertos bajo MIT) empieza aquí.
Como los autores del modelo solo publican su tabla comparativa completa para GLM-5.2 y GLM-5.1, GLM-5 no tiene columna de benchmarks propia. Esta página es honesta al respecto: te ofrece la ficha técnica y el posicionamiento publicados, más la columna de referencia publicada más cercana, en lugar de inventar cifras. Si necesitas puntuaciones concretas para decidir, la página del buque insignia es el sitio adecuado.
Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.
La respuesta aparecerá aquí...
Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.
El paso de la línea 4.x a GLM-5 tuvo que ver con la fiabilidad más que con la capacidad de titular. La ejecución multipaso es la parte del trabajo agéntico que decide en silencio si una ejecución termina: un modelo que razona de maravilla pero se salta un paso, olvida una restricción o repite trabajo ya hecho no sobrevive a una trayectoria de cincuenta turnos. GLM-5 afinó ese comportamiento, y lo hizo junto a una mejor programación y una mejor gestión de tareas de agentes complejas, razón por la que los dos lanzamientos posteriores pudieron centrarse en la longitud del horizonte y no en la fiabilidad básica. Lee la serie 5 como tres movimientos: GLM-5 hizo fiables las trayectorias largas, GLM-5.1 las hizo largas y GLM-5.2 las hizo larguísimas al reconstruir el stack de atención en torno a un indexador compartido.
La tabla comparativa publicada cubre GLM-5.2 y GLM-5.1. La columna inferior es la de GLM-5.1, el punto de referencia publicado más próximo a la generación de GLM-5. No se ha publicado ninguna columna de benchmarks para GLM-5 y aquí no se inventa ninguna.
Toma la columna anterior como una comprobación de cota superior y no como una puntuación de GLM-5. Muestra dónde aterrizó la generación inmediatamente posterior: 95.3 en AIME 2026, 86.2 en GPQA-Diamond, 71.8 en MCP-Atlas y 58.4 en SWE-bench Pro, con las filas de largo recorrido todavía flojas. Si eliges entre modelos GLM por rendimiento medido, las dos únicas opciones con columnas publicadas son GLM-5.2 y GLM-5.1, y GLM-5.2 gana todas las filas de ese enfrentamiento directo.
Comparación en Terminal-Bench 2.1 (Terminus-2), según los autores del modelo.
El gráfico sigue la trayectoria de la serie 5 frente al campo de pesos abiertos en Terminal-Bench 2.1: GLM-5.1 con 63.5 y MiniMax M3 con 65.0 se sitúan en la misma banda, Qwen3.7-Max alcanza 75.0 y GLM-5.2 despega con 81.0. GLM-5 es anterior a todas estas mediciones, así que su lugar en esa curva se infiere del posicionamiento y no de una medición, otra razón para pasar a la página del buque insignia si necesitas una cifra que puedas defender en una revisión de diseño.
GLM-5 sigue a GLM-4.7 y precede a GLM-5-Turbo, GLM-5.1 y GLM-5.2. Su descendiente directo en espíritu es GLM-5-Turbo, que tomó la misma base y la ajustó para escenarios de agentes dinámicos y de cadena larga. Para trabajo en producción hoy, la familia te dirige a GLM-5.2; GLM-5 importa sobre todo como el punto en el que se fijaron las decisiones de diseño de la generación actual.
El buque insignia con contexto de 1M tokens. Es el estado del arte de código abierto en programación y evaluaciones de largo recorrido, con niveles de esfuerzo explícitos Non-Thinking, High y Max.
Un modelo base de la serie 5 ajustado para escenarios de agentes dinámicos y de cadena larga, donde el plan cambia una y otra vez y la trayectoria debe seguir siendo ejecutable.
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.