GLM-5.1 — El modelo GLM de largo recorrido anterior a 5.2

GLM-5.1 es el modelo GLM que convirtió el trabajo de largo recorrido en una propuesta seria para los pesos abiertos. Llegó con un contexto de 200.000 tokens, ejecución autónoma de varias horas y entregables de calidad de ingeniería en un momento en que la mayoría de modelos abiertos aún se juzgaban por tareas de un solo archivo. Es también el único otro modelo GLM con una columna de benchmarks publicada al completo, lo que lo convierte en la referencia con la que se cita cada mejora de GLM-5.2.

Leer la columna de GLM-5.1 es la forma más rápida de entender qué cambió realmente la generación siguiente. Donde GLM-5.1 registra 63.5 en Terminal-Bench 2.1, 58.4 en SWE-bench Pro y 30.5 en FrontierSWE Dominance, GLM-5.2 registra 81.0, 62.1 y 74.4. La brecha es desigual a propósito: la programación estándar avanzó unos pocos puntos, la ejecución agéntica de largo recorrido avanzó decenas. Todas estas cifras son las publicadas por los autores del modelo.

200K
tokens de contexto
el techo que GLM-5.2 elevó después a un millón
63.5
Terminal-Bench 2.1
publicado para GLM-5.1 con el harness Terminus-2
30.5
FrontierSWE Dominance
frente al 74.4 de GLM-5.2 en la misma evaluación

Playground de IA gratuito — prueba un LLM de código abierto en vivo

Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.

La respuesta aparecerá aquí...

Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.

Qué abarca una ventana de contexto de 200K

Doscientos mil tokens bastan para un servicio sustancial, sus tests y una conversación larga sobre ellos: aproximadamente el conjunto de trabajo de una funcionalidad acotada, no de un monorepo entero. En la práctica eso significa que GLM-5.1 gestiona con comodidad trabajo agéntico bien delimitado y empieza a necesitar una capa de recuperación cuando una tarea abarca muchos módulos. Es también la ventana en la que el diseño anterior de predicción multi-token chocaba con un desajuste de KV-cache entre entrenamiento e inferencia, que limitaba la longitud de aceptación del decodificado especulativo a 4.56; eliminar ese desajuste es una de las cosas concretas que corrigió la siguiente generación. Si tu carga de trabajo cabe en 200K tokens, GLM-5.1 sigue siendo un modelo GLM capaz y totalmente abierto; si no cabe, el salto a la ventana de 1M es justamente la razón de ser de GLM-5.2.

Ventana de contexto
200.000 tokens
Licencia
Código abierto MIT
Niveles de esfuerzo
Introducidos en GLM-5.2
Terminal-Bench 2.1
63.5 (Terminus-2)
Alojamiento de pesos
HuggingFace · ModelScope

Resultados de benchmarks de GLM-5.1

Puntuaciones publicadas por los autores del modelo.

La columna publicada de GLM-5.1 es respetable en razonamiento y programación de longitud media: 95.3 en AIME 2026, 86.2 en GPQA-Diamond, 83.8 en IMOAnswerBench, 71.8 en el conjunto público de MCP-Atlas y 58.4 en SWE-bench Pro. Donde se le nota la falta de margen es en el trabajo de horizonte ultralargo: 30.5 en FrontierSWE Dominance, 20.1 en PostTrainBench y 1.0 en SWE-Marathon. Esas tres filas son precisamente las cargas para las que se entrenó la generación siguiente, y por eso allí las diferencias son mucho mayores que en las evaluaciones estándar de programación.

Ver los 17 benchmarks de GLM en detalle →

Cómo se compara GLM-5.1

Comparación en Terminal-Bench 2.1 (Terminus-2), según los autores del modelo.

En Terminal-Bench 2.1 con el harness Terminus-2, el 63.5 de GLM-5.1 queda por debajo del 75.0 de Qwen3.7-Max y más o menos a la par del 64.0 de DeepSeek-V4-Pro, mientras que GLM-5.2 despega en el campo abierto con 81.0 y Claude Opus 4.8 lidera con 85.0. Leído como linaje, el gráfico muestra a toda una generación de modelos abiertos agrupada en los sesenta bajos y un lanzamiento saliendo de esa banda, que es el argumento más claro para tomar GLM-5.2, y no GLM-5.1, como la referencia actual de pesos abiertos.

Leer la comparativa completa GLM-5.2 vs GLM-5.1 →

Dónde encaja GLM-5.1 en la gama de modelos GLM

GLM-5.1 llegó tras GLM-5 y GLM-5-Turbo y fue sucedido por GLM-5.2. Es el último modelo GLM sin niveles de esfuerzo explícitos, así que cualquier cosa que construyas sobre él gasta una cantidad fija de cómputo por tarea en lugar de permitirte ajustar el equilibrio por petición. Sigue siendo una opción sensata cuando quieres una huella de memoria menor y más predecible que la del buque insignia con contexto de 1M y tus tareas caben realmente en 200K tokens.

Más modelos GLM

Ver todo

Preguntas frecuentes sobre GLM-5.1

¿Qué es el modelo GLM-5.1?
GLM-5.1 es el anterior buque insignia de la familia de modelos GLM: un modelo de pesos abiertos con licencia MIT y contexto de 200.000 tokens, creado para el razonamiento de largo recorrido y el trabajo de ingeniería autónomo de varias horas. Es uno de los dos únicos modelos GLM con una columna de benchmarks publicada completa, junto con GLM-5.2.
¿Cuánto mejor es GLM-5.2 que GLM-5.1?
Depende por completo de la evaluación. En programación estándar la diferencia es moderada: SWE-bench Pro pasa de 58.4 a 62.1. En trabajo agéntico de largo recorrido es enorme: FrontierSWE Dominance de 30.5 a 74.4, DeepSWE de 18.0 a 46.2 y SWE-Marathon de 1.0 a 13.0. GLM-5.2 gana todas las filas de la tabla comparativa publicada.
¿Cuál es el tamaño de la ventana de contexto de GLM-5.1?
200.000 tokens, y GLM-5.2 elevó después el techo a un sólido 1.000.000. Para buena parte de la programación agéntica es suficiente, pero el análisis de un repositorio completo y los ciclos de investigación de horas son justo donde la ventana más pequeña empieza a forzar truncados o recuperación.
¿Sigue siendo GLM-5.1 de código abierto?
Sí. GLM-5.1 sigue siendo un modelo GLM de pesos abiertos con licencia MIT publicado en HuggingFace y ModelScope. Que quede superado no retira el lanzamiento: los pesos que ya has descargado siguen siendo utilizables indefinidamente, una de las ventajas prácticas de los pesos abiertos frente a una API alojada.
¿Hay alguna razón para seguir usando GLM-5.1?
Sí, si tus tareas caben en 200K tokens y quieres una huella de servicio menor. Una ventana de 200K cuesta muchísima menos memoria de KV-cache que una de un millón, y para trabajo bien delimitado la diferencia publicada en evaluaciones estándar de programación es de solo unos puntos. Para agentes de largo recorrido, usa GLM-5.2.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.