GLM-5.1 es el modelo GLM que convirtió el trabajo de largo recorrido en una propuesta seria para los pesos abiertos. Llegó con un contexto de 200.000 tokens, ejecución autónoma de varias horas y entregables de calidad de ingeniería en un momento en que la mayoría de modelos abiertos aún se juzgaban por tareas de un solo archivo. Es también el único otro modelo GLM con una columna de benchmarks publicada al completo, lo que lo convierte en la referencia con la que se cita cada mejora de GLM-5.2.
Leer la columna de GLM-5.1 es la forma más rápida de entender qué cambió realmente la generación siguiente. Donde GLM-5.1 registra 63.5 en Terminal-Bench 2.1, 58.4 en SWE-bench Pro y 30.5 en FrontierSWE Dominance, GLM-5.2 registra 81.0, 62.1 y 74.4. La brecha es desigual a propósito: la programación estándar avanzó unos pocos puntos, la ejecución agéntica de largo recorrido avanzó decenas. Todas estas cifras son las publicadas por los autores del modelo.
Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.
La respuesta aparecerá aquí...
Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.
Doscientos mil tokens bastan para un servicio sustancial, sus tests y una conversación larga sobre ellos: aproximadamente el conjunto de trabajo de una funcionalidad acotada, no de un monorepo entero. En la práctica eso significa que GLM-5.1 gestiona con comodidad trabajo agéntico bien delimitado y empieza a necesitar una capa de recuperación cuando una tarea abarca muchos módulos. Es también la ventana en la que el diseño anterior de predicción multi-token chocaba con un desajuste de KV-cache entre entrenamiento e inferencia, que limitaba la longitud de aceptación del decodificado especulativo a 4.56; eliminar ese desajuste es una de las cosas concretas que corrigió la siguiente generación. Si tu carga de trabajo cabe en 200K tokens, GLM-5.1 sigue siendo un modelo GLM capaz y totalmente abierto; si no cabe, el salto a la ventana de 1M es justamente la razón de ser de GLM-5.2.
Puntuaciones publicadas por los autores del modelo.
La columna publicada de GLM-5.1 es respetable en razonamiento y programación de longitud media: 95.3 en AIME 2026, 86.2 en GPQA-Diamond, 83.8 en IMOAnswerBench, 71.8 en el conjunto público de MCP-Atlas y 58.4 en SWE-bench Pro. Donde se le nota la falta de margen es en el trabajo de horizonte ultralargo: 30.5 en FrontierSWE Dominance, 20.1 en PostTrainBench y 1.0 en SWE-Marathon. Esas tres filas son precisamente las cargas para las que se entrenó la generación siguiente, y por eso allí las diferencias son mucho mayores que en las evaluaciones estándar de programación.
Comparación en Terminal-Bench 2.1 (Terminus-2), según los autores del modelo.
En Terminal-Bench 2.1 con el harness Terminus-2, el 63.5 de GLM-5.1 queda por debajo del 75.0 de Qwen3.7-Max y más o menos a la par del 64.0 de DeepSeek-V4-Pro, mientras que GLM-5.2 despega en el campo abierto con 81.0 y Claude Opus 4.8 lidera con 85.0. Leído como linaje, el gráfico muestra a toda una generación de modelos abiertos agrupada en los sesenta bajos y un lanzamiento saliendo de esa banda, que es el argumento más claro para tomar GLM-5.2, y no GLM-5.1, como la referencia actual de pesos abiertos.
GLM-5.1 llegó tras GLM-5 y GLM-5-Turbo y fue sucedido por GLM-5.2. Es el último modelo GLM sin niveles de esfuerzo explícitos, así que cualquier cosa que construyas sobre él gasta una cantidad fija de cómputo por tarea en lugar de permitirte ajustar el equilibrio por petición. Sigue siendo una opción sensata cuando quieres una huella de memoria menor y más predecible que la del buque insignia con contexto de 1M y tus tareas caben realmente en 200K tokens.
El buque insignia con contexto de 1M tokens. Es el estado del arte de código abierto en programación y evaluaciones de largo recorrido, con niveles de esfuerzo explícitos Non-Thinking, High y Max.
El lanzamiento que abrió la serie 5: fundamentos de programación más sólidos, ejecución multipaso más fiable y un comportamiento notablemente mejor en tareas de agentes complejas.
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.