GLM-5.2 vs GLM-5.1: todas las mejoras de una generación a otra

GLM-5.2 vs GLM-5.1 es la única comparativa de este sitio sin ambigüedad: en las 19 evaluaciones publicadas en las que ambos modelos tienen puntuación, el modelo GLM más reciente gana todas las filas. Lo interesante no es quién gana, sino por cuánto, porque los márgenes van de cuatro décimas de punto a más de cuarenta.

Ese abanico es la evidencia más clara disponible de lo que cambió realmente la generación. El razonamiento estándar avanzó poco, la programación estándar avanzó moderadamente y la ejecución agéntica de largo recorrido avanzó muchísimo, que es justo lo que cabría esperar de un lanzamiento cuyos cambios estrella son un aumento de contexto de cinco veces y un stack de atención dispersa reconstruido. Todas las cifras son las publicadas por los autores del modelo.

El veredicto

GLM-5.2 gana 19 de 19GLM-5.1 gana 0

GLM-5.2 gana 19 de 19 filas publicadas frente a GLM-5.1. Los márgenes pequeños están en benchmarks que ya rozaban el techo: HMMT Nov. 2025 pasa de 94.0 a 94.4 y HLE con herramientas de 52.3 a 54.7. Los grandes están en el trabajo de largo recorrido: FrontierSWE Dominance de 30.5 a 74.4, SWE-Marathon de 1.0 a 13.0, DeepSWE de 18.0 a 46.2 y CritPt de 4.6 a 20.9. Terminal-Bench 2.1 pasa de 63.5 a 81.0 con Terminus-2 y de 69.0 a 82.7 con Claude Code. Si hoy ejecutas GLM-5.1 y tu carga de trabajo es agéntica, esta no es una actualización marginal.

GLM-5.2 vs GLM-5.1: especificaciones de un vistazo

Los cambios estructurales explican el abanico de resultados. El techo de contexto pasó de 200.000 a 1.000.000 de tokens, la atención dispersa se reconstruyó para que cada cuatro capas compartan un indexador ligero, se eliminó el desajuste de KV-cache entre entrenamiento e inferencia de la capa de predicción multi-token y se introdujeron niveles de esfuerzo explícitos. Ambos lanzamientos siguen siendo modelos GLM de pesos abiertos con licencia MIT en los mismos alojamientos públicos.

GLM-5.2 vs GLM-5.1: especificaciones de un vistazo
CaracterísticaGLM-5.2GLM-5.1
Ventana de contexto1.000.000 tokens200.000 tokens
Arquitectura de atenciónAtención dispersa con IndexShareAtención dispersa, un indexador por capa
Longitud de aceptación de MTP5.47 (+20%)4.56 (referencia)
Control de esfuerzoExplícito — Non-Thinking, High, MaxNo expuesto
LicenciaLicencia MITLicencia MIT

Benchmark a benchmark: GLM-5.2 vs GLM-5.1

Lee primero el bloque de programación: nueve filas, nueve victorias, y los incrementos crecen con la longitud de la tarea. SWE-bench Pro gana 3.7 puntos, ProgramBench 12.8, Terminal-Bench 2.1 17.5, DeepSWE 28.2 (una mejora de 2.6×) y FrontierSWE Dominance 43.9. El bloque de razonamiento es un pleno más discreto: HLE gana 9.5, AIME 2026 3.9, IMOAnswerBench 7.2, GPQA-Diamond 5.0 y CritPt salta de 4.6 a 20.9, más de cuatro veces su puntuación anterior. El orden de esas diferencias es todo el argumento del lanzamiento. Si la generación simplemente se hubiera entrenado más tiempo con más datos, cabría esperar mejoras más o menos uniformes en toda la tabla; en cambio, los incrementos siguen la duración de las tareas de cada evaluación, que es lo que predecirías de un aumento de contexto de cinco veces y una reconstrucción de la atención apuntada de lleno al trabajo de largo recorrido.

Benchmark a benchmark: GLM-5.2 vs GLM-5.1
BenchmarkGLM-5.2GLM-5.1Ganador
Programación y largo recorrido
FrontierSWE Dominance74.430.5GLM-5.2
PostTrainBench34.320.1GLM-5.2
SWE-Marathon13.01.0GLM-5.2
SWE-bench Pro62.158.4GLM-5.2
NL2Repo48.942.7GLM-5.2
ProgramBench63.750.9GLM-5.2
DeepSWE46.218.0GLM-5.2
Terminal-Bench 2.1 (Terminus-2)81.063.5GLM-5.2
Terminal-Bench 2.1 (Claude Code)82.769.0GLM-5.2
Razonamiento y agéntico
MCP-Atlas (public set)76.871.8GLM-5.2
Tool-Decathlon48.240.7GLM-5.2
HLE40.531.0GLM-5.2
HLE w/ Tools54.752.3GLM-5.2
CritPt20.94.6GLM-5.2
AIME 202699.295.3GLM-5.2
HMMT Nov. 202594.494.0GLM-5.2
HMMT Feb. 202692.582.6GLM-5.2
IMOAnswerBench91.083.8GLM-5.2
GPQA-Diamond91.286.2GLM-5.2

* puntuación sobre el conjunto completo.

Todas las cifras de esta página son resultados publicados por los autores del modelo. glmmodel.com los reproduce; no ejecuta estas evaluaciones.

Ver los 17 benchmarks de GLM en detalle →

Cuándo elegir cada modelo

Cuándo elegir GLM-5.2

Para cualquier despliegue nuevo, GLM-5.2 es la opción por defecto. Gana todas las filas publicadas, ofrece cinco veces más contexto, expone niveles de esfuerzo para que gastes cómputo de forma deliberada y sirve esa ventana mayor con 2.9× menos FLOPs por token gracias a IndexShare, de modo que el modelo más grande no resulta proporcionalmente más caro por token.

  • Estás empezando un proyecto nuevo, donde no hay razón publicada para elegir el lanzamiento anterior.
  • Tus agentes se ejecutan durante horas: las filas de largo recorrido mejoraron en decenas de puntos, no en fracciones.
  • Necesitas más de 200.000 tokens de contexto y quieres que la ventana siga siendo utilizable en toda su longitud.
  • Quieres control del esfuerzo por petición, algo que GLM-5.1 no expone en absoluto.

Cuándo sigue teniendo sentido GLM-5.1

Hay exactamente un argumento honesto para quedarse en GLM-5.1, y es operativo más que cualitativo. Una ventana de 200.000 tokens cuesta muchísima menos memoria de KV-cache que una de un millón, así que si tus tareas caben de verdad y tu hardware va justo, el modelo anterior tiene una huella menor. En trabajo de programación acotado, la diferencia publicada es de solo unos puntos.

  • Tu hardware de servicio está limitado en memoria y tus prompts caben con holgura en 200.000 tokens.
  • Ya tienes un despliegue de GLM-5.1 validado y ninguna carga de largo recorrido que justifique revalidarlo.
  • Tus tareas son acotadas, donde la diferencia publicada en SWE-bench Pro es de 62.1 frente a 58.4 y no algo dramático.
  • Necesitas un modelo fijado y estable y prefieres planificar la migración en lugar de asumirla ahora.

Prueba el playground de IA gratuito en la página de inicio →

Preguntas frecuentes sobre GLM-5.2 vs GLM-5.1

¿Qué cambió entre GLM-5.1 y GLM-5.2?
Cuatro cosas: el techo de contexto pasó de 200.000 a 1.000.000 de tokens, la atención dispersa se reconstruyó en torno a IndexShare para que cada cuatro capas compartan un indexador, se eliminó el desajuste de KV-cache de la capa de predicción multi-token para elevar la longitud de aceptación de 4.56 a 5.47, y se introdujeron los niveles de esfuerzo explícitos Non-Thinking, High y Max.
¿Cuánto mayor es la ventana de contexto de GLM-5.2?
Cinco veces mayor: 1.000.000 de tokens frente a 200.000, con hasta 128.000 tokens de salida. Los autores del modelo describen la ventana mayor como sólida y no simplemente aceptada, es decir, se entrenó con trayectorias largas de agentes de programación para que la calidad se mantenga en profundidad dentro del contexto.
¿Qué es IndexShare y por qué importa aquí?
IndexShare permite que cada cuatro capas de atención dispersa compartan un indexador ligero, calculando los índices top-k una vez y reutilizándolos. Eso elimina el trabajo del indexador en tres de cada cuatro capas y reduce 2.9× los FLOPs por token con 1M de contexto, que es lo que hace práctico y no teórico servir una ventana de un millón de tokens.
¿Debería pasar de GLM-5.1 a GLM-5.2?
Si tu carga de trabajo es agéntica o de largo recorrido, sí: las mejoras publicadas allí son de decenas de puntos, no de unos pocos. Si tus tareas son acotadas y tu hardware de servicio está limitado en memoria, la huella de KV-cache menor del modelo anterior es una razón legítima para esperar.
¿Siguen siendo ambos modelos GLM de código abierto?
Sí. Tanto GLM-5.1 como GLM-5.2 son lanzamientos de pesos abiertos con licencia MIT publicados en HuggingFace y ModelScope sin restricciones regionales. Un lanzamiento nuevo no retira el anterior: los pesos que ya tienes siguen siendo utilizables indefinidamente.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.