GLM-5.2 vs GLM-5.1 es la única comparativa de este sitio sin ambigüedad: en las 19 evaluaciones publicadas en las que ambos modelos tienen puntuación, el modelo GLM más reciente gana todas las filas. Lo interesante no es quién gana, sino por cuánto, porque los márgenes van de cuatro décimas de punto a más de cuarenta.
Ese abanico es la evidencia más clara disponible de lo que cambió realmente la generación. El razonamiento estándar avanzó poco, la programación estándar avanzó moderadamente y la ejecución agéntica de largo recorrido avanzó muchísimo, que es justo lo que cabría esperar de un lanzamiento cuyos cambios estrella son un aumento de contexto de cinco veces y un stack de atención dispersa reconstruido. Todas las cifras son las publicadas por los autores del modelo.
GLM-5.2 gana 19 de 19 filas publicadas frente a GLM-5.1. Los márgenes pequeños están en benchmarks que ya rozaban el techo: HMMT Nov. 2025 pasa de 94.0 a 94.4 y HLE con herramientas de 52.3 a 54.7. Los grandes están en el trabajo de largo recorrido: FrontierSWE Dominance de 30.5 a 74.4, SWE-Marathon de 1.0 a 13.0, DeepSWE de 18.0 a 46.2 y CritPt de 4.6 a 20.9. Terminal-Bench 2.1 pasa de 63.5 a 81.0 con Terminus-2 y de 69.0 a 82.7 con Claude Code. Si hoy ejecutas GLM-5.1 y tu carga de trabajo es agéntica, esta no es una actualización marginal.
Los cambios estructurales explican el abanico de resultados. El techo de contexto pasó de 200.000 a 1.000.000 de tokens, la atención dispersa se reconstruyó para que cada cuatro capas compartan un indexador ligero, se eliminó el desajuste de KV-cache entre entrenamiento e inferencia de la capa de predicción multi-token y se introdujeron niveles de esfuerzo explícitos. Ambos lanzamientos siguen siendo modelos GLM de pesos abiertos con licencia MIT en los mismos alojamientos públicos.
| Característica | GLM-5.2 | GLM-5.1 |
|---|---|---|
| Ventana de contexto | 1.000.000 tokens | 200.000 tokens |
| Arquitectura de atención | Atención dispersa con IndexShare | Atención dispersa, un indexador por capa |
| Longitud de aceptación de MTP | 5.47 (+20%) | 4.56 (referencia) |
| Control de esfuerzo | Explícito — Non-Thinking, High, Max | No expuesto |
| Licencia | Licencia MIT | Licencia MIT |
Lee primero el bloque de programación: nueve filas, nueve victorias, y los incrementos crecen con la longitud de la tarea. SWE-bench Pro gana 3.7 puntos, ProgramBench 12.8, Terminal-Bench 2.1 17.5, DeepSWE 28.2 (una mejora de 2.6×) y FrontierSWE Dominance 43.9. El bloque de razonamiento es un pleno más discreto: HLE gana 9.5, AIME 2026 3.9, IMOAnswerBench 7.2, GPQA-Diamond 5.0 y CritPt salta de 4.6 a 20.9, más de cuatro veces su puntuación anterior. El orden de esas diferencias es todo el argumento del lanzamiento. Si la generación simplemente se hubiera entrenado más tiempo con más datos, cabría esperar mejoras más o menos uniformes en toda la tabla; en cambio, los incrementos siguen la duración de las tareas de cada evaluación, que es lo que predecirías de un aumento de contexto de cinco veces y una reconstrucción de la atención apuntada de lleno al trabajo de largo recorrido.
| Benchmark | GLM-5.2 | GLM-5.1 | Ganador |
|---|---|---|---|
| Programación y largo recorrido | |||
| FrontierSWE Dominance | 74.4 | 30.5 | GLM-5.2 |
| PostTrainBench | 34.3 | 20.1 | GLM-5.2 |
| SWE-Marathon | 13.0 | 1.0 | GLM-5.2 |
| SWE-bench Pro | 62.1 | 58.4 | GLM-5.2 |
| NL2Repo | 48.9 | 42.7 | GLM-5.2 |
| ProgramBench | 63.7 | 50.9 | GLM-5.2 |
| DeepSWE | 46.2 | 18.0 | GLM-5.2 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | GLM-5.2 |
| Terminal-Bench 2.1 (Claude Code) | 82.7 | 69.0 | GLM-5.2 |
| Razonamiento y agéntico | |||
| MCP-Atlas (public set) | 76.8 | 71.8 | GLM-5.2 |
| Tool-Decathlon | 48.2 | 40.7 | GLM-5.2 |
| HLE | 40.5 | 31.0 | GLM-5.2 |
| HLE w/ Tools | 54.7 | 52.3 | GLM-5.2 |
| CritPt | 20.9 | 4.6 | GLM-5.2 |
| AIME 2026 | 99.2 | 95.3 | GLM-5.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | GLM-5.2 |
| HMMT Feb. 2026 | 92.5 | 82.6 | GLM-5.2 |
| IMOAnswerBench | 91.0 | 83.8 | GLM-5.2 |
| GPQA-Diamond | 91.2 | 86.2 | GLM-5.2 |
* puntuación sobre el conjunto completo.
Todas las cifras de esta página son resultados publicados por los autores del modelo. glmmodel.com los reproduce; no ejecuta estas evaluaciones.
Ver los 17 benchmarks de GLM en detalle →Para cualquier despliegue nuevo, GLM-5.2 es la opción por defecto. Gana todas las filas publicadas, ofrece cinco veces más contexto, expone niveles de esfuerzo para que gastes cómputo de forma deliberada y sirve esa ventana mayor con 2.9× menos FLOPs por token gracias a IndexShare, de modo que el modelo más grande no resulta proporcionalmente más caro por token.
Hay exactamente un argumento honesto para quedarse en GLM-5.1, y es operativo más que cualitativo. Una ventana de 200.000 tokens cuesta muchísima menos memoria de KV-cache que una de un millón, así que si tus tareas caben de verdad y tu hardware va justo, el modelo anterior tiene una huella menor. En trabajo de programación acotado, la diferencia publicada es de solo unos puntos.
Prueba el playground de IA gratuito en la página de inicio →
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.