GLM-5.2 — El modelo GLM insignia con contexto de 1M

GLM-5.2 es el modelo GLM insignia de pesos abiertos, diseñado para completar tareas de largo recorrido y programación agéntica más que para el chat de un solo turno. Es el lanzamiento que llevó el contexto utilizable de la familia de 200.000 tokens a un sólido millón, introdujo niveles de esfuerzo explícitos y reconstruyó el stack de atención dispersa en torno a un indexador compartido. Para un equipo que evalúa alternativas de pesos abiertos a la frontera cerrada, este es el modelo GLM que realmente compite en las evaluaciones que a esos equipos les importan, y lo hace con licencia MIT y pesos publicados abiertamente.

Frente a su predecesor GLM-5.1, GLM-5.2 no es una actualización incremental. Terminal-Bench 2.1 pasa de 63.5 a 81.0, DeepSWE de 18.0 a 46.2 y FrontierSWE Dominance de 30.5 a 74.4, todas cifras publicadas por los autores del modelo y ninguna medida aquí. La consecuencia práctica es que un agente de programación puede mantener un repositorio completo, la salida de sus tests y sus propios intentos previos dentro de una sola trayectoria, en lugar de releer fragmentos a través de una capa de recuperación.

1M
tokens de contexto
ampliado desde 200K y entrenado para seguir siendo utilizable en toda la ventana
81.0
Terminal-Bench 2.1
publicado para GLM-5.2, frente al 63.5 de GLM-5.1
MIT
licencia de código abierto
pesos abiertos, sin límites regionales

Playground de IA gratuito — prueba un LLM de código abierto en vivo

Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.

La respuesta aparecerá aquí...

Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.

Qué te aporta realmente la ventana de contexto de 1M

Un contexto de un millón de tokens cambia lo que construyes, no solo cuánto puedes pegar. En lugar de una canalización de recuperación que alimenta al modelo con fragmentos pequeños y con pérdidas, puedes cargar un repositorio entero, una referencia de API completa o varios días de logs en un único prompt y dejar que el modelo razone sobre todo a la vez. Eso es lo que hace visibles las dependencias entre archivos y los fallos sistémicos: el bug que solo aparece cuando la frontera del servicio, la migración y el fixture de test están presentes al mismo tiempo. GLM-5.2 se entrenó con trayectorias de agentes de programación de contexto largo que cubren implementación a gran escala, investigación automatizada, optimización del rendimiento y depuración compleja, y por eso los autores del modelo describen la ventana como sólida y no simplemente aceptada: la calidad debe mantenerse en profundidad dentro del contexto en lugar de degradarse cuando la ejecución se complica.

Ventana de contexto
1.000.000 tokens
Licencia
Código abierto MIT
Niveles de esfuerzo
Non-Thinking · High · Max
Salida máxima
128.000 tokens
Alojamiento de pesos
HuggingFace · ModelScope

Resultados de benchmarks de GLM-5.2

Puntuaciones publicadas por los autores del modelo.

La columna publicada de GLM-5.2 es más fuerte exactamente donde se diseñó el modelo: programación agéntica y ejecución de largo recorrido. Obtiene 81.0 en Terminal-Bench 2.1 con el harness Terminus-2 y 82.7 con Claude Code, 76.8 en el conjunto público de MCP-Atlas y 74.4 en FrontierSWE Dominance, donde cada tarea puede durar hasta veinte horas. En razonamiento puro registra 99.2 en AIME 2026 y 91.2 en GPQA-Diamond. En las tres evaluaciones de largo recorrido (FrontierSWE, PostTrainBench y SWE-Marathon) es el modelo de código abierto mejor clasificado del conjunto de comparación publicado.

Ver los 17 benchmarks de GLM en detalle →

Cómo se compara GLM-5.2

Comparación en SWE-bench Pro, según los autores del modelo.

En SWE-bench Pro, el 62.1 de GLM-5.2 queda por detrás del 69.2 de Claude Opus 4.8, pero supera a GPT-5.5 con 58.6 y a Gemini 3.1 Pro con 54.2, y también a su propio predecesor GLM-5.1 con 58.4. Ese patrón se repite en toda la tabla: la frontera cerrada sigue liderando varias evaluaciones estándar de programación, mientras que GLM-5.2 encabeza el campo de pesos abiertos y se lleva filas concretas por completo, incluidas Terminal-Bench 2.1 con el harness de Claude Code (82.7 frente a 78.9) y AIME 2026 (99.2 frente a 95.7).

Leer la comparativa completa GLM vs Claude →

Dónde encaja GLM-5.2 en la gama de modelos GLM

GLM-5.2 encabeza actualmente una línea que va de GLM-4.5-Air y GLM-4.7 a GLM-5, GLM-5-Turbo y GLM-5.1. Cada paso tuvo una prioridad distinta: GLM-4.7 se centró en programación y generación de front-end, GLM-5-Turbo en la ejecución de agentes de cadena larga y GLM-5.1 en el trabajo autónomo de varias horas; GLM-5.2 integra esas mejoras en un solo modelo con una ventana mucho mayor. Si tu presupuesto de hardware descarta el buque insignia, los niveles ligeros GLM-4.7-Flash y GLM-4.5-Air pertenecen a la misma familia bajo la misma licencia MIT.

Más modelos GLM

Ver todo

Preguntas frecuentes sobre GLM-5.2

¿Qué diferencia a GLM-5.2 de GLM-5.1?
GLM-5.2 eleva el contexto utilizable de 200.000 a un sólido 1.000.000 de tokens y reconstruye la atención dispersa en torno a IndexShare, que reduce 2.9× los FLOPs por token con 1M de contexto. Las diferencias publicadas en benchmarks son grandes: Terminal-Bench 2.1 pasa de 63.5 a 81.0, DeepSWE de 18.0 a 46.2 y FrontierSWE Dominance de 30.5 a 74.4. También introduce los niveles de esfuerzo Non-Thinking, High y Max.
¿Es GLM-5.2 de código abierto?
Sí. Los pesos principales de GLM-5.2 se publican con licencia MIT sin restricciones regionales, en HuggingFace y ModelScope. Puedes descargarlos, ajustarlos y servirlos en tu propio hardware sin pedir permiso, y sin que tus prompts salgan de tu infraestructura.
¿Puedo ejecutar el modelo GLM-5.2 en local?
Sí. Los autores del modelo indican soporte para transformers, vLLM, SGLang, xLLM y ktransformers. Servir el contexto completo de 1M es más un problema de memoria que de cómputo: pasados unos cientos de miles de tokens el cuello de botella pasa a ser la capacidad de KV-cache, por lo que la mayoría de despliegues autoalojados usan una ventana más corta con los mismos pesos.
¿Cuáles son los niveles de esfuerzo en GLM-5.2?
Non-Thinking, High y Max controlan cuánto cómputo dedica el modelo a cada tarea. En la curva publicada de programación agéntica eso equivale aproximadamente a un 63% con unos 35K tokens de salida, un 72% con unos 43K y un 74% con unos 83K. High es el valor por defecto práctico; Max solo justifica su gasto en tokens en problemas realmente difíciles y de largo recorrido.
¿Cómo se compara GLM-5.2 con Claude Opus 4.8?
Opus 4.8 lidera la mayor parte de la tabla publicada, incluidos SWE-bench Pro con 69.2 frente a 62.1, NL2Repo y SWE-Marathon. GLM-5.2 se lleva Terminal-Bench 2.1 con el harness de Claude Code, 82.7 frente a 78.9, además de AIME 2026 e IMOAnswerBench, y queda a menos de un punto en FrontierSWE. Además ofrece cinco veces más ventana de contexto y pesos abiertos.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.