GLM Model — IA abierta con contexto de 1M creada para tareas de largo recorrido

GLM-5.2 es el modelo de IA GLM insignia de pesos abiertos: un contexto sólido de 1M tokens, niveles de esfuerzo Non-Thinking / High / Max y puntuaciones publicadas de 81.0 en Terminal-Bench 2.1 y 74.4 en FrontierSWE. Compara abajo todos los modelos GLM, o prueba antes el playground de IA gratuito.

1M
tokens de contexto
ampliado desde 200K y estable bajo cargas de agentes
81.0
Terminal-Bench 2.1
publicado para GLM-5.2, frente al 63.5 de GLM-5.1
MIT
licencia de código abierto
pesos abiertos, sin límites regionales

Playground de IA gratuito — prueba un LLM de código abierto en vivo

Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.

La respuesta aparecerá aquí...

Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.

En qué destaca la familia de modelos GLM

Cuatro capacidades definen la generación actual de modelos GLM, todas publicadas por los autores del modelo y reproducibles a partir de los pesos abiertos.

Contexto sólido de 1M

Un contexto de 1M tokens que se mantiene utilizable, no solo aceptado: GLM-5.2 se entrenó con trayectorias de agentes de programación de contexto largo que cubren implementaciones a gran escala, investigación automatizada y depuración compleja.

Niveles de esfuerzo flexibles

Non-Thinking, High y Max te permiten intercambiar latencia por capacidad en cada tarea: aproximadamente un 63% con ~35K tokens de salida y hasta un 74% con ~83K en evaluaciones de programación agéntica.

Arquitectura IndexShare

Un único indexador ligero compartido por cada cuatro capas de atención dispersa reduce 2.9× los FLOPs por token con 1M de contexto, sin sacrificar calidad en distancias largas.

Pesos abiertos con licencia MIT

Un modelo GLM de código abierto bajo MIT: pesos en HuggingFace y ModelScope, sin límites regionales y servicio local mediante transformers, vLLM, SGLang, xLLM y ktransformers.

Benchmarks de GLM 5.2: resultados de largo recorrido

Todas las cifras siguientes son resultados publicados por los autores del modelo para GLM-5.2 y su conjunto de comparación. glmmodel.com los reproduce; no ejecuta estas evaluaciones.

Mejor modelo abierto
74.4%

FrontierSWE

Dominancia, tareas de hasta 20 horas

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
2.º en general
34.3%

PostTrainBench

Hasta 10 horas en una sola H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
2.º tras la serie Opus
13.0%

SWE-Marathon

SWE de horizonte ultralargo, hasta 10 horas

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

En los tres benchmarks de largo recorrido, GLM-5.2 es el modelo de código abierto mejor clasificado, prueba de que su contexto de 1M se traduce en trabajo entregado y no solo en tokens aceptados. Queda un punto por detrás de Opus 4.8 en FrontierSWE, supera por uno a GPT-5.5 y aventaja en once al Opus 4.7 de la generación anterior.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Puntuaciones de los modelos GLM en 17 benchmarks

Resultados publicados de benchmarks de modelos GLM: 17 evaluaciones en 8 modelos.

Resultados publicados de benchmarks de modelos GLM en cada evaluación y modelo
BenchmarkGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Razonamiento
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programación
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agéntico
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* puntuación sobre el conjunto completo.

Niveles de esfuerzo: Non-Thinking, High y Max

Un modelo GLM no tiene una única velocidad. El control del nivel de esfuerzo te permite gastar más cómputo solo en las tareas que lo necesitan.

Non-Thinking

~63%

~35K tokens medios

Ediciones rápidas, código repetitivo y refactorizaciones rutinarias donde la latencia importa más que la profundidad.

Más usado

High

~72%

~43K tokens medios

La opción por defecto para la mayoría de la programación agéntica: calidad casi de nivel Max por aproximadamente la mitad del gasto en tokens.

Max

~74%

~83K tokens medios

Problemas difíciles y de largo recorrido: asigna cómputo adicional cuando la tarea realmente lo justifica.

Promedio de Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA, evaluados en Claude Code 2.1.167. Datos publicados por los autores del modelo. Con presupuestos de tokens comparables, GLM-5.2 se sitúa entre Claude Opus 4.7 y Opus 4.8.

Cómo alcanza el modelo GLM el contexto de 1M

Elevar el techo de contexto de 200K a 1M tokens es un problema de ingeniería, no un parámetro de configuración. Tres cambios hacen el trabajo.

IndexShare para la atención dispersa

Cada cuatro capas del transformer comparten un indexador ligero. Se sitúa en la primera de las cuatro y sus índices top-k se reutilizan en las otras tres, eliminando el producto escalar del indexador y el cálculo top-k en 3 de cada 4 capas. Resultado: 2.9× menos FLOPs por token con 1M de contexto. Entrenado con IndexShare desde el entrenamiento intermedio con secuencias de 128K.

Compartición de capas del modelo GLM con IndexShareCapa N+3Capa N+2Capa N+1Capa NIndexadorcompartido

MTP con IndexShare y KVShare

La capa de predicción multi-token ejecuta su indexador una sola vez en el primer paso del borrador y reutiliza los índices en los pasos posteriores, eliminando el desajuste de KV-cache entre entrenamiento e inferencia que limitaba a la generación anterior. Combinado con muestreo por rechazo y una pérdida TV de extremo a extremo, la longitud de aceptación sube de 4.56 a 5.47, alrededor de un 20%, a lo largo de 7 pasos MTP.

Ablación de la longitud de aceptación de MTP
Referencia4.56
+ IndexShare + KVShare5.10
+ Muestreo por rechazo5.29
+ Pérdida TV de extremo a extremo5.47 (+20%)

Servir 1M de contexto de forma eficiente

Más allá de unos cientos de miles de tokens, el cuello de botella deja de ser el cómputo y pasa a ser la capacidad de KV-cache, los kernels de contexto largo y la sobrecarga de CPU. Tres soluciones: gestión de memoria y paralelismo de grano fino basados en LayerSplit, trabajo de kernels escalados a la longitud de contexto coordinado con la canalización de transferencia de caché, y gestión de caché en CPU, planificación de peticiones y ajuste de rutas en tiempo de ejecución. La ventaja de rendimiento se amplía a medida que crece el contexto.

Ventaja de rendimiento normalizada

Entrenado con RL agéntico

El stack de entrenamiento (slime) combina rollouts de caja blanca y caja negra, trayectorias compactas y flujos de subagentes. El entrenamiento OPD paralelo fusionó más de diez modelos expertos en unos dos días, con KV-cache en FP8 para mantener la memoria del rollout dentro del presupuesto.

Anti reward hacking

El RL de largo recorrido invita a los atajos, así que las acciones sospechosas pasan por un filtro de recuperación basado en reglas y luego por una comprobación de precisión con un LLM como juez. Los abusos confirmados se bloquean en línea y se responden con un resultado de herramienta ficticio, lo que permite que el rollout continúe en lugar de descartarse. El PPO con crítico sobre rollouts individuales mantiene entrenables las subtrazas de compactación.

Dónde rentabiliza su valor un modelo GLM de largo recorrido

Implementación a gran escala

Funcionalidades multiarchivo que sobreviven a una sola ventana de contexto: el modelo mantiene a la vista el estado completo del repositorio en lugar de releerlo cada pocos turnos.

Investigación automatizada

Ciclos de experimentación de horas en los que un agente debe planificar, ejecutar, leer resultados y revisar: exactamente la carga de trabajo que FrontierSWE y PostTrainBench se crearon para medir.

Optimización del rendimiento

Trabajo de kernels y sistemas que necesita el grafo de llamadas completo, la salida del profiler y los intentos previos sostenidos en una única trayectoria.

Depuración compleja

Trazas de reproducción largas, tests inestables y fallos entre servicios, donde truncar el contexto es justo lo que hace perder el bug.

Ejecuta cualquiera de ellos en tu propio hardware: pesos MIT, transformers · vLLM · SGLang · xLLM · ktransformers. Cómo ejecutar un modelo GLM en local →

Preguntas frecuentes sobre GLM Model

GLM es una familia de grandes modelos de lenguaje de pesos abiertos cuyo buque insignia actual es GLM-5.2. La línea abarca GLM-4.5-Air y GLM-4.7, pasando por GLM-5, GLM-5-Turbo, GLM-5.1 y ahora GLM-5.2, además de variantes de voz y visión. Todos los modelos GLM principales se publican con licencia MIT y pesos abiertos.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.