GLM-5.2 es el modelo de IA GLM insignia de pesos abiertos: un contexto sólido de 1M tokens, niveles de esfuerzo Non-Thinking / High / Max y puntuaciones publicadas de 81.0 en Terminal-Bench 2.1 y 74.4 en FrontierSWE. Compara abajo todos los modelos GLM, o prueba antes el playground de IA gratuito.
Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.
La respuesta aparecerá aquí...
Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.
Cuatro capacidades definen la generación actual de modelos GLM, todas publicadas por los autores del modelo y reproducibles a partir de los pesos abiertos.
Un contexto de 1M tokens que se mantiene utilizable, no solo aceptado: GLM-5.2 se entrenó con trayectorias de agentes de programación de contexto largo que cubren implementaciones a gran escala, investigación automatizada y depuración compleja.
Non-Thinking, High y Max te permiten intercambiar latencia por capacidad en cada tarea: aproximadamente un 63% con ~35K tokens de salida y hasta un 74% con ~83K en evaluaciones de programación agéntica.
Un único indexador ligero compartido por cada cuatro capas de atención dispersa reduce 2.9× los FLOPs por token con 1M de contexto, sin sacrificar calidad en distancias largas.
Un modelo GLM de código abierto bajo MIT: pesos en HuggingFace y ModelScope, sin límites regionales y servicio local mediante transformers, vLLM, SGLang, xLLM y ktransformers.
Todas las cifras siguientes son resultados publicados por los autores del modelo para GLM-5.2 y su conjunto de comparación. glmmodel.com los reproduce; no ejecuta estas evaluaciones.
Dominancia, tareas de hasta 20 horas
Hasta 10 horas en una sola H100
SWE de horizonte ultralargo, hasta 10 horas
En los tres benchmarks de largo recorrido, GLM-5.2 es el modelo de código abierto mejor clasificado, prueba de que su contexto de 1M se traduce en trabajo entregado y no solo en tokens aceptados. Queda un punto por detrás de Opus 4.8 en FrontierSWE, supera por uno a GPT-5.5 y aventaja en once al Opus 4.7 de la generación anterior.
Resultados publicados de benchmarks de modelos GLM: 17 evaluaciones en 8 modelos.
| Benchmark | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Razonamiento | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE w/ Tools | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programación | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (best harness) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agéntico | ||||||||
| MCP-Atlas (public set) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* puntuación sobre el conjunto completo.
Un modelo GLM no tiene una única velocidad. El control del nivel de esfuerzo te permite gastar más cómputo solo en las tareas que lo necesitan.
~35K tokens medios
Ediciones rápidas, código repetitivo y refactorizaciones rutinarias donde la latencia importa más que la profundidad.
~43K tokens medios
La opción por defecto para la mayoría de la programación agéntica: calidad casi de nivel Max por aproximadamente la mitad del gasto en tokens.
~83K tokens medios
Problemas difíciles y de largo recorrido: asigna cómputo adicional cuando la tarea realmente lo justifica.
Promedio de Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA, evaluados en Claude Code 2.1.167. Datos publicados por los autores del modelo. Con presupuestos de tokens comparables, GLM-5.2 se sitúa entre Claude Opus 4.7 y Opus 4.8.
Elevar el techo de contexto de 200K a 1M tokens es un problema de ingeniería, no un parámetro de configuración. Tres cambios hacen el trabajo.
Cada cuatro capas del transformer comparten un indexador ligero. Se sitúa en la primera de las cuatro y sus índices top-k se reutilizan en las otras tres, eliminando el producto escalar del indexador y el cálculo top-k en 3 de cada 4 capas. Resultado: 2.9× menos FLOPs por token con 1M de contexto. Entrenado con IndexShare desde el entrenamiento intermedio con secuencias de 128K.
La capa de predicción multi-token ejecuta su indexador una sola vez en el primer paso del borrador y reutiliza los índices en los pasos posteriores, eliminando el desajuste de KV-cache entre entrenamiento e inferencia que limitaba a la generación anterior. Combinado con muestreo por rechazo y una pérdida TV de extremo a extremo, la longitud de aceptación sube de 4.56 a 5.47, alrededor de un 20%, a lo largo de 7 pasos MTP.
| Referencia | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Muestreo por rechazo | 5.29 |
| + Pérdida TV de extremo a extremo | 5.47 (+20%) |
Más allá de unos cientos de miles de tokens, el cuello de botella deja de ser el cómputo y pasa a ser la capacidad de KV-cache, los kernels de contexto largo y la sobrecarga de CPU. Tres soluciones: gestión de memoria y paralelismo de grano fino basados en LayerSplit, trabajo de kernels escalados a la longitud de contexto coordinado con la canalización de transferencia de caché, y gestión de caché en CPU, planificación de peticiones y ajuste de rutas en tiempo de ejecución. La ventaja de rendimiento se amplía a medida que crece el contexto.
Ventaja de rendimiento normalizada
El stack de entrenamiento (slime) combina rollouts de caja blanca y caja negra, trayectorias compactas y flujos de subagentes. El entrenamiento OPD paralelo fusionó más de diez modelos expertos en unos dos días, con KV-cache en FP8 para mantener la memoria del rollout dentro del presupuesto.
El RL de largo recorrido invita a los atajos, así que las acciones sospechosas pasan por un filtro de recuperación basado en reglas y luego por una comprobación de precisión con un LLM como juez. Los abusos confirmados se bloquean en línea y se responden con un resultado de herramienta ficticio, lo que permite que el rollout continúe en lugar de descartarse. El PPO con crítico sobre rollouts individuales mantiene entrenables las subtrazas de compactación.
Desde el nivel Flash de 30B hasta el buque insignia con contexto de 1M: elige un modelo GLM y consulta su ficha técnica completa y su columna de benchmarks.
Contexto de 1M tokens, estado del arte abierto en programación y tareas de largo recorrido, e ingeniería agéntica más potente.
El anterior buque insignia: grandes avances en largo recorrido y trabajo autónomo de varias horas con resultados de calidad de ingeniería.
Mejor programación, ejecución multipaso más fiable y mejor comportamiento en agentes complejos.
Modelo base ajustado para escenarios de agentes dinámicos y de cadena larga.
Programación mejorada, razonamiento multipaso estable y mejor generación de front-end.
30B parámetros; eficiente y de alto rendimiento, por delante de modelos abiertos de escala similar.
Modelo GLM de huella reducida con gran rendimiento por unidad de cómputo.
Reconocimiento de voz a texto en tiempo real con un CER de 0.0717.
Funcionalidades multiarchivo que sobreviven a una sola ventana de contexto: el modelo mantiene a la vista el estado completo del repositorio en lugar de releerlo cada pocos turnos.
Ciclos de experimentación de horas en los que un agente debe planificar, ejecutar, leer resultados y revisar: exactamente la carga de trabajo que FrontierSWE y PostTrainBench se crearon para medir.
Trabajo de kernels y sistemas que necesita el grafo de llamadas completo, la salida del profiler y los intentos previos sostenidos en una única trayectoria.
Trazas de reproducción largas, tests inestables y fallos entre servicios, donde truncar el contexto es justo lo que hace perder el bug.
Ejecuta cualquiera de ellos en tu propio hardware: pesos MIT, transformers · vLLM · SGLang · xLLM · ktransformers. Cómo ejecutar un modelo GLM en local →
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.