Este es el conjunto completo de benchmarks publicados de GLM en un solo sitio: 17 evaluaciones en 8 modelos que cubren razonamiento, programación y uso agéntico de herramientas, más las tres evaluaciones de largo recorrido realizadas por terceros. Todo lo que hay en esta página es un resultado publicado por los autores del modelo o por la organización que ejecutó la evaluación. glmmodel.com reproduce estas cifras; no las ejecuta.
Esa distinción no es un descargo de responsabilidad porque sí. Las puntuaciones de benchmark dependen del harness hasta un punto que sorprende: el mismo modelo en la misma evaluación se mueve varios puntos entre Terminus-2 y Claude Code, así que la sección de metodología al final de esta página es posiblemente más útil que la propia tabla. Lee las cifras como capacidad reportada bajo condiciones declaradas, no como una promesa sobre tu carga de trabajo.
Todas las cifras de esta página son resultados publicados por los autores del modelo. glmmodel.com los reproduce; no ejecuta estas evaluaciones.
Dominancia, tareas de hasta 20 horas
Mejor modelo abiertoHasta 10 horas en una sola H100
2.º en generalSWE de horizonte ultralargo, hasta 10 horas
2.º tras la serie OpusEl trío de largo recorrido es aquello para lo que se construyó la generación actual del modelo GLM, y las tres evaluaciones fueron ejecutadas por organizaciones externas y no por los autores del modelo. FrontierSWE mide la dominancia en tareas de hasta veinte horas; PostTrainBench se ejecuta hasta diez horas en una sola H100; SWE-Marathon es ingeniería de software de horizonte ultralargo, también de hasta diez horas. GLM-5.2 es el modelo de código abierto mejor clasificado en las tres. Queda siete décimas de punto por detrás de Claude Opus 4.8 en FrontierSWE, supera allí a GPT-5.5 por 1.8 y aventaja en más de once al Opus 4.7 de la generación anterior.
Comparar GLM-5.2 con GLM-5.1 aísla lo que produjo una generación de trabajo, y comparar ambos con el mejor modelo cerrado de cada fila muestra cuánta distancia queda. Las etiquetas de diferencia de abajo son la puntuación publicada de GLM-5.2 menos la de GLM-5.1. Fíjate en lo desiguales que son: 3.7 puntos en SWE-bench Pro frente a 28.2 puntos en DeepSWE. Las evaluaciones que premian la ejecución sostenida avanzaron mucho más que las que premian un único parche acertado.
La tabla completa de abajo es la versión de referencia, agrupada en secciones de razonamiento, programación y agéntica. La columna de GLM-5.2 aparece resaltada. Un guion significa que los autores del modelo no publicaron puntuación para ese modelo en ese benchmark, y este sitio no rellena esas celdas con estimaciones. Desplázate horizontalmente para ver todas las columnas de modelos.
| Benchmark | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Razonamiento | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE w/ Tools | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programación | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (best harness) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agéntico | ||||||||
| MCP-Atlas (public set) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* puntuación sobre el conjunto completo.
Resultados publicados de benchmarks de modelos GLM: 17 evaluaciones en 8 modelos.
Los ajustes de evaluación siguientes son los publicados junto a los resultados. Merece la pena leerlos antes de citar ninguna cifra, porque la longitud de contexto, los parámetros de muestreo, la versión del harness y el presupuesto de tiempo mueven las puntuaciones de forma sustancial, y porque varias de estas evaluaciones las realizaron terceros y no los autores del modelo.
Muestreo con temperatura 1.0 y top-p 0.95, con una longitud máxima de generación de 163.840 tokens. Por defecto se reporta el subconjunto de solo texto; los resultados marcados con asterisco proceden del conjunto completo. AIME, HMMT e IMOAnswerBench usan un prompt de sistema con formato de respuesta fijo, con GPT-5.5 (medium) como modelo juez. HLE con herramientas usa un contexto de 300.000 tokens y ninguna estrategia de gestión de contexto.
Ejecutado con OpenHands usando un prompt de instrucciones adaptado, con temperatura 1, top-p 1 y un límite de 32K tokens nuevos, dentro de una ventana de contexto de 400K.
Evaluado con temperatura 1.0, top-p 1.0 y un límite de 48K tokens nuevos bajo un contexto de 400K. Se aplica un juicio basado en reglas y en LLM para bloquear comportamientos maliciosos como la instalación no autorizada de paquetes o las llamadas de red.
Ejecutado con el framework oficial de evaluación y el harness mini-swe-agent, con temperatura 1.0, top-p 1.0 y un tiempo límite de dos horas bajo un contexto de 400K. Cada tarea corre en un contenedor aislado con 2 CPU, 8 GB de RAM y sin acceso a internet.
200 instancias evaluadas con Claude Code 2.1.156 a temperatura 1.0, top-p 1.0, un límite de 64.000 tokens, hasta 2.000 turnos, un tiempo límite de seis horas por muestra y el máximo esfuerzo de razonamiento, bajo un contexto de 400K. Cada instancia corre en un sandbox de 4 CPU y 8 GB con el acceso a internet desactivado.
Evaluado con el framework Terminus-2 usando parseo JSON, un tiempo límite de cuatro horas, temperatura 1.0, top-p 1.0, un límite de 48K tokens nuevos y hasta 500 episodios, bajo una ventana de contexto de 256K. Los recursos se limitan a 4 CPU y 8 GB de RAM.
Evaluado en Claude Code 2.1.167 con temperatura 1.0, top-p 0.95 y 131.072 tokens nuevos, sorteando el límite de salida de 64K de la CLI mediante un proxy transparente. Se eliminan los límites de tiempo real y se mantienen las restricciones de CPU y memoria por tarea. Las puntuaciones son la media de cinco ejecuciones.
Todos los modelos evaluados en modo de razonamiento sobre el subconjunto público de 500 tareas, con un tiempo límite de diez minutos por tarea y Gemini-3.0-Pro como modelo juez.
Ejecutado a través del servicio oficial de evaluación con el presupuesto máximo de tokens fijado en 128K.
Realizado por Proximal, no por los autores del modelo, con una longitud de contexto de 1M, el nivel de esfuerzo máximo y 128K tokens máximos de salida. La puntuación de dominancia se reporta a fecha de 16 de junio de 2026.
Realizado por PostTrainBench, no por los autores del modelo, con una longitud de contexto de 1M, el nivel de esfuerzo máximo y 128K tokens máximos de salida.
Realizado por Abundant AI, no por los autores del modelo, con una longitud de contexto de 1M, el nivel de esfuerzo máximo y 128K tokens máximos de salida.
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.