Benchmarks de GLM: los 17 resultados de evaluación de GLM-5.2

Este es el conjunto completo de benchmarks publicados de GLM en un solo sitio: 17 evaluaciones en 8 modelos que cubren razonamiento, programación y uso agéntico de herramientas, más las tres evaluaciones de largo recorrido realizadas por terceros. Todo lo que hay en esta página es un resultado publicado por los autores del modelo o por la organización que ejecutó la evaluación. glmmodel.com reproduce estas cifras; no las ejecuta.

Esa distinción no es un descargo de responsabilidad porque sí. Las puntuaciones de benchmark dependen del harness hasta un punto que sorprende: el mismo modelo en la misma evaluación se mueve varios puntos entre Terminus-2 y Claude Code, así que la sección de metodología al final de esta página es posiblemente más útil que la propia tabla. Lee las cifras como capacidad reportada bajo condiciones declaradas, no como una promesa sobre tu carga de trabajo.

Los tres benchmarks GLM de largo recorrido

Todas las cifras de esta página son resultados publicados por los autores del modelo. glmmodel.com los reproduce; no ejecuta estas evaluaciones.

74.4%
FrontierSWE

Dominancia, tareas de hasta 20 horas

Mejor modelo abierto
34.3%
PostTrainBench

Hasta 10 horas en una sola H100

2.º en general
13.0%
SWE-Marathon

SWE de horizonte ultralargo, hasta 10 horas

2.º tras la serie Opus

El trío de largo recorrido es aquello para lo que se construyó la generación actual del modelo GLM, y las tres evaluaciones fueron ejecutadas por organizaciones externas y no por los autores del modelo. FrontierSWE mide la dominancia en tareas de hasta veinte horas; PostTrainBench se ejecuta hasta diez horas en una sola H100; SWE-Marathon es ingeniería de software de horizonte ultralargo, también de hasta diez horas. GLM-5.2 es el modelo de código abierto mejor clasificado en las tres. Queda siete décimas de punto por detrás de Claude Opus 4.8 en FrontierSWE, supera allí a GPT-5.5 por 1.8 y aventaja en más de once al Opus 4.7 de la generación anterior.

Mejoras de los benchmarks GLM entre generaciones

Comparar GLM-5.2 con GLM-5.1 aísla lo que produjo una generación de trabajo, y comparar ambos con el mejor modelo cerrado de cada fila muestra cuánta distancia queda. Las etiquetas de diferencia de abajo son la puntuación publicada de GLM-5.2 menos la de GLM-5.1. Fíjate en lo desiguales que son: 3.7 puntos en SWE-bench Pro frente a 28.2 puntos en DeepSWE. Las evaluaciones que premian la ejecución sostenida avanzaron mucho más que las que premian un único parche acertado.

Terminal-Bench 2.1+17.5
SWE-bench Pro+3.7
NL2Repo+6.2
DeepSWE+28.2 (2.6×)
ProgramBench+12.8
MCP-Atlas+5.0
Tool-Decathlon+7.5
HLE+9.5

Los 17 benchmarks GLM en 8 modelos

La tabla completa de abajo es la versión de referencia, agrupada en secciones de razonamiento, programación y agéntica. La columna de GLM-5.2 aparece resaltada. Un guion significa que los autores del modelo no publicaron puntuación para ese modelo en ese benchmark, y este sitio no rellena esas celdas con estimaciones. Desplázate horizontalmente para ver todas las columnas de modelos.

Resultados publicados de benchmarks de modelos GLM en cada evaluación y modelo
BenchmarkGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Razonamiento
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programación
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agéntico
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* puntuación sobre el conjunto completo.

Resultados publicados de benchmarks de modelos GLM: 17 evaluaciones en 8 modelos.

Cómo se evaluaron estos benchmarks GLM

Los ajustes de evaluación siguientes son los publicados junto a los resultados. Merece la pena leerlos antes de citar ninguna cifra, porque la longitud de contexto, los parámetros de muestreo, la versión del harness y el presupuesto de tiempo mueven las puntuaciones de forma sustancial, y porque varias de estas evaluaciones las realizaron terceros y no los autores del modelo.

HLE y otras tareas de razonamiento

Muestreo con temperatura 1.0 y top-p 0.95, con una longitud máxima de generación de 163.840 tokens. Por defecto se reporta el subconjunto de solo texto; los resultados marcados con asterisco proceden del conjunto completo. AIME, HMMT e IMOAnswerBench usan un prompt de sistema con formato de respuesta fijo, con GPT-5.5 (medium) como modelo juez. HLE con herramientas usa un contexto de 300.000 tokens y ninguna estrategia de gestión de contexto.

SWE-bench Pro

Ejecutado con OpenHands usando un prompt de instrucciones adaptado, con temperatura 1, top-p 1 y un límite de 32K tokens nuevos, dentro de una ventana de contexto de 400K.

NL2Repo

Evaluado con temperatura 1.0, top-p 1.0 y un límite de 48K tokens nuevos bajo un contexto de 400K. Se aplica un juicio basado en reglas y en LLM para bloquear comportamientos maliciosos como la instalación no autorizada de paquetes o las llamadas de red.

DeepSWE

Ejecutado con el framework oficial de evaluación y el harness mini-swe-agent, con temperatura 1.0, top-p 1.0 y un tiempo límite de dos horas bajo un contexto de 400K. Cada tarea corre en un contenedor aislado con 2 CPU, 8 GB de RAM y sin acceso a internet.

ProgramBench

200 instancias evaluadas con Claude Code 2.1.156 a temperatura 1.0, top-p 1.0, un límite de 64.000 tokens, hasta 2.000 turnos, un tiempo límite de seis horas por muestra y el máximo esfuerzo de razonamiento, bajo un contexto de 400K. Cada instancia corre en un sandbox de 4 CPU y 8 GB con el acceso a internet desactivado.

Terminal-Bench 2.1 (Terminus-2)

Evaluado con el framework Terminus-2 usando parseo JSON, un tiempo límite de cuatro horas, temperatura 1.0, top-p 1.0, un límite de 48K tokens nuevos y hasta 500 episodios, bajo una ventana de contexto de 256K. Los recursos se limitan a 4 CPU y 8 GB de RAM.

Terminal-Bench 2.1 (Claude Code)

Evaluado en Claude Code 2.1.167 con temperatura 1.0, top-p 0.95 y 131.072 tokens nuevos, sorteando el límite de salida de 64K de la CLI mediante un proxy transparente. Se eliminan los límites de tiempo real y se mantienen las restricciones de CPU y memoria por tarea. Las puntuaciones son la media de cinco ejecuciones.

MCP-Atlas

Todos los modelos evaluados en modo de razonamiento sobre el subconjunto público de 500 tareas, con un tiempo límite de diez minutos por tarea y Gemini-3.0-Pro como modelo juez.

Tool-Decathlon

Ejecutado a través del servicio oficial de evaluación con el presupuesto máximo de tokens fijado en 128K.

FrontierSWE

Realizado por Proximal, no por los autores del modelo, con una longitud de contexto de 1M, el nivel de esfuerzo máximo y 128K tokens máximos de salida. La puntuación de dominancia se reporta a fecha de 16 de junio de 2026.

PostTrainBench

Realizado por PostTrainBench, no por los autores del modelo, con una longitud de contexto de 1M, el nivel de esfuerzo máximo y 128K tokens máximos de salida.

SWE-Marathon

Realizado por Abundant AI, no por los autores del modelo, con una longitud de contexto de 1M, el nivel de esfuerzo máximo y 128K tokens máximos de salida.

Preguntas frecuentes sobre los benchmarks de GLM

¿Cuáles son las puntuaciones de benchmark de GLM-5.2?
Las cifras principales publicadas son 81.0 en Terminal-Bench 2.1, 62.1 en SWE-bench Pro, 74.4 en FrontierSWE Dominance, 34.3 en PostTrainBench, 46.2 en DeepSWE, 76.8 en el conjunto público de MCP-Atlas y 99.2 en AIME 2026. Es el modelo de código abierto mejor clasificado en las tres evaluaciones de largo recorrido.
¿Quién ejecutó estos benchmarks de GLM?
Los autores del modelo ejecutaron la mayoría y publicaron los ajustes. Las tres evaluaciones de largo recorrido las realizaron terceros: FrontierSWE por Proximal, PostTrainBench por PostTrainBench y SWE-Marathon por Abundant AI. glmmodel.com no ejecutó ninguna y las reproduce todas tal como se publicaron.
¿Por qué Terminal-Bench 2.1 tiene dos puntuaciones distintas?
Porque el harness cambia el resultado. Con Terminus-2, GLM-5.2 saca 81.0 y Claude Opus 4.8 saca 85.0; con Claude Code, GLM-5.2 saca 82.7 y Opus 4.8 saca 78.9. El mismo benchmark, ganador opuesto: por eso el harness debería citarse siempre junto a la cifra.
¿Por qué hay celdas vacías en la tabla?
Un guion significa que no se publicó ninguna puntuación para ese modelo en ese benchmark. Este sitio no estima, interpola ni infiere celdas ausentes, porque una cifra inventada en una tabla comparativa es peor que un hueco honesto.
¿Puedo reproducir estos resultados de benchmark de GLM?
Potencialmente, si replicas los ajustes publicados: la longitud de contexto, los parámetros de muestreo, la versión del harness, los tiempos límite y los límites de recursos aparecen todos en la sección de metodología anterior. Espera variabilidad en cualquier caso; varias de estas evaluaciones promedian múltiples ejecuciones precisamente porque una sola ejecución es ruidosa.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.