Los niveles de esfuerzo de GLM son el control por petición del modelo GLM insignia sobre cuánto cómputo dedica a una tarea. Hay tres (Non-Thinking, High y Max) y elegir entre ellos es el ajuste más determinante del que dispones, porque en la curva publicada la diferencia entre la opción más barata y la más cara es de aproximadamente once puntos de precisión y 2.4× más tokens de salida.
Un modelo GLM no tiene una única velocidad. Tratar el nivel de esfuerzo como una decisión por tarea y no como un ajuste global es lo que hace valiosa esta característica: el trabajo rutinario sale barato, el difícil recibe el cómputo que necesita y nada paga por una profundidad que no usa. Las cifras siguientes son las publicadas por los autores del modelo.
La curva publicada, promediada sobre Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA en Claude Code 2.1.167, es aproximadamente la siguiente. Las cifras de tokens son tokens de salida medios por tarea, que es el coste que realmente varía.
Ediciones rápidas, código repetitivo y refactorizaciones rutinarias donde la latencia importa más que la profundidad.
La opción por defecto para la mayoría de la programación agéntica: calidad casi de nivel Max por aproximadamente la mitad del gasto en tokens.
Problemas difíciles y de largo recorrido: asigna cómputo adicional cuando la tarea realmente lo justifica.
Promedio de Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA, evaluados en Claude Code 2.1.167. Datos publicados por los autores del modelo. Con presupuestos de tokens comparables, GLM-5.2 se sitúa entre Claude Opus 4.7 y Opus 4.8.
Los dos saltos no son equivalentes. Pasar de Non-Thinking a High compra unos nueve puntos de precisión por cerca de un 23% más de tokens de salida, un intercambio inequívocamente bueno para casi cualquier tarea que te importe. Pasar de High a Max compra unos dos puntos más por alrededor de un 93% más de tokens, un intercambio que solo merece la pena cuando esos dos puntos deciden si la tarea llega a completarse.
Esa asimetría es la razón por la que High es el valor por defecto práctico. También explica por qué activar Max de forma indiscriminada es un error común y caro: en una cola de tareas rutinarias casi duplica el gasto en tokens para no ganar casi nada, mientras que en problemas realmente difíciles y de largo recorrido es el ajuste que marca la diferencia. Con presupuestos de tokens comparables, los autores del modelo sitúan a GLM-5.2 entre Claude Opus 4.7 y Opus 4.8. También conviene señalar lo que la curva no dice. Son promedios de tres evaluaciones, así que el punto de cruce en tu propia carga de trabajo podría estar en cualquier parte: una distribución de tareas dominada por ediciones cortas sacará aún menos partido de Max que el promedio, mientras que otra dominada por depuraciones de varias horas puede sacar bastante más. La forma de la curva se traslada; los números exactos no.
Enruta por clase de tarea y no por preferencia. Una política por defecto que funciona es esta:
Todas las cifras de esta página son resultados publicados por los autores del modelo. glmmodel.com los reproduce; no ejecuta estas evaluaciones.
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.