Niveles de esfuerzo de GLM: Non-Thinking vs High vs Max

Los niveles de esfuerzo de GLM son el control por petición del modelo GLM insignia sobre cuánto cómputo dedica a una tarea. Hay tres (Non-Thinking, High y Max) y elegir entre ellos es el ajuste más determinante del que dispones, porque en la curva publicada la diferencia entre la opción más barata y la más cara es de aproximadamente once puntos de precisión y 2.4× más tokens de salida.

Un modelo GLM no tiene una única velocidad. Tratar el nivel de esfuerzo como una decisión por tarea y no como un ajuste global es lo que hace valiosa esta característica: el trabajo rutinario sale barato, el difícil recibe el cómputo que necesita y nada paga por una profundidad que no usa. Las cifras siguientes son las publicadas por los autores del modelo.

Los tres niveles de esfuerzo de GLM

La curva publicada, promediada sobre Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA en Claude Code 2.1.167, es aproximadamente la siguiente. Las cifras de tokens son tokens de salida medios por tarea, que es el coste que realmente varía.

Non-Thinking

~63%
~35K tokens medios

Ediciones rápidas, código repetitivo y refactorizaciones rutinarias donde la latencia importa más que la profundidad.

High

Más usado
~72%
~43K tokens medios

La opción por defecto para la mayoría de la programación agéntica: calidad casi de nivel Max por aproximadamente la mitad del gasto en tokens.

Max

~74%
~83K tokens medios

Problemas difíciles y de largo recorrido: asigna cómputo adicional cuando la tarea realmente lo justifica.

Promedio de Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA, evaluados en Claude Code 2.1.167. Datos publicados por los autores del modelo. Con presupuestos de tokens comparables, GLM-5.2 se sitúa entre Claude Opus 4.7 y Opus 4.8.

Cómo leer la curva de esfuerzo de GLM

Los dos saltos no son equivalentes. Pasar de Non-Thinking a High compra unos nueve puntos de precisión por cerca de un 23% más de tokens de salida, un intercambio inequívocamente bueno para casi cualquier tarea que te importe. Pasar de High a Max compra unos dos puntos más por alrededor de un 93% más de tokens, un intercambio que solo merece la pena cuando esos dos puntos deciden si la tarea llega a completarse.

Esa asimetría es la razón por la que High es el valor por defecto práctico. También explica por qué activar Max de forma indiscriminada es un error común y caro: en una cola de tareas rutinarias casi duplica el gasto en tokens para no ganar casi nada, mientras que en problemas realmente difíciles y de largo recorrido es el ajuste que marca la diferencia. Con presupuestos de tokens comparables, los autores del modelo sitúan a GLM-5.2 entre Claude Opus 4.7 y Opus 4.8. También conviene señalar lo que la curva no dice. Son promedios de tres evaluaciones, así que el punto de cruce en tu propia carga de trabajo podría estar en cualquier parte: una distribución de tareas dominada por ediciones cortas sacará aún menos partido de Max que el promedio, mientras que otra dominada por depuraciones de varias horas puede sacar bastante más. La forma de la curva se traslada; los números exactos no.

Elegir un nivel de esfuerzo de GLM en la práctica

Enruta por clase de tarea y no por preferencia. Una política por defecto que funciona es esta:

  • Non-Thinking para ediciones rápidas, código repetitivo, formateo, refactorizaciones rutinarias y todo aquello donde la latencia importe más que la profundidad.
  • High como opción por defecto para la programación agéntica: calidad casi de nivel Max por aproximadamente la mitad del gasto en tokens de Max.
  • Max para problemas difíciles y de largo recorrido: ejecuciones de varias horas, depuración profunda, trabajo de arquitectura y cualquier caso en que un intento fallido cueste más que los tokens extra.
  • Escala en lugar de empezar arriba: ejecuta primero en High y reintenta en Max solo si falla. Así el ajuste caro se queda en la pequeña fracción de tareas que lo necesita.
  • Mide con tu propia carga de trabajo. La curva publicada promedia tres evaluaciones; tu distribución de tareas tendrá su propia forma y su propio punto de cruce.

Todas las cifras de esta página son resultados publicados por los autores del modelo. glmmodel.com los reproduce; no ejecuta estas evaluaciones.

Preguntas frecuentes sobre los niveles de esfuerzo de GLM

¿Qué son los niveles de esfuerzo de GLM?
Non-Thinking, High y Max son ajustes por petición del modelo GLM insignia que controlan cuánto cómputo dedica a una tarea. En la curva publicada de programación agéntica eso equivale aproximadamente a un 63% con unos 35K tokens de salida, un 72% con unos 43K y un 74% con unos 83K.
¿Qué nivel de esfuerzo de GLM debería usar?
High para la mayor parte de la programación agéntica: es calidad casi de nivel Max por aproximadamente la mitad del gasto en tokens. Non-Thinking para trabajo rápido y rutinario donde manda la latencia. Max solo para problemas realmente difíciles y de largo recorrido en los que esos dos puntos extra de precisión deciden el resultado.
¿Merece la pena el coste en tokens del esfuerzo Max de GLM?
Solo de forma selectiva. Max cuesta alrededor de un 93% más de tokens de salida que High a cambio de unos dos puntos en la curva publicada. Eso es una relación excelente cuando un fallo sale caro y muy mala en una cola de tareas rutinarias, y por eso escalar tras un fallo es mejor que usar Max por defecto.
¿Tienen niveles de esfuerzo los modelos GLM anteriores?
No. Los niveles de esfuerzo explícitos se introdujeron con GLM-5.2. GLM-5.1 y los lanzamientos anteriores dedican una cantidad fija de cómputo por tarea, así que lo que construyas sobre ellos no puede ajustar ese equilibrio por petición.
¿Cómo se compara la curva de esfuerzo con los modelos cerrados?
Los autores del modelo sitúan a GLM-5.2 entre Claude Opus 4.7 y Opus 4.8 con presupuestos de tokens comparables. Las mediciones se promediaron sobre Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA, y se evaluaron en Claude Code 2.1.167.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.