Níveis de esforço do GLM: Non-Thinking vs High vs Max

Os níveis de esforço do GLM são o controlo, por pedido, da computação que o modelo GLM emblemático gasta numa tarefa. São três — Non-Thinking, High e Max — e escolher entre eles é o botão mais consequente que tem à disposição, porque na curva publicada a diferença entre a definição mais barata e a mais cara é de cerca de onze pontos de exatidão e 2.4× os tokens de saída.

Um modelo GLM não tem uma única velocidade. Tratar o nível de esforço como uma decisão por tarefa e não como uma definição global é o que torna a funcionalidade valiosa: o trabalho de rotina corre barato, o trabalho difícil recebe a computação de que precisa, e nada paga por profundidade que não usa. Os valores abaixo são tal como publicados pelos autores do modelo.

Os três níveis de esforço do GLM

A curva publicada, com média de Terminal-Bench 2.1, DeepSWE e SWE-Atlas QnA no Claude Code 2.1.167, é aproximadamente a seguinte. Os valores de tokens são a média de tokens de saída por tarefa, que é o custo que realmente varia.

Non-Thinking

~63%
~35K tokens em média

Edições rápidas, código repetitivo e refatorações de rotina, onde a latência importa mais do que a profundidade.

High

Mais usado
~72%
~43K tokens em média

A opção por omissão para a maior parte da programação agêntica: qualidade próxima do Max por cerca de metade dos tokens.

Max

~74%
~83K tokens em média

Problemas difíceis e de longo alcance — atribua computação extra quando a tarefa realmente o justifica.

Média de Terminal-Bench 2.1, DeepSWE e SWE-Atlas QnA, avaliados no Claude Code 2.1.167. Reportado pelos autores do modelo. Com orçamentos de tokens comparáveis, o GLM-5.2 situa-se entre o Claude Opus 4.7 e o Opus 4.8.

Como ler a curva de esforço do GLM

Os dois degraus não são equivalentes. Passar de Non-Thinking para High compra cerca de nove pontos de exatidão por cerca de 23% mais tokens de saída — uma troca inequivocamente boa para quase qualquer tarefa que lhe interesse. Passar de High para Max compra cerca de mais dois pontos por cerca de 93% mais tokens, o que só é uma boa troca quando esses dois pontos decidem se a tarefa é ou não bem-sucedida.

É essa assimetria que faz do High a opção prática por omissão. Explica também por que razão ativar o Max de forma indiscriminada é um erro comum e caro: numa fila de tarefas de rotina, quase duplica o gasto de tokens para ganhar quase nada, e em problemas genuinamente difíceis e de longo alcance é a definição que faz a diferença. Com orçamentos de tokens comparáveis, os autores do modelo posicionam o GLM-5.2 entre o Claude Opus 4.7 e o Opus 4.8. Vale também a pena notar o que a curva não diz. São médias de três avaliações, pelo que o ponto de cruzamento na sua própria carga de trabalho pode estar em qualquer lado — uma distribuição de tarefas dominada por edições curtas beneficiará ainda menos do Max do que a média sugere, enquanto uma dominada por depuração de várias horas poderá beneficiar consideravelmente mais. A forma da curva transfere-se; os números exatos não.

Escolher um nível de esforço do GLM na prática

Encaminhe por classe de tarefa e não por preferência. Uma política por omissão viável é a seguinte:

  • Non-Thinking para edições rápidas, código repetitivo, formatação, refatorações de rotina e tudo aquilo em que a latência importa mais do que a profundidade.
  • High como opção por omissão para programação agêntica — qualidade próxima do Max por cerca de metade do gasto de tokens do Max.
  • Max para problemas difíceis e de longo alcance: execuções de várias horas, depuração profunda, trabalho de arquitetura e tudo aquilo em que uma tentativa falhada custa mais do que os tokens extra.
  • Escale em vez de começar alto: corra primeiro em High e volte a tentar em Max apenas em caso de falha. Isso mantém a definição cara na pequena fração de tarefas que dela precisa.
  • Meça na sua própria carga de trabalho. A curva publicada faz a média de três avaliações; a sua distribuição de tarefas terá a sua própria forma e o seu próprio ponto de cruzamento.

Todos os valores desta página são resultados tal como publicados pelos autores do modelo. O glmmodel.com apenas os reporta; não executa estas avaliações.

FAQ dos níveis de esforço do GLM

O que são os níveis de esforço do GLM?
Non-Thinking, High e Max são definições por pedido do modelo GLM emblemático que controlam quanta computação ele gasta numa tarefa. Na curva publicada de programação agêntica, isso corresponde a cerca de 63% com aproximadamente 35K tokens de saída, 72% com cerca de 43K e 74% com cerca de 83K.
Que nível de esforço do GLM devo usar?
High para a maior parte da programação agêntica — é qualidade próxima do Max por cerca de metade do gasto de tokens. Non-Thinking para trabalho rápido e de rotina em que a latência domina. Max apenas para problemas genuinamente difíceis e de longo alcance, em que os dois pontos extra de exatidão decidem o resultado.
O esforço Max do GLM compensa o custo em tokens?
Apenas de forma seletiva. O Max custa cerca de 93% mais tokens de saída do que o High por aproximadamente mais dois pontos na curva publicada. Isso é excelente valor quando uma falha é cara e mau valor numa fila de tarefas de rotina, razão pela qual escalar em caso de falha é melhor do que usar Max por omissão.
Os modelos GLM mais antigos têm níveis de esforço?
Não. Os níveis de esforço explícitos foram introduzidos com o GLM-5.2. O GLM-5.1 e os lançamentos anteriores gastam uma quantidade fixa de computação por tarefa, pelo que nada do que se construa sobre eles pode ajustar o compromisso a cada pedido.
Como se compara a curva de esforço com a dos modelos fechados?
Os autores do modelo posicionam o GLM-5.2 entre o Claude Opus 4.7 e o Opus 4.8 com orçamentos de tokens comparáveis. As medições foram calculadas como média de Terminal-Bench 2.1, DeepSWE e SWE-Atlas QnA e avaliadas no Claude Code 2.1.167.

Experimente um modelo de IA ao vivo, grátis — sem conta

Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.