Benchmarks GLM: todos os 17 resultados de avaliação do GLM-5.2

Este é o conjunto completo de benchmarks GLM publicados num só lugar: 17 avaliações em 8 modelos, cobrindo raciocínio, programação e uso agêntico de ferramentas, mais as três avaliações de longo alcance conduzidas por terceiros. Tudo nesta página é um resultado tal como publicado pelos autores do modelo ou pela organização que realizou a avaliação. O glmmodel.com reporta estes valores; não os executa.

Essa distinção não é uma nota de rodapé por gosto. As pontuações de benchmark dependem do harness a um ponto que surpreende — o mesmo modelo na mesma avaliação oscila vários pontos entre o Terminus-2 e o Claude Code — pelo que a secção de metodologia no fundo desta página é possivelmente mais útil do que a própria tabela. Leia os números como capacidade reportada sob condições declaradas, não como uma promessa sobre a sua carga de trabalho.

Os três benchmarks GLM de longo alcance

Todos os valores desta página são resultados tal como publicados pelos autores do modelo. O glmmodel.com apenas os reporta; não executa estas avaliações.

74.4%
FrontierSWE

Dominance, tarefas até 20 horas

Melhor modelo open source
34.3%
PostTrainBench

Até 10 horas numa única H100

2.º no geral
13.0%
SWE-Marathon

SWE de alcance ultralongo, até 10 horas

2.º a seguir à série Opus

O trio de longo alcance é aquilo para que a geração atual dos modelos GLM foi criada, e as três avaliações foram conduzidas por organizações externas e não pelos autores do modelo. O FrontierSWE mede a dominância em tarefas que chegam às vinte horas; o PostTrainBench corre até dez horas numa única H100; o SWE-Marathon é engenharia de software de alcance ultralongo, também até dez horas. O GLM-5.2 é o modelo open source melhor classificado nas três. Fica sete décimas de ponto atrás do Claude Opus 4.8 no FrontierSWE, supera aí o GPT-5.5 por 1.8 e supera o Opus 4.7 da geração anterior por mais de onze.

Ganhos de geração para geração nos benchmarks GLM

Comparar o GLM-5.2 com o GLM-5.1 isola o que uma geração de trabalho produziu, e comparar ambos com o melhor modelo fechado em cada linha mostra quanta distância ainda falta. Os indicadores de diferença abaixo são a pontuação publicada do GLM-5.2 menos a pontuação publicada do GLM-5.1. Repare como são irregulares: 3.7 pontos no SWE-bench Pro contra 28.2 pontos no DeepSWE. As avaliações que premeiam execução sustentada avançaram muito mais do que as que premeiam um único bom patch.

Terminal-Bench 2.1+17.5
SWE-bench Pro+3.7
NL2Repo+6.2
DeepSWE+28.2 (2.6×)
ProgramBench+12.8
MCP-Atlas+5.0
Tool-Decathlon+7.5
HLE+9.5

Todos os 17 benchmarks GLM em 8 modelos

A tabela completa abaixo é a versão autoritativa, agrupada em secções de raciocínio, programação e agêntico. A coluna do GLM-5.2 está destacada. Um travessão significa que os autores do modelo não publicaram pontuação para esse modelo nesse benchmark, e este site não preenche essas células com estimativas. Desloque-se horizontalmente para ver todas as colunas de modelos.

Resultados de benchmark publicados dos modelos GLM em todas as avaliações e modelos
BenchmarkGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Raciocínio
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programação
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agêntico
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* pontuação no conjunto completo.

Resultados de benchmark publicados dos modelos GLM: 17 avaliações em 8 modelos.

Como foram avaliados estes benchmarks GLM

As definições de avaliação abaixo são as que foram publicadas juntamente com os resultados. Vale a pena lê-las antes de citar qualquer valor, porque o comprimento do contexto, os parâmetros de amostragem, a versão do harness e o orçamento de tempo limite alteram materialmente as pontuações — e porque várias destas avaliações foram conduzidas por terceiros e não pelos autores do modelo.

HLE e outras tarefas de raciocínio

Amostragem com temperatura 1.0 e top-p 0.95, com um comprimento máximo de geração de 163.840 tokens. Por omissão é reportado o subconjunto apenas de texto; os resultados assinalados com asterisco vêm do conjunto completo. O AIME, o HMMT e o IMOAnswerBench usam um prompt de sistema com formato de resposta fixo, tendo o GPT-5.5 (medium) como modelo juiz. O HLE com ferramentas usa um contexto de 300.000 tokens e nenhuma estratégia de gestão de contexto.

SWE-bench Pro

Executado com o OpenHands, usando um prompt de instrução adaptado, com temperatura 1, top-p 1 e um limite de 32K novos tokens, dentro de uma janela de contexto de 400K.

NL2Repo

Avaliado com temperatura 1.0, top-p 1.0 e um limite de 48K novos tokens, sob um contexto de 400K. É aplicado julgamento baseado em regras e por LLM para bloquear comportamentos maliciosos, como a instalação não autorizada de pacotes ou chamadas de rede.

DeepSWE

Executado com a framework de avaliação oficial e o harness mini-swe-agent, com temperatura 1.0, top-p 1.0 e um tempo limite de duas horas, sob um contexto de 400K. Cada tarefa corre num contentor isolado com 2 CPUs, 8 GB de RAM e sem acesso à Internet.

ProgramBench

200 instâncias avaliadas com o Claude Code 2.1.156, com temperatura 1.0, top-p 1.0, um limite de 64.000 tokens, até 2.000 turnos, um tempo limite de seis horas por amostra e esforço de raciocínio máximo, sob um contexto de 400K. Cada instância corre numa sandbox de 4 CPUs e 8 GB, com o acesso à Internet desativado.

Terminal-Bench 2.1 (Terminus-2)

Avaliado com a framework Terminus-2 usando parsing de JSON, um tempo limite de quatro horas, temperatura 1.0, top-p 1.0, um limite de 48K novos tokens e até 500 episódios, sob uma janela de contexto de 256K. Os recursos estão limitados a 4 CPUs e 8 GB de RAM.

Terminal-Bench 2.1 (Claude Code)

Avaliado no Claude Code 2.1.167 com temperatura 1.0, top-p 0.95 e 131.072 novos tokens, com o limite de saída de 64K da CLI contornado através de um proxy transparente. Os limites de tempo real são removidos, mantendo-se as restrições de CPU e memória por tarefa. As pontuações são a média de cinco execuções.

MCP-Atlas

Todos os modelos avaliados em modo de raciocínio no subconjunto público de 500 tarefas, com um tempo limite de dez minutos por tarefa, usando o Gemini-3.0-Pro como modelo juiz.

Tool-Decathlon

Executado através do serviço de avaliação oficial, com o orçamento máximo de tokens definido em 128K.

FrontierSWE

Conduzido pela Proximal, e não pelos autores do modelo, com um comprimento de contexto de 1M, o nível de esforço máximo e 128K tokens de saída máximos. A pontuação de dominância é reportada a 16 de junho de 2026.

PostTrainBench

Conduzido pela PostTrainBench, e não pelos autores do modelo, com um comprimento de contexto de 1M, o nível de esforço máximo e 128K tokens de saída máximos.

SWE-Marathon

Conduzido pela Abundant AI, e não pelos autores do modelo, com um comprimento de contexto de 1M, o nível de esforço máximo e 128K tokens de saída máximos.

FAQ dos benchmarks GLM

Quais são as pontuações de benchmark do GLM-5.2?
Os valores de destaque publicados são 81.0 no Terminal-Bench 2.1, 62.1 no SWE-bench Pro, 74.4 no FrontierSWE Dominance, 34.3 no PostTrainBench, 46.2 no DeepSWE, 76.8 no conjunto público do MCP-Atlas e 99.2 no AIME 2026. É o modelo open source melhor classificado nas três avaliações de longo alcance.
Quem executou estes benchmarks GLM?
Os autores do modelo executaram a maioria e publicaram as definições. As três avaliações de longo alcance foram conduzidas por terceiros: o FrontierSWE pela Proximal, o PostTrainBench pela PostTrainBench e o SWE-Marathon pela Abundant AI. O glmmodel.com não executou nenhuma e reporta todas tal como foram publicadas.
Por que razão o Terminal-Bench 2.1 tem duas pontuações diferentes?
Porque o harness altera o resultado. Sob o Terminus-2, o GLM-5.2 obtém 81.0 e o Claude Opus 4.8 obtém 85.0; sob o Claude Code, o GLM-5.2 obtém 82.7 e o Opus 4.8 obtém 78.9. Mesmo benchmark, vencedor oposto — razão pela qual o harness deve ser sempre citado junto do número.
Por que razão algumas células da tabela estão vazias?
Um travessão significa que não foi publicada nenhuma pontuação para esse modelo nesse benchmark. Este site não estima, interpola nem infere células em falta, porque um número inventado numa tabela comparativa é pior do que uma lacuna honesta.
Posso reproduzir estes resultados de benchmark GLM?
Possivelmente, se replicar as definições publicadas — comprimento de contexto, parâmetros de amostragem, versão do harness, tempo limite e limites de recursos estão todos listados na secção de metodologia acima. Conte sempre com variância; várias destas avaliações fazem a média de múltiplas execuções precisamente porque execuções isoladas são ruidosas.

Experimente um modelo de IA ao vivo, grátis — sem conta

Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.