Este é o conjunto completo de benchmarks GLM publicados num só lugar: 17 avaliações em 8 modelos, cobrindo raciocínio, programação e uso agêntico de ferramentas, mais as três avaliações de longo alcance conduzidas por terceiros. Tudo nesta página é um resultado tal como publicado pelos autores do modelo ou pela organização que realizou a avaliação. O glmmodel.com reporta estes valores; não os executa.
Essa distinção não é uma nota de rodapé por gosto. As pontuações de benchmark dependem do harness a um ponto que surpreende — o mesmo modelo na mesma avaliação oscila vários pontos entre o Terminus-2 e o Claude Code — pelo que a secção de metodologia no fundo desta página é possivelmente mais útil do que a própria tabela. Leia os números como capacidade reportada sob condições declaradas, não como uma promessa sobre a sua carga de trabalho.
Todos os valores desta página são resultados tal como publicados pelos autores do modelo. O glmmodel.com apenas os reporta; não executa estas avaliações.
Dominance, tarefas até 20 horas
Melhor modelo open sourceAté 10 horas numa única H100
2.º no geralSWE de alcance ultralongo, até 10 horas
2.º a seguir à série OpusO trio de longo alcance é aquilo para que a geração atual dos modelos GLM foi criada, e as três avaliações foram conduzidas por organizações externas e não pelos autores do modelo. O FrontierSWE mede a dominância em tarefas que chegam às vinte horas; o PostTrainBench corre até dez horas numa única H100; o SWE-Marathon é engenharia de software de alcance ultralongo, também até dez horas. O GLM-5.2 é o modelo open source melhor classificado nas três. Fica sete décimas de ponto atrás do Claude Opus 4.8 no FrontierSWE, supera aí o GPT-5.5 por 1.8 e supera o Opus 4.7 da geração anterior por mais de onze.
Comparar o GLM-5.2 com o GLM-5.1 isola o que uma geração de trabalho produziu, e comparar ambos com o melhor modelo fechado em cada linha mostra quanta distância ainda falta. Os indicadores de diferença abaixo são a pontuação publicada do GLM-5.2 menos a pontuação publicada do GLM-5.1. Repare como são irregulares: 3.7 pontos no SWE-bench Pro contra 28.2 pontos no DeepSWE. As avaliações que premeiam execução sustentada avançaram muito mais do que as que premeiam um único bom patch.
A tabela completa abaixo é a versão autoritativa, agrupada em secções de raciocínio, programação e agêntico. A coluna do GLM-5.2 está destacada. Um travessão significa que os autores do modelo não publicaram pontuação para esse modelo nesse benchmark, e este site não preenche essas células com estimativas. Desloque-se horizontalmente para ver todas as colunas de modelos.
| Benchmark | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Raciocínio | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE w/ Tools | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programação | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (best harness) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agêntico | ||||||||
| MCP-Atlas (public set) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* pontuação no conjunto completo.
Resultados de benchmark publicados dos modelos GLM: 17 avaliações em 8 modelos.
As definições de avaliação abaixo são as que foram publicadas juntamente com os resultados. Vale a pena lê-las antes de citar qualquer valor, porque o comprimento do contexto, os parâmetros de amostragem, a versão do harness e o orçamento de tempo limite alteram materialmente as pontuações — e porque várias destas avaliações foram conduzidas por terceiros e não pelos autores do modelo.
Amostragem com temperatura 1.0 e top-p 0.95, com um comprimento máximo de geração de 163.840 tokens. Por omissão é reportado o subconjunto apenas de texto; os resultados assinalados com asterisco vêm do conjunto completo. O AIME, o HMMT e o IMOAnswerBench usam um prompt de sistema com formato de resposta fixo, tendo o GPT-5.5 (medium) como modelo juiz. O HLE com ferramentas usa um contexto de 300.000 tokens e nenhuma estratégia de gestão de contexto.
Executado com o OpenHands, usando um prompt de instrução adaptado, com temperatura 1, top-p 1 e um limite de 32K novos tokens, dentro de uma janela de contexto de 400K.
Avaliado com temperatura 1.0, top-p 1.0 e um limite de 48K novos tokens, sob um contexto de 400K. É aplicado julgamento baseado em regras e por LLM para bloquear comportamentos maliciosos, como a instalação não autorizada de pacotes ou chamadas de rede.
Executado com a framework de avaliação oficial e o harness mini-swe-agent, com temperatura 1.0, top-p 1.0 e um tempo limite de duas horas, sob um contexto de 400K. Cada tarefa corre num contentor isolado com 2 CPUs, 8 GB de RAM e sem acesso à Internet.
200 instâncias avaliadas com o Claude Code 2.1.156, com temperatura 1.0, top-p 1.0, um limite de 64.000 tokens, até 2.000 turnos, um tempo limite de seis horas por amostra e esforço de raciocínio máximo, sob um contexto de 400K. Cada instância corre numa sandbox de 4 CPUs e 8 GB, com o acesso à Internet desativado.
Avaliado com a framework Terminus-2 usando parsing de JSON, um tempo limite de quatro horas, temperatura 1.0, top-p 1.0, um limite de 48K novos tokens e até 500 episódios, sob uma janela de contexto de 256K. Os recursos estão limitados a 4 CPUs e 8 GB de RAM.
Avaliado no Claude Code 2.1.167 com temperatura 1.0, top-p 0.95 e 131.072 novos tokens, com o limite de saída de 64K da CLI contornado através de um proxy transparente. Os limites de tempo real são removidos, mantendo-se as restrições de CPU e memória por tarefa. As pontuações são a média de cinco execuções.
Todos os modelos avaliados em modo de raciocínio no subconjunto público de 500 tarefas, com um tempo limite de dez minutos por tarefa, usando o Gemini-3.0-Pro como modelo juiz.
Executado através do serviço de avaliação oficial, com o orçamento máximo de tokens definido em 128K.
Conduzido pela Proximal, e não pelos autores do modelo, com um comprimento de contexto de 1M, o nível de esforço máximo e 128K tokens de saída máximos. A pontuação de dominância é reportada a 16 de junho de 2026.
Conduzido pela PostTrainBench, e não pelos autores do modelo, com um comprimento de contexto de 1M, o nível de esforço máximo e 128K tokens de saída máximos.
Conduzido pela Abundant AI, e não pelos autores do modelo, com um comprimento de contexto de 1M, o nível de esforço máximo e 128K tokens de saída máximos.
Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.