GLM-5.2 vs GLM-5.1 é a única comparação deste site sem ambiguidade: nas 19 avaliações publicadas em que ambos os modelos têm pontuação, o modelo GLM mais recente vence todas as linhas. O que torna a comparação interessante não é quem vence, mas por quanto, porque as margens variam entre quatro décimas de ponto e mais de quarenta.
Essa dispersão é a evidência mais clara disponível do que a geração realmente mudou. O raciocínio padrão avançou pouco, a programação padrão avançou moderadamente e a execução agêntica de longo alcance avançou enormemente — que é exatamente o que se esperaria de um lançamento cujas mudanças principais são um aumento de cinco vezes no contexto e uma stack de atenção esparsa reconstruída. Todos os valores são tal como publicados pelos autores do modelo.
O GLM-5.2 vence 19 de 19 linhas publicadas contra o GLM-5.1. As margens pequenas estão em benchmarks já próximos do teto — o HMMT Nov. 2025 passa de 94.0 para 94.4 e o HLE com ferramentas de 52.3 para 54.7. As grandes estão no trabalho de longo alcance: FrontierSWE Dominance de 30.5 para 74.4, SWE-Marathon de 1.0 para 13.0, DeepSWE de 18.0 para 46.2 e CritPt de 4.6 para 20.9. O Terminal-Bench 2.1 passa de 63.5 para 81.0 sob o Terminus-2 e de 69.0 para 82.7 sob o Claude Code. Se hoje usa o GLM-5.1 e a sua carga de trabalho é agêntica, esta não é uma atualização marginal.
As mudanças estruturais explicam a dispersão dos benchmarks. O teto de contexto passou de 200.000 para 1.000.000 de tokens, a atenção esparsa foi reconstruída para que cada quatro camadas partilhem um indexador leve, a incompatibilidade de KV-cache entre treino e inferência da camada de previsão multi-token foi eliminada e foram introduzidos níveis de esforço explícitos. Ambos os lançamentos continuam a ser modelos GLM de pesos abertos com licença MIT nos mesmos alojamentos públicos.
| Característica | GLM-5.2 | GLM-5.1 |
|---|---|---|
| Janela de contexto | 1.000.000 tokens | 200.000 tokens |
| Arquitetura de atenção | Atenção esparsa com IndexShare | Atenção esparsa, um indexador por camada |
| Comprimento de aceitação do MTP | 5.47 (+20%) | 4.56 (base) |
| Controlo de esforço | Explícito — Non-Thinking, High, Max | Não exposto |
| Licença | Licença MIT | Licença MIT |
Leia primeiro o bloco de programação: nove linhas, nove vitórias, e os aumentos crescem com a duração da tarefa. O SWE-bench Pro ganha 3.7 pontos, o ProgramBench 12.8, o Terminal-Bench 2.1 17.5, o DeepSWE 28.2 — uma melhoria de 2.6× — e o FrontierSWE Dominance 43.9. O bloco de raciocínio é uma vitória mais discreta: o HLE ganha 9.5, o AIME 2026 3.9, o IMOAnswerBench 7.2, o GPQA-Diamond 5.0 e o CritPt salta de 4.6 para 20.9, mais de quatro vezes a pontuação anterior. A ordem dessas diferenças é o argumento central do lançamento. Se a geração tivesse simplesmente sido treinada durante mais tempo com mais dados, esperar-se-iam ganhos aproximadamente uniformes em toda a tabela; em vez disso, os aumentos acompanham a duração das tarefas de cada avaliação, que é o que se previa de um aumento de cinco vezes no contexto e de uma reconstrução da atenção dirigida diretamente ao trabalho de longo alcance.
| Benchmark | GLM-5.2 | GLM-5.1 | Vencedor |
|---|---|---|---|
| Programação e longo alcance | |||
| FrontierSWE Dominance | 74.4 | 30.5 | GLM-5.2 |
| PostTrainBench | 34.3 | 20.1 | GLM-5.2 |
| SWE-Marathon | 13.0 | 1.0 | GLM-5.2 |
| SWE-bench Pro | 62.1 | 58.4 | GLM-5.2 |
| NL2Repo | 48.9 | 42.7 | GLM-5.2 |
| ProgramBench | 63.7 | 50.9 | GLM-5.2 |
| DeepSWE | 46.2 | 18.0 | GLM-5.2 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | GLM-5.2 |
| Terminal-Bench 2.1 (Claude Code) | 82.7 | 69.0 | GLM-5.2 |
| Raciocínio e agêntico | |||
| MCP-Atlas (public set) | 76.8 | 71.8 | GLM-5.2 |
| Tool-Decathlon | 48.2 | 40.7 | GLM-5.2 |
| HLE | 40.5 | 31.0 | GLM-5.2 |
| HLE w/ Tools | 54.7 | 52.3 | GLM-5.2 |
| CritPt | 20.9 | 4.6 | GLM-5.2 |
| AIME 2026 | 99.2 | 95.3 | GLM-5.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | GLM-5.2 |
| HMMT Feb. 2026 | 92.5 | 82.6 | GLM-5.2 |
| IMOAnswerBench | 91.0 | 83.8 | GLM-5.2 |
| GPQA-Diamond | 91.2 | 86.2 | GLM-5.2 |
* pontuação no conjunto completo.
Todos os valores desta página são resultados tal como publicados pelos autores do modelo. O glmmodel.com apenas os reporta; não executa estas avaliações.
Ver os 17 benchmarks GLM em detalhe →Para qualquer nova implementação, o GLM-5.2 é a opção por omissão. Vence todas as linhas publicadas, traz cinco vezes o contexto, expõe níveis de esforço para poder gastar computação de forma deliberada, e serve essa janela maior com FLOPs por token 2.9× menores graças ao IndexShare — pelo que o modelo maior não é proporcionalmente mais caro por token.
Há exatamente um argumento honesto para continuar no GLM-5.1, e é operacional e não qualitativo. Uma janela de 200.000 tokens custa muito menos memória de KV-cache do que uma de um milhão, pelo que, se as suas tarefas realmente cabem e o hardware está apertado, o modelo mais antigo tem uma pegada menor. Em trabalho de programação delimitado, a diferença publicada é de apenas alguns pontos.
Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.