GLM-5.2 vs GLM-5.1: todos os ganhos de geração para geração

GLM-5.2 vs GLM-5.1 é a única comparação deste site sem ambiguidade: nas 19 avaliações publicadas em que ambos os modelos têm pontuação, o modelo GLM mais recente vence todas as linhas. O que torna a comparação interessante não é quem vence, mas por quanto, porque as margens variam entre quatro décimas de ponto e mais de quarenta.

Essa dispersão é a evidência mais clara disponível do que a geração realmente mudou. O raciocínio padrão avançou pouco, a programação padrão avançou moderadamente e a execução agêntica de longo alcance avançou enormemente — que é exatamente o que se esperaria de um lançamento cujas mudanças principais são um aumento de cinco vezes no contexto e uma stack de atenção esparsa reconstruída. Todos os valores são tal como publicados pelos autores do modelo.

O veredicto

O GLM-5.2 vence 19 de 19GLM-5.1 vence 0

O GLM-5.2 vence 19 de 19 linhas publicadas contra o GLM-5.1. As margens pequenas estão em benchmarks já próximos do teto — o HMMT Nov. 2025 passa de 94.0 para 94.4 e o HLE com ferramentas de 52.3 para 54.7. As grandes estão no trabalho de longo alcance: FrontierSWE Dominance de 30.5 para 74.4, SWE-Marathon de 1.0 para 13.0, DeepSWE de 18.0 para 46.2 e CritPt de 4.6 para 20.9. O Terminal-Bench 2.1 passa de 63.5 para 81.0 sob o Terminus-2 e de 69.0 para 82.7 sob o Claude Code. Se hoje usa o GLM-5.1 e a sua carga de trabalho é agêntica, esta não é uma atualização marginal.

GLM-5.2 vs GLM-5.1: especificações num relance

As mudanças estruturais explicam a dispersão dos benchmarks. O teto de contexto passou de 200.000 para 1.000.000 de tokens, a atenção esparsa foi reconstruída para que cada quatro camadas partilhem um indexador leve, a incompatibilidade de KV-cache entre treino e inferência da camada de previsão multi-token foi eliminada e foram introduzidos níveis de esforço explícitos. Ambos os lançamentos continuam a ser modelos GLM de pesos abertos com licença MIT nos mesmos alojamentos públicos.

GLM-5.2 vs GLM-5.1: especificações num relance
CaracterísticaGLM-5.2GLM-5.1
Janela de contexto1.000.000 tokens200.000 tokens
Arquitetura de atençãoAtenção esparsa com IndexShareAtenção esparsa, um indexador por camada
Comprimento de aceitação do MTP5.47 (+20%)4.56 (base)
Controlo de esforçoExplícito — Non-Thinking, High, MaxNão exposto
LicençaLicença MITLicença MIT

Benchmark a benchmark: GLM-5.2 vs GLM-5.1

Leia primeiro o bloco de programação: nove linhas, nove vitórias, e os aumentos crescem com a duração da tarefa. O SWE-bench Pro ganha 3.7 pontos, o ProgramBench 12.8, o Terminal-Bench 2.1 17.5, o DeepSWE 28.2 — uma melhoria de 2.6× — e o FrontierSWE Dominance 43.9. O bloco de raciocínio é uma vitória mais discreta: o HLE ganha 9.5, o AIME 2026 3.9, o IMOAnswerBench 7.2, o GPQA-Diamond 5.0 e o CritPt salta de 4.6 para 20.9, mais de quatro vezes a pontuação anterior. A ordem dessas diferenças é o argumento central do lançamento. Se a geração tivesse simplesmente sido treinada durante mais tempo com mais dados, esperar-se-iam ganhos aproximadamente uniformes em toda a tabela; em vez disso, os aumentos acompanham a duração das tarefas de cada avaliação, que é o que se previa de um aumento de cinco vezes no contexto e de uma reconstrução da atenção dirigida diretamente ao trabalho de longo alcance.

Benchmark a benchmark: GLM-5.2 vs GLM-5.1
BenchmarkGLM-5.2GLM-5.1Vencedor
Programação e longo alcance
FrontierSWE Dominance74.430.5GLM-5.2
PostTrainBench34.320.1GLM-5.2
SWE-Marathon13.01.0GLM-5.2
SWE-bench Pro62.158.4GLM-5.2
NL2Repo48.942.7GLM-5.2
ProgramBench63.750.9GLM-5.2
DeepSWE46.218.0GLM-5.2
Terminal-Bench 2.1 (Terminus-2)81.063.5GLM-5.2
Terminal-Bench 2.1 (Claude Code)82.769.0GLM-5.2
Raciocínio e agêntico
MCP-Atlas (public set)76.871.8GLM-5.2
Tool-Decathlon48.240.7GLM-5.2
HLE40.531.0GLM-5.2
HLE w/ Tools54.752.3GLM-5.2
CritPt20.94.6GLM-5.2
AIME 202699.295.3GLM-5.2
HMMT Nov. 202594.494.0GLM-5.2
HMMT Feb. 202692.582.6GLM-5.2
IMOAnswerBench91.083.8GLM-5.2
GPQA-Diamond91.286.2GLM-5.2

* pontuação no conjunto completo.

Todos os valores desta página são resultados tal como publicados pelos autores do modelo. O glmmodel.com apenas os reporta; não executa estas avaliações.

Ver os 17 benchmarks GLM em detalhe →

Quando escolher cada modelo

Quando escolher o GLM-5.2

Para qualquer nova implementação, o GLM-5.2 é a opção por omissão. Vence todas as linhas publicadas, traz cinco vezes o contexto, expõe níveis de esforço para poder gastar computação de forma deliberada, e serve essa janela maior com FLOPs por token 2.9× menores graças ao IndexShare — pelo que o modelo maior não é proporcionalmente mais caro por token.

  • Está a começar um projeto novo, onde não há qualquer razão publicada para escolher o lançamento mais antigo.
  • Os seus agentes correm durante horas — as linhas de longo alcance melhoraram dezenas de pontos, não frações.
  • Precisa de mais de 200.000 tokens de contexto e quer que a janela se mantenha utilizável em toda a sua extensão.
  • Quer controlo de esforço por pedido, algo que o GLM-5.1 não expõe de todo.

Quando o GLM-5.1 ainda faz sentido

Há exatamente um argumento honesto para continuar no GLM-5.1, e é operacional e não qualitativo. Uma janela de 200.000 tokens custa muito menos memória de KV-cache do que uma de um milhão, pelo que, se as suas tarefas realmente cabem e o hardware está apertado, o modelo mais antigo tem uma pegada menor. Em trabalho de programação delimitado, a diferença publicada é de apenas alguns pontos.

  • O seu hardware de serviço tem memória limitada e os seus prompts cabem confortavelmente em 200.000 tokens.
  • Já tem uma implementação validada de GLM-5.1 e nenhuma carga de trabalho de longo alcance que justifique nova validação.
  • As suas tarefas são delimitadas, onde a diferença publicada no SWE-bench Pro é de 62.1 contra 58.4 e não algo dramático.
  • Precisa de um modelo estável e fixo e prefere agendar a migração em vez de a fazer agora.

Experimente o playground de IA gratuito na página inicial →

FAQ GLM-5.2 vs GLM-5.1

O que mudou entre o GLM-5.1 e o GLM-5.2?
Quatro coisas: o teto de contexto passou de 200.000 para 1.000.000 de tokens, a atenção esparsa foi reconstruída em torno do IndexShare para que cada quatro camadas partilhem um indexador, a incompatibilidade de KV-cache da camada de previsão multi-token foi eliminada, elevando o comprimento de aceitação de 4.56 para 5.47, e foram introduzidos níveis de esforço explícitos Non-Thinking, High e Max.
Quanto maior é a janela de contexto do GLM-5.2?
Cinco vezes maior — 1.000.000 de tokens contra 200.000 — com até 128.000 tokens de saída. Os autores do modelo descrevem a janela maior como sólida e não apenas aceite, o que significa que foi treinada com longas trajetórias de agentes de programação para que a qualidade se mantenha bem dentro do contexto.
O que é o IndexShare e por que razão importa aqui?
O IndexShare permite que cada quatro camadas de atenção esparsa partilhem um indexador leve, calculando os índices top-k uma vez e reutilizando-os. Isso elimina o trabalho do indexador em três de cada quatro camadas e reduz os FLOPs por token em 2.9× com 1M de contexto, que é o que torna prático, e não apenas teórico, servir uma janela de um milhão de tokens.
Devo atualizar do GLM-5.1 para o GLM-5.2?
Se a sua carga de trabalho é agêntica ou de longo alcance, sim — os ganhos publicados aí são de dezenas de pontos, não de alguns. Se as suas tarefas são delimitadas e o hardware de serviço tem memória limitada, a pegada menor de KV-cache do modelo mais antigo é uma razão legítima para esperar.
Ambos os modelos GLM continuam a ser open source?
Sim. Tanto o GLM-5.1 como o GLM-5.2 são lançamentos de pesos abertos com licença MIT, publicados no HuggingFace e no ModelScope sem restrições regionais. Um lançamento mais recente não retira um mais antigo — os pesos que já tem continuam utilizáveis indefinidamente.

Experimente um modelo de IA ao vivo, grátis — sem conta

Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.