O GLM-5 é o lançamento que abriu a geração atual da família de modelos GLM. Chegou com bases de programação materialmente mais fortes do que a linha 4.x, execução multipasso mais fiável e um comportamento visivelmente melhor em tarefas de agentes complexas, onde um plano tem de sobreviver ao contacto com a saída real das ferramentas. Tudo aquilo por que a série 5 é hoje conhecida — raciocínio de longo alcance, engenharia agêntica, pesos abertos sob MIT — começa aqui.
Como os autores do modelo publicam a sua tabela comparativa completa apenas para o GLM-5.2 e o GLM-5.1, o GLM-5 não tem coluna de benchmarks própria. Esta página é honesta quanto a isso: apresenta a ficha técnica e o posicionamento que foram publicados, mais a coluna de referência publicada mais próxima, em vez de inventar números. Se precisa de pontuações concretas para decidir, a página do modelo emblemático é o sítio certo.
Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.
A resposta aparecerá aqui...
Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.
O passo da linha 4.x para o GLM-5 foi sobre fiabilidade e não sobre capacidade de destaque. A execução multipasso é a parte do trabalho agêntico que decide discretamente se uma execução chega ao fim: um modelo que raciocina lindamente mas salta um passo, esquece uma restrição ou repete trabalho já feito não sobrevive a uma trajetória de cinquenta turnos. O GLM-5 apertou esse comportamento, e fê-lo em conjunto com melhor programação e melhor gestão de tarefas de agentes complexas, razão pela qual os dois lançamentos seguintes puderam focar-se na extensão do horizonte em vez da fiabilidade básica. Leia a série 5 como três movimentos: o GLM-5 tornou as trajetórias longas fiáveis, o GLM-5.1 tornou-as longas, e o GLM-5.2 tornou-as muito longas ao reconstruir a stack de atenção em torno de um indexador partilhado.
A tabela comparativa publicada abrange o GLM-5.2 e o GLM-5.1. A coluna abaixo é a do GLM-5.1 — o ponto de referência publicado mais próximo da geração GLM-5. Não foi publicada nenhuma coluna de benchmarks para o próprio GLM-5, e nenhuma é inventada aqui.
Trate a coluna acima como uma verificação de sanidade de limite superior, e não como uma pontuação do GLM-5. Mostra onde chegou a geração imediatamente a seguir ao GLM-5: 95.3 no AIME 2026, 86.2 no GPQA-Diamond, 71.8 no MCP-Atlas e 58.4 no SWE-bench Pro, com as linhas de longo alcance ainda fracas. Se está a escolher entre modelos GLM com base em desempenho medido, as duas únicas opções com colunas publicadas são o GLM-5.2 e o GLM-5.1, e o GLM-5.2 vence todas as linhas desse confronto direto.
Comparação no Terminal-Bench 2.1 (Terminus-2), tal como publicada pelos autores do modelo.
O gráfico acompanha a trajetória da série 5 face ao campo de pesos abertos no Terminal-Bench 2.1: o GLM-5.1 com 63.5 e o MiniMax M3 com 65.0 ficam na mesma faixa, o Qwen3.7-Max chega a 75.0 e o GLM-5.2 destaca-se com 81.0. O GLM-5 é anterior a todas estas medições, pelo que a sua posição nessa curva é inferida a partir do posicionamento e não medida — mais uma razão para passar à página do modelo emblemático se precisa de um número que possa defender numa revisão de arquitetura.
O GLM-5 sucede ao GLM-4.7 e precede o GLM-5-Turbo, o GLM-5.1 e o GLM-5.2. O seu descendente direto em espírito é o GLM-5-Turbo, que pegou na mesma base e a afinou para cenários de agentes dinâmicos e de cadeia longa. Para trabalho em produção hoje, a família aponta para o GLM-5.2; o GLM-5 importa sobretudo como o momento em que as decisões de design da geração atual foram fixadas.
O modelo emblemático com contexto de 1M de tokens. É o estado da arte open source em avaliações de programação e de longo alcance, com níveis de esforço explícitos Non-Thinking, High e Max.
Um modelo base da série 5 afinado para cenários de agentes dinâmicos e de cadeia longa, em que o plano muda repetidamente e a trajetória tem de continuar executável.
Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.