O GLM-5.1 é o modelo GLM que tornou o trabalho de longo alcance uma proposta séria para pesos abertos. Trouxe um contexto de 200.000 tokens, execução autónoma de várias horas e entregas de nível profissional numa altura em que a maioria dos modelos abertos ainda era avaliada em tarefas de ficheiro único. É também o único outro modelo GLM com uma coluna completa de benchmarks publicada, o que faz dele o ponto de referência face ao qual se cita cada melhoria do GLM-5.2.
Ler a coluna do GLM-5.1 é a forma mais rápida de perceber o que a geração seguinte mudou de facto. Onde o GLM-5.1 obtém 63.5 no Terminal-Bench 2.1, 58.4 no SWE-bench Pro e 30.5 no FrontierSWE Dominance, o GLM-5.2 obtém 81.0, 62.1 e 74.4. A diferença é irregular de propósito: a programação padrão avançou alguns pontos, a execução agêntica de longo alcance avançou dezenas. Todos estes são valores tal como publicados pelos autores do modelo.
Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.
A resposta aparecerá aqui...
Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.
Duzentos mil tokens chegam para um serviço substancial, os seus testes e uma longa conversa sobre eles — mais ou menos o conjunto de trabalho de uma funcionalidade bem delimitada, não de um monorepo inteiro. Na prática, isso significa que o GLM-5.1 lida confortavelmente com trabalho agêntico bem delimitado e começa a precisar de uma camada de recuperação quando a tarefa atravessa muitos módulos. É também a janela em que o design anterior de previsão multi-token esbarrou numa incompatibilidade de KV-cache entre treino e inferência, limitando o comprimento de aceitação da descodificação especulativa a 4.56; eliminar essa incompatibilidade é uma das coisas concretas que a geração seguinte corrigiu. Se a sua carga de trabalho cabe em 200K tokens, o GLM-5.1 continua a ser um modelo GLM capaz e totalmente aberto; se não cabe, o salto para a janela de 1M é a razão de ser do GLM-5.2.
Pontuações tal como publicadas pelos autores do modelo.
A coluna publicada do GLM-5.1 é respeitável em raciocínio e programação de duração média: 95.3 no AIME 2026, 86.2 no GPQA-Diamond, 83.8 no IMOAnswerBench, 71.8 no conjunto público do MCP-Atlas e 58.4 no SWE-bench Pro. Onde visivelmente lhe falta fôlego é no trabalho de alcance ultralongo — 30.5 no FrontierSWE Dominance, 20.1 no PostTrainBench e 1.0 no SWE-Marathon. Essas três linhas são precisamente as cargas de trabalho para as quais a geração seguinte foi treinada, e é por isso que as diferenças aí são muito maiores do que nas avaliações de programação padrão.
Comparação no Terminal-Bench 2.1 (Terminus-2), tal como publicada pelos autores do modelo.
No Terminal-Bench 2.1 sob o harness Terminus-2, os 63.5 do GLM-5.1 ficam abaixo dos 75.0 do Qwen3.7-Max e mais ou menos a par dos 64.0 do DeepSeek-V4-Pro, enquanto o GLM-5.2 destaca-se no campo aberto com 81.0 e o Claude Opus 4.8 lidera com 85.0. Lido como linhagem, o gráfico mostra uma geração de modelos abertos concentrada nos sessenta e poucos pontos e um lançamento a romper essa faixa — o que constitui o argumento mais claro para tratar o GLM-5.2, e não o GLM-5.1, como a referência atual de pesos abertos.
O GLM-5.1 sucedeu ao GLM-5 e ao GLM-5-Turbo e foi sucedido pelo GLM-5.2. É o último modelo GLM sem níveis de esforço explícitos, pelo que tudo o que construir sobre ele gasta uma quantidade fixa de computação por tarefa, sem lhe permitir ajustar o compromisso a cada pedido. Continua a ser uma escolha sensata quando quer uma pegada de memória menor e mais previsível do que a do modelo emblemático com contexto de 1M e as suas tarefas cabem mesmo em 200K tokens.
O modelo emblemático com contexto de 1M de tokens. É o estado da arte open source em avaliações de programação e de longo alcance, com níveis de esforço explícitos Non-Thinking, High e Max.
O lançamento que abriu a série 5: bases de programação mais fortes, execução multipasso mais fiável e um comportamento visivelmente melhor em tarefas de agentes complexas.
Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.