GLM-5.1 — o modelo GLM de longo alcance antes do 5.2

O GLM-5.1 é o modelo GLM que tornou o trabalho de longo alcance uma proposta séria para pesos abertos. Trouxe um contexto de 200.000 tokens, execução autónoma de várias horas e entregas de nível profissional numa altura em que a maioria dos modelos abertos ainda era avaliada em tarefas de ficheiro único. É também o único outro modelo GLM com uma coluna completa de benchmarks publicada, o que faz dele o ponto de referência face ao qual se cita cada melhoria do GLM-5.2.

Ler a coluna do GLM-5.1 é a forma mais rápida de perceber o que a geração seguinte mudou de facto. Onde o GLM-5.1 obtém 63.5 no Terminal-Bench 2.1, 58.4 no SWE-bench Pro e 30.5 no FrontierSWE Dominance, o GLM-5.2 obtém 81.0, 62.1 e 74.4. A diferença é irregular de propósito: a programação padrão avançou alguns pontos, a execução agêntica de longo alcance avançou dezenas. Todos estes são valores tal como publicados pelos autores do modelo.

200K
tokens de contexto
o teto que o GLM-5.2 viria a elevar para um milhão
63.5
Terminal-Bench 2.1
publicado para o GLM-5.1 sob o harness Terminus-2
30.5
FrontierSWE Dominance
contra 74.4 do GLM-5.2 na mesma avaliação

Playground de IA gratuito — experimente um LLM open source ao vivo

Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.

A resposta aparecerá aqui...

Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.

O que cobre uma janela de contexto de 200K

Duzentos mil tokens chegam para um serviço substancial, os seus testes e uma longa conversa sobre eles — mais ou menos o conjunto de trabalho de uma funcionalidade bem delimitada, não de um monorepo inteiro. Na prática, isso significa que o GLM-5.1 lida confortavelmente com trabalho agêntico bem delimitado e começa a precisar de uma camada de recuperação quando a tarefa atravessa muitos módulos. É também a janela em que o design anterior de previsão multi-token esbarrou numa incompatibilidade de KV-cache entre treino e inferência, limitando o comprimento de aceitação da descodificação especulativa a 4.56; eliminar essa incompatibilidade é uma das coisas concretas que a geração seguinte corrigiu. Se a sua carga de trabalho cabe em 200K tokens, o GLM-5.1 continua a ser um modelo GLM capaz e totalmente aberto; se não cabe, o salto para a janela de 1M é a razão de ser do GLM-5.2.

Janela de contexto
200.000 tokens
Licença
MIT open source
Níveis de esforço
Introduzidos no GLM-5.2
Terminal-Bench 2.1
63.5 (Terminus-2)
Alojamento dos pesos
HuggingFace · ModelScope

Resultados de benchmark do GLM-5.1

Pontuações tal como publicadas pelos autores do modelo.

A coluna publicada do GLM-5.1 é respeitável em raciocínio e programação de duração média: 95.3 no AIME 2026, 86.2 no GPQA-Diamond, 83.8 no IMOAnswerBench, 71.8 no conjunto público do MCP-Atlas e 58.4 no SWE-bench Pro. Onde visivelmente lhe falta fôlego é no trabalho de alcance ultralongo — 30.5 no FrontierSWE Dominance, 20.1 no PostTrainBench e 1.0 no SWE-Marathon. Essas três linhas são precisamente as cargas de trabalho para as quais a geração seguinte foi treinada, e é por isso que as diferenças aí são muito maiores do que nas avaliações de programação padrão.

Ver os 17 benchmarks GLM em detalhe →

Como se compara o GLM-5.1

Comparação no Terminal-Bench 2.1 (Terminus-2), tal como publicada pelos autores do modelo.

No Terminal-Bench 2.1 sob o harness Terminus-2, os 63.5 do GLM-5.1 ficam abaixo dos 75.0 do Qwen3.7-Max e mais ou menos a par dos 64.0 do DeepSeek-V4-Pro, enquanto o GLM-5.2 destaca-se no campo aberto com 81.0 e o Claude Opus 4.8 lidera com 85.0. Lido como linhagem, o gráfico mostra uma geração de modelos abertos concentrada nos sessenta e poucos pontos e um lançamento a romper essa faixa — o que constitui o argumento mais claro para tratar o GLM-5.2, e não o GLM-5.1, como a referência atual de pesos abertos.

Ler a comparação completa GLM-5.2 vs GLM-5.1 →

Onde se situa o GLM-5.1 na linha de modelos GLM

O GLM-5.1 sucedeu ao GLM-5 e ao GLM-5-Turbo e foi sucedido pelo GLM-5.2. É o último modelo GLM sem níveis de esforço explícitos, pelo que tudo o que construir sobre ele gasta uma quantidade fixa de computação por tarefa, sem lhe permitir ajustar o compromisso a cada pedido. Continua a ser uma escolha sensata quando quer uma pegada de memória menor e mais previsível do que a do modelo emblemático com contexto de 1M e as suas tarefas cabem mesmo em 200K tokens.

Mais modelos GLM

Ver tudo

FAQ do GLM-5.1

O que é o modelo GLM-5.1?
O GLM-5.1 é o anterior modelo emblemático da família GLM: um modelo de pesos abertos com licença MIT e contexto de 200.000 tokens, criado para raciocínio de longo alcance e trabalho de engenharia autónomo de várias horas. É um dos dois únicos modelos GLM com uma coluna completa de benchmarks publicada, a par do GLM-5.2.
Quanto melhor é o GLM-5.2 face ao GLM-5.1?
Depende inteiramente da avaliação. Em programação padrão a diferença é modesta — o SWE-bench Pro passa de 58.4 para 62.1. Em trabalho agêntico de longo alcance é enorme: FrontierSWE Dominance de 30.5 para 74.4, DeepSWE de 18.0 para 46.2, SWE-Marathon de 1.0 para 13.0. O GLM-5.2 vence todas as linhas da tabela publicada do confronto direto.
Qual é o tamanho da janela de contexto do GLM-5.1?
200.000 tokens, tendo o GLM-5.2 elevado depois o teto para 1.000.000 sólidos. Para muita programação agêntica isso é suficiente, mas a análise de um repositório inteiro e os ciclos de investigação de várias horas são exatamente onde a janela mais pequena começa a forçar truncagem ou recuperação.
O GLM-5.1 continua a ser open source?
Sim. O GLM-5.1 continua a ser um modelo GLM de pesos abertos com licença MIT, publicado no HuggingFace e no ModelScope. Ser substituído não retira um lançamento do mercado — os pesos que já descarregou continuam utilizáveis indefinidamente, o que é uma das vantagens práticas dos pesos abertos face a uma API alojada.
Há alguma razão para continuar a usar o GLM-5.1?
Sim, se as suas tarefas couberem em 200K tokens e quiser uma pegada de serviço menor. Uma janela de 200K custa muito menos memória de KV-cache do que uma de um milhão de tokens, e em trabalho bem delimitado a diferença publicada nas avaliações de programação padrão é de apenas alguns pontos. Para agentes de longo alcance, use antes o GLM-5.2.

Experimente um modelo de IA ao vivo, grátis — sem conta

Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.