GLM Model — IA aberta com contexto de 1M criada para trabalho de longo alcance

O GLM-5.2 é o modelo de IA GLM emblemático de pesos abertos: um contexto sólido de 1M de tokens, níveis de esforço Non-Thinking / High / Max e resultados reportados de 81.0 no Terminal-Bench 2.1 e 74.4 no FrontierSWE. Compare abaixo todos os modelos GLM — ou experimente primeiro o playground de IA gratuito.

1M
tokens de contexto
aumentado a partir de 200K, mantendo-se estável sob cargas de agentes
81.0
Terminal-Bench 2.1
reportado para o GLM-5.2, acima dos 63.5 do GLM-5.1
MIT
licença open source
pesos abertos, sem limites regionais

Playground de IA gratuito — experimente um LLM open source ao vivo

Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.

A resposta aparecerá aqui...

Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.

O que a família de modelos GLM faz melhor

Quatro capacidades definem a geração atual dos modelos GLM — todas reportadas pelos autores do modelo e reproduzíveis a partir dos pesos abertos.

Contexto sólido de 1M

Um contexto de 1M de tokens que se mantém utilizável, e não apenas aceite: o GLM-5.2 foi treinado com trajetórias de agentes de programação de contexto longo, cobrindo implementação em larga escala, investigação automatizada e depuração complexa.

Níveis de esforço flexíveis

Non-Thinking, High e Max permitem trocar latência por capacidade em cada tarefa — cerca de 63% com ~35K tokens de saída até 74% com ~83K em avaliações de programação agêntica.

Arquitetura IndexShare

Um indexador leve partilhado a cada quatro camadas de atenção esparsa reduz os FLOPs por token em 2.9× com 1M de contexto, sem perda de qualidade a longa distância.

Pesos abertos sob MIT

Um modelo GLM open source sob MIT: pesos no HuggingFace e no ModelScope, sem limites regionais, e execução local através de transformers, vLLM, SGLang, xLLM e ktransformers.

Benchmarks do GLM 5.2: resultados de longo alcance

Todos os valores abaixo são resultados publicados pelos autores do modelo para o GLM-5.2 e o respetivo conjunto de comparação. O glmmodel.com apenas os reporta; não executa estas avaliações.

Melhor modelo open source
74.4%

FrontierSWE

Dominance, tarefas até 20 horas

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
2.º no geral
34.3%

PostTrainBench

Até 10 horas numa única H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
2.º a seguir à série Opus
13.0%

SWE-Marathon

SWE de alcance ultralongo, até 10 horas

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

Nos três benchmarks de longo alcance, o GLM-5.2 é o modelo open source melhor classificado — prova de que o seu contexto de 1M se traduz em trabalho concluído, e não apenas em tokens aceites. Fica um ponto atrás do Opus 4.8 no FrontierSWE, supera o GPT-5.5 por um ponto e ultrapassa o Opus 4.7 da geração anterior por onze.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Pontuações dos modelos GLM em 17 benchmarks

Resultados de benchmark publicados dos modelos GLM: 17 avaliações em 8 modelos.

Resultados de benchmark publicados dos modelos GLM em todas as avaliações e modelos
BenchmarkGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Raciocínio
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programação
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (best harness)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agêntico
MCP-Atlas (public set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* pontuação no conjunto completo.

Níveis de esforço: Non-Thinking, High e Max

Um modelo GLM não tem uma única velocidade. O controlo do nível de esforço permite gastar mais computação apenas nas tarefas que a exigem.

Non-Thinking

~63%

~35K tokens em média

Edições rápidas, código repetitivo e refatorações de rotina, onde a latência importa mais do que a profundidade.

Mais usado

High

~72%

~43K tokens em média

A opção por omissão para a maior parte da programação agêntica: qualidade próxima do Max por cerca de metade dos tokens.

Max

~74%

~83K tokens em média

Problemas difíceis e de longo alcance — atribua computação extra quando a tarefa realmente o justifica.

Média de Terminal-Bench 2.1, DeepSWE e SWE-Atlas QnA, avaliados no Claude Code 2.1.167. Reportado pelos autores do modelo. Com orçamentos de tokens comparáveis, o GLM-5.2 situa-se entre o Claude Opus 4.7 e o Opus 4.8.

Como o modelo GLM chega ao contexto de 1M

Elevar o teto de contexto de 200K para 1M de tokens é um problema de engenharia, não uma opção de configuração. Três mudanças fazem o trabalho.

IndexShare para atenção esparsa

A cada quatro camadas do transformer partilha-se um indexador leve. Ele fica na primeira das quatro e os seus índices top-k são reutilizados pelas outras três — eliminando o produto escalar do indexador e o trabalho de top-k em 3 de cada 4 camadas. Resultado: FLOPs por token 2.9× menores com 1M de contexto. Treinado com IndexShare desde o mid-training, com sequências de 128K.

Partilha de camadas do modelo GLM com IndexShareCamada N+3Camada N+2Camada N+1Camada NIndexadorpartilhado

MTP com IndexShare e KVShare

A camada de previsão multi-token executa o seu indexador uma vez no primeiro passo de rascunho e reutiliza os índices nos passos seguintes, eliminando a incompatibilidade de KV-cache entre treino e inferência que limitava a geração anterior. Combinado com rejection sampling e uma perda TV ponta a ponta, o comprimento de aceitação sobe de 4.56 para 5.47 — cerca de 20% — ao longo de 7 passos MTP.

Ablação do comprimento de aceitação do MTP
Base4.56
+ IndexShare + KVShare5.10
+ Rejection Sampling5.29
+ Perda TV ponta a ponta5.47 (+20%)

Servir 1M de contexto de forma eficiente

Passadas algumas centenas de milhares de tokens, o estrangulamento deixa de ser a computação e passa a ser a capacidade de KV-cache, os kernels de contexto longo e o overhead de CPU. Três correções: gestão de memória e paralelismo de granularidade fina baseados em LayerSplit, trabalho de kernel escalado ao comprimento do contexto coordenado com o pipeline de transferência de cache, e gestão de cache do lado do CPU, escalonamento de pedidos e afinação dos caminhos de execução. A vantagem de throughput aumenta à medida que o contexto cresce.

Vantagem de throughput normalizada

Treinado com RL agêntico

A stack de treino (slime) combina rollout de caixa branca e caixa negra, trajetórias compactas e fluxos com subagentes. O treino OPD paralelo fundiu mais de dez modelos especialistas em cerca de dois dias, com KV-cache em FP8 a manter a memória de rollout dentro do orçamento.

Anti reward hacking

O RL de longo alcance convida a atalhos, por isso as ações suspeitas passam por um filtro de recall baseado em regras e depois por uma verificação de precisão feita por um LLM-juiz. Os casos confirmados são bloqueados online e respondidos com um resultado de ferramenta fictício, deixando o rollout continuar em vez de ser descartado. PPO com crítico em rollouts individuais mantém treináveis os sub-traços de compactação.

Onde um modelo GLM de longo alcance compensa

Implementação em larga escala

Funcionalidades multificheiro que ultrapassam uma única janela de contexto: o modelo mantém à vista todo o estado do repositório em vez de o reler a cada poucas iterações.

Investigação automatizada

Ciclos de experimentação de várias horas em que o agente tem de planear, executar, ler resultados e rever — a carga de trabalho que o FrontierSWE e o PostTrainBench foram criados para medir.

Otimização de desempenho

Trabalho de kernel e de sistemas que exige ter o grafo de chamadas completo, a saída do profiler e as tentativas anteriores reunidos numa só trajetória.

Depuração complexa

Longos traços de reprodução, testes instáveis e falhas entre serviços, em que truncar o contexto é precisamente o que faz perder o bug.

Execute tudo isto no seu próprio hardware — pesos MIT, transformers · vLLM · SGLang · xLLM · ktransformers. Como executar um modelo GLM localmente →

FAQ do modelo GLM

GLM é uma família de grandes modelos de linguagem de pesos abertos cujo modelo emblemático atual é o GLM-5.2. A linha vai do GLM-4.5-Air e do GLM-4.7 até ao GLM-5, GLM-5-Turbo, GLM-5.1 e agora GLM-5.2, além de variantes de voz e visão. Todos os modelos GLM principais são disponibilizados sob licença MIT, com pesos publicados abertamente.

Experimente um modelo de IA ao vivo, grátis — sem conta

Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.