GLM vs Gemini 3.1 Pro é a comparação mais desequilibrada deste site, e está desequilibrada a favor do modelo de pesos abertos. Ao longo de 19 avaliações publicadas, o GLM-5.2 vence 15, incluindo absolutamente todas as linhas de programação e de longo alcance, enquanto as vitórias do Gemini 3.1 Pro se concentram numa faixa estreita de benchmarks de raciocínio intensivo em conhecimento.
Vale a pena dizê-lo com clareza em vez de o disfarçar: são dois modelos otimizados para coisas diferentes. Todos os valores são resultados tal como publicados pelos autores do modelo e aqui reproduzidos sem alterações; o glmmodel.com não executa estas avaliações. Os indicadores de vitória são aritmética sobre os números publicados.
O GLM-5.2 vence 15 das 19 linhas publicadas contra o Gemini 3.1 Pro, e o bloco de programação é uma vitória total — FrontierSWE Dominance 74.4 contra 39.6, DeepSWE 46.2 contra 10.0, ProgramBench 63.7 contra 39.5, NL2Repo 48.9 contra 33.4, SWE-bench Pro 62.1 contra 54.2 e Terminal-Bench 2.1 81.0 contra 74.0. As quatro vitórias do Gemini 3.1 Pro são o HLE (45.0 contra 40.5), o GPQA-Diamond (94.3 contra 91.2), o HMMT Nov. 2025 por quatro décimas e o Tool-Decathlon por seis décimas. Se o seu trabalho é engenharia de software, os dados publicados apontam fortemente para o modelo GLM; se é conhecimento académico alargado, o Gemini mantém vantagem.
Tal como nas outras comparações com modelos de pesos fechados, a diferença estrutural é a posse. O GLM-5.2 publica uma janela de 1.000.000 de tokens e pesos com licença MIT que correm na stack de inferência aberta padrão. O Gemini 3.1 Pro é um modelo proprietário alojado; o seu teto de contexto está fora do conjunto de comparação publicado com que este site trabalha, pelo que a tabela o regista em vez de estimar.
| Característica | GLM-5.2 | Gemini 3.1 Pro |
|---|---|---|
| Janela de contexto | 1.000.000 tokens | Não publicado |
| Abertura | Pesos abertos | API fechada |
| Licença | Licença MIT | Proprietária |
| Controlo de esforço | Explícito — Non-Thinking, High, Max | Implícito |
| Auto-alojamento | Sim — transformers, vLLM, SGLang, xLLM, ktransformers | Não — apenas API alojada |
O bloco de programação e longo alcance dispensa comentários: nove linhas, nove vitórias do GLM-5.2, várias por mais de vinte pontos. O bloco de raciocínio e agêntico é genuinamente misto. O Gemini lidera no HLE e no GPQA-Diamond, que premeiam conhecimento académico alargado, e ganha o HMMT Nov. 2025 e o Tool-Decathlon por frações de ponto. O GLM-5.2 vence o AIME 2026, o HMMT Fev. 2026, o CritPt, o IMOAnswerBench, o HLE com ferramentas e o conjunto agêntico MCP-Atlas. A divisão é coerente e não arbitrária. Os benchmarks que pedem ao modelo que recorde e aplique conhecimento factual amplo numa só passagem favorecem o Gemini 3.1 Pro; os que lhe pedem que planeie, execute, leia a saída das ferramentas e reveja ao longo de muitos turnos favorecem o GLM-5.2, e quanto mais longa a trajetória, maior a diferença. Decidir a qual destas duas formas se assemelha o seu próprio trabalho é mais útil do que somar vitórias.
| Benchmark | GLM-5.2 | Gemini 3.1 Pro | Vencedor |
|---|---|---|---|
| Programação e longo alcance | |||
| FrontierSWE Dominance | 74.4 | 39.6 | GLM-5.2 |
| PostTrainBench | 34.3 | 21.6 | GLM-5.2 |
| SWE-Marathon | 13.0 | 4.0 | GLM-5.2 |
| SWE-bench Pro | 62.1 | 54.2 | GLM-5.2 |
| NL2Repo | 48.9 | 33.4 | GLM-5.2 |
| ProgramBench | 63.7 | 39.5 | GLM-5.2 |
| DeepSWE | 46.2 | 10.0 | GLM-5.2 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 74.0 | GLM-5.2 |
| Terminal-Bench 2.1 (best harness) | 82.7 | 70.7 | GLM-5.2 |
| Raciocínio e agêntico | |||
| MCP-Atlas (public set) | 76.8 | 69.2 | GLM-5.2 |
| Tool-Decathlon | 48.2 | 48.8 | Gemini 3.1 Pro |
| HLE | 40.5 | 45.0 | Gemini 3.1 Pro |
| HLE w/ Tools | 54.7 | 51.4 | GLM-5.2 |
| AIME 2026 | 99.2 | 98.2 | GLM-5.2 |
| HMMT Nov. 2025 | 94.4 | 94.8 | Gemini 3.1 Pro |
| HMMT Feb. 2026 | 92.5 | 87.3 | GLM-5.2 |
| CritPt | 20.9 | 17.7 | GLM-5.2 |
| IMOAnswerBench | 91.0 | 81.0 | GLM-5.2 |
| GPQA-Diamond | 91.2 | 94.3 | Gemini 3.1 Pro |
* pontuação no conjunto completo.
Todos os valores desta página são resultados tal como publicados pelos autores do modelo. O glmmodel.com apenas os reporta; não executa estas avaliações.
Ver os 17 benchmarks GLM em detalhe →Com estes dados publicados, a engenharia de software não é caso duvidoso. Todas as linhas de programação e de longo alcance vão para o modelo GLM, normalmente com margem larga, e ele acrescenta ainda uma janela de contexto de 1.000.000 de tokens e pesos abertos. Para cargas de trabalho com agentes, lidera também o conjunto público do MCP-Atlas por 76.8 contra 69.2.
As vantagens do Gemini 3.1 Pro aqui são reais mas estreitas. Lidera o HLE com 45.0 contra 40.5 e o GPQA-Diamond com 94.3 contra 91.2 — ambos benchmarks que premeiam conhecimento factual amplo de nível pós-graduado e não a execução ao longo de uma trajetória longa. Se é isso que procura, é o modelo mais forte desta tabela.
Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.