GLM-4.5-Air — o modelo GLM leve e eficiente

O GLM-4.5-Air é o lançamento que estabeleceu a eficiência como objetivo de primeira ordem para a família de modelos GLM. É um modelo de pequena pegada concebido para entregar forte desempenho por cada unidade de computação que consome, e não para liderar tabelas classificativas — o nível a que se recorre quando a carga de trabalho é de grande volume, sensível à latência ou corre num sítio onde um modelo emblemático simplesmente não pode ser implementado.

Esse objetivo de design envelheceu bem. A família oferece hoje uma escada de eficiência clara — GLM-4.5-Air, depois o GLM-4.7-Flash de 30B, depois os lançamentos de tamanho completo, até ao emblemático GLM-5.2 com contexto de 1M — e tudo isso está sob a mesma licença MIT, com pesos nos mesmos alojamentos públicos. Escolher entre eles é uma decisão de hardware e de custo de computação, não de licenciamento, o que é uma posição materialmente diferente de escolher entre APIs alojadas, onde os níveis são também fronteiras comerciais.

Air
nível de eficiência
a linha de pequena pegada da família
MIT
licença open source
MIT, sem restrições regionais
4.5
geração da série
a geração GLM-4.5

Playground de IA gratuito — experimente um LLM open source ao vivo

Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.

A resposta aparecerá aqui...

Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.

O que lhe dá o "desempenho por unidade de computação"

Os benchmarks de fronteira premeiam a capacidade a qualquer custo, que é o oposto de como a maioria dos sistemas em produção está realmente restringida. Se um pedido tem de responder em menos de um segundo, ou um pipeline tem de processar milhões de documentos, a pergunta operativa não é qual o modelo com a pontuação mais alta, mas qual o modelo que ultrapassa o seu limiar de qualidade mais barato. Um modelo GLM orientado à eficiência muda a forma daquilo que consegue construir: pode dar-se ao luxo de o chamar em todos os itens em vez de amostrar, corrê-lo dentro do caminho do pedido em vez de num lote noturno e manter toda a carga de trabalho no seu próprio hardware. O corolário é saber quando é a escolha errada — trabalho agêntico de longo alcance, raciocínio à escala do repositório e problemas multipasso difíceis pertencem ao modelo emblemático, e tentar forçá-los num modelo leve produz repetições caras em vez de poupanças.

Parâmetros
Leve (nível Air)
Licença
MIT open source
Posicionamento
Desempenho por unidade de computação
Família
Série GLM-4.5
Alojamento dos pesos
HuggingFace · ModelScope

O GLM-4.5-Air nos dados de benchmark publicados

A tabela comparativa publicada abrange o GLM-5.2 e o GLM-5.1. A coluna abaixo é a do GLM-5.1, apresentada apenas como ponto de referência da família. Não foi publicada nenhuma coluna de benchmarks para o GLM-4.5-Air, e nenhuma é inventada aqui.

O GLM-4.5-Air não tem nenhuma linha no conjunto de comparação publicado, pelo que esta página não cita nenhuma para ele. A coluna de referência existe para lhe dizer o que um modelo de tamanho completo da geração seguinte alcançou, que é a forma honesta de enquadrar um nível leve: está a trocar capacidade mensurável por uma pegada de serviço muito menor, e a dimensão dessa troca é algo que deve medir na sua própria carga de trabalho.

Ver os 17 benchmarks GLM em detalhe →

Como se compara a família em raciocínio difícil

Comparação no HLE (Humanity's Last Exam), tal como publicada pelos autores do modelo.

O HLE é a avaliação publicada que mais penaliza capacidade limitada. O Claude Opus 4.8 lidera com 49.8 no conjunto completo, o Qwen3.7-Max obtém 41.4, o GLM-5.2 40.5, o DeepSeek-V4-Pro 37.7 e o GLM-5.1 31.0. Mesmo os modelos mais fortes respondem a menos de metade das perguntas, o que diz claramente que o raciocínio difícil e aberto não é o destino de um modelo leve — encaminhe essas tarefas para o modelo emblemático e reserve o Air para o trabalho de grande volume para que foi criado.

Ler a comparação completa GLM vs Qwen →

Onde se situa o GLM-4.5-Air na linha de modelos GLM

O GLM-4.5-Air é o modelo mais antigo da linha apresentada neste site e a origem da linha de eficiência da família, mais tarde continuada pelo GLM-4.7-Flash de 30B. Acima dele estão o GLM-4.7, o GLM-5, o GLM-5-Turbo, o GLM-5.1 e o emblemático GLM-5.2. Uma arquitetura sensata usa ambos os extremos: Air ou Flash para volume, GLM-5.2 para os problemas que justificam a computação. Como todos os níveis partilham licença e alojamento de pesos, essa divisão não lhe custa nada em termos contratuais — está a correr dois checkpoints da mesma família aberta em vez de negociar duas relações com fornecedores distintos, e pode mover tráfego entre eles sempre que as suas medições assim o indicarem.

Mais modelos GLM

Ver tudo

FAQ do GLM-4.5-Air

O que é o modelo GLM-4.5-Air?
O GLM-4.5-Air é o membro leve e de pequena pegada da família de modelos GLM, concebido para forte desempenho face à computação que consome. Como todos os modelos GLM principais, é disponibilizado sob licença MIT com pesos publicados abertamente.
Para que serve o GLM-4.5-Air?
Trabalho de grande volume e sensível à latência: classificação, extração, sumarização, edições de rotina e tudo o que precise de correr em todos os itens em vez de numa amostra. É a ferramenta errada para engenharia agêntica de longo alcance, que pertence ao GLM-5.2.
O GLM-4.5-Air tem pontuações de benchmark publicadas?
Não. A tabela comparativa publicada pelos autores do modelo abrange apenas o GLM-5.2 e o GLM-5.1, pelo que não há coluna do Air para reportar e este site não estima nenhuma. Avalie-o na sua própria tarefa se estiver a considerá-lo.
O GLM-4.5-Air é open source?
Sim. Tem licença MIT com pesos abertos no HuggingFace e no ModelScope e sem restrições regionais, e corre na stack de inferência aberta padrão, tal como o resto da família.
GLM-4.5-Air ou GLM-4.7-Flash?
O Flash é o nível leve de 30B mais recente e herda o trabalho de programação e raciocínio da geração GLM-4.7; o Air é o marco de eficiência anterior, com uma pegada menor. Se ambos couberem no seu hardware, avalie-os na sua própria carga de trabalho — nenhum tem uma coluna publicada que decida por si.

Experimente um modelo de IA ao vivo, grátis — sem conta

Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.