GLM-4.7-Flash — o modelo GLM leve de 30B

O GLM-4.7-Flash é o membro de 30 mil milhões de parâmetros da família de modelos GLM, criado para o caso em que o modelo emblemático simplesmente não cabe. Trinta mil milhões de parâmetros é a classe de tamanho que corre num único acelerador de memória elevada, ou quantizada em hardware de consumo, o que faz dele a escolha natural para desenvolvimento local, inferência on-premise e tudo aquilo em que a latência por pedido importa mais do que os últimos pontos de benchmark.

Os autores do modelo posicionam-no como eficiente e de alto desempenho, e reportam que supera modelos open source de escala semelhante. Essa é a afirmação relevante para este nível: ninguém que implemente um modelo de 30B espera que ele bata um sistema de fronteira, mas interessa-lhe muito saber se bate as outras opções de 30B que poderia ter usado.

30B
parâmetros
a classe de tamanho que cabe num único acelerador
MIT
licença open source
MIT, sem restrições regionais
4.7
geração da série
o nível leve da linha GLM-4.7

Playground de IA gratuito — experimente um LLM open source ao vivo

Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.

A resposta aparecerá aqui...

Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.

Por que razão vale a pena ter um modelo GLM de 30B

A contagem de parâmetros decide onde um modelo pode fisicamente correr, e essa restrição condiciona mais decisões de arquitetura do que a capacidade bruta. Um modelo de 30B pode ser servido em hardware que uma equipa pequena já possui, mantém os prompts dentro da sua rede e responde suficientemente depressa para caber num ciclo interativo em vez de numa fila de processamento em lote. É também o tamanho a partir do qual o fine-tuning deixa de ser um projeto de investigação — pode adaptar um modelo GLM de 30B a um domínio restrito e ainda avaliar o resultado numa tarde. O compromisso é real: menos parâmetros significam menos margem em raciocínio difícil e de longo alcance, que é precisamente a carga de trabalho para a qual o modelo emblemático com contexto de 1M foi criado. A forma certa de usar a família é encaminhar o trabalho por dificuldade, mantendo as tarefas baratas e de grande volume no Flash e reservando o modelo emblemático para os problemas que realmente o exigem.

Parâmetros
30B
Licença
MIT open source
Posicionamento
Leve, alto throughput
Família
Série GLM-4.7
Alojamento dos pesos
HuggingFace · ModelScope

O GLM-4.7-Flash nos dados de benchmark publicados

A tabela comparativa publicada abrange o GLM-5.2 e o GLM-5.1. A coluna abaixo é a do GLM-5.1, apresentada apenas como ponto de referência da família. Não foi publicada nenhuma coluna de benchmarks para o GLM-4.7-Flash, e nenhuma é estimada aqui.

Não existe nenhuma linha publicada para o GLM-4.7-Flash, e inferir uma a partir de um modelo muito maior seria enganador em qualquer dos sentidos. Para o que a coluna de referência serve é para calibração: mostra a amplitude que os modelos GLM publicados ocupam, de modo a saber o que um modelo de tamanho completo da geração anterior alcançou antes de decidir se um modelo de 30B será provavelmente suficiente para a sua tarefa.

Ver os 17 benchmarks GLM em detalhe →

Como se compara a família em programação de longo alcance

Comparação no DeepSWE, tal como publicada pelos autores do modelo.

O DeepSWE é onde a escala do modelo se revela de forma mais brutal. O GPT-5.5 lidera com 70.0 e o Claude Opus 4.8 obtém 58.0, o GLM-5.2 chega a 46.2, e a geração aberta anterior agrupa-se muito abaixo — GLM-5.1 e Qwen3.7-Max com 18.0, DeepSeek-V4-Pro com 8.0. Se a sua carga de trabalho se parece com o DeepSWE, um modelo leve é a ferramenta errada por mais eficiente que seja; se se parece com classificação, extração ou edições de código de rotina, o Flash é provavelmente tudo o que precisa.

Ler a comparação completa GLM vs Qwen →

Onde se situa o GLM-4.7-Flash na linha de modelos GLM

O GLM-4.7-Flash é o nível leve da geração GLM-4.7, a par do GLM-4.7 de tamanho completo e acima do mais antigo GLM-4.5-Air na linha de eficiência da família. Tudo nessa linha tem a mesma licença MIT e os mesmos alojamentos de pesos, pelo que mudar de nível é uma decisão de hardware e não jurídica.

Mais modelos GLM

Ver tudo

FAQ do GLM-4.7-Flash

O que é o modelo GLM-4.7-Flash?
O GLM-4.7-Flash é o membro leve de 30 mil milhões de parâmetros da família de modelos GLM. Tem licença MIT e pesos abertos, foi criado para inferência eficiente de alto throughput e é reportado pelos autores do modelo como superior a modelos open source de escala semelhante.
Que hardware preciso para executar o GLM-4.7-Flash?
Trinta mil milhões de parâmetros é a classe de tamanho que cabe num único acelerador de memória elevada com precisão reduzida, ou em hardware de consumo depois de quantizado. Os requisitos exatos dependem da quantização, do comprimento de contexto e da framework de serviço, por isso meça com a sua própria configuração em vez de confiar numa regra prática.
O GLM-4.7-Flash tem pontuações de benchmark publicadas?
Não na tabela comparativa que os autores do modelo publicaram, que abrange o GLM-5.2 e o GLM-5.1. Este site não estima uma coluna para ele. A afirmação publicada para este modelo é relativa: é reportado como superior a modelos abertos de escala semelhante.
O GLM-4.7-Flash é open source?
Sim. É um modelo GLM de pesos abertos com licença MIT, publicado no HuggingFace e no ModelScope sem restrições regionais, e corre em transformers, vLLM, SGLang, xLLM e ktransformers como o resto da família.
GLM-4.7-Flash ou GLM-4.5-Air?
O Flash é o nível leve mais recente e traz as melhorias de programação e raciocínio da geração GLM-4.7; o Air é o marco de eficiência anterior. Nenhum tem uma coluna de benchmarks publicada, por isso, se ambos couberem no seu hardware, o mais sensato é avaliá-los na sua própria tarefa em vez de decidir pelo posicionamento.

Experimente um modelo de IA ao vivo, grátis — sem conta

Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.