O GLM-4.7-Flash é o membro de 30 mil milhões de parâmetros da família de modelos GLM, criado para o caso em que o modelo emblemático simplesmente não cabe. Trinta mil milhões de parâmetros é a classe de tamanho que corre num único acelerador de memória elevada, ou quantizada em hardware de consumo, o que faz dele a escolha natural para desenvolvimento local, inferência on-premise e tudo aquilo em que a latência por pedido importa mais do que os últimos pontos de benchmark.
Os autores do modelo posicionam-no como eficiente e de alto desempenho, e reportam que supera modelos open source de escala semelhante. Essa é a afirmação relevante para este nível: ninguém que implemente um modelo de 30B espera que ele bata um sistema de fronteira, mas interessa-lhe muito saber se bate as outras opções de 30B que poderia ter usado.
Sem registo, sem conta, sem créditos. Escreva um prompt e receba uma resposta em streaming.
A resposta aparecerá aqui...
Este playground executa um LLM open source gratuito através da OpenRouter. Não é o GLM-5.2 e não utiliza pesos GLM — está aqui para que possa testar um modelo ao vivo enquanto lê os dados de benchmark publicados do GLM mais abaixo.
A contagem de parâmetros decide onde um modelo pode fisicamente correr, e essa restrição condiciona mais decisões de arquitetura do que a capacidade bruta. Um modelo de 30B pode ser servido em hardware que uma equipa pequena já possui, mantém os prompts dentro da sua rede e responde suficientemente depressa para caber num ciclo interativo em vez de numa fila de processamento em lote. É também o tamanho a partir do qual o fine-tuning deixa de ser um projeto de investigação — pode adaptar um modelo GLM de 30B a um domínio restrito e ainda avaliar o resultado numa tarde. O compromisso é real: menos parâmetros significam menos margem em raciocínio difícil e de longo alcance, que é precisamente a carga de trabalho para a qual o modelo emblemático com contexto de 1M foi criado. A forma certa de usar a família é encaminhar o trabalho por dificuldade, mantendo as tarefas baratas e de grande volume no Flash e reservando o modelo emblemático para os problemas que realmente o exigem.
A tabela comparativa publicada abrange o GLM-5.2 e o GLM-5.1. A coluna abaixo é a do GLM-5.1, apresentada apenas como ponto de referência da família. Não foi publicada nenhuma coluna de benchmarks para o GLM-4.7-Flash, e nenhuma é estimada aqui.
Não existe nenhuma linha publicada para o GLM-4.7-Flash, e inferir uma a partir de um modelo muito maior seria enganador em qualquer dos sentidos. Para o que a coluna de referência serve é para calibração: mostra a amplitude que os modelos GLM publicados ocupam, de modo a saber o que um modelo de tamanho completo da geração anterior alcançou antes de decidir se um modelo de 30B será provavelmente suficiente para a sua tarefa.
Comparação no DeepSWE, tal como publicada pelos autores do modelo.
O DeepSWE é onde a escala do modelo se revela de forma mais brutal. O GPT-5.5 lidera com 70.0 e o Claude Opus 4.8 obtém 58.0, o GLM-5.2 chega a 46.2, e a geração aberta anterior agrupa-se muito abaixo — GLM-5.1 e Qwen3.7-Max com 18.0, DeepSeek-V4-Pro com 8.0. Se a sua carga de trabalho se parece com o DeepSWE, um modelo leve é a ferramenta errada por mais eficiente que seja; se se parece com classificação, extração ou edições de código de rotina, o Flash é provavelmente tudo o que precisa.
O GLM-4.7-Flash é o nível leve da geração GLM-4.7, a par do GLM-4.7 de tamanho completo e acima do mais antigo GLM-4.5-Air na linha de eficiência da família. Tudo nessa linha tem a mesma licença MIT e os mesmos alojamentos de pesos, pelo que mudar de nível é uma decisão de hardware e não jurídica.
O modelo emblemático com contexto de 1M de tokens. É o estado da arte open source em avaliações de programação e de longo alcance, com níveis de esforço explícitos Non-Thinking, High e Max.
O marco original de eficiência da família: um modelo GLM de pequena pegada com forte desempenho por cada unidade de computação que consome.
Leia os benchmarks do modelo GLM e depois ponha um modelo real a trabalhar. O playground acima é gratuito e não exige nada de si; se quiser um conjunto de ferramentas de IA mais completo, o plano gratuito do nosso parceiro começa aqui.