GLM-4.7-Flash — El modelo GLM ligero de 30B

GLM-4.7-Flash es el miembro de treinta mil millones de parámetros de la familia de modelos GLM, pensado para el caso en que el buque insignia sencillamente no cabe. Treinta mil millones de parámetros es la clase de tamaño que corre en un solo acelerador de mucha memoria, o cuantizado en hardware de consumo, lo que lo convierte en la opción natural para desarrollo local, inferencia on-premise y cualquier escenario donde la latencia por petición importe más que los últimos puntos de benchmark.

Los autores del modelo lo posicionan como eficiente y de alto rendimiento, e indican que supera a modelos de código abierto de escala similar. Esa es la afirmación relevante para este nivel: nadie que despliegue un modelo de 30B espera que gane a un sistema de frontera, pero sí le importa mucho si gana a las otras opciones de 30B que podría haber ejecutado.

30B
parámetros
la clase de tamaño que cabe en un solo acelerador
MIT
licencia de código abierto
MIT, sin restricciones regionales
4.7
generación de la serie
el nivel ligero de la línea GLM-4.7

Playground de IA gratuito — prueba un LLM de código abierto en vivo

Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.

La respuesta aparecerá aquí...

Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.

Por qué merece la pena tener un modelo GLM de 30B

El número de parámetros decide dónde puede ejecutarse físicamente un modelo, y esa restricción determina más decisiones de arquitectura que la capacidad bruta. Un modelo de 30B puede servirse en hardware que un equipo pequeño ya posee, mantiene los prompts dentro de tu propia red y responde lo bastante rápido para vivir en un bucle interactivo en vez de en una cola por lotes. Es además el tamaño en el que el fine-tuning deja de ser un proyecto de investigación: puedes adaptar un modelo GLM de 30B a un dominio concreto y evaluar el resultado esa misma tarde. La contrapartida es real: menos parámetros significan menos margen en razonamiento difícil y de largo recorrido, que es justo la carga para la que se creó el buque insignia con contexto de 1M. La forma correcta de usar la familia es enrutar el trabajo por dificultad, dejando en Flash las tareas baratas de alto volumen y reservando el buque insignia para los problemas que realmente lo necesitan.

Parámetros
30B
Licencia
Código abierto MIT
Posicionamiento
Ligero, alto rendimiento
Familia
Serie GLM-4.7
Alojamiento de pesos
HuggingFace · ModelScope

GLM-4.7-Flash en los datos de benchmarks publicados

La tabla comparativa publicada cubre GLM-5.2 y GLM-5.1. La columna inferior es la de GLM-5.1, mostrada solo como punto de referencia de la familia. No se ha publicado ninguna columna de benchmarks para GLM-4.7-Flash y aquí no se estima ninguna.

No hay fila publicada para GLM-4.7-Flash, e inferir una a partir de un modelo mucho mayor sería engañoso en cualquier dirección. Para lo que sirve la columna de referencia es para calibrar: muestra el rango que ocupan los modelos GLM publicados, de modo que sepas qué logró un modelo de tamaño completo de la generación anterior antes de decidir si un modelo de 30B será suficiente para tu tarea.

Ver los 17 benchmarks de GLM en detalle →

Cómo se compara la familia en programación de largo recorrido

Comparación en DeepSWE, según los autores del modelo.

DeepSWE es donde la escala del modelo se nota de forma más brutal. GPT-5.5 lidera con 70.0 y Claude Opus 4.8 registra 58.0, GLM-5.2 alcanza 46.2 y la generación abierta anterior se agrupa muy por debajo: GLM-5.1 y Qwen3.7-Max con 18.0 y DeepSeek-V4-Pro con 8.0. Si tu carga de trabajo se parece a DeepSWE, un modelo ligero es la herramienta equivocada por muy eficiente que sea; si se parece a clasificación, extracción o ediciones rutinarias de código, Flash probablemente sea todo lo que necesitas.

Leer la comparativa completa GLM vs Qwen →

Dónde encaja GLM-4.7-Flash en la gama de modelos GLM

GLM-4.7-Flash es el nivel ligero de la generación GLM-4.7, junto al GLM-4.7 de tamaño completo y por encima del más antiguo GLM-4.5-Air en la línea de eficiencia de la familia. Todo en esa línea comparte la misma licencia MIT y los mismos alojamientos de pesos, así que moverse entre niveles es una decisión de hardware, no legal.

Más modelos GLM

Ver todo

Preguntas frecuentes sobre GLM-4.7-Flash

¿Qué es el modelo GLM-4.7-Flash?
GLM-4.7-Flash es el miembro ligero de treinta mil millones de parámetros de la familia de modelos GLM. Tiene licencia MIT y pesos abiertos, está creado para inferencia eficiente de alto rendimiento y, según los autores del modelo, supera a modelos de código abierto de escala similar.
¿Qué hardware necesito para ejecutar GLM-4.7-Flash?
Treinta mil millones de parámetros es la clase de tamaño que cabe en un solo acelerador de mucha memoria con precisión reducida, o en hardware de consumo una vez cuantizado. Los requisitos exactos dependen de tu cuantización, longitud de contexto y framework de servicio, así que mídelo con tu propia configuración en lugar de fiarte de una regla general.
¿Tiene GLM-4.7-Flash puntuaciones de benchmark publicadas?
No en la tabla comparativa que publicaron los autores del modelo, que cubre GLM-5.2 y GLM-5.1. Este sitio no estima una columna para él. La afirmación publicada sobre este modelo es relativa: se indica que supera a modelos abiertos de escala similar.
¿Es GLM-4.7-Flash de código abierto?
Sí. Es un modelo GLM de pesos abiertos con licencia MIT publicado en HuggingFace y ModelScope sin restricciones regionales, y funciona con transformers, vLLM, SGLang, xLLM y ktransformers como el resto de la familia.
¿GLM-4.7-Flash o GLM-4.5-Air?
Flash es el nivel ligero más reciente e incorpora las mejoras de programación y razonamiento de la generación GLM-4.7; Air es el hito de eficiencia anterior. Ninguno tiene columna de benchmarks publicada, así que si ambos caben en tu hardware lo sensato es evaluarlos en tu propia tarea y no por posicionamiento.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.