GLM-4.5-Air — El modelo GLM ligero y eficiente

GLM-4.5-Air es el lanzamiento que estableció la eficiencia como objetivo de primer nivel para la familia de modelos GLM. Es un modelo de huella reducida diseñado para ofrecer un rendimiento sólido por cada unidad de cómputo que consume, más que para encabezar una tabla de clasificación: el nivel al que recurres cuando una carga de trabajo es de gran volumen, sensible a la latencia o se ejecuta en un lugar donde un buque insignia sencillamente no puede desplegarse.

Ese objetivo de diseño ha envejecido bien. La familia ofrece ahora una escalera de eficiencia clara (GLM-4.5-Air, luego el GLM-4.7-Flash de 30B y después los lanzamientos de tamaño completo, hasta el buque insignia GLM-5.2 con contexto de 1M) y todo ello bajo la misma licencia MIT con pesos en los mismos alojamientos públicos. Elegir entre ellos es una decisión de hardware y coste de cómputo, no de licencia, lo que supone una posición materialmente distinta a elegir entre APIs alojadas, donde los niveles son además fronteras comerciales.

Air
nivel de eficiencia
la línea de huella reducida de la familia
MIT
licencia de código abierto
MIT, sin restricciones regionales
4.5
generación de la serie
la generación GLM-4.5

Playground de IA gratuito — prueba un LLM de código abierto en vivo

Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.

La respuesta aparecerá aquí...

Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.

Qué te aporta el «rendimiento por unidad de cómputo»

Los benchmarks de frontera premian la capacidad a cualquier precio, que es justo lo contrario de cómo están restringidos la mayoría de sistemas en producción. Si una petición debe responder en menos de un segundo, o una canalización tiene que procesar millones de documentos, la pregunta operativa no es qué modelo puntúa más alto sino cuál supera tu listón de calidad de la forma más barata. Un modelo GLM orientado a la eficiencia cambia la forma de lo que puedes construir: puedes permitirte llamarlo en cada elemento en lugar de muestrear, ejecutarlo dentro de la ruta de la petición en vez de en un lote nocturno, y mantener toda la carga en tu propio hardware. El corolario es saber cuándo es la elección equivocada: el trabajo agéntico de largo recorrido, el razonamiento a escala de repositorio y los problemas multipaso difíciles corresponden al buque insignia, y forzarlos en un modelo ligero produce reintentos caros en lugar de ahorro.

Parámetros
Ligero (nivel Air)
Licencia
Código abierto MIT
Posicionamiento
Rendimiento por unidad de cómputo
Familia
Serie GLM-4.5
Alojamiento de pesos
HuggingFace · ModelScope

GLM-4.5-Air en los datos de benchmarks publicados

La tabla comparativa publicada cubre GLM-5.2 y GLM-5.1. La columna inferior es la de GLM-5.1, mostrada solo como punto de referencia familiar. No se ha publicado ninguna columna de benchmarks para GLM-4.5-Air y aquí no se inventa ninguna.

GLM-4.5-Air no tiene fila en el conjunto de comparación publicado, así que esta página no cita ninguna para él. La columna de referencia existe para indicarte qué logró un modelo de tamaño completo de la generación siguiente, que es la manera honesta de enmarcar un nivel ligero: estás cambiando capacidad medible por una huella de servicio mucho menor, y el tamaño de ese intercambio es algo que deberías medir en tu propia carga de trabajo.

Ver los 17 benchmarks de GLM en detalle →

Cómo se compara la familia en razonamiento difícil

Comparación en HLE (Humanity's Last Exam), según los autores del modelo.

HLE es la evaluación publicada que más castiga la capacidad limitada. Claude Opus 4.8 lidera con 49.8 sobre el conjunto completo, Qwen3.7-Max registra 41.4, GLM-5.2 40.5, DeepSeek-V4-Pro 37.7 y GLM-5.1 31.0. Incluso los modelos más fuertes responden menos de la mitad de las preguntas, lo que deja claro que el razonamiento difícil y abierto no es el terreno de un modelo ligero: enruta esas tareas al buque insignia y reserva Air para el trabajo de alto volumen para el que se creó.

Leer la comparativa completa GLM vs Qwen →

Dónde encaja GLM-4.5-Air en la gama de modelos GLM

GLM-4.5-Air es el modelo más antiguo de la gama recogida en este sitio y el origen de la línea de eficiencia de la familia, continuada después por el GLM-4.7-Flash de 30B. Por encima quedan GLM-4.7, GLM-5, GLM-5-Turbo, GLM-5.1 y el buque insignia GLM-5.2. Una arquitectura sensata usa ambos extremos: Air o Flash para el volumen y GLM-5.2 para los problemas que justifican el cómputo. Como todos los niveles comparten licencia y alojamiento de pesos, esa división no te cuesta nada contractualmente: estás ejecutando dos checkpoints de la misma familia abierta en vez de negociar dos relaciones de proveedor distintas, y puedes mover tráfico entre ellos cuando tus mediciones lo aconsejen.

Más modelos GLM

Ver todo

Preguntas frecuentes sobre GLM-4.5-Air

¿Qué es el modelo GLM-4.5-Air?
GLM-4.5-Air es el miembro ligero y de huella reducida de la familia de modelos GLM, diseñado para ofrecer un rendimiento sólido en relación con el cómputo que consume. Como todos los modelos GLM principales, se publica con licencia MIT y pesos abiertos.
¿Para qué sirve GLM-4.5-Air?
Para trabajo de alto volumen y sensible a la latencia: clasificación, extracción, resumen, ediciones rutinarias y cualquier cosa que necesites ejecutar en todos los elementos y no en una muestra. Es la herramienta equivocada para la ingeniería agéntica de largo recorrido, que corresponde a GLM-5.2.
¿Tiene GLM-4.5-Air puntuaciones de benchmark publicadas?
No. La tabla comparativa publicada por los autores del modelo cubre únicamente GLM-5.2 y GLM-5.1, así que no hay columna de Air que reportar y este sitio no la estima. Evalúalo en tu propia tarea si estás considerándolo.
¿Es GLM-4.5-Air de código abierto?
Sí. Tiene licencia MIT con pesos abiertos en HuggingFace y ModelScope y sin restricciones regionales, y funciona con el stack de inferencia abierto habitual, igual que el resto de la familia.
¿GLM-4.5-Air o GLM-4.7-Flash?
Flash es el nivel ligero de 30B más reciente y hereda el trabajo de programación y razonamiento de la generación GLM-4.7; Air es el hito de eficiencia anterior, con una huella menor. Si ambos caben en tu hardware, mídelos con tu propia carga de trabajo: ninguno tiene columna publicada que decida por ti.

Prueba gratis un modelo de IA en vivo, sin cuenta

Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.