GLM-4.5-Air es el lanzamiento que estableció la eficiencia como objetivo de primer nivel para la familia de modelos GLM. Es un modelo de huella reducida diseñado para ofrecer un rendimiento sólido por cada unidad de cómputo que consume, más que para encabezar una tabla de clasificación: el nivel al que recurres cuando una carga de trabajo es de gran volumen, sensible a la latencia o se ejecuta en un lugar donde un buque insignia sencillamente no puede desplegarse.
Ese objetivo de diseño ha envejecido bien. La familia ofrece ahora una escalera de eficiencia clara (GLM-4.5-Air, luego el GLM-4.7-Flash de 30B y después los lanzamientos de tamaño completo, hasta el buque insignia GLM-5.2 con contexto de 1M) y todo ello bajo la misma licencia MIT con pesos en los mismos alojamientos públicos. Elegir entre ellos es una decisión de hardware y coste de cómputo, no de licencia, lo que supone una posición materialmente distinta a elegir entre APIs alojadas, donde los niveles son además fronteras comerciales.
Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.
La respuesta aparecerá aquí...
Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.
Los benchmarks de frontera premian la capacidad a cualquier precio, que es justo lo contrario de cómo están restringidos la mayoría de sistemas en producción. Si una petición debe responder en menos de un segundo, o una canalización tiene que procesar millones de documentos, la pregunta operativa no es qué modelo puntúa más alto sino cuál supera tu listón de calidad de la forma más barata. Un modelo GLM orientado a la eficiencia cambia la forma de lo que puedes construir: puedes permitirte llamarlo en cada elemento en lugar de muestrear, ejecutarlo dentro de la ruta de la petición en vez de en un lote nocturno, y mantener toda la carga en tu propio hardware. El corolario es saber cuándo es la elección equivocada: el trabajo agéntico de largo recorrido, el razonamiento a escala de repositorio y los problemas multipaso difíciles corresponden al buque insignia, y forzarlos en un modelo ligero produce reintentos caros en lugar de ahorro.
La tabla comparativa publicada cubre GLM-5.2 y GLM-5.1. La columna inferior es la de GLM-5.1, mostrada solo como punto de referencia familiar. No se ha publicado ninguna columna de benchmarks para GLM-4.5-Air y aquí no se inventa ninguna.
GLM-4.5-Air no tiene fila en el conjunto de comparación publicado, así que esta página no cita ninguna para él. La columna de referencia existe para indicarte qué logró un modelo de tamaño completo de la generación siguiente, que es la manera honesta de enmarcar un nivel ligero: estás cambiando capacidad medible por una huella de servicio mucho menor, y el tamaño de ese intercambio es algo que deberías medir en tu propia carga de trabajo.
Comparación en HLE (Humanity's Last Exam), según los autores del modelo.
HLE es la evaluación publicada que más castiga la capacidad limitada. Claude Opus 4.8 lidera con 49.8 sobre el conjunto completo, Qwen3.7-Max registra 41.4, GLM-5.2 40.5, DeepSeek-V4-Pro 37.7 y GLM-5.1 31.0. Incluso los modelos más fuertes responden menos de la mitad de las preguntas, lo que deja claro que el razonamiento difícil y abierto no es el terreno de un modelo ligero: enruta esas tareas al buque insignia y reserva Air para el trabajo de alto volumen para el que se creó.
GLM-4.5-Air es el modelo más antiguo de la gama recogida en este sitio y el origen de la línea de eficiencia de la familia, continuada después por el GLM-4.7-Flash de 30B. Por encima quedan GLM-4.7, GLM-5, GLM-5-Turbo, GLM-5.1 y el buque insignia GLM-5.2. Una arquitectura sensata usa ambos extremos: Air o Flash para el volumen y GLM-5.2 para los problemas que justifican el cómputo. Como todos los niveles comparten licencia y alojamiento de pesos, esa división no te cuesta nada contractualmente: estás ejecutando dos checkpoints de la misma familia abierta en vez de negociar dos relaciones de proveedor distintas, y puedes mover tráfico entre ellos cuando tus mediciones lo aconsejen.
El buque insignia con contexto de 1M tokens. Es el estado del arte de código abierto en programación y evaluaciones de largo recorrido, con niveles de esfuerzo explícitos Non-Thinking, High y Max.
El nivel ligero de 30B. Eficiente y lo bastante rápido para inferencia local, y según lo publicado supera a modelos abiertos de escala similar.
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.