GLM-5.2 es el modelo GLM insignia de pesos abiertos, diseñado para completar tareas de largo recorrido y programación agéntica más que para el chat de un solo turno. Es el lanzamiento que llevó el contexto utilizable de la familia de 200.000 tokens a un sólido millón, introdujo niveles de esfuerzo explícitos y reconstruyó el stack de atención dispersa en torno a un indexador compartido. Para un equipo que evalúa alternativas de pesos abiertos a la frontera cerrada, este es el modelo GLM que realmente compite en las evaluaciones que a esos equipos les importan, y lo hace con licencia MIT y pesos publicados abiertamente.
Frente a su predecesor GLM-5.1, GLM-5.2 no es una actualización incremental. Terminal-Bench 2.1 pasa de 63.5 a 81.0, DeepSWE de 18.0 a 46.2 y FrontierSWE Dominance de 30.5 a 74.4, todas cifras publicadas por los autores del modelo y ninguna medida aquí. La consecuencia práctica es que un agente de programación puede mantener un repositorio completo, la salida de sus tests y sus propios intentos previos dentro de una sola trayectoria, en lugar de releer fragmentos a través de una capa de recuperación.
Sin registro, sin cuenta, sin créditos. Escribe un prompt y recibe la respuesta en streaming.
La respuesta aparecerá aquí...
Este playground ejecuta un LLM de código abierto gratuito a través de OpenRouter. No es GLM-5.2 y no utiliza pesos de GLM: está aquí para que puedas probar un modelo en vivo mientras consultas los datos de benchmarks publicados de GLM que aparecen más abajo.
Un contexto de un millón de tokens cambia lo que construyes, no solo cuánto puedes pegar. En lugar de una canalización de recuperación que alimenta al modelo con fragmentos pequeños y con pérdidas, puedes cargar un repositorio entero, una referencia de API completa o varios días de logs en un único prompt y dejar que el modelo razone sobre todo a la vez. Eso es lo que hace visibles las dependencias entre archivos y los fallos sistémicos: el bug que solo aparece cuando la frontera del servicio, la migración y el fixture de test están presentes al mismo tiempo. GLM-5.2 se entrenó con trayectorias de agentes de programación de contexto largo que cubren implementación a gran escala, investigación automatizada, optimización del rendimiento y depuración compleja, y por eso los autores del modelo describen la ventana como sólida y no simplemente aceptada: la calidad debe mantenerse en profundidad dentro del contexto en lugar de degradarse cuando la ejecución se complica.
Puntuaciones publicadas por los autores del modelo.
La columna publicada de GLM-5.2 es más fuerte exactamente donde se diseñó el modelo: programación agéntica y ejecución de largo recorrido. Obtiene 81.0 en Terminal-Bench 2.1 con el harness Terminus-2 y 82.7 con Claude Code, 76.8 en el conjunto público de MCP-Atlas y 74.4 en FrontierSWE Dominance, donde cada tarea puede durar hasta veinte horas. En razonamiento puro registra 99.2 en AIME 2026 y 91.2 en GPQA-Diamond. En las tres evaluaciones de largo recorrido (FrontierSWE, PostTrainBench y SWE-Marathon) es el modelo de código abierto mejor clasificado del conjunto de comparación publicado.
Comparación en SWE-bench Pro, según los autores del modelo.
En SWE-bench Pro, el 62.1 de GLM-5.2 queda por detrás del 69.2 de Claude Opus 4.8, pero supera a GPT-5.5 con 58.6 y a Gemini 3.1 Pro con 54.2, y también a su propio predecesor GLM-5.1 con 58.4. Ese patrón se repite en toda la tabla: la frontera cerrada sigue liderando varias evaluaciones estándar de programación, mientras que GLM-5.2 encabeza el campo de pesos abiertos y se lleva filas concretas por completo, incluidas Terminal-Bench 2.1 con el harness de Claude Code (82.7 frente a 78.9) y AIME 2026 (99.2 frente a 95.7).
GLM-5.2 encabeza actualmente una línea que va de GLM-4.5-Air y GLM-4.7 a GLM-5, GLM-5-Turbo y GLM-5.1. Cada paso tuvo una prioridad distinta: GLM-4.7 se centró en programación y generación de front-end, GLM-5-Turbo en la ejecución de agentes de cadena larga y GLM-5.1 en el trabajo autónomo de varias horas; GLM-5.2 integra esas mejoras en un solo modelo con una ventana mucho mayor. Si tu presupuesto de hardware descarta el buque insignia, los niveles ligeros GLM-4.7-Flash y GLM-4.5-Air pertenecen a la misma familia bajo la misma licencia MIT.
El anterior buque insignia. Trajo a la familia los primeros grandes avances en largo recorrido y sigue siendo la referencia con la que se mide cada mejora de GLM-5.2.
Un modelo base de la serie 5 ajustado para escenarios de agentes dinámicos y de cadena larga, donde el plan cambia una y otra vez y la trayectoria debe seguir siendo ejecutable.
Consulta los benchmarks del modelo GLM y luego pon a trabajar un modelo real. El playground de arriba es gratuito y no te pide nada; si quieres un kit de IA más completo, el plan gratuito de nuestro partner empieza aquí.