Todos los modelos

GLM-5.1: modelo de Z.AI

El buque insignia de Z.AI. Hasta 1M tokens de ventana de contexto. Potente para agentes de código base completo o base de conocimiento completa a un precio muy por debajo de Sonnet.

1M tokens · Text / Code · Prompt cache

Okou ya no ejecuta GLM-5.1. Esta página se mantiene como referencia de sus especificaciones, precios y benchmarks. Para el mismo tipo de trabajo, usa GPT 5.6 Luna.

Ver GPT 5.6 Luna

GLM-5.1 es el especialista en contexto largo del catálogo, con hasta 1M tokens de entrada. Úsalo cuando el prompt es genuinamente enorme: un repositorio completo de una vez, varios cientos de documentos en una sola ejecución de investigación. Los rankings independientes lo sitúan consistentemente en el nivel superior de modelos de peso abierto para trabajo de contexto largo.

El precio de lista del proveedor es $1,40 / $4,40 por 1M tokens, muy por debajo de la mitad de Sonnet 4.6 a nivel de proveedor, y la API es compatible con Anthropic, por lo que los agentes estilo Claude funcionan sin reescritura. Recurre a Sonnet u Opus cuando la profundidad de razonamiento en inglés importa más que el tamaño del contexto, y a Kimi K2.7 Code cuando la latencia domina.

¿Qué es GLM-5.1?

El modelo insignia de propósito general de Z.AI / Zhipu AI.

GLM-5.1 es el buque insignia de la serie GLM de Zhipu AI, distribuido a través de Z.AI. Es un modelo de razonamiento con fuerte capacidad general y una ventana de contexto inusualmente grande: hasta 1M tokens, varias veces más grande que los predeterminados de Anthropic y Moonshot en el mismo rango de precio.

Qué destaca de GLM-5.1

Características principales de arquitectura y capacidades.

GLM-5.1 expone una ventana de contexto de hasta 1M tokens (la más grande del catálogo Built-in) a través de una superficie API compatible con Anthropic, por lo que los agentes estilo Claude funcionan sin cambios. El upstream soporta caché de prompts en api.z.ai.

Especificaciones rápidas

FamiliaSerie GLM-5
ModalidadesTexto, código
IdiomasMultilingüe
Ventana de contextoHasta 1M tokens
Caché de promptsSoportado (compatible con Anthropic)

Benchmarks de GLM-5.1

Las reseñas independientes sitúan a GLM-5.1 en el nivel superior de modelos de peso abierto para tareas de contexto largo. Las cifras cambian semanalmente en los rankings de terceros. Deliberadamente no fijamos porcentajes exactos aquí.

Code Arenaranking de terceros
Top-3 (pesos abiertos)
Recuperación de contexto largoreportado por el proveedor
Fuerte en ventana de 1M tokens

Precios de GLM-5.1

Precio de lista del proveedor, por 1M de tokens.

Input$1.40
Output$4.40
Lectura de caché$0.26
Escritura de caché$1.40

Cómo se comporta GLM-5.1 en la práctica

Comportamiento observado en ejecuciones de agentes en producción.

Recuperación de contexto largo

La ventana de 1M tokens de GLM-5.1 es genuinamente utilizable. Mantiene la coherencia mucho más allá del límite de 200K que restringe a la familia Anthropic en los modelos más antiguos de 200K. Útil para agentes de repositorio completo o corpus de documentos completo.

Razonamiento

Razonamiento general sólido. Por debajo de Sonnet 4.6 en el enrutamiento multi-herramienta en inglés más difícil, pero la brecha es pequeña en relación con la diferencia de costo.

Mejores tareas para GLM-5.1

La refactorización de repositorio completo que cabe en un solo prompt

Carga un código base de tamaño medio de 500K tokens en una sola llamada a GLM-5.1 y pide un renombrado entre archivos, una revisión arquitectónica o un pase de seguridad. Los modelos con ventanas más pequeñas te obligan a dividir el repositorio y unir resultados, que es donde se infiltran los bugs. GLM-5.1 mantiene cada archivo en memoria de trabajo y referencia las rutas correctas en su salida.

La ejecución de investigación sobre cientos de documentos

Wikis, RFCs, contratos, tickets de soporte del año pasado — carga todo el montón de una vez y busca patrones entre documentos. El costo por ejecución se mantiene manejable gracias al bajo precio de proveedor, lo que hace que este tipo de flujo de trabajo de "leer todo, resumir una vez" sea realmente asequible en producción en lugar de un proyecto científico único.

Cuándo evitar GLM-5.1

Evita GLM-5.1 en el razonamiento en inglés más difícil donde Sonnet 4.6 u Opus 4.7 aún lideran, y en respuestas de chat críticas en latencia donde Kimi K2.7 Code es mucho más rápido.

GLM-5.1 vs otros modelos

GLM-5.1 vs Kimi K2.7 Code

Ambos son opciones de contexto largo a costo de crédito similar (×0,4 vs ×0,3). Kimi tiene mejor recuperación de contexto largo en nuestra evaluación interna; GLM-5.1 gana en tamaño bruto de contexto (1M vs 256K). Elige Kimi para transcripciones muy largas; elige GLM-5.1 cuando necesitas meter un código base completo en un solo prompt.

GLM-5.1 vs Claude Sonnet 4.6

Sonnet 4.6 (×1) lidera en precisión de enrutamiento de herramientas y razonamiento en inglés. GLM-5.1 (×0,4) lidera en ventana de contexto y es la opción correcta cuando el costo o el tamaño del contexto dominan la decisión.

GLM-5.1 vs DeepSeek V4 Pro

DeepSeek V4 Pro (×0,1) es más barato y tiene mejores benchmarks en Code Arena según reseñas de terceros. GLM-5.1 aún gana en tamaño de contexto. Elige DeepSeek para trabajo de contexto estándar sensible al costo; elige GLM-5.1 cuando el tamaño del contexto es la restricción.

Conclusión: ¿deberías usar GLM-5.1?

Elige GLM-5.1 cuando el tamaño del contexto es la restricción. Para todo lo demás, DeepSeek V4 Pro es más barato y Sonnet 4.6 enruta herramientas de manera más fiable.

Disponibilidad de GLM-5.1 en Okou

GLM-5.1 se ha retirado del catálogo de Okou, por lo que ya no puede seleccionarse en el chat ni en un workflow, y tampoco está disponible con tu propia clave de API. GPT 5.6 Luna cubre el mismo nivel de ahorro de costes.