Tous les modèles

GLM-5.1 : le modèle de Z.AI

Le modèle phare de Z.AI. Une fenêtre de contexte allant jusqu'à 1M de tokens. Solide pour les agents traitant un codebase entier ou une base de connaissances entière, à un tarif bien inférieur à celui du Sonnet.

1M tokens · Text / Code · Prompt cache

Okou n'exécute plus GLM-5.1. Cette page est conservée comme référence pour ses caractéristiques, ses tarifs et ses benchmarks. Pour le même type de travail, utilisez GPT 5.6 Luna.

Voir GPT 5.6 Luna

GLM-5.1 est le spécialiste du contexte long de la gamme, avec une entrée allant jusqu'à 1M de tokens. Recourez-y quand le prompt est réellement gigantesque : un dépôt entier d'un coup, plusieurs centaines de documents en une seule exécution de recherche. Les classements indépendants le placent régulièrement dans le peloton de tête des modèles open-weight pour le travail en contexte long.

Le prix catalogue du fournisseur est de 1,40 $ / 4,40 $ par 1M de tokens, soit bien moins de la moitié du Sonnet 4.6 au niveau fournisseur, et l'API est compatible Anthropic, de sorte que les agents de style Claude s'intègrent sans réécriture. Recourez au Sonnet ou à l'Opus quand la profondeur de raisonnement en anglais compte plus que la taille du contexte, et au Kimi K2.7 Code quand la latence prime.

Qu'est-ce que GLM-5.1 ?

Le modèle phare polyvalent de Z.AI / Zhipu AI.

GLM-5.1 est le modèle phare de la série GLM de Zhipu AI, distribué via Z.AI. C'est un modèle de raisonnement aux capacités générales solides et à la fenêtre de contexte exceptionnellement vaste. Jusqu'à 1M de tokens, soit plusieurs fois plus que les valeurs par défaut d'Anthropic et de Moonshot au même niveau de prix.

Ce qui distingue GLM-5.1

Principales caractéristiques d'architecture et de capacités.

GLM-5.1 expose une fenêtre de contexte allant jusqu'à 1M de tokens (la plus vaste de la gamme intégrée) via une surface d'API compatible Anthropic, de sorte que les agents de style Claude s'intègrent sans changement. L'amont prend en charge la mise en cache des prompts sur api.z.ai.

Spécifications en un coup d'œil

FamilleSérie GLM-5
ModalitésTexte, code
LanguesMultilingue
Fenêtre de contexteJusqu'à 1M de tokens
Mise en cache des promptsPrise en charge (compatible Anthropic)

Benchmarks de GLM-5.1

Les tests indépendants placent GLM-5.1 dans le peloton de tête des modèles open-weight pour les tâches en contexte long. Les chiffres évoluent chaque semaine sur les classements tiers. Nous évitons délibérément d'y figer des pourcentages exacts.

Code Arenaclassement tiers
Top 3 (poids ouverts)
Rappel en contexte longcommuniqué par le fournisseur
Solide sur toute la fenêtre de 1M de tokens

Tarification de GLM-5.1

Prix catalogue fournisseur, par million de tokens.

Entrée$1.40
Sortie$4.40
Lecture cache$0.26
Écriture cache$1.40

Comment GLM-5.1 se comporte en pratique

Comportement observé lors d'exécutions d'agents en production.

Rappel en contexte long

La fenêtre de 1M de tokens de GLM-5.1 est réellement exploitable. Il maintient la cohérence bien au-delà de la limite de 200K qui bridait la famille Anthropic sur les anciens modèles à 200K. Utile pour les agents traitant un dépôt entier ou un corpus de documents entier.

Raisonnement

Raisonnement général solide. En dessous du Sonnet 4.6 sur le routage multi-outils en anglais le plus difficile, mais l'écart est faible au regard de la différence de coût.

Meilleures tâches d'agent pour GLM-5.1

La refactorisation de dépôt entier qui tient en un seul prompt

Déposez un codebase de taille moyenne de 500K tokens dans un seul appel GLM-5.1 et demandez un renommage transversal, une revue d'architecture ou un passage de sécurité. Les modèles à fenêtres plus petites vous obligent à découper le dépôt et à recoller les résultats, ce qui est précisément là où les bugs se glissent. GLM-5.1 garde tous les fichiers en mémoire de travail et référence les bons chemins dans sa sortie.

L'exécution de recherche sur des centaines de documents

Wikis, RFC, contrats, tickets de support de l'an dernier — chargez le tout d'un coup et demandez des motifs transversaux. Le coût par exécution reste maîtrisable grâce au faible prix fournisseur, ce qui rend ce type de flux « tout lire, synthétiser une fois » réellement abordable en production plutôt qu'un projet ponctuel.

Quand éviter GLM-5.1

Évitez GLM-5.1 sur le raisonnement en anglais le plus difficile, où le Sonnet 4.6 ou l'Opus 4.7 mènent encore, et sur les réponses de chat critiques en latence, où le Kimi K2.7 Code est bien plus rapide.

GLM-5.1 vs autres modèles

GLM-5.1 vs Kimi K2.7 Code

Les deux sont des options long contexte à un coût en crédits similaire (×0,4 contre ×0,3). Kimi a un meilleur rappel en contexte long dans notre évaluation interne ; GLM-5.1 l'emporte sur la taille de contexte brute (1M contre 256K). Choisissez Kimi pour les très longues transcriptions ; choisissez GLM-5.1 quand vous devez faire tenir un dépôt entier dans un seul prompt.

GLM-5.1 vs Claude Sonnet 4.6

Le Sonnet 4.6 (×1) mène sur la précision de routage d'outils et le raisonnement en anglais. GLM-5.1 (×0,4) mène sur la fenêtre de contexte et constitue le bon choix quand le coût ou la taille du contexte domine la décision.

GLM-5.1 vs DeepSeek V4 Pro

DeepSeek V4 Pro (×0,1) est moins cher et se classe mieux sur Code Arena selon les tests tiers. GLM-5.1 l'emporte encore sur la taille de contexte. Choisissez DeepSeek pour le travail à contexte standard sensible au coût ; choisissez GLM-5.1 quand la taille du contexte est la contrainte.

En résumé : devriez-vous utiliser GLM-5.1 ?

Choisissez GLM-5.1 quand la taille du contexte est la contrainte. Pour tout le reste, DeepSeek V4 Pro est moins cher et le Sonnet 4.6 route les outils plus fiablement.

Disponibilité de GLM-5.1 sur Okou

GLM-5.1 a été retiré de l'offre Okou : il ne peut plus être sélectionné dans le chat ni dans un workflow, et il n'est pas disponible avec votre propre clé API. GPT 5.6 Luna couvre le même palier économique.