Tutti i modelli

GLM-5.1: il modello di Z.AI

Il modello di punta di Z.AI. Finestra di contesto fino a 1M di token. Forte per agenti su intere codebase o intere knowledge base a un prezzo ben al di sotto di Sonnet.

1M tokens · Text / Code · Prompt cache

Okou non esegue più GLM-5.1. Questa pagina resta come riferimento per specifiche, prezzi e benchmark. Per lo stesso tipo di lavoro, usa GPT 5.6 Luna.

Vedi GPT 5.6 Luna

GLM-5.1 è lo specialista long-context della gamma, con fino a 1M di token di input. Ricorri ad esso quando il prompt è davvero enorme: un intero repository in una volta, diverse centinaia di documenti in una singola esecuzione di ricerca. Le classifiche indipendenti lo collocano costantemente nella fascia alta dei modelli open-weight per il lavoro long-context.

Il prezzo di listino vendor è di $1,40 / $4,40 per 1M di token, ben sotto la metà di Sonnet 4.6 a livello vendor, e l'API è Anthropic-compatibile, quindi gli agenti in stile Claude si integrano senza riscritture. Ricorri a Sonnet o Opus quando la profondità di ragionamento in inglese conta più della dimensione del contesto, e a Kimi K2.7 Code quando domina la latenza.

Cos'è GLM-5.1?

Il modello di punta generalista di Z.AI / Zhipu AI.

GLM-5.1 è il modello di punta della serie GLM di Zhipu AI, distribuito tramite Z.AI. È un modello di ragionamento con forti capacità generali e una finestra di contesto insolitamente grande. Fino a 1M di token, diverse volte più grande dei predefiniti di Anthropic e Moonshot nella stessa fascia di prezzo.

Cosa rende notevole GLM-5.1

Caratteristiche principali di architettura e capacità.

GLM-5.1 espone una finestra di contesto fino a 1M di token (la più grande della gamma Built-in) attraverso una superficie API Anthropic-compatibile, quindi gli agenti in stile Claude si integrano senza modifiche. L'upstream supporta il prompt caching su api.z.ai.

Specifiche in breve

FamigliaSerie GLM-5
ModalitàTesto, codice
LingueMultilingue
Finestra di contestoFino a 1M di token
Prompt cachingSupportato (Anthropic-compatibile)

Benchmark di GLM-5.1

Le recensioni indipendenti collocano GLM-5.1 nella fascia alta dei modelli open-weight per i task long-context. I numeri cambiano ogni settimana sulle classifiche di terze parti. Deliberatamente non fissiamo qui percentuali esatte.

Code Arenaleaderboard di terze parti
Top-3 (pesi aperti)
Richiamo long-contextdichiarato dal vendor
Solido su tutta la finestra da 1M di token

Prezzi di GLM-5.1

Prezzo di listino del provider, per 1M di token.

Input$1.40
Output$4.40
Lettura cache$0.26
Scrittura cache$1.40

Come si comporta GLM-5.1 nella pratica

Comportamento osservato dalle esecuzioni di agenti in produzione.

Richiamo long-context

La finestra da 1M di token di GLM-5.1 è davvero utilizzabile. Mantiene la coerenza ben oltre il confine dei 200K che limita la famiglia Anthropic sui vecchi modelli da 200K. Utile per agenti su interi repo o interi corpus di documenti.

Ragionamento

Ragionamento generale solido. Sotto Sonnet 4.6 sul routing multi-strumento in lingua inglese più difficile, ma il divario è piccolo rispetto alla differenza di costo.

I migliori task per agenti con GLM-5.1

Il refactor dell'intero repo che entra in un solo prompt

Inserisci una codebase di medie dimensioni da 500K token in una singola chiamata a GLM-5.1 e chiedi un rename tra file, una revisione architetturale o una passata di sicurezza. I modelli con finestre più piccole ti costringono a spezzare il repo e cucire insieme i risultati, che è dove si insinuano i bug. GLM-5.1 mantiene ogni file nella memoria di lavoro e cita i percorsi giusti nel suo output.

L'esecuzione di ricerca su centinaia di documenti

Wiki, RFC, contratti, i ticket di supporto dell'anno scorso — carica l'intera pila in una volta e chiedi pattern tra documenti. Il costo per esecuzione resta gestibile grazie al basso prezzo vendor, ed è ciò che rende questo tipo di workflow "leggi tutto, sintetizza una volta" davvero sostenibile in produzione invece che un progetto sperimentale una tantum.

Quando evitare GLM-5.1

Evita GLM-5.1 sul ragionamento in lingua inglese più difficile in cui Sonnet 4.6 o Opus 4.7 è ancora in testa, e sulle risposte di chat critiche per la latenza in cui Kimi K2.7 Code è molto più veloce.

GLM-5.1 vs altri modelli

GLM-5.1 vs Kimi K2.7 Code

Entrambi sono opzioni long-context a costo in credito simile (×0,4 contro ×0,3). Kimi ha un richiamo long-context più forte nella nostra valutazione interna; GLM-5.1 vince sulla dimensione grezza del contesto (1M contro 256K). Scegli Kimi per trascrizioni molto lunghe; scegli GLM-5.1 quando devi infilare un'intera codebase in un solo prompt.

GLM-5.1 vs Claude Sonnet 4.6

Sonnet 4.6 (×1) è in testa sull'accuratezza del routing degli strumenti e sul ragionamento in lingua inglese. GLM-5.1 (×0,4) è in testa sulla finestra di contesto ed è la scelta giusta quando il costo o la dimensione del contesto dominano la decisione.

GLM-5.1 vs DeepSeek V4 Pro

DeepSeek V4 Pro (×0,1) è più economico e ottiene punteggi più alti su Code Arena secondo le recensioni di terze parti. GLM-5.1 vince comunque sulla dimensione del contesto. Scegli DeepSeek per il lavoro a contesto standard sensibile ai costi; scegli GLM-5.1 quando la dimensione del contesto è il vincolo.

In sintesi: dovresti usare GLM-5.1?

Scegli GLM-5.1 quando la dimensione del contesto è il vincolo. Per tutto il resto, DeepSeek V4 Pro è più economico e Sonnet 4.6 instrada gli strumenti in modo più affidabile.

Disponibilità di GLM-5.1 su Okou

GLM-5.1 è stato rimosso dalla lineup di Okou, quindi non può più essere selezionato in chat né in un workflow, e non è disponibile con la tua chiave API. GPT 5.6 Luna copre lo stesso livello di risparmio.