Todos os modelos

GLM-5.1: o modelo da Z.AI

O carro-chefe da Z.AI. Janela de contexto de até 1M tokens. Forte para agentes de toda a base de código ou de toda a base de conhecimento, a um preço bem abaixo do Sonnet.

1M tokens · Text / Code · Prompt cache

A Okou não executa mais o GLM-5.1. Esta página é mantida como referência de especificações, preços e benchmarks. Para o mesmo tipo de trabalho, use o GPT 5.6 Luna.

Ver GPT 5.6 Luna

O GLM-5.1 é o especialista em contexto longo da linha, com até 1M tokens de entrada. Recorra a ele quando o prompt for genuinamente enorme: um repositório inteiro de uma vez, várias centenas de documentos em uma única execução de pesquisa. Leaderboards independentes consistentemente o classificam no topo dos modelos de pesos abertos para trabalho de contexto longo.

O preço de tabela da fornecedora é de $1.40 / $4.40 per 1M tokens, bem abaixo da metade do Sonnet 4.6 no nível da fornecedora, e a API é compatível com Anthropic, então agentes no estilo Claude se encaixam sem reescrita. Recorra ao Sonnet ou Opus quando a profundidade de raciocínio em inglês importar mais do que o tamanho do contexto, e ao Kimi K2.7 Code quando a latência dominar.

O que é o GLM-5.1?

O modelo carro-chefe de uso geral da Z.AI / Zhipu AI.

O GLM-5.1 é o carro-chefe da série GLM da Zhipu AI, distribuído via Z.AI. É um modelo de raciocínio com forte capacidade geral e uma janela de contexto incomumente grande. Até 1M tokens, várias vezes maior do que os padrões da Anthropic e da Moonshot na mesma faixa de preço.

O que se destaca no GLM-5.1

Principais recursos de arquitetura e capacidade.

O GLM-5.1 expõe uma janela de contexto de até 1M tokens (a maior da linha Built-in) por meio de uma superfície de API compatível com Anthropic, então agentes no estilo Claude se encaixam sem alterações. A origem suporta cache de prompts em api.z.ai.

Especificações em resumo

FamíliaSérie GLM-5
ModalidadesTexto, código
IdiomasMultilíngue
Janela de contextoAté 1M tokens
Cache de promptsSuportado (compatível com Anthropic)

Benchmarks do GLM-5.1

Análises independentes colocam o GLM-5.1 no topo dos modelos de pesos abertos para tarefas de contexto longo. Os números mudam semanalmente em leaderboards de terceiros. Deliberadamente não fixamos porcentagens exatas aqui.

Code Arenaleaderboard de terceiros
Top-3 (pesos abertos)
Recuperação em contexto longoreportado pela fornecedora
Forte em toda a janela de 1M tokens

Preços do GLM-5.1

Preço de tabela do provedor, por 1M de tokens.

Entrada$1.40
Saída$4.40
Leitura de cache$0.26
Escrita de cache$1.40

Como o GLM-5.1 se comporta na prática

Comportamento observado em execuções de agentes em produção.

Recuperação em contexto longo

A janela de 1M tokens do GLM-5.1 é genuinamente utilizável. Ele mantém coerência bem além do limite de 200K que restringe a família Anthropic nos modelos mais antigos de 200K. Útil para agentes de todo o repositório ou de todo o corpus de documentos.

Raciocínio

Raciocínio geral sólido. Abaixo do Sonnet 4.6 no roteamento multi-ferramentas em inglês mais difícil, mas a diferença é pequena em relação à diferença de custo.

Melhores tarefas de agente para o GLM-5.1

A refatoração de todo o repositório que cabe em um único prompt

Coloque uma base de código de porte médio com 500K tokens em uma única chamada ao GLM-5.1 e peça uma renomeação entre arquivos, uma revisão arquitetural ou uma passagem de segurança. Modelos com janelas menores forçam você a fragmentar o repositório e costurar os resultados, que é onde os bugs aparecem. O GLM-5.1 mantém cada arquivo na memória de trabalho e referencia os caminhos certos em sua saída.

A execução de pesquisa sobre centenas de documentos

Wikis, RFCs, contratos, os tickets de suporte do ano passado — carregue a pilha inteira de uma vez e peça padrões entre documentos. O custo por execução permanece gerenciável por causa do baixo preço da fornecedora, que é o que torna esse tipo de fluxo de "ler tudo, resumir uma vez" de fato viável em produção, em vez de um projeto científico pontual.

Quando dispensar o GLM-5.1

Evite o GLM-5.1 no raciocínio em inglês mais difícil, em que o Sonnet 4.6 ou o Opus 4.7 ainda lideram, e em respostas de chat críticas em latência, em que o Kimi K2.7 Code é muito mais rápido.

GLM-5.1 vs outros modelos

GLM-5.1 vs Kimi K2.7 Code

Ambos são opções de contexto longo com custo de créditos similar (×0.4 vs ×0.3). O Kimi tem recuperação de contexto longo mais forte em nossa avaliação interna; o GLM-5.1 vence no tamanho bruto de contexto (1M vs 256K). Escolha o Kimi para transcrições muito longas; escolha o GLM-5.1 quando precisar enfiar uma base de código inteira em um único prompt.

GLM-5.1 vs Claude Sonnet 4.6

O Sonnet 4.6 (×1) lidera em precisão de roteamento de ferramentas e raciocínio em inglês. O GLM-5.1 (×0.4) lidera na janela de contexto e é a escolha certa quando o custo ou o tamanho do contexto domina a decisão.

GLM-5.1 vs DeepSeek V4 Pro

O DeepSeek V4 Pro (×0.1) é mais barato e pontua mais alto no Code Arena, segundo análises de terceiros. O GLM-5.1 ainda vence no tamanho de contexto. Escolha o DeepSeek para trabalho de contexto padrão sensível a custo; escolha o GLM-5.1 quando o tamanho do contexto for a restrição.

Conclusão: você deveria usar o GLM-5.1?

Escolha o GLM-5.1 quando o tamanho do contexto for a restrição. Para todo o resto, o DeepSeek V4 Pro é mais barato e o Sonnet 4.6 roteia ferramentas de forma mais confiável.

Disponibilidade do GLM-5.1 na Okou

O GLM-5.1 foi removido do catálogo da Okou, portanto não pode mais ser selecionado no chat nem em um workflow, e não está disponível com sua própria chave de API. O GPT 5.6 Luna cobre o mesmo nível de economia.