GLM-5.1: o modelo da Z.AI
O carro-chefe da Z.AI. Janela de contexto de até 1M tokens. Forte para agentes de toda a base de código ou de toda a base de conhecimento, a um preço bem abaixo do Sonnet.
1M tokens · Text / Code · Prompt cache
A Okou não executa mais o GLM-5.1. Esta página é mantida como referência de especificações, preços e benchmarks. Para o mesmo tipo de trabalho, use o GPT 5.6 Luna.
Ver GPT 5.6 LunaO GLM-5.1 é o especialista em contexto longo da linha, com até 1M tokens de entrada. Recorra a ele quando o prompt for genuinamente enorme: um repositório inteiro de uma vez, várias centenas de documentos em uma única execução de pesquisa. Leaderboards independentes consistentemente o classificam no topo dos modelos de pesos abertos para trabalho de contexto longo.
O preço de tabela da fornecedora é de $1.40 / $4.40 per 1M tokens, bem abaixo da metade do Sonnet 4.6 no nível da fornecedora, e a API é compatível com Anthropic, então agentes no estilo Claude se encaixam sem reescrita. Recorra ao Sonnet ou Opus quando a profundidade de raciocínio em inglês importar mais do que o tamanho do contexto, e ao Kimi K2.7 Code quando a latência dominar.
O que é o GLM-5.1?
O modelo carro-chefe de uso geral da Z.AI / Zhipu AI.
O GLM-5.1 é o carro-chefe da série GLM da Zhipu AI, distribuído via Z.AI. É um modelo de raciocínio com forte capacidade geral e uma janela de contexto incomumente grande. Até 1M tokens, várias vezes maior do que os padrões da Anthropic e da Moonshot na mesma faixa de preço.
O que se destaca no GLM-5.1
Principais recursos de arquitetura e capacidade.
O GLM-5.1 expõe uma janela de contexto de até 1M tokens (a maior da linha Built-in) por meio de uma superfície de API compatível com Anthropic, então agentes no estilo Claude se encaixam sem alterações. A origem suporta cache de prompts em api.z.ai.
Especificações em resumo
Benchmarks do GLM-5.1
Análises independentes colocam o GLM-5.1 no topo dos modelos de pesos abertos para tarefas de contexto longo. Os números mudam semanalmente em leaderboards de terceiros. Deliberadamente não fixamos porcentagens exatas aqui.
Preços do GLM-5.1
Preço de tabela do provedor, por 1M de tokens.
Como o GLM-5.1 se comporta na prática
Comportamento observado em execuções de agentes em produção.
Recuperação em contexto longo
A janela de 1M tokens do GLM-5.1 é genuinamente utilizável. Ele mantém coerência bem além do limite de 200K que restringe a família Anthropic nos modelos mais antigos de 200K. Útil para agentes de todo o repositório ou de todo o corpus de documentos.
Raciocínio
Raciocínio geral sólido. Abaixo do Sonnet 4.6 no roteamento multi-ferramentas em inglês mais difícil, mas a diferença é pequena em relação à diferença de custo.
Melhores tarefas de agente para o GLM-5.1
A refatoração de todo o repositório que cabe em um único prompt
Coloque uma base de código de porte médio com 500K tokens em uma única chamada ao GLM-5.1 e peça uma renomeação entre arquivos, uma revisão arquitetural ou uma passagem de segurança. Modelos com janelas menores forçam você a fragmentar o repositório e costurar os resultados, que é onde os bugs aparecem. O GLM-5.1 mantém cada arquivo na memória de trabalho e referencia os caminhos certos em sua saída.
A execução de pesquisa sobre centenas de documentos
Wikis, RFCs, contratos, os tickets de suporte do ano passado — carregue a pilha inteira de uma vez e peça padrões entre documentos. O custo por execução permanece gerenciável por causa do baixo preço da fornecedora, que é o que torna esse tipo de fluxo de "ler tudo, resumir uma vez" de fato viável em produção, em vez de um projeto científico pontual.
Quando dispensar o GLM-5.1
Evite o GLM-5.1 no raciocínio em inglês mais difícil, em que o Sonnet 4.6 ou o Opus 4.7 ainda lideram, e em respostas de chat críticas em latência, em que o Kimi K2.7 Code é muito mais rápido.
GLM-5.1 vs outros modelos
GLM-5.1 vs Kimi K2.7 Code
Ambos são opções de contexto longo com custo de créditos similar (×0.4 vs ×0.3). O Kimi tem recuperação de contexto longo mais forte em nossa avaliação interna; o GLM-5.1 vence no tamanho bruto de contexto (1M vs 256K). Escolha o Kimi para transcrições muito longas; escolha o GLM-5.1 quando precisar enfiar uma base de código inteira em um único prompt.
GLM-5.1 vs Claude Sonnet 4.6
O Sonnet 4.6 (×1) lidera em precisão de roteamento de ferramentas e raciocínio em inglês. O GLM-5.1 (×0.4) lidera na janela de contexto e é a escolha certa quando o custo ou o tamanho do contexto domina a decisão.
GLM-5.1 vs DeepSeek V4 Pro
O DeepSeek V4 Pro (×0.1) é mais barato e pontua mais alto no Code Arena, segundo análises de terceiros. O GLM-5.1 ainda vence no tamanho de contexto. Escolha o DeepSeek para trabalho de contexto padrão sensível a custo; escolha o GLM-5.1 quando o tamanho do contexto for a restrição.
Conclusão: você deveria usar o GLM-5.1?
Escolha o GLM-5.1 quando o tamanho do contexto for a restrição. Para todo o resto, o DeepSeek V4 Pro é mais barato e o Sonnet 4.6 roteia ferramentas de forma mais confiável.
Disponibilidade do GLM-5.1 na Okou
O GLM-5.1 foi removido do catálogo da Okou, portanto não pode mais ser selecionado no chat nem em um workflow, e não está disponível com sua própria chave de API. O GPT 5.6 Luna cobre o mesmo nível de economia.