Todos os modelos

Kimi K3: o modelo de fronteira de 2,8T da Moonshot

O modelo Mixture-of-Experts de 2,8 trilhões de parâmetros da Moonshot, com janela de contexto de 1M de tokens, entrada nativa de imagem e vídeo e pesos abertos.

1M tokens · Text / Vision / Video / Code · Prompt cache

A Okou não executa o Kimi K3. Esta página é uma referência de especificações, preços e benchmarks. Para o mesmo tipo de trabalho na Okou, use hoje o Claude Fable 5.

Ver Claude Fable 5

O Kimi K3 é o modelo de fronteira da Moonshot AI, lançado em 16 de julho de 2026: uma rede Mixture-of-Experts esparsa com 2,8 trilhões de parâmetros no total, 16 de 896 especialistas ativos por token, janela de contexto de 1.048.576 tokens e entrada nativa de imagem e vídeo. A Artificial Analysis deu a ele 57,1 no Intelligence Index v4.1 — quarto entre as configurações testadas, atrás de Claude Fable 5 (59,9) e GPT 5.6 Sol (58,9), à frente do Claude Opus 4.8.

O preço de tabela é $3.00 por milhão de tokens de entrada, $0.30 com acerto de cache e $15.00 por milhão de tokens de saída, uniforme em toda a janela e sem sobretaxa de contexto longo. Os pesos abertos foram publicados no Hugging Face em 27 de julho de 2026 sob a Kimi K3 License, da própria Moonshot. A Okou não executa o Kimi K3. O modelo mais próximo na linha da Okou é o Claude Fable 5, que tem a mesma janela de 1M de tokens e lidera esse mesmo Intelligence Index.

O que é o Kimi K3?

16 de julho de 2026 · A linha de fronteira da Moonshot. Sucessor da série Kimi K2, incluindo o K2.7 Code.

O Kimi K3 é o modelo de fronteira da Moonshot AI, apresentado em 16 de julho de 2026 e servido pelo app Kimi e pela API Kimi como kimi-k3. É um modelo Mixture-of-Experts esparso: 2,8 trilhões de parâmetros no total, com 16 de 896 especialistas ativos por token — e é isso que mantém o custo de inferência perto de um modelo denso intermediário apesar do tamanho.

O salto em relação à linha K2 é maior no trabalho de agente de longa duração. Na suíte de lançamento da Moonshot, o K3 lidera todos os modelos testados em Program Bench, SWE Marathon, BrowseComp, SpreadsheetBench 2 e Automation Bench, ficando atrás do Claude Fable 5 em FrontierSWE e do GPT 5.6 Sol em DeepSWE. No Elo GDPval-AA v2 da Artificial Analysis, que pontua trabalho de conhecimento com valor econômico, chega a 1668, ante 1190 do Kimi K2.6 e acima dos 1600 do Claude Opus 4.8.

O que se destaca no Kimi K3

Principais recursos de arquitetura e capacidade.

O K3 combina a pilha MoE com dois mecanismos de eficiência que a Moonshot chama de Kimi Delta Attention e Attention Residuals, creditados por uma decodificação até 6,3 vezes mais rápida, e serve a janela de 1.048.576 tokens a um preço único, sem faixas de contexto. A saída vai até 131.072 tokens por padrão e pode ser configurada acima disso dentro da mesma janela. A entrada aceita texto, imagens e vídeo; a saída é texto. A API em platform.kimi.ai é compatível com OpenAI, e os pesos — cerca de 594 GB em MXFP4 — estão publicados para auto-hospedagem.

Especificações em resumo

FamíliaKimi K3
Parâmetros2,8T no total / 16 de 896 especialistas ativos (MoE)
ModalidadesTexto, imagem e vídeo na entrada; texto na saída
Janela de contexto1.048.576 tokens
Saída máxima131K tokens por padrão, configurável dentro da janela
LicençaKimi K3 License (pesos abertos, 27 de julho de 2026)

Benchmarks do Kimi K3

As notas de código, agentes e visão são os números de lançamento da Moonshot, com todos os modelos no esforço máximo de raciocínio; o Intelligence Index e o Elo GDPval são medições independentes da Artificial Analysis. Uma tabela do fornecedor é um teto, não uma garantia, e testadores independentes relataram uma taxa de alucinação bem acima da divulgada pela Moonshot.

Artificial Analysis Intelligence Index v4.1independente; 4º lugar, atrás de Fable 5 (59,9) e GPT 5.6 Sol (58,9)
57.1
GDPval-AA v2 (Elo)independente; acima do Opus 4.8 (1600)
1668
GPQA Diamondinformado pelo fornecedor
93.5
Terminal-Bench 2.1informado pelo fornecedor; Sol 88,8
88.3
FrontierSWEinformado pelo fornecedor; Fable 5 86,6
81.2
DeepSWEinformado pelo fornecedor; Sol 73,0
67.5
SWE Marathoninformado pelo fornecedor; melhor da suíte de lançamento
42.0
BrowseCompinformado pelo fornecedor; melhor da suíte de lançamento
91.2

Preços do Kimi K3

Preço de tabela do provedor, por 1M de tokens.

Entrada$3.00
Saída$15.00
Leitura de cache$0.30
Escrita de cacheNão cobrado

Como o Kimi K3 se comporta na prática

Comportamento relatado no material de lançamento do fornecedor e em avaliações independentes.

Execuções longas de agente

Os benchmarks que o K3 lidera com folga — SWE Marathon, Automation Bench, BrowseComp — medem manter o rumo por centenas de passos, e não acertar de primeira. Isso combina com o posicionamento da Moonshot: antes de tudo, um motor de agentes.

Preço único em 1M de tokens

A janela completa de 1.048.576 tokens é cobrada a uma única tarifa, sem sobretaxa a partir de um limite. A janela de 1M do GPT-5.5, por outro lado, cobra a entrada acima de 272K tokens de forma diferente, e é isso que encarece execuções muito longas em outros lugares.

Custo por tarefa

A Artificial Analysis mediu $0.94 por tarefa no índice — cerca de metade dos $1.80 do Claude Opus 4.8 e em linha com os $1.04 do GPT 5.6 Sol. A Moonshot cita taxas de acerto de cache acima de 90% em cargas de código, o que puxa o custo efetivo de entrada para perto dos $0.30.

Melhores tarefas de agente para o Kimi K3

Ler um repositório inteiro em um único contexto

Uma janela de 1M de tokens a preço único acomoda uma base de código completa, um trimestre de tickets de suporte ou um conjunto documental longo em uma única requisição, sem fatiar e sem sobretaxa esperando no fim da janela.

Agentes de navegação e pesquisa

BrowseComp 91,2 é a maior nota da tabela de lançamento da Moonshot, à frente de GPT 5.6 Sol e Claude Fable 5. Pesquisa web em vários saltos — achar a fonte, seguir a citação, conciliar os números — é onde o treino agêntico do K3 mais aparece.

Entrada de capturas de tela e vídeo

O K3 aceita imagens e vídeo nativamente, então agentes de QA que leem capturas de tela e pipelines que processam clipes gravados não precisam de um modelo de visão separado antes do modelo de raciocínio.

Quando dispensar o Kimi K3

Deixe o K3 de lado quando o trabalho exigir um perfil de segurança auditado pelo fornecedor ou suporte empresarial contratual nos EUA ou na UE; quando os prompts forem curtos a ponto de a tarifa de cache de $0.30 nunca valer e um modelo econômico resolver; e quando auto-hospedar for o objetivo — 594 GB de pesos MXFP4 pedem 64 ou mais aceleradores em produção. Testes independentes também mediram taxas de alucinação bem acima do número publicado pela Moonshot, então saídas cheias de fatos continuam exigindo conferência. E na Okou, o K3 simplesmente não é uma opção.

Kimi K3 vs outros modelos

Kimi K3 vs Claude Fable 5

O Fable 5 lidera no Intelligence Index (59,9 contra 57,1) e no FrontierSWE (86,6 contra 81,2); o K3 leva Terminal-Bench 2.1, BrowseComp e SWE Marathon. Ambos têm janela de 1M de tokens. O que costuma decidir é preço e disponibilidade: o Fable 5 custa $10/$50 por milhão de tokens e roda na Okou; o K3 custa $3/$15 e não roda.

Kimi K3 vs GPT 5.6 Sol

O Sol marca 58,9 no Intelligence Index contra 57,1 do K3, e vence DeepSWE (73,0 contra 67,5) e Terminal-Bench por meio ponto. O K3 responde com 1M de janela contra os 400K do Sol e um terço do preço de entrada. O custo medido por tarefa fica perto: $0.94 para o K3, $1.04 para o Sol.

Kimi K3 vs Claude Opus 4.8

O K3 está à frente do Opus 4.8 na maioria das suítes agênticas e no Elo GDPval-AA (1668 contra 1600), a $3/$15 contra $5/$25. O Opus 4.8 mantém a vantagem na confiabilidade do roteamento de ferramentas em produção e está disponível na Okou, onde o K3 não está.

Kimi K3 vs Kimi K2.7 Code

O K3 é o sucessor: 1M de tokens de contexto contra 256K, entrada de vídeo nativa e um teto bem mais alto nos benchmarks agênticos — por cerca do triplo do preço ($3/$15 contra $1.14/$4.80). Nenhum dos dois roda na Okou hoje: o K2.7 Code foi descontinuado e o K3 nunca foi adicionado.

Conclusão: você deveria usar o Kimi K3?

O modelo de pesos abertos mais forte lançado até agora e o primeiro que compete de verdade com a fronteira fechada em trabalho de agente, por um terço do preço do Fable 5. A Okou não o executa, então leia esta página como referência: para as mesmas cargas agênticas de 1M de tokens na Okou, o Claude Fable 5 é o mais parecido.

Perguntas frequentes

Posso usar o Kimi K3 na Okou?

Hoje não. O Kimi K3 não faz parte da linha de modelos da Okou — não pode ser escolhido no chat nem em um workflow, e não pode ser adicionado com a sua própria chave de API. O Claude Fable 5 é o modelo mais próximo que a Okou executa: mesma janela de contexto de 1M de tokens e a maior nota nesse mesmo Intelligence Index.

Quando o Kimi K3 foi lançado?

A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026 no app Kimi e na API Kimi, e publicou os pesos abertos no Hugging Face em 27 de julho de 2026.

Qual é a janela de contexto do Kimi K3?

1.048.576 tokens, somando entrada e saída, com preço uniforme em toda a janela. A saída é de 131.072 tokens por padrão e pode ser configurada acima disso dentro do contexto restante.

Quanto custa o Kimi K3?

$3.00 por milhão de tokens de entrada sem acerto de cache, $0.30 por milhão com acerto de cache e $15.00 por milhão de tokens de saída, sem sobretaxa de contexto longo. No app Kimi, os planos pagos começam em $19 por mês com janela de 256K, e a janela completa de 1M é liberada a partir de $39 por mês.

O Kimi K3 é open source?

Os pesos são abertos sob a Kimi K3 License, da própria Moonshot, que se parece com a MIT em quase tudo, com duas condições comerciais: um negócio de model-as-a-service precisa de um acordo separado com a Moonshot quando a receita passa de $20M em quaisquer 12 meses consecutivos, e todo produto com mais de 100 milhões de usuários ativos mensais ou $20M de receita mensal precisa exibir "Kimi K3" na interface.

Alternativas

Disponibilidade do Kimi K3 na Okou

O Kimi K3 não faz parte da linha de modelos da Okou, então não pode ser escolhido no chat nem em um workflow, e também não pode ser adicionado com a sua própria chave de API. O Claude Fable 5 é o modelo mais próximo que a Okou executa hoje.