Kimi K3 : le modèle frontière 2,8T de Moonshot
Le modèle Mixture-of-Experts de 2 800 milliards de paramètres de Moonshot, avec une fenêtre de contexte de 1M de tokens, une entrée image et vidéo native et des poids ouverts.
1M tokens · Text / Vision / Video / Code · Prompt cache
Okou n'exécute pas Kimi K3. Cette page sert de référence pour ses caractéristiques, ses tarifs et ses benchmarks. Pour le même type de travail sur Okou, utilisez aujourd'hui Claude Fable 5.
Voir Claude Fable 5Kimi K3 est le modèle frontière de Moonshot AI, lancé le 16 juillet 2026 : un réseau Mixture-of-Experts creux de 2 800 milliards de paramètres au total, dont 16 experts sur 896 actifs par token, avec une fenêtre de contexte de 1 048 576 tokens et une entrée image et vidéo native. Artificial Analysis lui attribue 57,1 sur l'Intelligence Index v4.1 : quatrième parmi les configurations testées, derrière Claude Fable 5 (59,9) et GPT 5.6 Sol (58,9), devant Claude Opus 4.8.
Le tarif public est de 3,00 $ par million de tokens en entrée, 0,30 $ en cas de cache hit et 15,00 $ par million de tokens en sortie, uniforme sur toute la fenêtre et sans surcoût de contexte long. Les poids ouverts ont été publiés sur Hugging Face le 27 juillet 2026 sous la Kimi K3 License propre à Moonshot. Okou n'exécute pas Kimi K3. Le modèle le plus proche dans la gamme Okou est Claude Fable 5, qui offre la même fenêtre de 1M de tokens et domine ce même Intelligence Index.
Qu'est-ce que Kimi K3 ?
16 juillet 2026 · La ligne frontière de Moonshot. Successeur de la série Kimi K2, dont K2.7 Code.
Kimi K3 est le modèle frontière de Moonshot AI, dévoilé le 16 juillet 2026 et servi via l'application Kimi et l'API Kimi sous l'identifiant kimi-k3. C'est un modèle Mixture-of-Experts creux : 2 800 milliards de paramètres au total, avec 16 experts sur 896 actifs par token, ce qui maintient le coût d'inférence proche de celui d'un modèle dense de milieu de gamme malgré la taille.
L'écart avec la ligne K2 est le plus net sur le travail d'agent de longue haleine. Dans la suite de lancement de Moonshot, K3 devance tous les modèles testés sur Program Bench, SWE Marathon, BrowseComp, SpreadsheetBench 2 et Automation Bench, tout en restant derrière Claude Fable 5 sur FrontierSWE et GPT 5.6 Sol sur DeepSWE. Sur l'Elo GDPval-AA v2 d'Artificial Analysis, qui évalue le travail intellectuel à valeur économique, il atteint 1668, contre 1190 pour Kimi K2.6 et au-dessus des 1600 de Claude Opus 4.8.
Ce qui distingue Kimi K3
Principales caractéristiques d'architecture et de capacités.
K3 associe la pile MoE à deux mécanismes d'efficacité que Moonshot appelle Kimi Delta Attention et Attention Residuals, crédités d'un décodage jusqu'à 6,3 fois plus rapide, et sert sa fenêtre de 1 048 576 tokens à un tarif unique, sans paliers de contexte. La sortie va jusqu'à 131 072 tokens par défaut et peut être configurée plus haut dans la même fenêtre. L'entrée accepte texte, images et vidéo ; la sortie est du texte. L'API sur platform.kimi.ai est compatible OpenAI, et les poids — environ 594 Go en MXFP4 — sont publiés pour l'auto-hébergement.
Spécifications en un coup d'œil
Benchmarks de Kimi K3
Les scores de code, d'agent et de vision sont les chiffres de lancement de Moonshot, tous modèles réglés sur l'effort de raisonnement maximal ; l'Intelligence Index et l'Elo GDPval proviennent des mesures indépendantes d'Artificial Analysis. Un tableau d'éditeur est un plafond, pas une garantie, et des testeurs indépendants rapportent un taux d'hallucination nettement supérieur au chiffre publié par Moonshot.
Tarification de Kimi K3
Prix catalogue fournisseur, par million de tokens.
Comment Kimi K3 se comporte en pratique
Comportement rapporté par les documents de lancement de l'éditeur et par des évaluations indépendantes.
Exécutions d'agent longues
Les benchmarks que K3 domine nettement — SWE Marathon, Automation Bench, BrowseComp — mesurent la capacité à tenir le cap sur des centaines d'étapes, pas la justesse d'une réponse isolée. Cela correspond au positionnement de Moonshot : un moteur d'agents avant tout.
Tarif uniforme sur 1M de tokens
La fenêtre complète de 1 048 576 tokens est facturée à un seul tarif, sans surcoût au-delà d'un seuil. La fenêtre de 1M de GPT-5.5 facture différemment l'entrée au-delà de 272K tokens, ce qui rend ailleurs les très longues exécutions coûteuses.
Coût par tâche
Artificial Analysis mesure 0,94 $ par tâche sur son index — environ la moitié des 1,80 $ de Claude Opus 4.8 et dans la lignée des 1,04 $ de GPT 5.6 Sol. Moonshot annonce des taux de cache hit supérieurs à 90 % sur les charges de code, ce qui rapproche le coût d'entrée effectif du tarif de 0,30 $.
Meilleures tâches d'agent pour Kimi K3
Lire un dépôt entier dans un seul contexte
Une fenêtre de 1M de tokens à tarif uniforme accueille une base de code complète, un trimestre de tickets de support ou un long corpus documentaire en une seule requête, sans découpage et sans surcoût qui attend en fin de fenêtre.
Agents de navigation et de recherche
BrowseComp 91,2 est le meilleur score du tableau de lancement de Moonshot, devant GPT 5.6 Sol et Claude Fable 5. La recherche web à plusieurs sauts — trouver la source, suivre la citation, réconcilier les chiffres — est là où l'entraînement agentique de K3 se voit le mieux.
Entrée de captures d'écran et de vidéo
K3 accepte nativement images et vidéo : les agents de QA qui lisent des captures et les pipelines qui traitent des clips enregistrés n'ont pas besoin d'un modèle de vision séparé devant le modèle de raisonnement.
Quand éviter Kimi K3
Écartez K3 quand le travail exige un profil de sécurité audité par l'éditeur ou un support entreprise contractuel aux États-Unis ou dans l'UE ; quand les prompts sont assez courts pour que le tarif cache de 0,30 $ ne s'applique jamais et qu'un modèle économique suffit ; et quand l'auto-hébergement est le but — 594 Go de poids MXFP4 réclament 64 accélérateurs ou plus en production. Des tests indépendants mesurent aussi des taux d'hallucination bien supérieurs au chiffre publié par Moonshot : les sorties riches en faits demandent toujours une vérification. Et sur Okou, K3 n'est tout simplement pas proposé.
Kimi K3 vs autres modèles
Kimi K3 vs Claude Fable 5
Fable 5 mène sur l'Intelligence Index (59,9 contre 57,1) et FrontierSWE (86,6 contre 81,2) ; K3 prend Terminal-Bench 2.1, BrowseComp et SWE Marathon. Les deux offrent une fenêtre de 1M de tokens. Ce qui tranche, en général, c'est le prix et la disponibilité : Fable 5 est à 10 $/50 $ par million de tokens et tourne sur Okou, K3 est à 3 $/15 $ et n'y tourne pas.
Kimi K3 vs GPT 5.6 Sol
Sol obtient 58,9 sur l'Intelligence Index contre 57,1 pour K3, et gagne DeepSWE (73,0 contre 67,5) et Terminal-Bench d'un demi-point. K3 répond par une fenêtre de 1M face aux 400K de Sol et un tiers du prix d'entrée. Le coût mesuré par tâche est proche : 0,94 $ pour K3, 1,04 $ pour Sol.
Kimi K3 vs Claude Opus 4.8
K3 devance Opus 4.8 sur la plupart des suites agentiques et sur l'Elo GDPval-AA (1668 contre 1600), à 3 $/15 $ contre 5 $/25 $. Opus 4.8 garde l'avantage sur la fiabilité du routage d'outils en production et reste disponible sur Okou, ce que K3 n'est pas.
Kimi K3 vs Kimi K2.7 Code
K3 est le successeur : 1M de tokens de contexte contre 256K, entrée vidéo native et un plafond bien plus haut sur les benchmarks agentiques — pour environ trois fois le prix (3 $/15 $ contre 1,14 $/4,80 $). Aucun des deux ne tourne aujourd'hui sur Okou : K2.7 Code a été retiré, et K3 n'a jamais été ajouté.
En résumé : devriez-vous utiliser Kimi K3 ?
Le modèle à poids ouverts le plus solide publié à ce jour, et le premier à rivaliser avec la frontière fermée sur le travail d'agent, au tiers du prix de Fable 5. Okou ne l'exécute pas : cette page est une référence. Pour les mêmes charges d'agent à 1M de tokens sur Okou, Claude Fable 5 s'en rapproche le plus.
Questions fréquentes
Puis-je utiliser Kimi K3 sur Okou ?
Pas aujourd'hui. Kimi K3 ne fait pas partie de la gamme de modèles Okou : il ne peut être choisi ni dans le chat ni dans un workflow, et il ne peut pas être ajouté avec votre propre clé API. Claude Fable 5 est le modèle le plus proche que Okou exécute : même fenêtre de contexte de 1M de tokens, et meilleur score sur ce même Intelligence Index.
Quand Kimi K3 est-il sorti ?
Moonshot AI a lancé Kimi K3 le 16 juillet 2026 dans l'application Kimi et l'API Kimi, et a publié les poids ouverts sur Hugging Face le 27 juillet 2026.
Quelle est la fenêtre de contexte de Kimi K3 ?
1 048 576 tokens, entrée et sortie confondues, facturés au même tarif sur toute la fenêtre. La sortie est de 131 072 tokens par défaut et peut être configurée plus haut dans le contexte restant.
Combien coûte Kimi K3 ?
3,00 $ par million de tokens en entrée hors cache, 0,30 $ par million en cas de cache hit et 15,00 $ par million de tokens en sortie, sans surcoût de contexte long. Dans l'application Kimi, les formules payantes démarrent à 19 $ par mois pour une fenêtre de 256K, et la fenêtre complète de 1M se débloque à partir de 39 $ par mois.
Kimi K3 est-il open source ?
Les poids sont ouverts sous la Kimi K3 License propre à Moonshot, proche d'une licence MIT avec deux conditions commerciales : une activité de model-as-a-service doit signer un accord séparé avec Moonshot dès que son chiffre d'affaires dépasse 20 M$ sur 12 mois consécutifs, et tout produit dépassant 100 millions d'utilisateurs actifs mensuels ou 20 M$ de revenus mensuels doit afficher « Kimi K3 » dans son interface.
Alternatives
Disponibilité de Kimi K3 sur Okou
Kimi K3 ne fait pas partie de la gamme de modèles Okou : il ne peut être choisi ni dans le chat ni dans un workflow, et il ne peut pas être ajouté avec votre propre clé API. Claude Fable 5 est le modèle le plus proche que Okou exécute aujourd'hui.