Moonshot AI a publié l’intégralité des poids de Kimi K3 le 27 juillet 2026, onze jours après la mise en ligne du modèle dans l’application Kimi. Le dépôt Hugging Face compte 96 fragments safetensors totalisant environ 1,56 To. Avec 2,8 billions de paramètres au total, dont 104 milliards actifs par token, K3 est le plus grand modèle ouvert jamais publié. Moonshot le présente comme le premier modèle ouvert de classe 3T au monde, et cette affirmation dispose désormais d’un bouton de téléchargement pour l’étayer.

Les scores indépendants sont eux aussi tombés, et ils sont solides sans faire un carton plein. Kimi K3 obtient 57 sur l’Intelligence Index d’Artificial Analysis, devant tout autre modèle à poids ouverts et derrière seulement trois modèles fermés. Ci-dessous, vous trouverez les specs vérifiées, ce que la licence autorise réellement, les tarifs API officiels que Moonshot a désormais publiés, et une lecture honnête de la façon dont K3 se compare à Claude Opus 5.

Les points clés à retenir

  • Les poids ouverts sont sortis le 27 juillet 2026, 96 fragments et environ 1,56 To sur Hugging Face, sous une licence Kimi K3 personnalisée plutôt que MIT.
  • Une conception à mélange d’experts avec 2,8 billions de paramètres au total, 104 milliards activés par token, et une fenêtre de contexte de 1 048 576 tokens.
  • Accepte les entrées texte, image et vidéo, raisonne toujours, et expose désormais un effort de raisonnement faible, élevé et maximal plutôt que maximal uniquement.
  • La tarification API officielle est de 3,00 $ par million de tokens en entrée et de 15,00 $ en sortie, tombant à 0,30 $ sur l’entrée en cache, le même tarif affiché que Claude Sonnet 5.
  • Obtient 57 sur l’Intelligence Index d’Artificial Analysis, le meilleur résultat à poids ouverts, avec GLM-5.2 ensuite à 51.

Qu’est-ce que Kimi K3 ?

De l'éditeur

Tous les modèles d'IA dans une seule app

Fello AI réunit GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 et plus dans une seule app native pour Mac et iPhone.

Téléchargez maintenant !

Kimi K3 est le grand modèle de langage phare de Moonshot AI, lancé le 16 juillet 2026 et publié en poids ouverts le 27 juillet. Il utilise une conception à mélange d’experts avec 2,8 billions de paramètres au total, dont 104 milliards s’activent sur un token donné, et il lit une fenêtre de contexte d’un million de tokens. La propre documentation de Moonshot confirme qu’il accepte les entrées texte, image et vidéo.

L’écart entre le lancement et les poids était prévu, et Moonshot l’avait dit à l’époque. Son billet de lancement promettait les fichiers « d’ici le 27 juillet 2026 » pendant que l’équipe travaillait « en étroite collaboration avec les partenaires d’inférence et les mainteneurs open source pour aligner les détails techniques et assurer un déploiement fiable dans tout l’écosystème ». Le rapport technique est sorti avec les poids plutôt qu’après eux.

SpecKimi K3
DéveloppeurMoonshot AI
Sortie16 juillet 2026 (poids le 27 juillet 2026)
ArchitectureMélange d’experts (MoE)
Paramètres totaux2,8 billions
Paramètres activés104 milliards par token
Couches93 (69 Kimi Delta Attention, 24 Gated MLA)
Experts896 au total, 16 sélectionnés par token
Encodeur visuelMoonViT-V2, 401 M de paramètres
Fenêtre de contexte1 048 576 tokens
Types d’entréeTexte, image, vidéo
QuantificationPoids MXFP4, activations MXFP8
Contrôle du raisonnementreasoning_effort faible / élevé / maximal, maximal par défaut
LicenceLicence Kimi K3 (personnalisée, pas MIT)

Avec 2,8 billions de paramètres, Kimi K3 est le plus grand modèle ouvert publié à ce jour, largement au-dessus du V4-Pro de DeepSeek à 1,6 billion. La conception à mélange d’experts signifie que seule une petite fraction de ces paramètres s’active sur un token donné, si bien que le coût de calcul effectif reste bien en dessous de ce que le décompte brut suggère. Activer 16 experts sur 896 est un ratio de parcimonie inhabituellement élevé. Ce choix est central dans la façon dont Moonshot a tiré des performances de pointe de l’architecture.

Analyse de l’intelligence, des performances et du prix de Kimi K3 par Artificial Analysis [source]

Poids ouverts de Kimi K3 : ce qui est réellement sorti

C’est la partie qui a changé le 27 juillet, et c’est la raison pour laquelle K3 compte plus que sa ligne de benchmark. Tout autre modèle de ce niveau de capacité est une API que vous louez. K3 est un fichier que vous pouvez détenir.

Ce que contient le dépôt

Le dépôt Hugging Face contient 120 fichiers, dont 96 sont des fragments safetensors, et l’ensemble du téléchargement atteint environ 1,56 To. Moonshot livre le modèle en poids MXFP4 natifs avec des activations MXFP8, appliqués via un entraînement tenant compte de la quantification dès l’étape de fine-tuning supervisé. C’est pourquoi un modèle de 2,8 billions de paramètres tient dans 1,56 To au lieu de plusieurs fois cela, et cela signifie que vous ne téléchargez pas une quantification communautaire avec perte, vous téléchargez ce que Moonshot a entraîné.

L’engouement a été immédiat. Un jour après la mise en ligne des fichiers, le dépôt affichait environ 99 000 téléchargements et plus de 7 300 « j’aime », comptés le 28 juillet 2026. Pour un point de contrôle que presque personne ne peut héberger sur sa propre machine, c’est beaucoup de trafic, et une grande partie proviendra de fournisseurs d’inférence, de projets de quantification et de laboratoires de recherche plutôt que de particuliers.

Moonshot cite trois moteurs d’inférence comme runtimes recommandés, vLLM, SGLang et TokenSpeed, chacun avec sa propre recette publiée pour K3. Le rapport technique est sorti avec les poids plutôt qu’après eux, si bien que les détails de l’architecture sont eux aussi publics.

La licence Kimi K3 n’est pas MIT

Lisez ceci avant de concevoir un produit autour d’elle.

La licence accorde les droits habituels d’utiliser, copier, modifier, distribuer, sous-licencier, affiner et vendre, ce qui se lit comme du MIT pour la plupart des lecteurs. Deux clauses attachent ensuite des conditions que MIT n’a pas.

La première est un seuil de revenus sur la revente. Si vous exploitez une activité de modèle en tant que service et que vos revenus dépassent 20 millions de dollars sur 12 mois consécutifs, vous devez signer un accord distinct avec Moonshot avant d’utiliser K3 à des fins commerciales. La seconde est une règle d’attribution. Tout produit bâti sur K3 comptant plus de 100 millions d’utilisateurs actifs mensuels, ou plus de 20 millions de dollars de revenus mensuels, doit afficher le nom « Kimi K3 » de façon visible dans son interface.

Les deux conditions sont levées pour un usage purement interne, c’est-à-dire tout ce qui n’expose jamais le modèle ou ses sorties à des tiers. Pour un développeur individuel, une startup ou un groupe de recherche, l’effet pratique est nul. Pour un hyperscaler qui revend de l’inférence, c’est une négociation. C’est aussi pourquoi GLM et sa licence MIT l’emportent encore sur la liberté de licence, même si K3 l’emporte sur la capacité.

Ce qu’il faut pour faire tourner Kimi K3 soi-même

Téléchargeable n’est pas la même chose qu’exécutable. Un point de contrôle de 1,56 To a besoin d’un cluster GPU multi-nœuds pour servir à plein contexte, si bien que « vous pouvez l’auto-héberger » est vrai pour les laboratoires et les équipes d’infrastructure sérieuses, pas pour quelqu’un doté d’une seule station de travail. Si vous voulez un modèle ouvert que vous pouvez réellement faire tourner sur votre propre matériel, les plus petits modèles Kimi et GLM restent les options réalistes. Notre sélection des meilleurs modèles d’IA open source les classe selon les exigences matérielles.

L’architecture derrière le bond

Moonshot rapporte une amélioration d’environ 2,5x de l’efficacité globale de mise à l’échelle par rapport à Kimi K2. En clair, K3 convertit le calcul brut en intelligence utilisable bien plus efficacement que la génération précédente. Trois changements portent l’essentiel du poids, et les trois sont désormais documentés dans le rapport technique public.

Kimi Delta Attention

Kimi Delta Attention (KDA) est un mécanisme d’attention linéaire hybride, et 69 des 93 couches du modèle l’utilisent, les 24 restantes tournant en Gated MLA. L’attention standard devient plus lente et plus gourmande en mémoire à mesure que les séquences s’allongent, ce qui est exactement le problème à un million de tokens. Moonshot rapporte que KDA permet un décodage jusqu’à 6,3x plus rapide dans des contextes d’un million de tokens, ce qui compte pour le travail agentique où un modèle lit et raisonne à répétition sur d’immenses portions de code ou de documents.

Attention Residuals

Les Attention Residuals (AttnRes) traitent la façon dont l’information circule à travers la profondeur du réseau plutôt qu’à travers la longueur de la séquence. Au lieu d’accumuler les représentations uniformément couche par couche, AttnRes récupère sélectivement des représentations à travers la profondeur. Moonshot indique que cela offre une efficacité d’entraînement supérieure d’environ 25 % tout en ajoutant moins de 2 % de calcul supplémentaire, et a ouvert la technique en open source plus tôt en 2026 avant de l’intégrer à K3.

Stable LatentMoE et entraînement MXFP4

La troisième pièce est le cadre Stable LatentMoE, qui rend entraînable la parcimonie agressive de 16 experts sur 896 sans l’instabilité qui accompagne habituellement le fait de pousser un MoE aussi loin. À ses côtés se trouve la décision d’entraîner en MXFP4 dès l’étape de fine-tuning plutôt que de quantifier ensuite, ce qui maintient les poids publiés à la fois petits et fidèles au modèle que Moonshot a évalué.

Une démonstration que Moonshot a mise en avant est parlante. L’équipe a chargé K3 d’optimiser son propre noyau d’entraînement AttnRes à l’échelle de production, 96 couches, un modèle à 8 192 dimensions et 8 192 tokens. Sur 15 heures d’itération ininterrompue, K3 a conçu un algorithme de noyau inédit en deux phases, fusionné des noyaux tout en préservant la numérique, et réduit le temps aller-plus-retour de 283,6 ms à 114,4 ms. C’est le genre de tâche d’ingénierie à long horizon sur laquelle la plupart des modèles calent en quelques minutes.

Une fenêtre de contexte d’un million de tokens

Kimi K3 gère jusqu’à 1 048 576 tokens dans un seul contexte, soit environ quatre fois la fenêtre de 256K de K2.6. C’est assez pour contenir une base de code entière, une pile de longs documents ou une longue exécution d’agent en plusieurs étapes sans perdre le fil. Cela correspond aussi à la fenêtre qu’Anthropic donne à Claude Opus 5 et Sonnet 5, si bien que l’avantage de long contexte que Kimi détenait sur les modèles fermés phares s’est réduit à une égalité.

Entrée multimodale et raisonnement toujours actif

K3 accepte le texte, les images et la vidéo, ce qui le fait passer au-delà de la gamme K2 axée sur le texte vers un vrai territoire multimodal. La liste de modèles de Moonshot indique clairement que K3, K2.7 Code et K2.6 prennent tous l’entrée vidéo, et la fiche du modèle rapporte 90,0 sur Video-MME avec sous-titres. Le raisonnement est toujours actif, et le paramètre reasoning_effort prend désormais en charge faible, élevé et maximal, avec maximal par défaut. Au lancement, seul maximal était disponible, si bien que les niveaux d’effort promis sont depuis arrivés.

Comment Kimi K3 se comporte sur les benchmarks

Deux questions distinctes se posent ici. Que disent les classements indépendants au sujet de Kimi K3, et que prétend la propre suite d’évaluation de Moonshot ? Le tableau indépendant n’est arrivé qu’après le lancement, c’est donc le meilleur point de départ, et les chiffres du fournisseur prennent davantage de sens une fois que vous l’avez vu.

Ce que disent les classements indépendants

Artificial Analysis note Kimi K3 à 57 sur son Intelligence Index. Sur l’ensemble des 264 lignes de ce classement, exactement six variantes obtiennent un score supérieur, et elles appartiennent à seulement trois modèles, Claude Opus 5 à 61, Claude Fable 5 à 60 et GPT-5.6 Sol à 59. Face à la concurrence ouverte, ce n’est pas serré, avec GLM-5.2 ensuite à 51 et DeepSeek V4 Pro à 44.

Le même classement note K3 à 50,1 sur son Agentic Index et à 76,2 en codage, dans les deux cas le meilleur résultat à poids ouverts et dans les deux cas derrière Opus 5 et GPT-5.6 Sol. Un chiffre va dans l’autre sens, la vitesse de sortie. Artificial Analysis chronomètre K3 à environ 33 tokens par seconde, contre 55 pour Opus 5 et 81 pour GPT-5.6 Sol, si bien que K3 est le modèle le plus lent du groupe de pointe.

Sur le classement WebDev d’Arena, où des humains votent à l’aveugle sur des interfaces générées, K3 a obtenu 1 681,6 à la date de clôture du vote du 27 juillet. C’est le deuxième au classement général, derrière Claude Opus 5 à 1 725,3 et devant Claude Fable 5 à 1 629,1, GPT-5.6 Sol à 1 623,1 et GLM-5.2 à 1 586,8. K3 détenait carrément la première place au lancement, avant qu’Opus 5 n’arrive le 24 juillet et ne la prenne.

Le classement Agent d’Arena, qui évalue à quel point les modèles orchestrent des outils sur de vraies tâches, place actuellement Kimi K3 en tête à 0,148, devant Claude Fable 5 à 0,099 et GLM 5.2 à 0,091. Lisez celui-ci avec une réserve, car Claude Opus 5 n’apparaît pas encore sur ce classement. Sur le classement texte général, K3 se situe au 11e rang avec 1 485,8 points issus de 3 559 votes, un rappel que la préférence brute en conversation et la capacité agentique ne sont pas la même chose.

Les propres benchmarks de codage de Moonshot

Moonshot a publié une large suite comparant Kimi K3 à Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 et GLM-5.2, tous exécutés à effort de réflexion maximal. Ce sont les propres exécutions du fournisseur, K3 étant évalué sur le harnais Kimi Code dans plusieurs lignes, alors traitez-les comme les affirmations de Moonshot plutôt que comme des résultats indépendants.

BenchmarkKimi K3Fable 5GPT-5.6 SolOpus 4.8GPT-5.5GLM-5.2
DeepSWE67,570,073,059,067,046,2
ProgramBench77,876,877,671,970,863,7
Terminal-Bench 2.188,388,088,884,683,482,7
FrontierSWE81,286,671,366,764,967,3
SWE-Marathon42,035,039,040,014,013,0
Kimi Code Bench 2.072,976,964,871,769,064,2

À lire tel quel, Kimi K3 remporte carrément ProgramBench et SWE-Marathon et se situe à moins d’un demi-point du leader sur Terminal-Bench 2.1. Sur FrontierSWE, il arrive deuxième derrière Fable 5 mais bien devant tout le reste. Les propres notes de bas de page de Moonshot ajoutent une réserve à garder en tête : Claude Fable 5 a déclenché des replis de sécurité sur 35 % des tâches SWE-Marathon dans cette évaluation, ce qui a pu tirer son score vers le bas.

Benchmarks agentiques et de travail intellectuel

BenchmarkKimi K3Fable 5GPT-5.6 SolOpus 4.8GLM-5.2
BrowseComp91,288,090,484,3n/d
MCPMark-Verified94,587,492,976,4n/d
GDPval-AA v2 (Elo)1 6861 7471 7361 5931 510
AA-Briefcase (Elo)1 5481 5831 4951 3541 260
JobBench54,357,445,448,443,4
SpreadsheetBench 234,834,732,431,628,1
AutomationBench30,829,129,727,212,9
OSWorld 2.058,366,162,655,7n/d

Kimi K3 mène BrowseComp, MCPMark, SpreadsheetBench 2 et AutomationBench, et prend la deuxième place sur AA-Briefcase, le benchmark agentique à long horizon, battant GPT-5.6 Sol et ne cédant qu’à Fable 5. Une note de bas de page compte sur BrowseComp : ce 91,2 utilise une stratégie de compaction du contexte déclenchée à 300K tokens. Exécuté avec la fenêtre complète de 1M et sans gestion du contexte, K3 obtient 90,4, ce qui reste le meilleur chiffre de la colonne.

Sur l’utilisation de l’ordinateur, Fable 5 et GPT-5.6 Sol battent tous deux K3 sur OSWorld 2.0, si bien que le modèle ouvert n’est pas en tête partout. Il a affiché 93,5 % sur GPQA Diamond, au niveau de GPT-5.5 et devant les 91,2 de GLM-5.2, et 94,6 sur Harvey Lab-AA, le meilleur score de cette ligne parmi tous les modèles du tableau.

Le propre résumé de Moonshot est plus mesuré que ne l’a été la couverture médiatique. Son billet de lancement indique que la performance globale de K3 « reste en retrait des modèles propriétaires les plus puissants, Claude Fable 5 et GPT 5.6 Sol », tout en démontrant une performance de niveau pointe sur l’ensemble de la suite. Quand un laboratoire sous-vend son propre modèle, c’est généralement le chiffre auquel se fier.

Kimi K3 vs Claude Opus 5

La comparaison que tout le monde fait, c’est Kimi K3 vs Claude, et le match a évolué le 24 juillet quand Anthropic a livré Claude Opus 5. Le tableau de lancement de Moonshot avait été construit face à Claude Opus 4.8, qui était le modèle phare actif à l’époque, donc les colonnes ci-dessus restent attribuées à 4.8. Pour une décision que vous prenez aujourd’hui, Opus 5 est le modèle de l’autre côté du tableau.

ModèleDéveloppeurContextePoids ouvertsPrix API par 1M
Kimi K3Moonshot AI1 048 576Oui, licence Kimi K33 $ / 15 $
Claude Opus 5Anthropic1MNon5 $ / 25 $
Claude Fable 5Anthropic1MNon10 $ / 50 $
GLM-5.2Z.ai1MOui, MIT1,40 $ / 4,40 $
Kimi K2.6Moonshot AI262 144Oui, MIT modifié0,95 $ / 4 $

Sur le prix, K3 est le vainqueur net, à 3 $ / 15 $ contre 5 $ / 25 $ pour Opus 5 et 10 $ / 50 $ pour Fable 5. Sur la capacité mesurée, Opus 5 mène, de quatre points sur l’Intelligence Index d’Artificial Analysis et de 44 points sur le classement WebDev d’Arena. Anthropic ne publie aucun chiffre SWE-bench pour Opus 5, donc quiconque vous en cite un ne cite pas Anthropic.

Le vrai clivage n’est pas le score, c’est ce que vous pouvez posséder. Opus 5 est le modèle le plus fort et le choix par défaut le plus sûr pour le codage en production, et c’est le nouveau modèle par défaut d’Anthropic sur Claude Max. K3 est celui que vous pouvez télécharger, auditer, affiner et faire tourner à l’intérieur de votre propre réseau, ce qu’aucun modèle Claude ne permet à quelque prix que ce soit. Si vous choisissez entre des modèles phares pour une tâche précise, notre guide sur quand utiliser quel modèle d’IA décompose la décision tâche par tâche.

Tarifs de Kimi K3

Moonshot a désormais publié des tarifs officiels, ce qui met à la retraite les estimations tierces qui circulaient au lancement. La tarification de Kimi K3 est de 3,00 $ par million de tokens en entrée et de 15,00 $ par million de tokens en sortie, avec l’entrée en cache à 0,30 $, une remise de 90 % qui compte beaucoup si vous renvoyez sans cesse le même long contexte.

ModèleEntrée (échec de cache)Entrée (succès de cache)SortieContexte
kimi-k33,00 $0,30 $15,00 $1 048 576
kimi-k2.7-code0,95 $0,19 $4,00 $262 144
kimi-k2.7-code-highspeed1,90 $0,38 $8,00 $262 144
kimi-k2.60,95 $0,16 $4,00 $262 144
kimi-k2.50,60 $0,10 $3,00 $262 144

Ces tarifs placent K3 exactement au même prix affiché que Claude Sonnet 5, qui est aussi à 3 $ en entrée et 15 $ en sortie, tout en obtenant quatre points de plus sur l’Intelligence Index d’Artificial Analysis. Face aux deux modèles Claude qui le devancent, K3 est 40 % moins cher qu’Opus 5 et 70 % moins cher que Fable 5. L’outil de recherche web intégré est facturé séparément à 0,005 $ par appel réussi, même si Moonshot signale actuellement cet outil comme en cours de révision et déconseille de compter dessus à court terme.

K3 représente une nette hausse de coût par rapport à la gamme K2, ce qui reflète son empreinte plus importante et son raisonnement toujours actif. Si votre charge de travail n’a pas besoin d’une échelle de niveau pointe, K2.6 ou K2.7 Code restent bien moins chers. Sur la plateforme API, K3 devient disponible une fois que vous avez effectué une recharge réussie d’au moins 1 $, et votre recharge cumulée définit vos limites de débit. Notre détail complet des tarifs de Kimi compare côte à côte chaque offre et chaque tarif API.

La demande a dépassé le matériel de Moonshot. Le 20 juillet 2026, l’entreprise a suspendu les nouveaux abonnements Kimi. Elle a indiqué que la demande des 48 heures précédentes avait « poussé au bord des limites de notre capacité actuelle » et qu’elle « rouvrirait de nouvelles places d’abonnement par lots » à mesure qu’elle ajoutait du matériel, dans une déclaration rapportée par le South China Morning Post. Les abonnés existants ont conservé leur accès. La pression n’est pas totalement retombée. Moonshot met désormais fin à sa remise de recharge de lancement de K3 le 29 juillet 2026 au lieu du 12 août comme prévu, et sa propre documentation tarifaire en donne pour raison de récentes contraintes sur les ressources de calcul.

Comment utiliser Kimi K3

Il existe quatre façons d’atteindre Kimi K3 maintenant que les poids sont publics, et celle qui convient dépend de si vous voulez une fenêtre de chat, un agent de terminal, une API ou les fichiers bruts. Voici l’ordre pratique.

  1. Application Kimi et Playground. La voie la plus rapide est l’application Kimi ou le Playground web, où K3 est sélectionnable pour les utilisateurs connectés. C’est l’option sans code pour tester le modèle sur vos propres prompts.
  2. Kimi Code CLI. Moonshot indique que K3 fonctionne le mieux dans son propre agent de terminal, où vous choisissez le modèle avec la commande /model. K3 se branche aussi sur Codex CLI, Claude Code, OpenCode et Hermes Agent via les intégrations documentées de Moonshot.
  3. L’API. Les développeurs appellent kimi-k3 via la plateforme API de Kimi, qui propose des endpoints compatibles OpenAI et compatibles Anthropic. Elle prend en charge l’appel d’outils, la sortie structurée à schéma JSON, la mise en cache du contexte et le contrôle reasoning_effort, et K3 est aussi répertorié sur des agrégateurs comme OpenRouter.
  4. Poids ouverts. Le point de contrôle complet est sur Hugging Face sous la licence Kimi K3, et Moonshot recommande vLLM, SGLang ou TokenSpeed pour le servir. Prévoyez le téléchargement de 1,56 To et le matériel multi-nœuds qu’il exige.

Vous préféreriez ne pas jongler avec un abonnement distinct pour chaque nouveau modèle ? Des applications comme Fello réunissent en un seul endroit de puissants modèles d’IA actuels, ce qui aide pendant qu’un lancement comme celui-ci se stabilise. Pour une vue plus large du terrain ouvert, notre sélection des meilleurs modèles d’IA open source disponibles en ce moment replace la lignée de K3 dans son contexte. Si vous pesez spécifiquement les modèles chinois ouverts, notre explication sur ce qu’est GLM et comment il rivalise est un compagnon utile.

L’entreprise derrière Moonshot AI

Kimi K3 arrive à un moment charnière pour Moonshot AI, la startup pékinoise fondée en 2023 par Yang Zhilin. L’entreprise lèverait entre 1 et 2 milliards de dollars dans un nouveau tour qui la valoriserait jusqu’à 31,5 milliards de dollars. C’est environ 50 % de plus que les 20 milliards de dollars atteints en mai, quand elle a levé 2 milliards de dollars. Si le tour se conclut à l’objectif, cela marquerait une multiplication par sept de la valorisation depuis décembre 2025, quand Moonshot valait un peu plus de 4 milliards de dollars. Un chiffre plus élevé se profile déjà derrière. Bloomberg a rapporté le 22 juillet que Moonshot prévoit une dernière levée pré-introduction en bourse à une valorisation pré-money allant jusqu’à 50 milliards de dollars, avec des discussions débutant en août et une cotation à Hong Kong possible dans les six mois.

La stratégie open source est centrale dans cette dynamique. Quand Moonshot a ouvert Kimi K2.6 en open source en avril 2026, il est monté jusqu’à devenir le deuxième grand modèle de langage le plus utilisé sur OpenRouter à la mi-2026. Cela a placé un laboratoire fondé trois ans plus tôt devant la plupart des laboratoires de pointe occidentaux sur les classements d’usage indépendants. Publier les poids de K3 étend ce scénario à un modèle de classe pointe.

Le calendrier n’était pas accidentel. Kimi K3 est arrivé juste avant la Conférence mondiale sur l’intelligence artificielle 2026 à Shanghai, où le président chinois Xi Jinping devait exposer les priorités de Pékin en matière d’IA. Quelques jours plus tard, lors de cette même conférence, Alibaba a présenté en avant-première Qwen 3.8, son propre rival de 2,4 billions de paramètres. La réaction en Occident a été un mélange d’admiration et d’inquiétude, des observateurs notant que la Chine semble combler ce qui était autrefois une avance américaine confortable.

Pourquoi Kimi K3 compte

Kimi K3 n’est pas juste une énième sortie de modèle. Les poids étant publics, c’est le plus grand modèle à poids ouverts jamais publié, remettant aux développeurs une capacité à l’échelle de pointe qu’ils peuvent télécharger, inspecter et faire tourner eux-mêmes. C’est un défi direct aux modèles phares fermés et vendus au prix fort qui ont défini le sommet du marché.

L’écart qu’il comble est plus étroit que le titre le suggère et plus large qu’il n’y paraît.

Quatre points sur l’Intelligence Index d’Artificial Analysis séparent K3 de Claude Opus 5, mais six points séparent K3 du meilleur modèle ouvert qui l’a précédé. Le terrain ouvert a plus avancé ce mois-ci que le terrain fermé.

Le contexte commercial rend l’ambition claire. La famille Kimi de Moonshot aurait franchi 300 millions de dollars de revenus récurrents annualisés à la mi-juin, et, selon le rapport de lancement de TechCrunch, l’entreprise lève de nouveaux capitaux à une valorisation rapportée de 31,5 milliards de dollars, avec un tour pré-introduction en bourse plus important qui se profile derrière. Un laboratoire bien financé qui livre un gigantesque modèle ouvert à des prix agressifs est exactement le genre de pression qui redéfinit ce que tous les autres facturent. Pour voir à quelle vitesse le côté fermé avance, notre guide sur comment tirer le meilleur de GPT-5.6 est un contrepoint utile.

En résumé

Kimi K3 a livré ce qu’il avait promis. Les poids sont publics, la licence est exploitable pour presque tous ceux qui les utiliseront réellement, et la tarification est officielle et basse. Les classements indépendants confirment désormais qu’il est le modèle ouvert le plus fort qui existe, avec une marge nette. Ce qu’il n’est pas, c’est le meilleur modèle qui existe, et Moonshot le dit lui-même.

Notre recommandation : utilisez K3 quand ce sont les poids ouverts, le coût ou un contexte d’un million de tokens dont vous avez besoin. Gardez Claude Opus 5 dans la boucle pour le codage de production le plus difficile, où il mène toujours sur chaque classement indépendant ayant noté les deux. Si vous voulez la version pratique de ce compromis, notre test de Claude Opus 5 couvre ce que le côté fermé offre désormais pour 5 $ par million de tokens.

Kimi K3 a sa place dans une comparaison en tête à tête. Avec Fello AI, vous pouvez faire tourner Kimi aux côtés de Claude, GPT-5.6, Gemini, DeepSeek et Perplexity dans une seule application native pour Mac, iPhone et iPad. Envoyez la même tâche de codage ou de recherche à tous les modèles de pointe à la fois et voyez lequel l’emporte réellement sur votre travail, sans jongler avec des comptes séparés. Quand un modèle ouvert aussi performant arrive, le moyen le plus rapide de le juger est un test côte à côte.

FAQ

Les poids ouverts de Kimi K3 sont-ils disponibles ?

Oui. Moonshot a publié l’intégralité des poids de Kimi K3 sur Hugging Face le 27 juillet 2026, onze jours après le lancement. Le dépôt contient 96 fragments safetensors, environ 1,56 To au total, publiés sous la licence Kimi K3 personnalisée.

Kimi K3 est-il open source ?

Il est à poids ouverts plutôt qu’open source au sens strict. La licence Kimi K3 autorise l’utilisation, la modification, la distribution et la vente commerciale. Une activité de modèle en tant que service générant plus de 20 millions de dollars sur 12 mois quelconques a besoin d’un accord distinct, et les produits comptant plus de 100 millions d’utilisateurs mensuels doivent créditer Kimi K3 à l’écran.

Combien de paramètres Kimi K3 a-t-il ?

Kimi K3 compte 2,8 billions de paramètres au total dans une conception à mélange d’experts, dont 104 milliards s’activent par token. Moonshot le présente comme le premier modèle ouvert de classe 3T au monde, et sa fiche de modèle confirme les deux chiffres.

Kimi K3 est-il meilleur que Claude Opus 5 ?

Pas sur la capacité mesurée. Claude Opus 5 obtient 61 sur l’Intelligence Index d’Artificial Analysis contre 57 pour Kimi K3, et mène le classement WebDev d’Arena. K3 l’emporte sur le prix, à 3 $ et 15 $ par million de tokens contre 5 $ et 25 $, et c’est le seul des deux que vous pouvez télécharger et faire tourner vous-même.

Combien coûte Kimi K3 ?

La tarification API officielle est de 3,00 $ par million de tokens en entrée et de 15,00 $ par million de tokens en sortie, tombant à 0,30 $ par million sur l’entrée en cache. La recherche web est facturée séparément à 0,005 $ par appel réussi, et le modèle devient disponible sur la plateforme API après une recharge d’au moins 1 $.