Kimi K3 : poids ouverts publiés, que change ce LLM de 2,8 T ?
Kimi K3 : poids ouverts publiés, que change ce LLM de 2,8 T ?
Poids Kimi K3 publiés le 27 juillet sur Hugging Face : 1,56 To, licence spécifique, 104 Md de paramètres actifs. Ce que votre DSI doit trancher.
Sommaire
- Les poids de Kimi K3 sont téléchargeables depuis le 27 juillet
- Ce que la licence Kimi K3 autorise vraiment
- Les mesures publiées placent K3 derrière Claude Fable 5
- Le prix de l'API aligne K3 sur Claude Sonnet
- Washington accuse Moonshot d'avoir copié Claude
- Un banc d'essai de deux semaines tranche avant le comité de septembre
Parler de ce sujet avec Webotit
Moonshot AI a lancé Kimi K3 le 16 juillet 2026 et publié ses poids sur Hugging Face le 27 juillet.910 Le modèle compte 2,8 T de paramètres et traite texte, image et vidéo.2 Sa licence n'est ni MIT ni Apache : au-delà de 20 M$ de revenus de revente d'inférence, un accord séparé s'impose.11 Héberger un tel modèle chez vous redevient une option à instruire.
Les poids de Kimi K3 sont téléchargeables depuis le 27 juillet
Moonshot a tenu sa date. Les poids complets de Kimi K3 sont publiés sur Hugging Face depuis le 27 juillet 2026, avec le rapport technique et les outils d'entraînement. Les poids, c'est le modèle lui-même, téléchargeable et modifiable, à l'inverse d'un accès fermé par API (la connexion payante entre le modèle et vos logiciels).910 Le dépôt pèse environ 1,56 To, sur 118 fichiers. Une fois compressé, il occupe encore environ 1,4 To en mémoire.1011
La fiche modèle confirme les chiffres du lancement. Le total atteint 2,8 T de paramètres, un T valant mille milliards. Seuls 104 milliards travaillent à chaque appel, soit 3,7 % du réseau, parce que le modèle ne réveille que 16 de ses 896 spécialistes internes.239 La fenêtre de contexte atteint 1 048 576 tokens, ces fragments de texte qu'il avale d'un coup.2
Le lancement, lui, remonte au 16 juillet 2026, sur Kimi.com, Kimi Code et l'API de l'éditeur.13 Deux versions sont livrées. K3 Max sert la conversation et les agents, K3 Swarm Max fait tourner beaucoup d'agents en parallèle.3 Neuf jours ont séparé l'ouverture de l'API et la sortie des poids.
Ce que la licence Kimi K3 autorise vraiment
Elle autorise l'usage interne, l'hébergement chez vous, l'affinage du modèle et sa compression, sans rien demander.11 Elle encadre une seule chose : la revente d'inférence, c'est-à-dire vendre à d'autres l'accès au modèle. Le texte est une licence maison, la « Kimi K3 License », ni MIT ni Apache, signalée comme licence non standard sur Hugging Face.1011 La différence se lit en direction juridique, pas en salle serveurs.
Deux seuils déclenchent une obligation. Au-delà de 20 M$ de revenus cumulés sur douze mois glissants tirés de la revente d'inférence, il faut négocier un accord séparé avec Moonshot. Au-delà de 100 millions d'utilisateurs actifs par mois, ou de 20 M$ de revenus mensuels, le nom Kimi K3 doit s'afficher dans votre interface.1011
Sous ces seuils, rien ne vous est demandé.11
Je retiens surtout ceci : « poids ouverts » ne veut pas dire « licence libre ». Faites lire le texte par votre direction juridique avant le pilote, pas après.
Les mesures publiées placent K3 derrière Claude Fable 5
Sur le classement composite d'Artificial Analysis, repris par Moonshot dans son billet de lancement, K3 atteint 1 547 points Elo, une échelle de performance relative, comme aux échecs.3 C'est 732 de plus que Kimi K2.6, sorti en avril 2026.4 Moonshot écrit elle-même que son modèle reste derrière Claude Fable 5 et GPT-5.6 Sol sur les évaluations globales.3
Sur huit tests d'automatisation publiés par l'éditeur, K3 arrive en tête sur quatre d'entre eux, dont Automation Bench, SpreadsheetBench 2 et BrowseComp.34 Sur les autres, il finit second derrière Fable 5. Un agrégateur communautaire non affilié le donne aussi gagnant sur un classement de code front-end, à prendre avec prudence.5
Depuis la sortie des poids, une mesure indépendante existe. Artificial Analysis crédite Kimi K3 de 60 points sur son indice d'intelligence, avec un débit mesuré de 38,2 tokens produits par seconde.14 C'est lent face à ses concurrents. Pour un agent qui répond en direct à un client, cette lenteur se voit.
Une réserve s'impose sur l'origine des autres scores. Les innovations d'architecture annoncées par Moonshot, Kimi Delta Attention et Attention Residuals, n'ont été validées que sur les mesures du laboratoire lui-même.2 Et un modèle peut bien se comporter sur une API, puis autrement une fois installé sur vos serveurs. Ce risque ne se lève qu'en testant les poids chez vous.
Ce que je retiens de ces mesures tient en une phrase. Un modèle à poids ouverts entre dans la conversation des meilleurs sur des tâches d'automatisation réelles, pas seulement sur des exercices académiques. Kimi K2.6 n'y était pas en avril : il gagnait sur le code, pas sur les tests d'automatisation en entreprise.6
Le prix de l'API aligne K3 sur Claude Sonnet
Moonshot facture 3 $ par million de tokens en entrée, 0,30 $ quand l'entrée est déjà en cache, et 15 $ en sortie.47 C'est le tarif de la gamme Claude Sonnet, pas un rabais à la DeepSeek. Kimi K2.6 était à 0,95 $ en entrée.6
L'arbitrage économique change de nature. K2.6 se vendait par son prix. K3 se vend par sa performance et par des poids que vous pouvez télécharger. Devant un comité de direction, ce n'est pas le même argument. Des fournisseurs tiers le proposent aussi via OpenRouter, une place de marché qui revend l'accès à plusieurs modèles, à des tarifs proches de ceux de Moonshot.10 Moonshot vend enfin Kimi Hosted Agent, une offre pour entreprises où l'éditeur héberge lui-même les agents, dans des environnements isolés.4
Héberger le modèle chez vous remplace une facture variable par un coût fixe. Au lieu d'une note d'API qui suit vos volumes, vous financez des cartes graphiques, une équipe pour les exploiter et une facture d'électricité. Le point de bascule dépend de votre volume mensuel de tokens. Je le pose comme une hypothèse à instrumenter, pas comme une promesse chiffrée.
Sur un support client à volume soutenu, le coût interne par million de tokens finit par passer sous le prix de l'API. Cela arrive dès que vos machines tournent à plein. L'écart n'apparaît qu'après plusieurs cycles budgétaires de montée en volume, jamais la première année. Avant d'arbitrer, estimer le retour sur investissement d'un projet chatbot ou agent IA sur votre trafic donne la ligne de flottaison à défendre.
Washington accuse Moonshot d'avoir copié Claude
Le 22 juillet 2026, la Maison Blanche a visé Moonshot nommément. Le conseiller scientifique et technologique du président accuse l'éditeur d'avoir copié Claude Fable à l'échelle industrielle. La méthode : faire parler le modèle pour en extraire le savoir-faire. Le secrétaire au Trésor a évoqué des sanctions et une inscription sur la liste des entités sous restriction d'exportation américaine, l'Entity List.12
L'enquête suit son cours. Le service américain qui contrôle les exportations sensibles, le Bureau of Industry and Security, examine un point précis. Des laboratoires chinois auraient accédé à des serveurs Nvidia en passant par la Thaïlande.13 À ce jour, Moonshot n'a pas été inscrit sur cette liste.13
Le sujet dépasse Moonshot. Anthropic accuse depuis juin 2026 des opérateurs liés à Alibaba d'avoir aspiré Claude par 28,8 millions d'appels d'API, pour en copier le comportement.8 Un modèle chinois à poids ouverts pose donc deux questions distinctes : la qualité du modèle, et la solidité de son éditeur.
Une banque, une mutuelle ou un assureur qui déploie un chatbot en relation client manipule des données personnelles, parfois des données de santé. Installer le modèle sur ses propres serveurs supprime les allers-retours d'appels vers un fournisseur étranger. Cela ne dit rien de la provenance des données d'entraînement.
Votre dossier de conformité doit donc contenir un mémo juridique sur la procédure d'isolement utilisée pour l'entraînement, dite clean room. Il doit aussi montrer que votre courtier a vérifié votre couverture d'assurance IA. Enfin, il traite la continuité d'accès au fournisseur comme un risque à part, distinct de la qualité du modèle. Sur un dossier client, la règle ne bouge pas avec le modèle : l'IA prépare, l'humain valide.
Un banc d'essai de deux semaines tranche avant le comité de septembre
Traitez K3 comme un candidat à tester, pas comme une bascule immédiate. Le bon geste tient en une ligne de budget : un banc d'essai court, de sept à quinze jours, sur vos vraies données. Comparez-le au modèle que vous utilisez déjà. Son résultat se présente ensuite au comité de direction.
D'ici là, rouvrez la liste courte arrêtée en juin, souvent bâtie autour de Claude Opus 4.8 et de Mistral Medium 3.5. Demandez à votre équipe un chiffrage de l'hébergement interne face au prix de l'API. Et faites lire la licence par votre direction juridique avant que le sujet arrive en comité.
Ce que ce mouvement déplace chez vous est simple. Les modèles à poids ouverts rendent crédible une production interne. Le tri, la qualification, la réponse de premier niveau et le contrôle documentaire tournent sur vos serveurs. Vos conseillers gardent la relation qui demande un nom, un visage et quelqu'un qui décide.
Un chatbot d'entreprise ou une équipe d'agents IA orchestrés qui traite de gros volumes de conversations peut arbitrer entre facture d'API et coût d'infrastructure. Le point de bascule n'est pas le même à 100 000 conversations par mois qu'à 5 millions.
L'avantage ne durera peut-être pas. Le prochain palier propriétaire peut effacer l'écart en un trimestre, et je ne parierais pas sur une avance longue. Depuis le 27 juillet, une entreprise française peut pourtant télécharger un modèle proche des meilleurs et le faire tourner chez elle. La vraie question est de savoir si vous avez déjà réservé le créneau pour présenter ce banc d'essai.
Vous voulez trancher sur vos propres volumes ? Découvrez nos solutions d'agents IA.
Questions frequentes
Les poids de Kimi K3 sont-ils téléchargeables, et sous quelle licence ?
Oui. Moonshot AI a publié les poids complets sur Hugging Face le 27 juillet 2026, avec le rapport technique : environ 1,56 To sur 118 fichiers. La licence n'est ni MIT ni Apache. C'est un texte maison, la « Kimi K3 License », signalée comme licence non standard. Elle impose un accord séparé avec Moonshot dès que la revente d'inférence dépasse 20 M$ de revenus sur douze mois glissants. Le nom Kimi K3 doit aussi s'afficher au-delà de 100 millions d'utilisateurs actifs par mois, ou de 20 M$ de revenus mensuels. L'usage interne, l'hébergement chez soi, l'affinage et la compression restent libres.
Kimi K3 est-il vraiment au niveau de Claude Fable 5 et GPT-5.6 ?
Selon les mesures que Moonshot publie, K3 atteint 1 547 points Elo sur le classement composite d'Artificial Analysis. Il reste derrière Claude Fable 5 et GPT-5.6 Sol sur les évaluations globales. Sur huit tests d'automatisation, l'éditeur le place en tête sur quatre, dont Automation Bench, SpreadsheetBench 2 et BrowseComp, et second derrière Fable 5 sur les autres. Un agrégateur communautaire non affilié le donne gagnant sur un classement de code front-end, à prendre avec prudence.
Combien coûte l'API Kimi K3 par rapport à Claude et à Kimi K2.6 ?
Kimi K3 coûte 3 $ par million de tokens en entrée, 0,30 $ si l'entrée est en cache et 15 $ en sortie. C'est le tarif de la gamme Claude Sonnet, et nettement plus que Kimi K2.6, facturé 0,95 $ en entrée. K2.6 se vendait par son prix. K3 se vend par sa performance et par des poids que vous pouvez télécharger. Des fournisseurs tiers le proposent aussi via OpenRouter, à des tarifs proches.
Un modèle chinois à poids ouverts comme K3 est-il utilisable dans un secteur régulé français ?
Héberger le modèle sur vos serveurs supprime les appels vers un fournisseur externe. Cela ne remplace pas un audit de la provenance des données d'entraînement ni une procédure d'isolement documentée par l'éditeur. Il faut aussi une lecture de la licence par votre direction juridique et une assurance IA vérifiée avec votre courtier. S'ajoute un risque fournisseur depuis le 22 juillet 2026. La Maison Blanche accuse Moonshot d'avoir copié Claude Fable et le Trésor américain évoque des sanctions. Aucune inscription à l'Entity List n'a été prononcée à ce jour. Une banque, une mutuelle ou un assureur met ces pièces au dossier avant de décider.
Faut-il basculer un projet agents IA lancé sur Claude ou Mistral vers Kimi K3 ?
Non, pas mécaniquement. Un projet lancé sur Claude Opus 4.8 ou Mistral Medium 3.5 garde le support, les engagements de service et la feuille de route de son fournisseur. La bonne pratique reste un banc d'essai de sept à quinze jours sur vos données réelles, présenté ensuite au comité de direction. Une bascule, s'il y en a une, se prépare pour le cycle budgétaire 2027, pas dans l'urgence.
Sources et references
Articles associés
Kimi K2.6 : le modèle open-weight qui bat GPT-5.4
Kimi K2.6 orchestre 300 agents et bat GPT-5.4 sur SWE-bench Pro. Benchmarks, prix et impact pour les DSI français.
LireAnthropic accuse Qwen d'avoir aspiré Claude : 28,8 M d'appels
Anthropic accuse des opérateurs liés à Alibaba et son labo Qwen de 28,8 M d'appels frauduleux sur Claude entre avril et juin 2026. Alibaba dément.
LireSelf-host d’agents IA : open weights, vLLM et TGI
Guide 2026 pour décider et réussir le self-host : modèles open-weight (Llama/Mistral), moteurs d’inférence (vLLM, TGI, Ollama), sécurité et MLOps.
Lire
