Aller au contenu principal
Retour à Chinois
LLM

Kimi K3 : poids ouverts publiés, que change ce LLM de 2,8 T ?

Poids Kimi K3 publiés le 27 juillet sur Hugging Face : 1,56 To, licence spécifique, 104 Md de paramètres actifs. Ce que votre DSI doit trancher.

Louis-Clément Schiltz
CEO & Founder, Webotit.ai
11 min de lecture

Parler de ce sujet avec Webotit

En bref

Moonshot AI a publié Kimi K3 le 16 juillet 2026, puis ses poids complets sur Hugging Face le 27 juillet : MoE 2,8 T paramètres, 104 Md activés par token, 1 M tokens de contexte, multimodal. La licence n'est ni MIT ni Apache et impose un accord séparé au-delà de 20 M$ de revenus pour la revente d'inférence. Pour un DSI d'ETI française, l'hébergement interne redevient une option à instruire.

Mise à jour du 19 août 2026

Les poids complets de Kimi K3 sont publiés sur Hugging Face depuis le 27 juillet 2026, à la date annoncée, avec le rapport technique et les outils d'infrastructure utilisés pour l'entraînement.910 Le dépôt pèse environ 1,56 To répartis sur 118 fichiers, pour une empreinte mémoire d'environ 1,4 To en MXFP4.1011 La fiche modèle confirme les 2,8 T de paramètres totaux, 104 milliards activés par token, 16 experts retenus sur 896 et 1 048 576 tokens de contexte.9

Le point à ne pas manquer est juridique. La licence n'est ni MIT ni Apache : Moonshot publie un document propre, la « Kimi K3 License », signalée license:other sur Hugging Face. Elle impose de négocier un accord séparé dès qu'une activité de revente d'inférence dépasse 20 M$ de revenus cumulés sur douze mois glissants, et l'affichage visible du nom Kimi K3 dans l'interface au-delà de 100 millions d'utilisateurs actifs mensuels ou de 20 M$ de revenus mensuels.1011 L'usage interne en entreprise, l'auto-hébergement, l'affinage et la quantification restent hors de ces seuils.11

Deuxième fait postérieur à la rédaction : le 22 juillet 2026, le directeur de l'Office of Science and Technology Policy de la Maison Blanche a accusé nommément Moonshot d'avoir conduit une distillation industrielle de Claude Fable, et le secrétaire au Trésor a évoqué sanctions et inscription à l'Entity List.12 Le Bureau of Industry and Security enquête sur l'accès de laboratoires chinois à des serveurs Nvidia GB300 routés via la Thaïlande. À la date de cette mise à jour, aucune désignation Entity List n'a été prononcée contre Moonshot.13

Ce que Moonshot a livré le 16 juillet

Moonshot AI a publié Kimi K3 le 16 juillet 2026, sur Kimi.com, Kimi Code et l'API Kimi, avec une architecture qui déplace la comparaison entre modèles frontière propriétaires et modèles à poids ouverts (open-weight).3 Deux mille huit cents milliards de paramètres au total, organisés en Mixture-of-Experts : 896 experts au total, 16 activés par token, soit 104 milliards de paramètres mobilisés à chaque appel — 3,7 % du réseau.239 La fenêtre de contexte atteint 1 048 576 tokens.23 Le modèle est nativement multimodal : texte, image et vidéo en entrée.23

Deux variantes sont livrées le jour du lancement. K3 Max est le modèle chat et agent générique. K3 Swarm Max est optimisé pour le traitement parallèle à grande échelle, autrement dit pour les architectures qui font tourner beaucoup d'agents parallèlement.3

L'annonce importante n'était pas dans les paramètres. Elle était dans le calendrier : Moonshot annonçait la publication des poids complets, téléchargeables, pour le 27 juillet 2026 — date tenue.3910 Neuf jours séparaient l'accès API de la sortie des poids, de quoi auditer le modèle via l'API avant de préparer un déploiement local.

Où K3 se situe dans les évaluations reportées par Moonshot

Sur le classement composite d'Artificial Analysis reporté dans le billet de lancement Moonshot, K3 atteint un Elo de 1 547, un saut de 732 points par rapport à Kimi K2.6 publié en avril 2026.34 Moonshot indique elle-même que K3 reste derrière Claude Fable 5 et GPT-5.6 Sol sur les évaluations globales.3

Sur les benchmarks d'automatisation reportés dans la même publication (huit tests au total, avec des harnais spécifiques par benchmark), Moonshot place K3 en tête sur quatre d'entre eux — Automation Bench, SpreadsheetBench 2 et BrowseComp inclus — et second derrière Fable 5 sur les autres.34 Un agrégateur communautaire non affilié (kimik3.xyz) publie également des scores sur un Frontend Code Arena où K3 est cité à 1 679 points, devant Claude Fable 5, GPT-5.6 Sol et GLM-5.2 — à prendre avec la prudence due à la non-affiliation.5

Depuis la sortie des poids, la mesure indépendante existe. Artificial Analysis crédite Kimi K3 (max) de 60 points sur son Intelligence Index, avec un débit mesuré de 38,2 tokens de sortie par seconde — lent au regard de ses pairs, ce qui compte pour un agent qui répond en direct à un client.14

Pour une DSI qui constitue sa liste courte de LLM pour la fin 2026, la lecture est nette. Un modèle à poids ouverts vient de rejoindre la conversation frontière sur les tâches agentiques réelles, pas seulement sur des tests académiques — même s'il n'atteint pas encore la première place sur les composites globaux tels que reportés par Moonshot. Ce n'était pas vrai avec Kimi K2.6 en avril, qui restait dominant sur SWE-bench Pro mais absent des benchmarks d'automatisation entreprise.6

La grille tarifaire API : parité Sonnet, pas de rabais DeepSeek

L'API Kimi K3 est disponible au lancement, à trois tarifs par million de tokens. 0,30 $ en entrée mise en cache, 3 $ en entrée fraîche, 15 $ en sortie.47 Ce positionnement mérite d'être lu à voix haute par un DSI. Il aligne K3 sur la grille historique de Claude Sonnet, pas sur celle de DeepSeek ou de Kimi K2.6, qui étaient à 0,95 dollar en entrée.6

L'arbitrage économique change de nature. K2.6 gagnait par le prix pur, en offrant une architecture agents à un cinquième du coût de Claude Opus. K3 propose un compromis différent : niveau de performance frontière sur l'automatisation en entreprise, prix API équivalent à un modèle propriétaire de milieu de gamme, mais surtout la possibilité, ouverte depuis le 27 juillet, de basculer sur ses propres poids. Plusieurs fournisseurs tiers routent par ailleurs K3 via OpenRouter, à des tarifs proches de ceux de Moonshot.10

Ce que ça change pour une DSI d'ETI française

Pour un DSI, un directeur relation client ou une direction innovation qui pilotent un déploiement d'agents IA en France, trois arbitrages concrets se posent avant la fin de l'année.

Arbitrage 1 — l'appel d'offres LLM de fin d'année mérite d'être rouvert. Une ETI française qui a arrêté sa liste courte en juin autour de Claude Opus 4.8 et Mistral Medium 3.5 dispose désormais des poids pour tester K3 sur ses propres cas d'usage. Une banque, une mutuelle ou un industriel qui préparait un pilote agents IA voit apparaître une option où le modèle tourne sur ses propres serveurs, sans que la donnée quitte l'infrastructure. Aucun benchmark public ne remplace un test sur les données réelles de la marque : la mesure de référence K3 vs propriétaire est une pièce que le CODIR va demander. Autant la produire maintenant.

Arbitrage 2 — repenser l'arbitrage entre API et hébergement interne sur le budget agents IA. Une entreprise qui héberge K3 en interne substitue un coût fixe à un coût variable. À la place d'une facture API qui suit le volume, elle finance un cluster GPU, une équipe MLOps et une facture électricité. Le point de bascule dépend du volume mensuel de tokens traités. Hypothèse à instrumenter, pas promesse chiffrée : pour un agent IA qui gère du support client à volume soutenu, le coût par million de tokens en hébergement interne tombe sous le prix API dès que le cluster est suffisamment saturé — mais l'écart n'apparaît qu'après plusieurs cycles budgétaires de montée en volume, jamais dès la première année. Avant de basculer, estimer le retour sur investissement d'un projet chatbot ou agent IA sur votre propre trafic donne la ligne de flottaison chiffrée à défendre en COMEX.

Arbitrage 3 — les secteurs régulés doivent auditer le fournisseur, pas seulement le modèle. Une banque, une mutuelle ou un assureur qui déploie un chatbot en relation client manipule des données personnelles et parfois des données de santé. Un modèle à poids ouverts sur ses propres serveurs élimine le transit transatlantique d'appels API. Il n'élimine pas les questions liées à la provenance des données d'entraînement d'un modèle chinois. Anthropic accuse depuis juin 2026 des opérateurs liés à Alibaba d'avoir aspiré Claude via 28,8 millions d'appels API à des fins de distillation.8 Le sujet n'est pas seulement Alibaba. Le 22 juillet 2026, la Maison Blanche a d'ailleurs visé Moonshot elle-même, accusée d'avoir distillé Claude Fable à grande échelle, avec une menace explicite de sanctions et d'inscription à l'Entity List.12 Aucune désignation n'a été prononcée à ce jour, mais l'enquête du Bureau of Industry and Security reste ouverte.13 Un audit de conformité sérieux pour un modèle chinois à poids ouverts en production régulée exige donc aujourd'hui un mémo juridique sur la procédure d'isolement (clean-room) utilisée pour l'entraînement, une couverture assurantielle IA vérifiée avec le courtier, et une ligne « continuité d'accès au fournisseur » distincte de la qualité du modèle.

Les limites à instrumenter avant de signer

Quatre zones d'ombre méritent d'être posées sur la table avant que le comité d'investissement de septembre valide K3 en production.

Un. Les 2,8 T de paramètres sont désormais confirmés par la fiche modèle publiée avec les poids, tout comme les 104 milliards de paramètres activés par token.9 Reste la vérification qui compte pour vous : un modèle peut bien figurer sur une API et se comporter autrement une fois installé sur votre infrastructure. Ce risque ne se lève qu'une fois les poids testés en interne, sur vos propres cas d'usage.

Deux. L'architecture Kimi Delta Attention et les Attention Residuals annoncés par Moonshot sont des innovations propres au laboratoire, non validées en dehors de ses propres benchmarks.2 Les résultats sur les benchmarks d'automatisation entreprise sont impressionnants, mais un DSI ne prend pas de décision d'architecture sur une seule série de mesures. Une phase de tests A/B en parallèle du modèle actuellement en production, sur vos propres historiques de conversations client, est le seul juge de paix.

Trois. Le dépôt pèse environ 1,56 To sur 118 fichiers, pour une empreinte mémoire d'environ 1,4 To en MXFP4 : il faut prévoir une infrastructure GPU sérieuse pour l'héberger, même en quantifiant.1011 Kimi Hosted Agent, l'offre agents entreprise de Moonshot, propose une alternative infogérée avec environnements isolés et sessions longues.4 Sa disponibilité pour les entreprises françaises et son intégration à une architecture conforme au RGPD restent à confirmer contractuellement avec l'éditeur — pas à déduire de la documentation générale.

Quatre. La licence est un sujet de direction juridique, pas d'équipe technique. « Poids ouverts » ne veut pas dire MIT ni Apache : au-delà de 20 M$ de revenus sur douze mois glissants pour une activité de revente d'inférence, un accord séparé avec Moonshot devient nécessaire, et une obligation d'affichage du nom Kimi K3 s'applique au-delà de 100 millions d'utilisateurs actifs mensuels ou de 20 M$ de revenus mensuels.1011 Pour un usage interne ou un produit sous ces seuils, la contrainte est nulle ; pour un éditeur qui revendrait de l'inférence, elle se lit avant le pilote, pas après.

Ce qu'il faut retenir

Ce que ça change pour votre entreprise

Pour un directeur relation client d'une compagnie d'assurance ou d'une banque française, la lecture n'est pas que K3 remplace demain matin le modèle propriétaire déjà en place. C'est que la question « peut-on héberger nous-mêmes un modèle au niveau frontière sur nos propres serveurs, sans que la donnée client sorte du SI, avec un budget compatible avec un pilote 2027 » redevient sérieuse.

Pour un directeur e-commerce ou une direction opérations d'une enseigne nationale, le calcul est plus opérationnel. Un chatbot IA d'entreprise ou une équipe d'agents IA orchestrés qui traite des volumes élevés de conversations SAV peut arbitrer entre une facture API qui suit la saisonnalité et un coût d'infrastructure fixe. Le point de bascule n'est pas le même pour une marque à 100 000 conversations par mois et pour une marque à 5 millions.

Webotit.ai, spécialiste français de l'IA conversationnelle B2B, accompagne de longue date les directions relation client d'ETI et de Grands Comptes français dans l'arbitrage entre modèles propriétaires et modèles à poids ouverts, en gardant la donnée sensible sur infrastructure européenne. Notre lecture sur K3 : le modèle mérite un banc d'essai sur les données réelles de la marque, une phase de comparaison A/B contre le modèle actuel, une lecture de la licence par la direction juridique et un audit provenance-conformité avant toute mise en production régulée. Le poste budgétaire à ouvrir en septembre est un pilote court — quelques jours à deux semaines — qui tranchera l'affaire, pas une bascule directe en production.

Depuis le 27 juillet, une entreprise française peut télécharger un modèle qui s'approche des tout meilleurs propriétaires sur les benchmarks d'automatisation publiés par le laboratoire. L'avantage ne durera peut-être pas — le prochain palier propriétaire peut effacer l'écart en un trimestre — mais la porte est ouverte. La vraie question pour un DSI d'ETI n'est donc pas « faut-il basculer sur K3 en production ». C'est « ai-je déjà réservé un créneau CODIR pour présenter le résultat d'un banc d'essai comparatif court ». Si la réponse est non, c'est le moment de bloquer la date.

Vous voulez voir concrètement ce qu'une architecture d'agents IA pilotable sur un modèle à poids ouverts peut apporter à votre relation client ? Découvrez nos solutions d'agents IA.

Questions frequentes

Les poids de Kimi K3 sont-ils téléchargeables, et sous quelle licence ?

Oui. Moonshot AI a publié les poids complets de Kimi K3 sur Hugging Face le 27 juillet 2026, comme annoncé, avec le rapport technique : environ 1,56 To répartis sur 118 fichiers. La licence n'est ni MIT ni Apache : c'est un document propre à l'éditeur, la « Kimi K3 License », signalée license:other. Elle impose un accord séparé avec Moonshot dès qu'une activité de revente d'inférence dépasse 20 M$ de revenus cumulés sur douze mois glissants, et l'affichage du nom Kimi K3 dans l'interface au-delà de 100 millions d'utilisateurs actifs mensuels ou de 20 M$ de revenus mensuels. L'usage interne, l'auto-hébergement, l'affinage et la quantification restent hors de ces seuils.

Kimi K3 est-il vraiment au niveau de Claude Fable 5 et GPT-5.6 ?

Selon les évaluations reportées par Moonshot dans son billet de lancement, Kimi K3 atteint un Elo de 1 547 sur le classement composite d'Artificial Analysis mais reste derrière Claude Fable 5 et GPT-5.6 Sol sur les évaluations globales. Sur huit benchmarks d'automatisation à harnais spécifiques, Moonshot place K3 en tête sur quatre — Automation Bench, SpreadsheetBench 2 et BrowseComp inclus — et second derrière Fable 5 sur les autres. Un agrégateur communautaire non affilié publie également un Frontend Code Arena où K3 est cité en tête, à prendre avec la prudence due à la non-affiliation.

Combien coûte l'API Kimi K3 par rapport à Claude et à Kimi K2.6 ?

Kimi K3 est facturé 3 dollars par million de tokens en entrée fraîche, 0,30 dollar en entrée mise en cache et 15 dollars en sortie. C'est la parité tarifaire avec la gamme Claude Sonnet d'Anthropic, et un tarif nettement supérieur à Kimi K2.6 (0,95 dollar par million de tokens en entrée). L'arbitrage économique change de nature : K2.6 gagnait par le prix pur, K3 se positionne sur la performance frontière avec la possibilité, ouverte depuis le 27 juillet, de basculer sur ses propres poids. Plusieurs fournisseurs tiers routent également K3 via OpenRouter à des tarifs proches.

Un modèle chinois à poids ouverts comme K3 est-il utilisable dans un secteur régulé français ?

Un modèle à poids ouverts hébergé sur ses propres serveurs élimine le transit d'appels API vers un fournisseur externe. Il ne dispense pas d'un audit de provenance des données d'entraînement, d'une procédure d'isolement (clean-room) documentée par l'éditeur, d'une lecture de la licence par la direction juridique et d'une couverture assurantielle IA vérifiée avec le courtier. S'ajoute depuis le 22 juillet 2026 un risque fournisseur : la Maison Blanche accuse Moonshot d'avoir distillé Claude Fable et le Trésor américain évoque sanctions et inscription à l'Entity List, sans qu'aucune désignation n'ait été prononcée à ce jour. Une banque, une mutuelle ou un assureur qui envisage K3 en production régulée doit inclure ces éléments dans son dossier avant décision, en plus du test de performance sur les cas d'usage réels.

Faut-il basculer un projet agents IA lancé sur Claude ou Mistral vers Kimi K3 ?

Non, pas mécaniquement. Un projet lancé sur Claude Opus 4.8 ou Mistral Medium 3.5 conserve les avantages de son fournisseur (support entreprise, engagements de service, feuille de route), même si K3 devient une alternative sérieuse. La bonne pratique à court terme est un banc d'essai comparatif de sept à quinze jours sur les données réelles de la marque, dont le résultat est présenté au CODIR suivant. Le basculement, s'il a lieu, se prépare pour un cycle budgétaire 2027, pas dans l'urgence.

Sources et references

  1. [1]
  2. [2]
  3. [3]
  4. [4]
  5. [5]
  6. [6]
  7. [7]
  8. [8]
  9. [9]
  10. [10]
  11. [11]
  12. [12]
  13. [13]
  14. [14]
Kimi K3Moonshot AIpoids ouvertsagents IAsouveraineté