Qwen 3.8 Max en poids ouverts : 3 freins pour votre DSI
Qwen 3.8 Max en poids ouverts : 3 freins pour votre DSI
Alibaba annonce les poids ouverts de Qwen 3.8 Max (2,4 T MoE) mi-août 2026. Trois freins à peser avant de rouvrir votre appel d'offres agents IA T4.
Parler de ce sujet avec Webotit
Alibaba a publié Qwen 3.8 Max le 3 août 2026 : 2,4 T MoE, 95 B actifs, 1 M de contexte, à 2 $ / 6 $ le million de tokens. Poids ouverts annoncés pour la semaine du 10 août sous Apache 2.0 — premier modèle Qwen de classe Max en poids ouverts. Pour une DSI d'ETI qui prépare son appel d'offres agents IA du T4, c'est une deuxième option chinoise hébergeable en interne, après Kimi K3 (27 juillet).
Ce que contient l'annonce du 3 août
Alibaba a mis Qwen 3.8 Max à disposition sur son API le 3 août 2026, avec une confirmation officielle que les poids ouverts sont annoncés pour la semaine du 10 août sur Hugging Face et ModelScope.1 C'est la première fois qu'un modèle de classe Max de la famille Qwen sort en licence Apache 2.0 — les précédents modèles phares restaient derrière l'API DashScope.2
Les chiffres techniques : 2,4 T de paramètres en Mixture-of-Experts, 95 B actifs par requête, fenêtre de contexte 1 M de tokens, entrée multimodale (texte, image, vidéo) et sortie texte.3 API à 2 $ en entrée et 6 $ en sortie par million de tokens, point d'accès compatible OpenAI et Anthropic via DashScope.5 Le point de comparaison direct est Kimi K3 de Moonshot AI, sorti en poids ouverts le 27 juillet à 2,8 T de paramètres pour la même fenêtre 1 M, à 3 $ / 15 $ par million.4 Kimi K3 est déjà téléchargeable en interne ; les poids Qwen 3.8 Max sont annoncés pour la semaine du 10 août — environ quinze jours après ceux de Kimi K3.1
Le pari agentique est explicite. Alibaba a montré une démonstration où Qwen 3.8 Max a travaillé de façon autonome pendant 125 heures d'affilée, écrit 7 600 lignes de code et exécuté plus de 1 100 actions dont 33 cycles d'entraînement GPU sans reprise humaine.6 Lors d'un autre essai public, le modèle a construit un projet baptisé « oh-my-cli » depuis un dépôt vide et l'a fait évoluer pendant seize jours ouvrés — 265 commits, 127 demandes de fusion et 151 tickets consignés à date de la publication.7
Ce que disent les benchmarks — et ce qu'ils ne disent pas
C'est là que la lecture se complique. Sur Terminal-Bench 2.1 — le benchmark qui mesure la capacité d'un agent à enchaîner des commandes shell pour finir une tâche — Qwen 3.8 Max score 86,6, devant Claude Opus 4.8 et Claude Fable 5 à 84,6, mais toujours derrière GPT-5.6 Sol (max) à 88,8.8
Sur SWE-bench Pro, un benchmark de résolution de bugs sur des dépôts réels, l'écart s'inverse violemment : Qwen 3.8 Max plafonne à 67,7, contre 80,0 pour Fable 5 — 12,3 points de retard.8 Même schéma sur FrontierSWE : 73,5 contre 88,8 pour Fable 5.8
Un modèle en dents de scie n'est pas un modèle mauvais. C'est un modèle qui excelle sur un profil de tâches — commandes shell, boucles d'action-observation, orchestration d'outils — et qui décroche sur un autre — refactor de code métier existant, résolution de bugs à cheval sur plusieurs fichiers. Pour une équipe d'agents IA en production qui doit à la fois exécuter des enchaînements d'API et corriger du code métier, ce profil oblige à composer avec un second modèle en secours, pas à remplacer Fable 5 d'un coup.
Trois freins avant de rouvrir votre appel d'offres agents IA T4
Frein 1 — le budget d'inférence n'est pas ce qu'il paraît. Le tarif API à 2 $ / 6 $ est agressif, mais un agent qui tourne en continu — la démo Alibaba tient 125 heures d'affilée6 — consomme surtout en sortie, où le tarif est trois fois plus élevé qu'en entrée. Alibaba propose par ailleurs un tarif réduit à 0,25 $ par million de tokens lorsque la requête est servie par le cache.5 Le vrai levier de coût n'est donc pas le prix affiché du token mais la longueur des sorties et le taux de requêtes servies par le cache, deux paramètres qui dépendent de vos prompts et de vos volumes, pas du modèle. Avant de rouvrir votre business case, estimez le retour sur investissement d'une bascule Qwen 3.8 Max avec vos propres volumes de trafic support, pas ceux d'un livre blanc générique.
Frein 2 — les poids ouverts n'ouvrent pas la porte de l'hébergement en interne à toutes les ETI. Un modèle 2,4 T de paramètres pèse plus d'un téraoctet de poids bruts en quantification 4 bits, avant toute mémoire de contexte, de KV-cache ou d'activation. Le charger en interne demande un cluster GPU dédié dont le dimensionnement dépend de la version des poids retenue, du moteur d'inférence et du niveau de quantification — les H200 de Nvidia offrent 141 Go de VRAM chacun.11 Ce n'est pas un investissement de rupture : c'est un poste budgétaire annuel à négocier en amont avec un partenaire hébergeur souverain (OVHcloud, Scaleway, Outscale). Une DSI d'ETI qui n'a pas déjà provisionné cette infrastructure pour un autre projet IA en 2026 ne bascule pas Qwen 3.8 Max en interne au T4 2026. Pour la plupart des équipes, l'option pragmatique reste l'API DashScope hébergée en Asie, avec les questions de latence et de résidence des données qui vont avec.
Frein 3 — la conformité AI Act ne fait pas l'économie de la provenance chinoise. Depuis l'entrée en application des pouvoirs d'enquête de l'AI Office le 2 août 2026, un fournisseur de modèle GPAI encourt jusqu'à 15 M€ ou 3 % du chiffre d'affaires mondial pour manquement à ses obligations de transparence.9 Alibaba n'a jamais publié la composition détaillée des jeux d'entraînement de la famille Qwen, et le sujet de la distillation à partir de modèles américains propriétaires reste sur la table.10 Une DSI dans un secteur régulé — banque, mutuelle, santé, service public — doit faire remonter ces questions à sa direction juridique avant tout pilote Qwen 3.8 Max, pas après. Un modèle sous Apache 2.0 est légalement redistribuable ; il n'efface pas les obligations de transparence de son distributeur en Europe.
Ce que ça change pour une entreprise française
Pour une DSI, un directeur relation client ou un directeur e-commerce d'ETI en phase d'appel d'offres agents IA pour le T4 2026, Qwen 3.8 Max ne change pas le calendrier immédiat. Il change la carte des options 2027.
Une liste courte T4 2026 qui contenait Claude Fable 5, GPT-5.6 Sol et Mistral Vibe garde son squelette : ces trois modèles restent hébergeables sur des zones européennes régulées (Anthropic sur Bedrock EU, OpenAI sur Azure France Central, Mistral sur ses propres data centers français). Les alternatives chinoises en poids ouverts — Kimi K3 fin juillet, Qwen 3.8 Max attendu la semaine du 10 août, DeepSeek V4 Pro depuis juin — se rangent dans une deuxième couche : à évaluer en pilote sur des cas d'usage non critiques (agents de veille interne, automatisation back-office, tests de code) au T1 ou T2 2027, une fois l'infrastructure souveraine dimensionnée.
Pour un callbot ou un chatbot de relation client en production, la question ne se pose même pas au T4 : la latence conversationnelle vise 200 ms sur la voix et 1 s sur l'écrit, une contrainte qui interdit un routage à Singapour pour un modèle chinois hébergé. Mesurer un vrai ROI par cas d'usage avec le fournisseur retenu prime sur la course à l'annonce.
Le vrai signal du 3 août n'est pas le score Terminal-Bench de Qwen 3.8 Max. C'est la vitesse à laquelle deux acteurs chinois — Moonshot et Alibaba — ouvrent en une quinzaine de jours des modèles de classe Max qu'aucun laboratoire américain n'ouvre encore. Sur les six semaines qui viennent, cette dynamique ne justifie pas de casser une présélection T4 qui tient.
Ce qu'il faut retenir
- Qwen 3.8 Max sort le 3 août 2026 — 2,4 T MoE, 95 B actifs, 1 M de contexte3, API à 2 $ / 6 $ par million de tokens.5
- Poids ouverts la semaine du 10 août sous Apache 2.0 — premier modèle phare Qwen en poids ouverts1, environ quinze jours après Kimi K3 (2,8 T) déjà téléchargeable depuis le 27 juillet.4
- Benchmarks en dents de scie — bat Fable 5 sur Terminal-Bench 2.1 (86,6 vs 84,6) mais perd 12 points sur SWE-bench Pro (67,7 vs 80,0).8
- Trois freins avant de rouvrir votre appel d'offres T4 — budget d'inférence réel, infrastructure GPU souveraine à provisionner, questions AI Act sur la provenance des données d'entraînement.9
- Décision recommandée pour une DSI d'ETI — garder Fable 5 / GPT-5.6 Sol / Mistral Vibe dans la liste courte T4 2026 ; placer Qwen 3.8 Max et Kimi K3 dans une évaluation pilote T1-T2 2027.
Conclusion
Le 3 août 2026 n'est pas un jour de bascule pour les agents IA en production dans une ETI française. C'est un jour où la carte des options 2027 se recompose, silencieusement.
Deux modèles chinois de classe Max ouverts en une quinzaine de jours — Kimi K3 déjà installable depuis le 27 juillet, Qwen 3.8 Max annoncé pour la semaine du 10 août : c'est un signal fort pour la souveraineté du calcul, mais un signal faible pour une décision d'appel d'offres T4 2026 qui doit livrer avant Noël. Ne rouvrez pas votre liste courte. Ajoutez une ligne « à évaluer T1 2027 » à votre document d'arbitrage, et concentrez-vous sur ce qui sera livré dans quatre mois — pas sur ce qui pourrait l'être dans huit.
Vous voulez cadrer la présélection LLM et l'orchestration d'agents IA de votre entreprise pour le T4 2026 sans céder à chaque annonce, ou chiffrer le coût complet (TCO) d'une bascule LLM avant votre prochain CODIR ? Nos équipes d'IA conversationnelle sont disponibles.
Questions frequentes
Qwen 3.8 Max est-il vraiment meilleur que Claude Fable 5 pour un agent IA d'entreprise ?
Sur Terminal-Bench 2.1, oui — 86,6 contre 84,6. Sur SWE-bench Pro et FrontierSWE, non — Fable 5 conserve 12 à 15 points d'avance.8 Pour un agent qui enchaîne des commandes shell et des appels d'API, Qwen 3.8 Max est compétitif. Pour un agent qui corrige du code métier existant, Fable 5 reste devant.
Peut-on installer Qwen 3.8 Max sur site dans une ETI française dès août 2026 ?
Techniquement oui, à partir de la semaine du 10 août 2026 quand les poids seront publiés sous Apache 2.0.1 Pratiquement, le modèle pèse plus d'un téraoctet de poids bruts en 4 bits avant toute mémoire d'exécution, ce qui demande un cluster GPU dédié dimensionné selon le moteur d'inférence et le niveau de quantification retenus, avec un partenaire hébergeur souverain (OVHcloud, Scaleway, Outscale). Une ETI qui n'a pas déjà provisionné cette infrastructure pour un autre projet IA en 2026 ne bascule pas en interne au T4.
Qwen 3.8 Max est-il conforme à l'AI Act européen ?
Le modèle est légalement utilisable en Europe sous licence Apache 2.0, mais la conformité AI Act reste à la charge du déployeur. Depuis le 2 août 2026, un fournisseur de modèle GPAI encourt jusqu'à 15 M€ ou 3 % du chiffre d'affaires mondial pour manquement aux obligations de transparence.9 Une DSI dans un secteur régulé doit documenter l'origine du modèle et la traçabilité de ses données d'entraînement — deux points qu'Alibaba n'a jamais entièrement publiés pour la famille Qwen.10
Quelle différence entre Qwen 3.8 Max et Kimi K3 pour une présélection d'entreprise ?
Kimi K3 (Moonshot AI, 27 juillet 2026) est plus gros — 2,8 T contre 2,4 T — et publié plus tôt en poids ouverts. Qwen 3.8 Max est moins cher sur l'API (2 $ / 6 $ contre 3 $ / 15 $ par million de tokens) et adossé à un fournisseur cloud (Alibaba Cloud) qui offre une infrastructure adjacente.45 Sur les benchmarks agentiques, Kimi K3 mène sur Program Bench et SWE Marathon, Qwen 3.8 Max mène sur Terminal-Bench 2.1.8 Aucun des deux ne remplace Claude Fable 5 en production immédiate pour une ETI française.
Sources et references
Articles associés

Qwen3.6-Max : Alibaba prend la tête des benchmarks coding
Alibaba lance Qwen3.6-Max-Preview, premier sur 6 benchmarks coding. Analysez ce que la montée des LLM chinois change pour les DSI français.
Lire
Anthropic accuse Qwen d'avoir aspiré Claude : 28,8 M d'appels
Anthropic accuse des opérateurs liés à Alibaba et son labo Qwen de 28,8 M d'appels frauduleux sur Claude entre avril et juin 2026. Alibaba dément.
Lire
DeepSeek annule son prix permanent : +52 % à +1 114 %
DeepSeek remplace son prix permanent par une grille horaire : +52 % à +1 114 % dès le 16 août 2026. Comment réviser votre routage multi-LLM.
Lire