Aller au contenu principal
Retour à Cloud
Infrastructure IA

Scaleway-Vsora-ZML : la chaîne IA souveraine ferme côté silicium

Scaleway déploiera les premiers serveurs Jotunn8 de Vsora. La chaîne IA souveraine française se referme du silicium au cloud pour les DSI sous DORA.

Louis-Clément Schiltz
CEO & Founder, Webotit.ai
9 min de lecture

Parler de ce sujet avec Webotit

En bref

Le 18 juin 2026 à VivaTech, la Région Île-de-France, Scaleway, Vsora et ZML signent un accord pour déployer la première offre cloud d'inférence IA souveraine basée sur le processeur français Jotunn8. Scaleway s'engage à valider l'architecture en production avec 3 200 TFLOPS par puce et 50 % d'énergie en moins. La chaîne IA souveraine française couvre enfin du silicium à l'inférence.

Le 18 juin 2026 à VivaTech : la chaîne IA souveraine ferme côté silicium

Sur le stand de la Région Île-de-France à VivaTech, quatre acteurs ont signé un accord qui change la carte des fournisseurs IA évaluables par une DSI française. La Région Île-de-France, Scaleway, Vsora et ZML s'engagent à déployer en Île-de-France la première offre cloud d'inférence IA basée sur un processeur conçu en France.1

Vsora est une entreprise fabless de semi-conducteurs fondée en 2015 à Meudon-la-Forêt, dans les Hauts-de-Seine. Elle a levé 46 millions de dollars en avril 2025 auprès d'Otium, Omnes Capital, Adélie Capital et du fonds European Innovation Council pour porter en production Jotunn8, son processeur d'inférence IA pour datacenter.2 Le tape-out a été réalisé en seconde moitié 2025 chez TSMC sur le nœud 5 nm avec packaging CoWoS multi-chips.3 Les premiers exemplaires de silicium sortent des fonderies depuis le premier trimestre 2026.4

Scaleway s'engage publiquement à intégrer Jotunn8 dans ses propres serveurs, à valider l'architecture en production sur ses datacenters et à la commercialiser à ses clients sous forme de Model-as-a-Service.1 ZML, éditeur d'une pile d'inférence open source écrite en Zig sur OpenXLA et MLIR, assure le portage logiciel des principaux modèles vers la nouvelle architecture.1 La Région Île-de-France apporte la commande publique structurante et la coordination industrielle.5

La veille de cette signature, Bull, Foxconn et NVIDIA confirmaient l'assemblage du Vera Rubin NVL72 à Angers — j'en parlais sous l'angle DORA pour les banques. Avec l'accord Scaleway-Vsora-ZML, l'histoire change de nature. À Angers, on assemble du silicium NVIDIA en France. À Meudon, on conçoit du silicium en France. Ce sont deux étapes différentes de la chaîne souveraine. Pour une direction des risques, ce sont aussi deux degrés différents d'indépendance.

Vsora Jotunn8 : ce que la puce propose face à NVIDIA et AMD

Jotunn8 vise un seul usage : l'inférence en datacenter pour les LLM et les agents multimodaux. Pas l'entraînement.

Les chiffres communiqués par Vsora et son partenaire d'industrialisation GUC en mai 2026 sont précis. Chaque puce délivre 3 200 TFLOPS de calcul à un taux d'utilisation supérieur à 50 %.3 Elle embarque 288 Go de mémoire HBM3e directement intégrée au package.3 Vsora annonce une consommation énergétique inférieure de 50 % à celle des puces concurrentes les plus performantes du marché pour un volume de tokens équivalent.3

L'argument que Vsora défend auprès des opérateurs cloud européens est simple. Sur une charge d'inférence LLM réelle, la facture d'électricité d'un datacenter européen pèse lourd. Diviser par deux la consommation énergétique pour le même débit de tokens, c'est donc agir sur une ligne directe du compte de résultat d'un opérateur cloud.

Pour un DSI français, l'argument ne se prend pas tel quel. Il a besoin de chiffres de production sur ses propres modèles, mesurés en latence, en débit utile et en coût total. C'est précisément ce que Scaleway s'engage à livrer en validant l'architecture en environnement de production, sur des charges client réelles.1 La grille tarifaire commerciale n'est pas encore publiée. Les premières instances Jotunn8 en accès managé Scaleway Model-as-a-Service sont annoncées pour 2027.

L'enjeu industriel dépasse Vsora. Si Scaleway publie en 2027 un coût par million de tokens sur un modèle open source hébergé sur Jotunn8 qui se compare favorablement aux offres des hyperscalers, l'argument bascule. Une banque sous DORA, une mutuelle sous ACPR, un industriel sous NIS2 disposent alors d'un fournisseur alternatif évaluable, financièrement défendable et politiquement portable.

Le rôle de ZML, le maillon logiciel qu'on oublie toujours

C'est le détail qui pose problème quand un éditeur de puce annonce un nouveau silicium : la pile logicielle. CUDA verrouille l'écosystème NVIDIA depuis quinze ans. ROCm chez AMD reste un chantier permanent. Toute alternative crédible doit livrer la même fluidité de portage des modèles open source qu'un développeur attend de PyTorch sur H100.

ZML développe une pile d'inférence open source écrite en Zig, posée sur OpenXLA, MLIR et Bazel.6 Elle est conçue pour faire tourner les mêmes modèles indifféremment sur GPU NVIDIA, AMD, ou sur de nouveaux accélérateurs comme TPU, Cerebras ou Vsora.6 Dans l'accord, ZML est chargée d'assurer le portage des principaux modèles open source vers Jotunn8 et de fournir l'environnement d'exécution managé que Scaleway exposera à ses clients.1

Pour une DSI qui exploite déjà des charges Mistral, Llama ou Qwen sur Scaleway, ZML vise une bascule sans réécriture applicative : le même code, la même API, une puce différente derrière. Si la promesse tient, Scaleway-Vsora-ZML devient un remplacement potentiel pour une partie des charges d'inférence aujourd'hui sur AWS, Azure ou Google Cloud.

C'est aussi pour cela que le maillon ZML compte autant que la puce. Un Jotunn8 sans pile logicielle robuste resterait un démonstrateur. Un Jotunn8 avec ZML et Scaleway derrière devient un produit cloud.

Ce que ça change pour une entreprise française

Précisons d'emblée : ce qui suit relève de l'illustration. À ce stade, aucune instance Jotunn8 n'est commercialement disponible et aucune grille tarifaire n'est publiée. Les scénarios ci-dessous décrivent des situations hypothétiques, sans chiffrage réel, pour montrer en quoi l'annonce peut peser dans une décision de DSI.

Premier cas de figure, conditionnel : une banque sous supervision ACPR qui prépare sa revue annuelle de résilience opérationnelle. Tant que sa cartographie ICT ne recense que des fournisseurs IA hébergés chez les hyperscalers américains, ses options de portabilité restent théoriques. Un service cloud d'inférence opéré par Scaleway, sur du matériel conçu en France et une pile logicielle open source documentée, pourrait y figurer comme alternative réellement actionnable. La clause de portabilité que la direction juridique cherche à inscrire dans un avenant aurait alors un destinataire crédible. Rappelons que c'est l'ACPR, et non la BCE, qui supervise une banque privée régionale au titre de DORA.9

Deuxième cas de figure, conditionnel : un assureur santé qui opère un chatbot de relation adhérent à fort volume. Si le coût d'inférence pèse de manière sensible dans le coût total du programme, et si Scaleway publie en 2027 un coût par million de tokens compétitif sur un modèle open source hébergé sur Jotunn8, la bascule d'un volume de conversations standardisé vers la stack Scaleway-Vsora deviendrait un dossier d'arbitrage à présenter en comité. Pas tout le volume — le volume reproductible et bien typé, là où la qualité de réponse est stabilisée et la latence acceptable.

Troisième cas de figure, conditionnel : un industriel qui automatise la qualification de ses emails fournisseurs via un mailbot. La bascule d'une charge de classification et de génération de réponses vers un opérateur cloud français, avec un argument énergétique mesurable et une facturation en euros sans exposition au risque de change, constituerait un dossier simple à défendre devant une direction financière. C'est précisément le profil de charge que Vsora cible : volume élevé, modèle compact, contraintes RGPD fortes, sensibilité au coût marginal.

Dans aucun de ces cas je ne dis qu'il faut basculer aujourd'hui. Je dis qu'il faut rouvrir la grille des fournisseurs évaluables avant de signer le moindre renouvellement à horizon 2027.

Mes recommandations Webotit pour cadrer vos arbitrages d'inférence 2027

En tant qu'acteur français de l'IA conversationnelle, voici trois mouvements à engager d'ici fin juillet 2026.

Premier mouvement, ajoutez Scaleway-Vsora-ZML à votre cartographie des fournisseurs IA dans la revue annuelle DORA, ACPR ou NIS2. Pas comme fournisseur opérationnel — il ne l'est pas encore. Comme fournisseur évaluable en option de portabilité. Cela renforce le dossier devant le superviseur et incite le fournisseur historique à négocier des clauses contractuelles plus ouvertes.

Deuxième mouvement, lancez un POC d'inférence Mistral ou Llama sur Scaleway Model-as-a-Service dès maintenant, sur un cas d'usage non critique. L'instance Jotunn8 n'est pas encore disponible, mais Scaleway propose déjà des instances H100 et GH200 en facturation à la seconde, et l'accès managé aux instances Jotunn8 est annoncé pour 2027. Trois mois de POC suffisent pour produire les chiffres comparatifs latence, débit, coût et qualité qu'il vous faudra présenter en CODIR au quatrième trimestre.

Troisième mouvement, refaites passer votre calculateur de retour sur investissement IA avec deux hypothèses de coût d'inférence : la grille actuelle hyperscaler et une grille hypothétique nettement moins chère en stack souveraine. Sur un déploiement de chatbot relation client ou mailbot de qualification à volume soutenu, la sensibilité du business case au coût d'inférence est forte. Mesurer ce delta avant le renouvellement de votre contrat hyperscaler vous donne un levier de négociation immédiat, indépendamment de toute bascule effective vers Vsora.

Si vous voulez en discuter, parlez-en à nos équipes spécialisées en agents IA gouvernables pour ETI françaises ou cadrez l'arbitrage avec notre équipe banques sous DORA ou notre équipe assurances sous ACPR.

Ce qu'il faut retenir

Conclusion

L'accord du 18 juin n'éteint pas le monopole NVIDIA sur l'IA. Il ouvre une deuxième porte. À Angers, l'industrie française reprend la main sur l'assemblage du silicium NVIDIA. À Meudon et bientôt sur les datacenters Scaleway en Île-de-France, c'est le silicium lui-même qui est conçu en France et opéré sous marque française. Ce sont deux degrés d'indépendance distincts. Une banque sous DORA, une mutuelle sous ACPR, un industriel sous NIS2 peuvent désormais envisager de documenter une portabilité réelle en deux étapes, plutôt qu'un exit théorique.

Pour les DSI qui renégocient un contrat hyperscaler entre septembre 2026 et mars 2027, c'est l'une des premières fois depuis longtemps qu'un fournisseur alternatif crédible commence à se chiffrer et à se contractualiser. La question utile en CODIR n'est plus « est-ce que je bascule », mais « combien de tokens je pourrais porter en deux étapes vers une stack souveraine sans casser la qualité de service ».

Questions frequentes

Vsora Jotunn8 est-il disponible commercialement aujourd'hui ?

Pas en accès managé client. Les premiers exemplaires de silicium Jotunn8 sortent des fonderies TSMC depuis le premier trimestre 2026. Scaleway s'engage à valider l'architecture en environnement de production sur ses propres datacenters Île-de-France au second semestre 2026, puis à ouvrir les premières instances managées Model-as-a-Service à ses clients en 2027. Une DSI française peut d'ores et déjà demander à Scaleway une priorité d'accès à la phase pilote.

Quelle différence concrète avec l'annonce Bull-Foxconn-NVIDIA sur le Vera Rubin NVL72 ?

Bull-Foxconn assemble en France des plateformes NVIDIA composées de silicium américain. Scaleway-Vsora-ZML conçoit en France un silicium d'inférence français et l'opère sur un cloud français. Les deux annonces sont complémentaires : l'une renforce la couche d'assemblage matériel souverain, l'autre attaque le verrou de conception du silicium. Pour DORA Article 28, ce sont deux degrés différents d'indépendance que vous pouvez documenter dans votre cartographie ICT.

Le coût par token d'une inférence sur Jotunn8 sera-t-il vraiment plus bas qu'un GPU NVIDIA H100 ?

Vsora annonce une consommation énergétique inférieure de 50 % à celle des puces concurrentes pour un débit de tokens équivalent. La grille tarifaire commerciale Scaleway n'est pas publiée à ce stade. La vérité économique se mesurera début 2027 sur vos propres charges en production. Un DSI averti prépare aujourd'hui un POC comparatif Scaleway H100 contre Scaleway Jotunn8 pour la phase pilote, plutôt que de prendre l'argument pour acquis.

Quels modèles open source pourrai-je déployer sur Scaleway-Vsora dès 2027 ?

ZML assure le portage des principaux modèles open source vers Jotunn8 et l'environnement d'exécution managé exposé par Scaleway. L'architecture est conçue pour faire tourner les mêmes modèles que sur GPU NVIDIA, sans modification applicative côté client : la même API d'inférence, exposée par Scaleway Model-as-a-Service. La liste précise des modèles prioritaires sera publiée par Scaleway à l'ouverture de l'offre.

Une PME ou ETI française qui ne fait pas de gros volumes d'inférence est-elle concernée ?

Oui, à condition que le déploiement IA porte sur un cas d'usage à volume soutenu : chatbot relation client à plusieurs milliers de conversations par jour, mailbot de qualification à plusieurs milliers d'emails traités par jour, agent métier de selfcare. En dessous d'un seuil de volume, le coût d'inférence ne pèse pas assez lourd dans le compte de résultat pour justifier la bascule. Au-dessus, l'arbitrage devient un dossier à présenter à la direction financière, avec ou sans contrainte réglementaire DORA ou NIS2.

Sources et references

  1. [1]
  2. [2]
  3. [3]
  4. [4]
  5. [5]
  6. [6]
  7. [7]
  8. [8]
  9. [9]
  10. [10]
souveraineté IAinfrastructure IAScalewayVsoraVivaTech 2026inférence