Aller au contenu principal
Retour à Comparatif
Callbot

MAI-Voice-2 : ce que la voix native Azure change pour un callbot ETI

Microsoft lance MAI-Voice-2 le 2 juin 2026 : voix native Azure à 22 $/M caractères, 15 langues dont le français, latence temps réel. Ce que ça change.

Louis-Clément Schiltz
CEO & Founder, Webotit.ai
8 min de lecture

Parler de ce sujet avec Webotit

En bref

Microsoft a annoncé MAI-Voice-2 le 2 juin 2026 à Build : voix native Azure en 15 langues (18 locales) dont le français, latence temps réel visée sous 300 ms pour la variante Flash, prix 22 $ par million de caractères en preview Foundry. Pour une DSI d'ETI sous Azure, c'est un benchmark obligatoire avant de signer une stack callbot, mais pas un remplaçant de la couche métier.

Si vous êtes une ETI française sous Azure et que vous avez un projet callbot ouvert ou en cours d'arbitrage, la question a changé entre fin mai et aujourd'hui.

Microsoft ne se contente plus d'orchestrer des modèles tiers. Microsoft veut posséder la couche voix de son propre Copilot.

Ce que Microsoft a annoncé exactement le 2 juin 2026

À Build 2026, l'équipe MAI a dévoilé plusieurs modèles internes. Trois concernent la voix et la parole : MAI-Voice-2 pour la synthèse, une variante Flash orientée temps réel, et MAI-Transcribe-1.5 pour la reconnaissance.1

MAI-Voice-2 couvre 15 langues et 18 locales, dont le français de France (par exemple la voix fr-FR-Soleil), l'allemand, l'italien, l'espagnol d'Espagne et du Mexique, le portugais du Brésil et du Portugal, le néerlandais et le chinois simplifié.2 Il propose le clonage de voix à partir d'un court extrait de référence — encadré, comme toute voix personnalisée sur Azure, par une procédure d'accès limité et de consentement —, des personas de locuteur définies, et la génération multi-locuteurs dans un même flux.6

La variante Flash vise un temps avant premier paquet audio inférieur à 300 millisecondes en streaming.3 À noter : la documentation Azure Speech précise que le modèle privilégie le naturel et l'expressivité, et n'est pas d'abord conçu pour les scénarios les plus sensibles à la latence.56 Le chiffre sub-300 ms reste donc à confirmer sur votre propre chaîne téléphonique.

Le modèle est facturé 22 dollars par million de caractères dans Azure AI Foundry, en preview ouverte aux clients Azure.1 Aucune date GA précise n'est publiée pour l'Europe, ni de grille Foundry détaillée par région.

22 dollars par million de caractères : ce que cela facture vraiment

22 dollars par million de caractères, ce n'est pas un chiffre à comparer brut à un tarif par minute ou par token. Voici, à titre purement illustratif, ce que cela peut représenter en charge utile — les volumes ci-dessous sont des hypothèses de calcul, pas des données observées.

Prenons l'hypothèse d'un appel callbot de 3 à 5 minutes en assurance ou en banque. Si la voix synthétisée occupe environ la moitié du temps de parole, cela fait 2 à 3 minutes de TTS. À une cadence française parlée standard de 800 à 1 200 caractères par minute, on synthétise de l'ordre de 2 000 à 3 600 caractères par appel.

Au tarif Foundry, un tel appel coûterait donc entre 4 et 8 centimes de dollar en TTS seul. Sur une hypothèse de 10 000 appels par mois, cela situe la couche TTS entre 400 et 800 dollars mensuels. Ces ordres de grandeur ne servent qu'à cadrer un budget : vos volumes réels, votre longueur de scripts et votre format audio décalent le résultat.

Ces montants ne couvrent ni la reconnaissance vocale (MAI-Transcribe-1.5 ou Azure Speech), ni le LLM de décision, ni la téléphonie SIP, ni l'orchestration. La voix nette de Microsoft, ce n'est que la dernière brique de la chaîne. La facture totale d'un callbot reste dominée par le LLM, comme nous l'avons décortiqué dans la stack callbot 2026.

Sur le seul critère prix, MAI-Voice-2 se positionne comme un benchmark intéressant face aux fournisseurs de TTS établis. Sur les critères qui pèsent vraiment — qualité prosodie française, robustesse au bruit téléphonique, support des accents francophones non métropolitains — le verdict ne tombera qu'après vos propres tests d'écoute.

Real-time voice agents Copilot Studio : la couche d'au-dessus

Le sujet n'est pas seulement le modèle. C'est la couche d'orchestration que Microsoft assemble autour.

Microsoft a annoncé la disponibilité générale des Real-time voice agents dans Copilot Studio, en Amérique du Nord, sur Dynamics 365 Contact Center.4 L'architecture est explicitement speech-to-speech avec interruption (barge-in) et raisonnement temps réel, pour les cas d'usage standards d'un contact center : facturation, prise de commande, vérification d'éligibilité, prise et déplacement de rendez-vous, gestion de compte ou d'adhésion. Le contexte client est conservé automatiquement lors d'une escalade vers un agent humain — le pattern que les directions relation client réclament depuis des années, et que beaucoup de plateformes voix tierces gèrent encore mal.

Point important : la brique temps réel de Copilot Studio repose aujourd'hui sur des modèles hébergés en Amérique du Nord, et non sur MAI-Voice-2 lui-même.4 Autrement dit, « voix native Azure » recouvre deux briques distinctes : le modèle de synthèse MAI-Voice-2, et l'orchestration voix temps réel de Copilot Studio. Les deux avancent en parallèle, pas au même rythme.

Concrètement : si vous êtes déjà engagé sur Microsoft 365, Dynamics 365 ou Power Platform, votre direction métier va probablement vous demander un POC voix Microsoft cette année. Mais la GA n'est pour l'instant que nord-américaine. Pas de date publique pour la France. Pas de couverture francophone Dynamics 365 Contact Center confirmée.

Trois façons de se positionner, selon votre stack

Plutôt que des profils d'entreprises, voici trois configurations types — hypothétiques — et la posture rationnelle pour chacune.

Si vous êtes déjà sous Dynamics 365 Contact Center. Le POC de la variante Flash en preview Foundry peut se lancer en parallèle de la stack actuelle, sans toucher à la production. L'objectif : valider la qualité prosodie française sur un échantillon d'appels réels, mesurer la latence end-to-end sur votre SIP, comparer le coût total avec votre TTS actuel. Le risque produit est faible, et la donnée brute arme l'arbitrage budgétaire.

Si vous êtes sur Azure sans Dynamics 365 Contact Center. La preview Foundry suffit techniquement pour tester la brique voix. Mais MAI-Voice-2 ne résout aucun des sujets qui décident vraiment d'un déploiement : connexion sécurisée au SI, conformité sectorielle (ACPR côté assurance, RGPD sur les données personnelles), orchestration métier des transferts vers un conseiller humain. La couche modèle ne fait qu'une fraction du chemin.

Si vous exploitez déjà un callbot custom sur des fournisseurs de voix tiers. Aucune urgence à basculer. MAI-Voice-2 peut entrer comme TTS de secours dans une stratégie multifournisseurs, pour éviter la dépendance à un seul éditeur de voix : un router en sortie de LLM qui choisit le fournisseur habituel en routine et bascule sur MAI-Voice-2 en débordement ou sur des langues moins bien servies. Même logique que le multi-LLM côté texte — le coût et la résilience priment sur la fidélité à une marque.

Ce que MAI-Voice-2 ne change pas : la couche métier

Voici le piège classique quand un grand acteur sort un modèle voix de qualité.

L'équipe achat regarde le prix par caractère, l'équipe DSI regarde la latence, l'équipe métier regarde la démo, et tout le monde oublie que la voix n'est qu'une fraction d'un callbot qui tient en production.

Le reste, c'est la connaissance métier. Le callbot d'une banque doit distinguer une demande d'opposition de carte d'un signalement de fraude. Le callbot d'une mutuelle doit séparer un remboursement courant d'un dossier de tiers payant. Le callbot d'un e-commerçant doit rattacher un retour produit à un statut de commande dans le WMS. Aucun de ces sujets n'est résolu par un modèle voix natif Azure.

Ce qui reste à construire après MAI-Voice-2 : l'orchestration métier, les garde-fous sur le périmètre du callbot, la connexion sécurisée au SI, le routage vers un humain compétent, la mesure du taux de résolution réel, et la conduite du changement côté équipes terrain. Un chantier spécialisé de plusieurs mois, quelle que soit la couche voix choisie.

C'est précisément le rôle que joue Webotit sur la couche agents IA d'orchestration, et c'est le sujet qu'il faut chiffrer avant de signer une stack callbot complète.

Ce que ça change pour une entreprise française

Trois recommandations concrètes à porter en CODIR.

Pour une DSI sous stack Microsoft 365 et Dynamics 365 : ouvrir un POC MAI-Voice-2 dans Foundry. Ne signez pas d'engagement avec un éditeur de voix tiers avant d'avoir mesuré la qualité française sur vos propres appels. Les Real-time voice agents de Copilot Studio arriveront en Europe dans un second temps, et vous avez intérêt à préparer dès maintenant votre cartographie de modèles voix éligibles.

Pour une direction relation client ou expérience client : MAI-Voice-2 n'est pas un produit prêt à déployer. C'est un modèle de base que Microsoft empaquette dans Copilot Studio. La question n'est pas « est-ce qu'on bascule sur Microsoft voix ? », mais « est-ce qu'on construit notre couche métier sur Copilot Studio ou sur une stack indépendante ? ». La réponse dépend de votre dépendance Azure existante, de votre conformité sectorielle et de votre besoin de portabilité multicloud.

Pour un DAF qui doit arbitrer un budget callbot : intégrez la baisse probable du coût TTS dans vos hypothèses, mais ne capitalisez pas la totalité de l'économie. Le coût LLM, le coût d'orchestration et le coût d'intégration métier ne baissent pas avec MAI-Voice-2. La couche voix native rejoint la même logique de facturation à la consommation que nous avons documentée pour Claude Code Agent SDK le 15 juin 2026 : forfait sur la couche humaine, consommation sur la couche agent.

Webotit est un acteur français de l'IA conversationnelle, spécialisé sur les callbots multilingues et la couche d'orchestration métier qui va autour. Notre approche est agnostique sur le modèle voix : MAI-Voice-2 entre dans le champ des briques que nous benchmarkons, au même titre que les fournisseurs de TTS établis.

La voix native Azure va vraisemblablement devenir un standard de marché sous 12 mois. Le débat ne porte plus sur la qualité du TTS, il porte sur le contrôle de la couche métier.

Vous avez un projet callbot à arbitrer ou un POC à cadrer avant la fin du trimestre ? Discutez-en avec nos équipes Webotit pour comparer Copilot Studio, une voix tierce et une stack indépendante sur votre cas réel — sans pitch, avec les chiffres.

Questions frequentes

Qu'est-ce que MAI-Voice-2 et en quoi diffère-t-il d'Azure Speech ?

MAI-Voice-2 est un modèle de synthèse vocale interne de Microsoft, présenté à Build 2026 et disponible en preview publique dans Azure Speech (Foundry). Il apporte une couverture multilingue, un clonage de voix soumis à validation, et une intégration à Copilot Studio. Les voix Azure Speech historiques restent disponibles ; Microsoft positionne MAI-Voice-2 comme la nouvelle génération, encore en preview.

Le français est-il vraiment supporté par MAI-Voice-2 ?

Oui. La documentation Microsoft liste des voix françaises de France pour MAI-Voice-2 (par exemple fr-FR-Soleil), aux côtés de l'allemand, l'italien, l'espagnol, le portugais et le néerlandais. La qualité prosodie française doit toutefois être validée par vos propres tests d'écoute, en conditions téléphoniques et avec votre vocabulaire métier.

Quel est le vrai coût d'un callbot construit sur MAI-Voice-2 ?

Le tarif public est de 22 $ par million de caractères en preview Foundry. À titre illustratif, pour un appel de quelques minutes, cela représente quelques centimes de TTS seul ; l'addition mensuelle dépend directement de vos volumes. Surtout, la voix ne représente qu'une part de la facture totale : le LLM de décision, la téléphonie SIP, la transcription et l'orchestration métier dominent le coût final.

Faut-il abandonner sa stack callbot actuelle pour MAI-Voice-2 ?

Pas avant d'avoir mesuré trois points : la qualité prosodie française sur un échantillon d'appels réels, la latence end-to-end avec votre téléphonie SIP, et le coût total intégré (pas le seul coût TTS). Pour une organisation déjà sous Dynamics 365, un POC en preview Foundry se justifie. Pour un callbot custom existant, MAI-Voice-2 entre plutôt en multifournisseurs qu'en remplacement.

Quand MAI-Voice-2 sera-t-il en GA en France et en Europe ?

Microsoft n'a pas publié de date GA précise par région à ce jour. Côté orchestration, les Real-time voice agents de Copilot Studio sont en GA en Amérique du Nord sur Dynamics 365 Contact Center, avec une expansion internationale annoncée sans calendrier ferme. La couverture francophone complète sur la couche orchestration reste à confirmer.

Sources et references

  1. [1]
  2. [2]
  3. [3]
  4. [4]
  5. [5]
  6. [6]
MicrosoftMAI-Voice-2AzurecallbotDSIvoix IACopilot Studio