Gemini 3.6 Flash : -17 % de prix, que gagne votre chatbot ?
Gemini 3.6 Flash : -17 % de prix, que gagne votre chatbot ?
Google baisse le prix de sortie à 7,50 $/M et génère 17 % de tokens en moins. Recalculez le coût complet de votre chatbot avant tout engagement 2027.
Parler de ce sujet avec Webotit
Google a lancé Gemini 3.6 Flash le 21 juillet 2026 à 1,50 $ et 7,50 $ par million de tokens entrée/sortie, soit -17 % sur le prix de sortie face à 3.5 Flash, avec 17 % de tokens de sortie en moins à tâche équivalente. Pour une DSI qui exploite un chatbot Gemini, la facture peut reculer de 17 % à 31 %. Rouvrez le coût complet (TCO) avant tout contrat pluriannuel : Gemini 4 est déjà annoncé.
Ce que Google a réellement annoncé le 21 juillet
Le 21 juillet 2026, Google a mis en disponibilité générale trois nouveaux modèles Flash : Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, et Gemini 3.5 Flash Cyber.1
Les prix d'interface applicative (API) changent surtout sur la gamme intermédiaire :
- Gemini 3.6 Flash : 1,50 $ par million de tokens en entrée, 7,50 $ en sortie. La sortie descend de 9,00 $ sur 3.5 Flash.19
- Gemini 3.5 Flash-Lite : 0,30 $ en entrée, 2,50 $ en sortie, dans une gamme positionnée frontalement face aux petits modèles concurrents.2
- Gemini 3.5 Flash Cyber : modèle spécialisé cybersécurité, distribué en pilote fermé aux gouvernements et partenaires via CodeMender. Aucun accès commercial public annoncé à date.3
Sur les benchmarks Google, 3.6 Flash monte à 49 % sur DeepSWE contre 37 % pour 3.5 Flash, et à 63,9 % sur MLE Bench contre 49,7 %.4 Le débit atteint environ 304 tokens par seconde.7 La fenêtre de contexte reste à 1 million de tokens en entrée et 64 000 en sortie.1
Gemini 3.6 Flash et 3.5 Flash-Lite sont accessibles depuis Gemini API, Google AI Studio, Android Studio, Vertex AI et Gemini Enterprise Agent Platform.15 Gemini 3.5 Flash Cyber reste limité au pilote CodeMender et n'est pas exposé sur ces plateformes.3 La mise en cache du contexte (context caching) à 0,15 $ par million de tokens (soit 90 % de remise sur le prompt système répété) reste active.5
Dernier signal : Google confirme travailler sur Gemini 4, sans date de sortie.6
Le calcul honnête : jusqu'à -31 % sur la facture chatbot
Prenons une hypothèse chiffrée illustrative, calibrée sur la Gemini Developer API et donc limitée aux seuls tokens de sortie (à volume et prompts d'entrée constants, sans tenir compte du traitement par lots, du cache, du stockage, des appels d'outils, des reprises ni des surcharges Vertex AI qui peuvent en modifier le montant final) :
- Volume hypothétique : 100 000 conversations / mois
- Consommation moyenne : 500 tokens sortie par conversation
- Total : 50 millions de tokens sortie / mois
Sur 3.5 Flash à 9,00 $/M en sortie : 450 $ / mois.9
Sur 3.6 Flash à 7,50 $/M en sortie, à volume constant : 375 $ / mois, soit -17 %.9
Sur 3.6 Flash avec la réduction de 17 % de tokens de sortie annoncée par Google sur l'Artificial Analysis Index : 41,5 M tokens à 7,50 $/M = 311 $ / mois, soit -31 % vs 3.5 Flash.7
Ce n'est pas une facture Vertex AI complète : elle inclurait aussi les tokens d'entrée, le stockage du cache, les appels d'outils, l'orchestration et les éventuelles surcharges de plateforme. Deux vigilances avant de généraliser :
- Le -17 % de tokens de sortie est une moyenne mesurée par Google sur l'Artificial Analysis Index, pas une garantie sur vos propres usages. Sur un chatbot conversationnel court, l'écart peut se réduire à -5 à -10 %.
- Le cache de contexte à 0,15 $/M en entrée rend la remise réelle beaucoup plus forte pour un chatbot avec un prompt système long (persona, politiques, outils). Comptez 60 à 80 % de réduction sur les tokens d'entrée récurrents, à condition de bien architecturer votre appel API.5
Callbot et mailbot : ce qui bouge concrètement
Sur un callbot, la latence perçue par l'appelant se joue à la seconde. Le vrai gain de 3.6 Flash n'est pas le débit (304 tokens par seconde en sortie, proche de 3.5 Flash), c'est le fait que le modèle génère en moyenne 17 % de tokens en moins pour dire la même chose.7 Calcul illustratif : sur une réponse type de 100 tokens, 17 % de tokens en moins font 17 tokens économisés, soit environ 56 ms à 304 tokens par seconde. Ce n'est pas une révolution, mais c'est du temps gagné qui s'accumule sur des appels de 3 à 5 minutes avec 20 à 30 tours de dialogue.
Cela ne remplace pas une pile audio dédiée (transcription bas-latence, synthèse vocale en flux, détection de fin de parole agressive) : c'est un ajustement d'infrastructure LLM, pas une refonte de l'expérience vocale. Pour un centre d'appels d'assurance qui absorberait 30 000 appels débordement / mois (hypothèse illustrative), la vraie marge est ailleurs : le cache de contexte à 0,15 $/M sur le prompt système (persona, politiques de réponse, script d'orientation) peut faire chuter le coût unitaire d'appel de manière substantielle si votre équipe API sait passer la clé cached_content.5
Sur un mailbot, la donne est différente. Un mailbot ne court pas après la milliseconde : il tourne par lots, souvent la nuit. La Batch API de Gemini offre 50 % de remise sur le prix nominal, tous modèles confondus, y compris 3.6 Flash.9 Toujours en scénario Gemini Developer API sortie uniquement (donc hors entrée, cache, stockage et coûts Vertex AI additionnels), un mailbot qui traiterait 200 000 emails / mois avec 800 tokens sortie / email (160 M tokens / mois) passerait d'environ 1 440 $ / mois sur 3.5 Flash (nominal, hors batch) à environ 500 $ / mois sur 3.6 Flash en traitement par lots (132,8 M tokens à 3,75 $/M avec l'efficience de 17 % annoncée par Google, soit ≈ 498 $) — chiffre à titre illustratif, à recalculer sur vos propres données. Trois pièges à connaître : la Batch API décale la réponse de quelques minutes à 24 heures (donc pas de temps réel), le cache ne s'applique qu'aux tokens d'entrée récurrents (pas aux sorties du mailbot), et Vertex AI Batch facture différemment de la Gemini API directe.
Ce que ça change pour une entreprise française
Un directeur relation client ou un DSI d'ETI française qui exploite déjà Gemini 3.5 Flash sur Vertex AI n'a rien à décider avant fin août. La bascule vers 3.6 Flash est un simple changement de nom de modèle dans l'appel API : la structure des prompts, les appels d'outils et la fenêtre de contexte sont identiques.
Trois points de vigilance méritent un arbitrage explicite en CODIR ou en revue trimestrielle DSI :
Souveraineté et RGPD. Vertex AI propose un point d'accès (endpoint) européen multi-région pour Gemini Flash qui garde le trafic à l'intérieur du périmètre européen.8 Attention à la distinction que Google fait entre localisation de l'endpoint et résidence garantie du traitement ML : la région du point d'accès n'implique pas mécaniquement que le traitement reste dans la même région. Avant tout arbitrage DPO ou achats, vérifiez la disponibilité par région (y compris europe-west9 Paris) et la configuration exacte de résidence des données dans la documentation officielle Google Cloud, qui évolue à chaque nouvelle version.10 Selon vos exigences internes de localisation France, Mistral en France ou un déploiement Bedrock à Paris peuvent rester plus simples à défendre.
Contrat pluriannuel et Gemini 4. Google a explicitement laissé entrevoir Gemini 4 lors du lancement du 21 juillet. Signer un engagement Vertex AI de 24 mois sans clause de renégociation du tarif ou de bascule vers Gemini 4 revient à s'engager sur un modèle probablement dépassé début 2027. Demandez à votre commercial Google Cloud une clause de changement de modèle et une clause de révision tarifaire à 12 mois.
Flash Cyber n'est pas pour vous. Le pilote est réservé aux gouvernements et à quelques partenaires stratégiques. Sur le V8 de Chrome, il trouve 55 vulnérabilités uniques contre 47 pour 3.5 Flash standard et 36 pour Claude Opus 4.6.3 Impressionnant, mais sans effet sur votre feuille de route tant que Google n'ouvre pas l'accès commercial. Ne budgétez pas dessus.
Le circuit achats raccourci. Si votre ETI est déjà sur Google Workspace avec un contrat cadre, ajouter Vertex AI Gemini se fait en avenant. Pour une PME qui pilote son support client sur un chatbot maison, c'est souvent la voie la plus rapide vers un chatbot relation client en production, plus rapide qu'un tour d'appel d'offres OpenAI ou Anthropic.
Ce qu'il faut retenir
- Prix : Gemini 3.6 Flash sort à 1,50 $ / 7,50 $ par million de tokens entrée/sortie, soit -17 % sur la sortie face à 3.5 Flash.
- Efficience : -17 % de tokens de sortie à tâche égale selon Artificial Analysis, et un score DeepSWE qui passe de 37 % à 49 % selon Google.
- Impact sur le coût complet du chatbot : entre -17 % et -31 % de facture selon que vous comptez la seule baisse de prix ou l'efficience de tokens annoncée.
- Callbot : 304 tokens par seconde en sortie, environ 56 ms gagnées sur une réponse type de 100 tokens grâce aux -17 % de tokens à tâche égale (calcul illustratif).
- Vigilance : Gemini 4 déjà annoncé — négociez une clause de changement de modèle avant tout engagement au-delà de 12 mois.
Notre recommandation : rouvrez le calcul de coût en septembre
Pas d'urgence à basculer aujourd'hui. Le bon moment est septembre, une fois que les benchmarks indépendants (Artificial Analysis, DeepSWE, MLE Bench en conditions réelles) ont confirmé les chiffres Google et que votre équipe data a mesuré l'écart réel sur vos propres données. D'ici là, trois actions concrètes :
- Comparez sur 500 conversations réelles vos usages actuels entre 3.5 Flash et 3.6 Flash. Mesurez à la fois le coût par conversation et la qualité de réponse (satisfaction interne, taux de transfert vers un agent humain).
- Si vous ne connaissez pas votre coût par conversation, notre simulateur de retour sur investissement chatbot et callbot le calcule à partir de trois paramètres : volume mensuel, coût agent humain moyen, taux de résolution automatisé cible.
- Pour un projet d'agents IA multi-étapes qui empile plusieurs appels LLM (RAG + validation + action), refaites toute la chaîne : le cache de contexte à 90 % de remise change souvent l'arbitrage entre développement interne et achat.
Webotit.ai déploie des chatbots, callbots, mailbots et équipes d'agents IA pour des ETI et grands comptes français, avec un mélange Gemini / Claude / Mistral choisi cas d'usage par cas d'usage. Sur les déploiements Vertex AI, la bascule 3.5 → 3.6 Flash tient dans une modification de configuration. La renégociation Gemini 4 se prépare avec plus d'anticipation.
Questions frequentes
Quel est le prix API de Gemini 3.6 Flash en juillet 2026 ?
Gemini 3.6 Flash est facturé 1,50 $ par million de tokens en entrée et 7,50 $ par million de tokens en sortie, avec un cache de contexte à 0,15 $/M sur les tokens servis par le cache. Le prix d'entrée reste identique à 3.5 Flash, la sortie baisse de 9,00 $ à 7,50 $ selon la grille officielle Gemini Developer API.9
Gemini 3.6 Flash est-il disponible sur Vertex AI en Europe ?
Oui, Gemini 3.6 Flash est accessible via le point d'accès Vertex AI européen multi-région. La disponibilité par région Google Cloud spécifique (dont europe-west9 Paris) évolue à chaque nouvelle version et doit être vérifiée dans la documentation officielle des régions Vertex AI, qui distingue la localisation du point d'accès de la résidence garantie du traitement ML.10
Faut-il basculer un chatbot Gemini 3.5 Flash vers 3.6 Flash tout de suite ?
Non, l'urgence n'existe pas. Comparez d'abord sur 500 conversations réelles vos usages entre les deux modèles, mesurez le coût par conversation et la qualité de réponse, puis basculez si le gain est confirmé. Le bon moment de décision est septembre 2026, après les benchmarks indépendants.
Qu'est-ce que Gemini 3.5 Flash Cyber et est-ce disponible pour une entreprise française ?
Gemini 3.5 Flash Cyber est un modèle spécialisé dans la détection et la correction de vulnérabilités logicielles, distribué via CodeMender en pilote fermé aux gouvernements et à quelques partenaires stratégiques. Aucun accès commercial n'est ouvert pour les entreprises françaises à date.
Comment Gemini 3.6 Flash se compare-t-il aux autres modèles milieu de gamme ?
Gemini 3.6 Flash à 1,50 $ / 7,50 $ (entrée/sortie) se positionne comme un remplaçant direct du 3.5 Flash pour les charges de travail agentiques complexes, avec un meilleur ratio prix/performance revendiqué sur DeepSWE et MLE Bench.4 Le vrai comparatif face à Claude, Mistral ou GPT-5 se fait sur vos propres usages : le prix par token ne dit rien du coût par conversation résolue.
Sources et references
Articles associés

Gemini 3.5 Flash : le piège du Flash premium
Benchmarks, prix réel, premiers retours : analysez Gemini 3.5 Flash avant de remplacer Claude, GPT ou Gemini 3.1 Pro.
Lire
Gemini 3.1 Flash-Lite GA : l'arbitrage coût-volume des ETI
Gemini 3.1 Flash-Lite passe en GA le 7 mai 2026 : 0,25 $ / 1,50 $ par million de tokens, contexte 1M, 2,5x plus rapide. Quoi en faire pour un chatbot ETI.
Lire
GPT-5.4 vs Gemini 3.1 : la guerre des prix LLM profite aux ETI
Analysez la chute de 80% des prix API des LLM en 2026 et son impact concret sur les projets chatbot et agents IA des entreprises françaises.
Lire