Aller au contenu principal
Retour à Outrank
IA Conversationnelle

Natural language understanding : guide complet 2026

Natural language understanding : composants, différences avec NLG et NLP, intégration LLM et RAG, cas d'usage relation client et bonnes pratiques RGPD.

Louis-Clément Schiltz
CEO & Founder, Webotit.ai
15 min de lecture

Parler de ce sujet avec Webotit

En bref

Le natural language understanding (NLU) lit une demande client et en tire trois choses : l'intention, les informations utiles et un niveau de certitude. Il décide de l'orientation, quand le grand modèle de langage se charge de la formulation. Un assistant qui répond bien mais oriente mal a raté cette étape.

« J'ai un souci avec ma facture du 12 ». Derrière cette phrase, il y a peut-être une contestation, un prélèvement refusé, une erreur d'adresse ou une question d'échéance. Un serveur vocal à menus entend le mot facture, puis envoie l'appel vers un parcours général. Le client répète alors son problème à chaque transfert. La compréhension du langage part de l'autre côté. Elle cherche ce que la personne veut obtenir, extrait la date, mesure sa propre certitude, puis oriente.

Ce guide suit l'ordre des questions posées avant une signature. Ce que fait cette brique, ce qu'elle demande à votre entreprise, ce qui casse en production, ce que le RGPD impose et ce qu'il faut exiger d'un fournisseur.

Natural language understanding : comprendre, pas rédiger

Le natural language understanding est la brique qui interprète la demande. Elle rend une intention, des entités (les informations utiles : un numéro de contrat, une date, un produit) et un score de confiance. Elle ne rédige rien. Elle dit de quoi il s'agit, avec quel degré de certitude, et ce que le système a le droit de faire ensuite.

Deux sigles voisins prêtent à confusion. Le NLP (traitement automatique du langage) désigne l'ensemble plus large des techniques de traitement de texte. Le NLG (génération de langage) intervient à l'autre bout de la chaîne, pour écrire la réponse.

BriqueCe qu'elle faitCe qu'elle produit
NLUComprendre la demande et son contexteUne intention, des entités, un niveau de confiance
NLPTraiter et analyser le langage au sens largeUn texte découpé, annoté ou transformé
NLGÉcrire une réponse lisibleUne phrase, un résumé, une reformulation

Sur « résiliez mon contrat », la compréhension retient l'intention de résiliation et le contrat concerné. La génération, elle, produit la phrase qui explique les étapes. Les deux se contrôlent séparément, parce qu'un système peut écrire une réponse polie sur une demande qu'il a mal comprise.

Une direction de la relation client attend cinq effets de cette brique :

  • Structurer les demandes, en transformant une formulation libre en intention, entités et action possible.
  • Réduire les transferts inutiles, en envoyant la demande à la bonne équipe dès le premier échange.
  • Préparer le passage à l'humain, avec un résumé et des champs déjà remplis.
  • Tracer les décisions, pour répondre à un contrôle sans reconstituer la conversation de mémoire.
  • Alimenter le grand modèle de langage avec un contexte qualifié plutôt qu'un message brut.

La recherche française sur le sujet n'est pas neuve. La conférence nationale du traitement automatique des langues s'est tenue pour la première fois en 1994, puis presque chaque année depuis 1997.6

L'usage, lui, reste jeune. En 2021, 6 % des entreprises françaises de dix salariés ou plus utilisaient l'IA.1 Seules 1 % déclaraient analyser des données massives avec le traitement du langage ou la reconnaissance vocale. La moyenne européenne d'adoption tenait à 7 %.1

Un dirigeant achète parfois un assistant fondé sur un grand modèle de langage en croyant acheter un moteur de compréhension. La fluidité d'une réponse ne garantit ni le bon routage, ni l'extraction correcte d'une référence client, ni la maîtrise d'une action sensible. Le premier contrôle porte sur la décision prise, pas sur le style de la sortie.

Quatre étapes pour passer d'une phrase à une décision

Prenons « Je veux résilier ma mutuelle santé avant le 31 mars ». Un moteur de compréhension la traite en quatre temps. Il découpe la phrase, reconnaît l'intention, extrait les informations utiles, puis relie le tout au contexte. À la sortie, l'entreprise ne reçoit pas une réponse. Elle reçoit une étiquette, des champs remplis et un score.

Le découpage prépare le terrain. Il transforme la phrase en unités, traite les accents, la casse et la ponctuation sans effacer les indices utiles. Un client peut dire « je veux arrêter ma complémentaire » ou « comment mettre fin à mon contrat santé ». La forme change, l'objectif reste le même.

La reconnaissance de l'intention compare l'énoncé aux cas que l'entreprise a définis. Elle rend une étiquette, ici la résiliation de contrat, avec un score de confiance. Ce score commande la suite : poursuivre seul, poser une question de clarification, ou passer la main à un conseiller.

L'extraction des entités récupère ce qui rend l'intention exploitable, ici le produit « mutuelle santé » et la date « 31 mars ». Une bonne classification sans extraction fiable n'automatise rien : le dossier arrive incomplet, et le conseiller reprend tout depuis le début.

Le lien au contexte ferme la boucle. Le système analyse les relations entre les mots, puis rapproche les formulations voisines, y compris celles qu'il n'a jamais vues à l'entraînement. Les tests doivent donc se séparer eux aussi : les intentions d'un côté, les entités de l'autre, le contexte à part.

Le comparatif COLE (une évaluation de modèles sur des phénomènes propres à la langue française) réunit 23 tâches et 94 modèles.2 Une moyenne flatteuse peut masquer une faiblesse sur la paraphrase ou la syntaxe. Demandez à votre fournisseur le détail par tâche, pas le score global.

Ce que votre entreprise doit fournir

Un moteur ne se branche pas sur du vide. Il lui faut la liste de vos intentions, écrite à partir de vos conversations réelles et non du catalogue du fournisseur. Il lui faut des exemples annotés par des conseillers et un jeu de test tenu à l'écart de l'entraînement. Il lui faut aussi un accès aux systèmes internes pour vérifier les entités.

Cette matière a une valeur, et elle se négocie avant la signature. Les intentions, les annotations et le jeu de test sont produits par vos équipes, sur vos conversations. Le contrat doit dire qui les possède et sous quelle forme vous les récupérez le jour où vous changez de fournisseur.

Un projet de back-office se sert ensuite de cette structuration pour classer les demandes, pré-remplir un dossier et déclencher une action. Il s'appuie alors sur des agents IA dédiés au back-office.

Le NLU oriente, le modèle de langage rédige

Les deux ne sont pas concurrents, ils occupent deux places dans la chaîne. Le moteur de compréhension aiguille la demande vers le bon service : intention, numéro de dossier, parcours connu ou non. Le grand modèle de langage reformule, résume et explique. L'un décide, l'autre parle.

Avec le RAG (l'assistant va chercher la réponse dans vos documents avant de répondre), le modèle s'appuie sur des sources choisies plutôt que sur sa mémoire.

Un parcours vocal ou écrit suit alors une séquence stable :

  1. Le canal fournit un texte, écrit ou transcrit depuis la voix.
  2. Le moteur de compréhension sort l'intention et les entités.
  3. Un filtre de confiance applique des règles plus strictes aux demandes sensibles.
  4. La recherche documentaire se limite à une base validée.
  5. Le modèle de langage rédige la réponse.
  6. Un conseiller reprend la main quand la confiance baisse ou que l'action engage l'entreprise.

Une résiliation, un paiement ou une modification de contrat ne suivent pas les mêmes règles qu'une question sur les horaires. Le modèle peut expliquer la procédure. L'autorisation de l'acte, elle, reste gouvernée par vos règles métier et par le contrôle d'identité.

La recherche documentaire réduit les réponses inventées, elle ne rend pas une base exacte pour autant. Les sources se versionnent, s'attribuent à un responsable et se retirent quand elles vieillissent. Une base de connaissance IA pour le service client est d'abord un objet de contrôle, ensuite un réservoir de documents.

Faut-il encore un moteur de compréhension avec un grand modèle de langage ?

Je réponds oui dès que la conversation déclenche une action. Un grand modèle sait classer une intention, et il le fait souvent bien. Il le fait sans garantie de stabilité : la même phrase peut recevoir deux étiquettes à deux jours d'intervalle, et vous n'avez pas de score à régler. Une chaîne de décision a besoin d'une sortie stable et rejouable.

Le partage se fait par le risque, pas par la mode. Une question sur les horaires supporte une réponse générée librement. Une résiliation, un remboursement ou une opposition sur une carte demandent une décision explicite, journalisée, que vous pouvez rejouer six mois plus tard devant un contrôleur.

Chat, voix, e-mail : le canal change les règles

Le même moteur ne reçoit pas le même signal selon le canal. Un chat arrive court et lisible. Un e-mail arrive long, désordonné, avec parfois plusieurs demandes dans le même texte. Un appel arrive sous forme de transcription, avec le bruit, les hésitations et les accents. Les erreurs de transcription se propagent ensuite à l'intention et aux entités.

CanalContrainte principaleCe qu'il faut mesurer
Chatbot webVariantes de vocabulaire, contexte de sessionCompréhension, résolution, satisfaction
CallbotBruit, accents, hésitations, erreurs de transcriptionQualité de transcription, incompréhensions, transferts
MailbotLongueur, structure libre, demandes multiplesClassement, extraction, délai de traitement

La voix ajoute une couche de perte, et elle se mesure. Sur le corpus français MEDIA, le meilleur système spécialisé affiche 13,20 % de caractères mal transcrits sur les données de test.7 Une erreur de transcription se propage à l'intention, puis aux entités, puis au dossier transmis au conseiller.

Un chatbot de relation client traite une demande d'attestation, vérifie les informations nécessaires et passe la main quand le dossier sort de son périmètre. Un mailbot de réponse aux e-mails classe le sujet, distingue une réclamation d'une souscription, extrait le numéro de dossier et remet au conseiller un résumé avec des champs pré-remplis.

L'annonce de la machine se joue dès la première seconde. En France, 72 % des personnes se sentiraient trompées si une entreprise ne disait pas dès le départ qu'elles parlent à une IA.3 La même enquête indique que 90 % préfèrent attendre un conseiller humain plutôt qu'un conseiller virtuel, et que 64 % refusent un conseiller assisté par IA.3 Annoncez l'IA, et gardez une sortie humaine visible.

Ce que ça donne selon votre secteur

Le vocabulaire change d'un métier à l'autre, et les intentions avec lui. Une mutuelle qui ouvrirait ce chantier commencerait par ses demandes les plus répétitives : attestation, changement de coordonnées bancaires, suivi de remboursement. Une banque de détail regarderait d'abord l'opposition sur une carte et le suivi d'un virement. Un site marchand partirait du suivi de commande et du retour produit.

La règle reste la même dans les trois cas. Commencez par les demandes répétitives qui n'engagent pas l'entreprise. Gardez sous décision humaine tout ce qui touche à l'argent, au contrat ou à la santé. Mesurez la résolution avant d'élargir le périmètre.

Ce qui échoue en production, et comment le voir venir

Les projets qui déraillent tombent rarement en panne de modèle. Ils échouent sur la préparation, sur le périmètre et sur le pilotage. La démonstration passe, le premier mois passe, puis les demandes réelles arrivent avec leur désordre. Les causes sont peu nombreuses, et chacune se vérifie sans outil particulier.

Les causes d'échec les plus fréquentes

  • Transcription dégradée : le bruit, les accents et les voix qui se chevauchent abîment le texte avant toute compréhension.
  • Intentions trop proches : deux étiquettes voisines produisent un routage instable, et personne ne sait laquelle corriger.
  • Entités non reliées aux systèmes internes : le dossier arrive incomplet, le conseiller reprend tout depuis le début.
  • Base documentaire périmée : la recherche renvoie une procédure retirée, et la réponse est fausse avec assurance.
  • Seuil de confiance figé : réglé une fois au lancement, il ne suit ni les campagnes ni les nouvelles offres.
  • Sortie humaine théorique : l'escalade existe sur le schéma, personne ne décroche derrière.
  • Dérive du vocabulaire : les formulations changent avec vos offres, le modèle reste sur celles d'hier.

Les erreurs des premiers projets

  • Écrire les intentions depuis le catalogue du fournisseur plutôt que depuis vos conversations.
  • Prendre la démonstration pour la production, alors qu'elle ne montre que les phrases qui marchent.
  • Ouvrir le périmètre aux actes qui engagent l'entreprise dès le premier mois.
  • Suivre le taux de réponse plutôt que la résolution : un assistant qui répond toujours peut résoudre rarement.
  • Lancer sans jeu de test annoté, donc sans moyen de comparer deux versions.
  • Laisser chez le fournisseur les annotations produites par vos conseillers.
  • Traiter le projet comme une livraison, quand il demande une revue mensuelle.

Les indicateurs à suivre

Un tableau de bord utile relie la qualité du langage à un résultat métier. Une intention bien classée qui déclenche le mauvais traitement ne vaut rien. Un transfert vers un conseiller peut être un succès, s'il arrive parce que le système a reconnu la complexité du dossier. Quatre familles suffisent : compréhension, transcription, effet sur les opérations, satisfaction client.

BlocCe que vous suivezSignal d'alerteFréquence
AutonomieDemandes résolues sans conseiller, transferts justifiésRésolution sans conseiller sous les 70 %Hebdomadaire
QualitéIntentions correctes, entités extraites, satisfaction, ré-appelsHausse des incompréhensions ou baisse de satisfactionHebdomadaire
ÉconomieCoût par contact, délai de retour sur investissementCoût stable sans gain de résolutionMensuelle
ConformitéTraces conservées, incidents, information donnée au clientTrace manquante ou escalade indisponibleMensuelle

Les mesures de laboratoire viennent d'un jeu de test annoté et servent à comparer deux versions. Les mesures de production viennent des conversations réelles. Faites tourner une nouvelle version en observation, sans lui confier la décision, avant de la mettre en production.

Le réglage du seuil de confiance mérite un point mensuel. Trop prudent, il transfère des conversations que le système savait traiter. Trop bas, il laisse passer des erreurs sur des demandes sensibles. Gardez un échantillon de conversations, faites annoter les erreurs par des conseillers, et réentraînez sur des erreurs observées plutôt que sur une impression de baisse.

Un tableau ne dit jamais d'où vient une baisse. Une transcription dégradée abîme l'intention, un modèle peut reformuler une demande hors périmètre, une recherche documentaire peut remonter le mauvais document. Chaque seuil franchi déclenche donc une vérification humaine, puis la correction du composant en cause.

Un calcul d'ordre de grandeur avec vos volumes

Prenons un service client qui reçoit 9 000 appels par mois. Supposons qu'un tiers de ces appels concerne le suivi d'un dossier déjà ouvert. Le gain brut se calcule en trois temps. Ce volume, multiplié par la part que l'assistant traite seul, multipliée par le coût moyen d'un appel pris par un conseiller.

Retranchez ensuite le coût de la plateforme, celui des connexions à vos logiciels, et le temps que vos conseillers passent à annoter. Ce que vous obtenez reste une borne haute, pas un retour sur investissement. La borne basse suppose que la part traitée seule tombe de moitié après six mois de dérive.

Le même calcul vaut à l'écrit. Si vous traitez 5 000 e-mails par mois et que le classement automatique fait gagner quelques minutes par message, comptez d'abord en heures de conseiller. Les euros viennent ensuite. Comparez ces heures au coût complet de la solution, licence, intégration et pilotage compris.

Je préfère cette formule aux promesses de gain affichées en pourcentage. Elle oblige à nommer trois chiffres qui sont les vôtres : le volume, la part automatisable et le coût par contact. Les trois se discutent avec votre direction financière avant de se discuter avec un fournisseur.

RGPD : ce que le texte impose à un assistant qui comprend

Un assistant qui lit des demandes clients traite des données personnelles. Le RGPD s'applique dès qu'un système d'IA collecte ou utilise ces données.4 Trois articles portent l'essentiel pour un projet conversationnel.9 Il s'agit de l'article 5 pour les principes, l'article 6 pour la base légale, l'article 22 pour les décisions entièrement automatisées.

L'article 5 fixe les principes que la CNIL rappelle aux professionnels : licéité, finalité, minimisation, exactitude, limitation de la conservation, sécurité.4 Un assistant RH qui traite un nom et un historique de demandes entre dans ce cadre comme un traitement de données ordinaire.

L'article 6 impose une base légale, choisie avant l'entraînement et avant la mise en service. Six bases sont possibles. Le contrat, l'obligation légale, l'intérêt légitime et le consentement, les plus courantes pour un service client, n'ouvrent pas les mêmes droits et ne se documentent pas de la même façon. Choisir cette base après le développement revient à découvrir tard qu'un parcours envoie au modèle des données qu'il ne devait pas voir.

L'article 22 encadre les décisions entièrement automatisées qui produisent des effets juridiques ou affectent la personne de manière significative. La personne peut alors obtenir une intervention humaine, exprimer son point de vue et contester la décision. Un refus prononcé de bout en bout par un assistant relève de cet article.

Trois autres obligations se vérifient aussi vite.9 Informez les personnes au début de l'interaction (article 13). Signez un contrat écrit avec le prestataire qui traite les données pour votre compte (article 28). Menez une analyse d'impact quand le traitement présente un risque élevé pour les personnes concernées (article 35).

La CNIL rappelle que le règlement européen sur l'IA complète le RGPD sans le remplacer.5 Ses recommandations sur le développement des systèmes d'IA placent ces arbitrages au moment de la conception, pas à la revue juridique d'avant lancement.8

Six contrôles tiennent dans une page :

  • Base légale définie avant l'entraînement et avant la mise en service.
  • Annonce de l'IA au début de l'interaction.
  • Minimisation des données envoyées au modèle et conservées dans les journaux.
  • Traçabilité de l'intention, des entités, du score et du transfert.
  • Reprise en main par un conseiller réellement disponible aux heures d'ouverture.
  • Durée de conservation revue selon la finalité du traitement.

La traçabilité sert la performance autant que la conformité. L'intention retenue, le score, les documents consultés et le moment du transfert se conservent ensemble. Sans cette trace, une réclamation se traite de mémoire, et une nouvelle version se déploie sans savoir ce que l'ancienne faisait.

Ce que je vérifierais avant de signer

Je me méfie des démonstrations qui portent sur la beauté de la réponse, parce qu'elles montrent la partie facile. Demandez plutôt le journal d'une conversation ratée. Quelle intention a été retenue, avec quel score, et pourquoi le système a continué au lieu de passer la main ? Un fournisseur incapable d'afficher cet écran vend un générateur de texte, pas une chaîne de décision.

Les questions à poser, et ce qu'une bonne réponse contient

  • Qui possède les intentions, les annotations et le jeu de test produits par mes conseillers ? Une bonne réponse nomme le propriétaire dans le contrat et prévoit l'export dans un format lisible.
  • Comment mesurez-vous la compréhension, et sur quel jeu de test ? Une bonne réponse sépare le jeu d'entraînement du jeu de test et montre le détail par intention.
  • Que se passe-t-il quand la confiance est basse ? Une bonne réponse décrit un seuil réglable, une question de clarification, puis un transfert vers un conseiller identifié.
  • Comment le système se comporte-t-il sur une transcription dégradée ? Une bonne réponse propose un test sur vos enregistrements, pas sur ceux du fournisseur.
  • Quelles données partent vers le modèle, où sont-elles hébergées, combien de temps sont-elles conservées ? Une bonne réponse tient dans un tableau, avec le nom du sous-traitant et le pays.
  • Qui met à jour la base documentaire, et comment retire-t-on une procédure périmée ? Une bonne réponse nomme un responsable et une date de revue.
  • Que coûte un changement de vocabulaire commercial : réentraînement inclus, facturé, ou impossible ? Une bonne réponse donne le délai et le prix avant la signature.

Mon opinion tient en une phrase : jugez la chaîne complète, pas le modèle. Le meilleur moteur d'un comparatif public peut échouer chez vous. Vos clients ne parlent ni comme un jeu de test ni comme une démonstration commerciale.

La décision de cette semaine ne coûte rien. Sortez une centaine de conversations réelles, anonymisez-les, et demandez à deux fournisseurs de les faire passer dans leur chaîne. Comparez les intentions retenues, les entités extraites et les scores, pas les phrases produites. C'est le test que je vous propose de faire passer à nos agents IA pour la relation client : réservez un échange, vos conversations sous le bras.

FAQ sur la compréhension du langage en relation client

Combien de temps faut-il pour un premier périmètre utile ?

Cela dépend du nombre d'intentions et de l'accès à vos systèmes. Un périmètre limité à quelques demandes répétitives, sans acte qui engage l'entreprise, se cadre en quelques semaines. Le délai vient rarement du modèle. Il vient des accès techniques, des validations juridiques et de la disponibilité de vos conseillers pour annoter.

Faut-il beaucoup de données pour démarrer ?

Ce sont vos exemples réels qui comptent, plus que leur volume. Des phrases annotées par des conseillers, prises dans vos conversations, valent mieux qu'un corpus générique acheté sur étagère. Le jeu de test pèse autant que le jeu d'entraînement, et il ne doit jamais servir à entraîner le modèle.

Comment annoncer l'IA sans faire fuir le client ?

Dites-le en une phrase, au début, et donnez la sortie humaine dans la même phrase. Ce qui inquiète le client, c'est de comprendre qu'aucune personne ne sera joignable. Une annonce courte, suivie d'une option claire pour parler à un conseiller, tient mieux qu'un long avertissement juridique.

Le moteur fonctionne-t-il dans une autre langue que le français ?

Cela dépend du modèle, et surtout des tests. Demandez les résultats par langue, sur vos propres phrases, pas une moyenne. Les abréviations, les tournures régionales et les fautes de frappe pèsent souvent plus lourd que la langue elle-même dans la qualité de la compréhension.

Que devient le moteur quand mes offres changent ?

Il se dégrade, doucement. Les nouvelles offres apportent des mots que le système n'a jamais vus, et les demandes glissent vers une intention voisine. Prévoyez une revue mensuelle du seuil de confiance et un réentraînement fondé sur des erreurs observées, pas sur une impression générale.

Sources et references

  1. [1]ActuIA : seulement 6 % des entreprises françaises utilisent l'IA (Eurostat)
  2. [2]arXiv : publication de recherche sur le comparatif COLE
  3. [3]Ipsos : Observatoire des services clients 2025
  4. [4]CNIL : IA, comment se mettre en conformité
  5. [5]CNIL : règlement européen sur l'IA, questions-réponses
  6. [6]ATALA : archives de la conférence TALN
  7. [7]Hugging Face : modèle de compréhension entraîné sur le corpus MEDIA
  8. [8]CNIL : recommandations pour le développement des systèmes d'IA
  9. [9]EUR-Lex, Règlement (UE) 2016/679 du 27 avril 2016 (RGPD), articles 5, 6, 13, 22, 28 et 35
natural language understandingNLU chatbotNLU et LLMNLU RGPDNLU relation client