Conformité au RGPD pour l'IA conversationnelle
Conformité au RGPD pour l'IA conversationnelle
Maîtrisez la conformité au RGPD de vos agents IA et chatbots. Bases légales, minimisation, droits, sécurité et checklist pratique pour un déploiement serein.
Sommaire
- Ce que le RGPD couvre dans un agent conversationnel
- Les cinq articles du RGPD qui commandent votre architecture
- Minimiser avant le modèle, effacer partout
- Sécuriser les flux et prouver ce que fait l'agent
- Service en ligne ou installation chez vous : comment trancher
- Les pannes de conformité arrivent après la mise en service
- Les questions à poser avant de signer
- FAQ sur le RGPD et les agents conversationnels
Parler de ce sujet avec Webotit
La conformité au RGPD d'un agent IA se prouve dans l'architecture, pas dans une politique de confidentialité. Vous devez savoir quelles données entrent, qui les traite, combien de temps elles restent et comment les effacer partout. Base juridique, minimisation avant le modèle, journaux exploitables et contrats de sous-traitance forment le socle vérifiable.
La CNIL a reçu 17 772 plaintes en 2024 et traité 5 629 notifications de violation de données personnelles la même année.1 Ces volumes décrivent un travail de contrôle continu, pas un risque théorique. Pour un DPO (le délégué à la protection des données), une DSI ou une direction de la relation client, tout se ramène à une question. Que devient une donnée personnelle une fois entrée dans votre agent conversationnel ?
Ce guide suit l'ordre dans lequel les décisions se prennent. Le périmètre réel du traitement, les articles qui s'appliquent, la base juridique, la minimisation, puis la sécurité, l'hébergement, les pannes observées et les questions à poser avant de signer. Lisez-le en entier, ou sautez à la section qui bloque votre projet.
Ce que le RGPD couvre dans un agent conversationnel
Le RGPD couvre tout ce que votre agent touche, pas seulement la fenêtre de discussion. Il s'applique à tout ce qui entre, circule et reste dans l'agent, et la liste est plus longue qu'on ne croit. La conformité devient une propriété de l'architecture. Elle se démontre avec des configurations, des durées et des preuves exportables.
Un chatbot à règles suit un chemin borné. Il collecte des champs, applique une règle, transmet une information au CRM. Un agent fondé sur un grand modèle de langage reçoit du texte libre et produit une réponse probable. Le traitement change alors de nature, et il change surtout de taille.
Le périmètre déborde la fenêtre de conversation
Sept endroits abritent des données personnelles dans un agent conversationnel. Les oublier dans le registre rend un contrôle inconfortable, parce que l'inventaire ne décrit plus la production.
- Les messages saisis par la personne, y compris ce qu'elle écrit sans qu'on le lui demande.
- Les instructions envoyées au modèle, qui embarquent souvent l'historique et des étiquettes internes.
- Les réponses produites, qui reformulent ou déduisent parfois une information sensible.
- Les documents retrouvés par la recherche documentaire, avec leurs étiquettes et leur dossier d'origine.
- La mémoire gardée entre deux visites, qui rattache un souvenir à une personne identifiable.
- Les journaux d'orchestration et de sécurité, qui conservent parfois le texte entier des échanges.
- Les jeux d'évaluation et les données de réglage fin, quand ils viennent de vraies conversations.
La mémorisation involontaire arrive vite. Une mémoire longue durée retient une préférence, un incident ou une information familiale qu'aucune règle métier n'a demandée. Séparez le contexte de la conversation en cours, la mémoire utile au service et les journaux nécessaires à la sécurité.
L'inférence pose le problème inverse. Un échange banal permet parfois de déduire une situation de santé, une opinion ou une fragilité. Analysez ce que le système produit et déduit, pas seulement les champs que vous aviez prévu de collecter.
Une base vectorielle (la mémoire qui range vos documents pour que l'agent les retrouve) n'est pas anonyme par nature. Avec la recherche documentaire, ou RAG (l'assistant va chercher la réponse dans vos documents avant de répondre), les extraits et leurs étiquettes permettent souvent de remonter à un dossier. Ils doivent être indexés, protégés et supprimables comme le reste du traitement.
Le fournisseur du modèle ajoute une question de maîtrise. Envoyer des instructions vers une interface hébergée hors UE demande une analyse des rôles, des garanties contractuelles et de la conservation réelle. La promesse commerciale de ne pas entraîner un modèle avec vos données ne remplace pas la description du flux.
Le réglage fin complique enfin l'effacement. Si des données clients ont influencé un modèle, supprimer la ligne d'origine ne suffit pas toujours à démontrer que l'influence a disparu. Le plus simple reste de ne pas mélanger données personnelles et entraînement quand l'usage ne l'exige pas.
La CNIL demande d'examiner la mémorisation éventuelle de données personnelles : l'application du RGPD au modèle lui-même dépend de ses capacités et de la documentation de cette analyse. Elle recommande aussi de placer des filtres fiables dans le système qui encapsule le modèle.5
Ce que la CNIL contrôle, en chiffres
La CNIL a prononcé 83 sanctions en 2025, pour 486 839 500 € cumulés, dont 78 amendes et 27 assorties d'injonctions sous astreinte.2 Une injonction sous astreinte oblige à corriger une configuration réelle, dans un délai fixé, avec une preuve à produire. Une conformité qui n'existe que sur le papier échoue à ce moment-là.
Le contrôle ne se limite pas aux sanctions. En 2025, la CNIL a mené 323 contrôles et rendu 259 décisions, dont 143 mises en demeure.3 Le plafond légal atteint 20 millions d'euros ou 4 % du chiffre d'affaires annuel mondial, le montant le plus élevé étant retenu.4
La conséquence pour un projet d'agent conversationnel tient en une phrase. Le registre, les durées de conservation, la liste des accès et les journaux doivent sortir en quelques jours, sans reconstituer l'histoire du projet dans l'urgence.
Les cinq articles du RGPD qui commandent votre architecture
L'essentiel tient en cinq articles.8 L'article 5 pose les principes, l'article 6 la base juridique, l'article 9 les données sensibles, l'article 32 la sécurité, l'article 83 les sanctions. Deux d'entre eux méritent une section à part, la base juridique et les données sensibles, parce qu'ils décident de votre architecture.
- Article 5 : licéité, loyauté et transparence, limitation des finalités, minimisation, exactitude, limitation de la conservation, intégrité et confidentialité, et obligation de prouver tout cela. Chaque principe devient une configuration dans l'agent.
- Article 6 : une base juridique par finalité. Un agent qui répond, personnalise et alimente un tableau de bord poursuit trois finalités, donc trois bases à justifier.
- Article 9 : traitement interdit par principe pour la santé, l'origine ou les opinions, sauf conditions particulières. Un message libre en apporte sans prévenir.
- Article 32 : sécurité adaptée au risque, chiffrement, disponibilité, et tests réguliers de l'efficacité des mesures. Pour un agent, il commande le cloisonnement et la journalisation.
- Article 83 : sanctions, avec un plafond qui atteint 20 millions d'euros ou 4 % du chiffre d'affaires annuel mondial, le plus élevé des deux.4
Une analyse d'impact sur la protection des données (article 35) s'ajoute quand le traitement présente un risque élevé pour les personnes. Un agent qui traite des demandes de santé, qui note des clients ou qui décide seul d'un refus entre dans cette zone. Menez l'analyse avant la mise en production, pas après le premier incident.
Article 6 : la base juridique se choisit avant le modèle
La base juridique se choisit avant l'outil. Elle dépend de la finalité, de la relation avec la personne et des données vraiment nécessaires au service. Un même agent poursuit souvent plusieurs finalités. Chacune a alors sa base, sa durée de conservation, sa configuration et ses preuves techniques.
Formulez la finalité en une phrase testable. « Répondre à une question sur un contrat en cours » se vérifie dans un registre. « Améliorer l'expérience grâce à l'IA » ne guide ni analyse d'impact ni contrôle de configuration.
Les six bases de l'article 6 ne se valent pas pour un agent conversationnel.
- Exécution du contrat : couvre les données nécessaires à la réponse attendue. Elle ne couvre pas l'analyse de sentiment, la personnalisation commerciale ni la réutilisation des conversations pour entraîner un modèle.
- Obligation légale : s'applique quand un texte impose de conserver, vérifier ou transmettre une information. Le registre cite l'obligation et la règle technique qui y répond.
- Intérêts vitaux : reste exceptionnelle. Elle ne justifie pas un agent généraliste qui collecterait largement des informations sensibles.
- Mission d'intérêt public : concerne une organisation investie d'une mission définie par le droit. Les instructions, les sources documentaires et les actions de l'agent restent dans ce périmètre.
- Consentement : doit rester libre, précis, éclairé et retirable. Une case unique qui couvre l'assistance, la personnalisation et l'entraînement ne donne pas ce niveau de détail.
- Intérêt légitime : suppose une mise en balance écrite. Une analyse de sentiment doit démontrer son utilité, limiter les données traitées et prévoir une opposition qui produit un effet réel.
Le retrait du consentement doit se propager aux mémoires, aux historiques et aux files de réutilisation. Une base qui rend ce retrait impraticable vous expose, quelle que soit sa commodité sur le papier. La CNIL détaille les droits des personnes sur leurs données, et ces droits pèsent sur le choix de la base autant que sur l'interface.6
Article 9 : les données sensibles arrivent par le texte libre
Un agent reçoit des données sensibles sans les avoir demandées. Une personne écrit sa maladie pour justifier un retard, son appartenance syndicale pour contester une décision, ou l'état de santé d'un proche. L'article 9 ajoute ses propres conditions à ces informations, et le choix d'une base de l'article 6 ne suffit jamais.
Filtrez avant l'envoi au modèle quand l'information n'est pas indispensable. Décidez ensuite si le parcours continue sans elle, et gardez par écrit la justification de ce choix.
La transparence doit correspondre au moment réel de la collecte. Les personnes doivent savoir si leurs échanges peuvent servir à entraîner un modèle ou rester en mémoire. Un paragraphe enfoui dans la politique générale ne remplace pas une mention affichée là où la donnée se saisit.
Minimiser avant le modèle, effacer partout
Minimiser, c'est empêcher une donnée inutile de traverser les couches de l'agent, bien au-delà du nombre de champs affichés. Le risque se loge souvent dans le contexte préparé automatiquement, quand l'orchestrateur injecte trop de documents, trop d'étiquettes ou tout l'historique. L'orchestrateur, c'est le logiciel qui pilote les échanges entre l'utilisateur, le modèle et vos outils.
Réduire la donnée avant qu'elle parte vers le modèle
Un dispositif utile sépare trois gestes : détecter, transformer, autoriser. Un filtre repère un nom, une adresse ou un numéro de contrat. Il remplace la valeur par un jeton quand le modèle n'en a pas besoin. La correspondance ne redevient lisible que là où le métier l'exige.
Une classification fonctionne avec un identifiant masqué. Un remboursement, lui, se traite dans le système métier, sans envoyer la fiche client entière au modèle. Cette distinction se décide parcours par parcours, jamais une fois pour toutes.
Le contrôle d'accès précède la génération. Chaque extrait documentaire porte des étiquettes qui limitent le périmètre avant la recherche. Un agent destiné à un client ne doit pas interroger toute la base en comptant sur le modèle pour ignorer les documents interdits. Un agent IA pour la relation client se juge sur ce point autant que sur sa qualité de réponse.
Prenons une hypothèse, à refaire avec vos chiffres : un service client qui traite 8 000 conversations par mois, dont un tiers sont des suivis de dossier. Si vous envoyez l'historique complet à chaque tour, le volume transmis au fournisseur devient le produit du nombre de tours par la taille du contexte. Comparez-le à ce que vous auriez transmis avec une intention détectée et un identifiant de dossier. L'écart entre les deux chiffres est votre marge de minimisation, et il se mesure avant tout arbitrage budgétaire.
Purger sans angle mort, et répondre aux demandes
L'effacement doit couvrir cinq endroits au moins, et une purge qui s'arrête au premier reste une purge partielle.
- Conversation active : ce qui reste dans la fenêtre de contexte, et ce qui disparaît à la fin du parcours.
- Mémoire et cache : les clés qui rattachent un souvenir à une personne identifiable.
- Base vectorielle : l'identifiant du document source, les étiquettes personnelles et la date d'expiration.
- Journaux : les traces de sécurité séparées des journaux d'exploitation, avec une durée par finalité.
- Entraînement : aucune donnée personnelle quand la finalité ne l'exige pas.
Une durée de conservation se déduit de la finalité, pas d'une habitude de stockage.7 Un service client supprime ou anonymise les tickets anciens, sauf obligation légale d'archivage. Écrivez la durée dans le registre, puis vérifiez qu'un travail automatique l'applique vraiment.
Les droits des personnes suivent la même logique de preuve. Une demande d'accès produit un export lisible des conversations. Une rectification indique quels systèmes ont été corrigés. Un effacement montre sa propagation vers le cache, la base vectorielle, les sauvegardes utiles et les jeux d'évaluation.
Imaginons une demande d'effacement reçue un vendredi soir, portant sur une personne qui a discuté avec l'agent, envoyé une pièce jointe et reçu un rappel automatique. Le ticket doit montrer la demande, la vérification d'identité, les systèmes interrogés, les actions faites, les exceptions retenues et la clôture. Si votre outil ne produit pas ce ticket, vous rédigerez la réponse à la main, à chaque fois.
Sécuriser les flux et prouver ce que fait l'agent
L'article 32 impose une sécurité adaptée au risque. Pour un agent, cela donne du chiffrement en transit et au repos, des secrets rangés dans un coffre et un cloisonnement réseau de la base vectorielle. Il faut aussi une protection contre les injections d'instructions, ces messages piégés qui détournent l'agent de sa consigne.
Une injection réussie peut pousser l'agent à révéler un document récupéré, le message système ou une information appartenant à un autre utilisateur. Les clés d'accès techniques ne doivent apparaître ni dans le code, ni dans les instructions, ni dans les journaux. Une rotation régulière et des droits limités par environnement réduisent la portée d'une fuite.
Le modèle ne doit pas pouvoir appeler directement toutes vos fonctions métier. L'orchestrateur applique une liste d'outils autorisés, des paramètres contrôlés et une validation humaine pour les actions à conséquence. L'IA prépare, l'humain valide.
La journalisation sert de preuve sans devenir une nouvelle fuite. Un journal horodaté garde l'identifiant de requête, la version du modèle, la règle appliquée, l'outil appelé et le résultat du contrôle. Le contenu entier de l'instruction n'est pas toujours utile. Quand il l'est, son accès reste séparé de celui des journaux de performance.
| Composant | Risque principal | Mesure | Preuve à produire |
|---|---|---|---|
| Interface de conversation | Collecte libre de données inutiles | Filtrage avant envoi, parcours guidé | Version de l'interface, tests de filtrage |
| Orchestrateur d'instructions | Injection, contextes mélangés | Liste d'outils autorisés, contextes séparés | Trace de la règle appliquée |
| Base vectorielle | Accès transversal, ré-identification | Cloisonnement, contrôle d'accès, étiquettes de suppression | Journal des requêtes et des purges |
| Modèle hébergé chez un tiers | Transfert et conservation externes | Contrat de sous-traitance, minimisation avant envoi | Contrat, configuration, inventaire des flux |
| Journaux d'inférence | Conversations exposées | Masquage, accès restreint, durée documentée | Export d'audit, preuve de purge |
| Connecteur vers le CRM | Modification ou divulgation erronée | Droits minimaux, validation des actions | Historique des appels et des décisions |
Service en ligne ou installation chez vous : comment trancher
Le choix d'hébergement ne décide pas de votre conformité, il décide de l'effort à fournir et de la nature des preuves. Un service en ligne allonge la chaîne de sous-traitance et raccourcit le délai de mise en route. Une installation chez vous réduit les flux externes et vous laisse toute la charge de la journalisation. Les deux se défendent, avec des travaux différents.
| Critère | Service en ligne | Installation chez vous | Modèle hébergé dans l'UE |
|---|---|---|---|
| Chaîne de sous-traitance | Longue, à cartographier | Courte, souvent interne | Moyenne, contractuelle |
| Lieu des données | À vérifier dans le contrat | Vos serveurs | Zone contractuelle connue |
| Délai de mise en route | Court | Long | Moyen |
| Charge de journalisation | Partagée avec le fournisseur | Entièrement à vous | Partagée |
| Preuve la plus difficile | Conservation des instructions | Traçabilité des accès administrateurs | Réversibilité en fin de contrat |
| Effort de mise à jour | Faible, mais subi | Fort, mais maîtrisé | Moyen |
La chaîne de sous-traitance se cartographie avant la signature : fournisseur du modèle, hébergeur, base vectorielle, outils de supervision, puis leurs propres sous-traitants. Le contrat de sous-traitance imposé par l'article 28 précise les instructions, la confidentialité et la sécurité. Il fixe aussi l'assistance aux droits, la notification des violations, la suppression en fin de service et les audits.
Une architecture locale mal journalisée fournit moins de preuves qu'un service en ligne bien gouverné. Un agent IA installé pour le back-office se juge donc sur sa cartographie des flux, sa traçabilité et ses rôles contractuels, pas sur l'adresse de ses serveurs.
La répartition des rôles se lit dans les décisions, pas dans les intitulés. Celui qui détermine la finalité et les opérations nécessaires porte la responsabilité centrale. Le fournisseur ne décide pas de la finalité métier, et vous ne pouvez pas lui déléguer votre preuve de conformité.
Le DPO ne valide pas un agent sur une fiche fonctionnelle. La direction métier connaît le parcours mais rarement les traitements créés par la mémoire, les journaux et les intégrations. Faites-les travailler ensemble sur le même document, dès le cadrage. La base de connaissance qui alimente l'agent a besoin d'un propriétaire métier, d'une règle de validation et d'une procédure de retrait.
Les pannes de conformité arrivent après la mise en service
Les projets qui échouent au contrôle ne se trompent presque jamais sur le droit. Ils se trompent sur l'écart entre l'architecture décrite et l'architecture déployée. Voici les pannes que cet écart produit, puis les erreurs qui les précèdent.
Les pannes de conformité les plus fréquentes
- Le registre décrit la maquette. La mémoire, les journaux et la recherche documentaire ont été ajoutés après sa rédaction, et personne ne l'a repris.
- La purge s'arrête à la base principale. Le cache, la base vectorielle et les sauvegardes gardent des copies que personne ne sait cibler.
- Les journaux conservent le texte entier des conversations. Ils sont accessibles à toute l'équipe technique, sans durée ni restriction d'accès.
- La mémoire longue durée n'expire jamais. Une préférence notée il y a deux ans ressort dans une réponse, et le client comprend qu'il est fiché.
- Le modèle change sans revalidation. Une nouvelle version modifie les réponses, les déductions et parfois la conservation, sans nouveau test.
- Un sous-traitant apparaît sans avenant. L'outil de supervision ajouté en cours de projet traite des conversations et n'est cité nulle part.
- Le jeu d'évaluation vient de la production. De vraies conversations servent à mesurer la qualité, sans base juridique ni durée.
Les faux pas de départ
- Promettre que l'agent ne traite aucune donnée personnelle. Le premier message libre dément la promesse, et le registre devient faux.
- Confondre politique de confidentialité et registre. Le premier document parle aux personnes, le second prouve à l'autorité.
- Traiter la minimisation comme un problème d'interface. Retirer un champ ne change rien si l'orchestrateur envoie tout l'historique.
- Faire porter la preuve au fournisseur. Vous déterminez la finalité, donc vous produisez la preuve.
- Tester la purge sur un compte vide. Un test crédible part d'un compte qui a vécu, avec pièces jointes, mémoire et journaux.
- Confondre données masquées et données anonymes. Un identifiant remplacé reste une donnée personnelle tant que la correspondance existe.
- Appeler le DPO à la recette. Une base juridique se choisit au cadrage, quand le parcours peut encore changer.
Les questions à poser avant de signer
Un agent conforme sait détecter les données personnelles, les limiter, les isoler et prouver ce qu'il en fait. Ces sept questions se posent en réunion, et les réponses se vérifient sur un compte de test. Une réponse orale sans document vaut un refus poli.
- Quel registre décrit ce parcours ? Une bonne réponse cite la mémoire, les journaux, la recherche documentaire et les sous-traitants ultérieurs, pas seulement l'interface.
- Où partent les instructions et combien de temps sont-elles gardées ? Une bonne réponse nomme le pays d'hébergement, la durée exacte et la clause contractuelle qui l'engage.
- Que se passe-t-il si je demande une purge de bout en bout ? Une bonne réponse propose une démonstration sur un compte de test, puis un export qui montre ce qui subsiste.
- Quels sous-traitants interviennent derrière le contrat ? Une bonne réponse donne une liste écrite, tenue à jour, avec un mécanisme d'information avant tout ajout.
- Comment filtrez-vous les données sensibles avant l'envoi au modèle ? Une bonne réponse décrit le filtre, ses limites connues et les tests qui mesurent son taux d'erreur.
- Que journalisez-vous, et qui y accède ? Une bonne réponse distingue les traces de sécurité des journaux d'exploitation, avec des droits différents.
- Que faites-vous quand vous changez de version de modèle ? Une bonne réponse décrit une revalidation, un préavis et un moyen de rester sur l'ancienne version un temps.
Je crois que la conformité d'un agent se juge sur une seule démonstration, et pas sur un dossier. Demandez la purge de bout en bout sur un compte de test, puis regardez ce qui reste dans la base vectorielle, les caches et les sauvegardes. Le résultat vous dira en dix minutes ce qu'un audit documentaire mettrait des semaines à établir.
Trois décisions se prennent cette semaine, sans budget. Ajoutez ces sept questions à votre appel d'offres en cours, parce qu'elles trient les fournisseurs plus vite qu'une grille de notation. Relisez le registre de votre agent déjà en production, en cherchant la mémoire et les journaux. Demandez enfin à votre DPO la liste des finalités que vous poursuivez vraiment, et comptez les bases juridiques qui manquent.
Si vous cadrez un projet cette année, confrontez cette grille à votre architecture avant de choisir l'outil. Vous pouvez l'appliquer à notre plateforme d'agents IA, à nos chatbots pour la relation client, puis réserver un échange pour prioriser les preuves à produire en premier.
FAQ sur le RGPD et les agents conversationnels
Faut-il une analyse d'impact pour un chatbot ?
Elle s'impose quand le traitement présente un risque élevé pour les personnes. Un agent qui traite des demandes de santé, qui évalue des clients ou qui décide seul d'un refus entre dans cette zone. Un agent qui donne des horaires d'ouverture n'y entre pas. Le DPO et le métier tranchent ensemble, et gardent la trace de leur raisonnement.
Peut-on utiliser les conversations pour entraîner un modèle ?
Cet usage constitue une finalité distincte du service rendu. Il lui faut sa propre base juridique, sa propre information aux personnes et sa propre durée de conservation. Le plus sûr reste de séparer les jeux d'entraînement des conversations réelles quand le service n'en dépend pas. Une case de consentement globale ne suffit pas à couvrir cette réutilisation.
Comment effacer une donnée présente dans la base vectorielle ?
Il faut avoir prévu la suppression au moment de l'indexation. Chaque extrait garde l'identifiant du document source, les étiquettes personnelles et une date d'expiration. La suppression cible alors ces identifiants, puis un contrôle vérifie qu'aucune recherche ne les remonte encore. Sans ces étiquettes, la seule issue reste la réindexation complète.
Un hébergement en France règle-t-il la question ?
Il simplifie l'analyse des transferts, sans supprimer les autres obligations. La base juridique, la minimisation, les durées, les droits et la journalisation restent identiques. Un fournisseur français peut aussi recourir à des sous-traitants hors UE, ce que seul le contrat révèle. Demandez la liste avant de conclure.
Qui est responsable en cas de fuite, vous ou le fournisseur ?
Celui qui détermine la finalité et les moyens essentiels porte la responsabilité principale, et c'est presque toujours vous. Le fournisseur répond de ses propres manquements et vous doit assistance, notification et preuves. Le contrat de sous-traitance fixe ces obligations. Il ne transfère pas votre devoir de démontrer la conformité.
Sources et references
- [1]CNIL, Rapport annuel 2024 (2025)
- [2]CNIL, Sanctions and corrective measures: the CNIL's actions in 2025
- [3]CNIL, Annual report 2025
- [4]CNIL, Sanctions : quelles sanctions peuvent être prononcées par la CNIL ?
- [5]CNIL, AI: the CNIL finalises its recommendations on the development of artificial intelligence systems
- [6]CNIL, Les droits des personnes sur leurs données
- [7]CNIL, Les durées de conservation des données
- [8]EUR-Lex, Règlement (UE) 2016/679 du 27 avril 2016 (RGPD), articles 5, 6, 9, 28, 32, 35 et 83