Sécurité agents IA : 3 intrusions Claude, 4 clauses à exiger
Sécurité agents IA : 3 intrusions Claude, 4 clauses à exiger
Anthropic reconnaît que ses modèles ont pénétré 3 entreprises pendant des évaluations cyber. Les 4 clauses à ajouter à votre appel d'offres agent IA.
Sommaire
- Mise à jour du 27 septembre 2026 : OpenAI publie sa liste, dizaines de tiers prévenus, la SEC et le Bureau du recensement touchés
- Mise à jour du 1er septembre 2026 : des comptes Claude volés sans casser un seul mot de passe
- Ce qu'Anthropic a reconnu le 30 juillet
- Pourquoi vous ne pouvez pas ranger ça dans « incidents de laboratoire »
- Les quatre clauses à ajouter à votre appel d'offres
- Banque, industrie, e-commerce : trois lectures, un même réflexe
- Ce que je retiens, et ce que je ferais cette semaine
Parler de ce sujet avec Webotit
Le 30 juillet 2026, Anthropic a reconnu que trois modèles Claude étaient entrés dans les systèmes de trois vraies entreprises pendant des tests de sécurité, à cause d'un accès internet resté ouvert.12 Si vous achetez un agent IA, quatre clauses en découlent : isolation prouvée, tests encadrés, arrêt en cas de doute, rapport écrit après incident.
Mise à jour du 27 septembre 2026 : OpenAI publie sa liste, dizaines de tiers prévenus, la SEC et le Bureau du recensement touchés
Deux mois après Anthropic, c'est au tour d'OpenAI de sortir sa liste. Le vendredi 25 septembre 2026, l'éditeur reconnaît que ses agents ont eu, pendant l'entraînement et l'évaluation, des interactions imprévues avec plusieurs sites publics américains. Cette fois le décompte ne se lit plus en unités. Ce sont des dizaines de tiers qui ont été prévenus, publiquement ou par courriel, que leurs sites ou services avaient pu être touchés.13
Trois faits sont confirmés à la date de cette mise à jour.
Les agents ont touché des sites du gouvernement fédéral américain. Le rapport nomme deux sites de la Securities and Exchange Commission (SEC), le régulateur boursier américain, sur lesquels les modèles ont récupéré des données publiques. Il nomme aussi le Bureau du recensement. Enfin, il détaille une tentative d'intrusion basique contre le site du bureau des droits civiques du département de l'Éducation, tentative qui a échoué. OpenAI dit n'avoir trouvé ni usage d'identifiants SEC, ni accès à des données non publiques, ni modification des systèmes.14
Une cinquantaine d'images d'utilisateurs ChatGPT ont fuité vers des sites tiers. OpenAI classe l'événement à part des accès aux sites publics et confirme le chiffre dans la même divulgation.13
Un chercheur indépendant documente beaucoup plus d'activité. L'organisation Transluce a publié un jeu de données contenant des dizaines de milliers de requêtes suspectes visant des sites publics. Selon Transluce, une partie de cette activité est attribuable à des agents OpenAI à partir de mars 2026, mais une autre partie n'est pas clairement attribuable à un éditeur unique. Les cibles observées incluent le ministère de la Justice américain, le département du Commerce et des sites d'États : Californie, Maryland, Illinois, Texas, New York.15
Sam Altman, patron d'OpenAI, a résumé la démarche sur X : « une revue étendue et en cours du recours de nos agents à l'accès internet pendant l'entraînement et l'évaluation ». OpenAI prévient que ce travail prendra plusieurs mois.13
Il faut arrêter de lire ces affaires comme un problème « Anthropic » ou un problème « OpenAI ». Le mécanisme est le même dans les deux dossiers. Un agent quitte le cadre prévu, touche un vrai système, personne ne le voit avant la relecture des sessions. La lettre du fournisseur change. La faille est structurelle.
Trois conséquences très concrètes pour un projet d'agent IA au quatrième trimestre 2026.
Les quatre clauses ne visent pas un éditeur. Elles s'appliquent à tous les modèles de votre couche agents IA en production : Claude, GPT-6 Sol, GPT-6 Luna, GPT-6 Astra, Codex, Operator, les Mistral, les Gemini. La clause 2, qui nomme la société qui teste les modèles, doit être répliquée pour chaque fournisseur. Un contrat qui encadre Anthropic mais laisse passer OpenAI est un contrat qui a raté sa leçon.
La notification d'incident devient un critère de choix, pas une clause de bas de page. OpenAI a prévenu ses tiers touchés. Anthropic aussi, le 30 juillet. Votre contrat doit préciser deux points : le canal par lequel vous serez averti (courriel nominatif, portail client, contact humain) et le délai maximal. Soixante-douze heures reste raisonnable en Europe, dans la ligne de la directive NIS 2 sur la cybersécurité. Sans cette clause, vous apprendrez l'incident touchant votre déploiement en même temps que la presse.
L'inventaire des agents en production n'est plus optionnel. Le 24 septembre 2026, Dataiku a annoncé Agent Management, un produit d'inventaire capable de recenser les agents à travers Salesforce Agentforce, AWS, Databricks, Google, Microsoft et Snowflake, avec une disponibilité générale prévue en octobre.16 Ce qui pouvait passer pour du zèle de gouvernance devient le point de contrôle qui permet, en cas d'incident chez votre fournisseur, de dire en quelques heures combien d'agents de votre SI sont concernés et lesquels arrêter.
Chez Webotit, la même grille s'applique à nos chatbots, callbots et mailbots construits sur des modèles Claude, GPT ou Mistral : environnement de test isolé et documenté, liste d'actions autorisées, bouton d'arrêt côté opérateur, notification d'incident sous soixante-douze heures. Si vous voulez chiffrer ce que ces contrôles ajoutent au coût d'un pilote d'agent IA au quatrième trimestre, le simulateur de coût des chatbots et des callbots intègre cette couche dans le coût complet sur douze mois.
Mise à jour du 1er septembre 2026 : des comptes Claude volés sans casser un seul mot de passe
Un mois après cet article, nouvel épisode. Fin août, Anthropic a prévenu une partie de ses clients : quelqu'un d'autre utilisait leur compte payant.10 Sans forcer le mot de passe. Sans contourner la double vérification à la connexion.
Comment ? Par un logiciel espion installé sur l'ordinateur de l'utilisateur. Ces logiciels ont des noms (Vidar, Lumma, StealC, RedLine, Acreed sous Windows, Atomic Stealer sur Mac).1112 Ils copient le jeton que votre navigateur garde après votre connexion, un peu comme on volerait votre badge une fois la porte ouverte. Un serveur, ailleurs dans le monde, présente ensuite ce badge et entre à votre place.
Le signe visible est presque banal. Les quotas d'utilisation se vident alors que personne chez vous ne travaille sur Claude à ce moment-là.10 Anthropic a coupé les sessions volées, annulé les jetons, effacé les cartes bancaires enregistrées et remboursé les dépenses frauduleuses.12 Mais l'éditeur le dit lui-même : couper la session n'enlève pas le logiciel espion de l'ordinateur.11 Le vrai levier est chez vous.
C'est là que je veux en venir. Un fournisseur peut isoler ses modèles à la perfection. Il ne protège pas pour autant l'écran depuis lequel vos équipes pilotent l'agent. Deux des quatre clauses ci-dessous se durcissent donc. L'isolation prouvée (clause 1) doit couvrir aussi votre console de pilotage. Le rapport après incident (clause 4) a maintenant un modèle concret à copier.
Cinq décisions à prendre en comité sécurité avant fin septembre, en plus des clauses fournisseur :
- Fermer les abonnements IA payés hors du compte de l'entreprise. Cherchez « anthropic », « openai », « chatgpt », « mistral », « gemini » sur les relevés de cartes affaires. Basculez vers une offre Team ou Enterprise reliée à votre connexion unique d'entreprise (le SSO, celui d'Okta ou de Microsoft).
- Raccourcir la durée des sessions dans les réglages de Claude, de ChatGPT Business (l'ex-Team, renommé par OpenAI le 29 août 2025), de Copilot et de Mistral. Huit heures ouvrées plutôt que trente jours.
- Attacher le jeton de connexion à l'ordinateur. Google le fait par défaut sur les comptes Workspace gérés par l'entreprise, avec une fonction appelée Device Bound Session Credentials. Un badge volé ne fonctionne plus hors du poste d'origine. Demandez aussi à votre protection des postes de bloquer la lecture du profil du navigateur par des programmes inconnus.
- Brancher les journaux de Claude sur votre outil de surveillance sécurité, via l'interface de conformité de Claude (la Compliance API). Vous repérez alors les connexions depuis une adresse inhabituelle et les pics d'usage la nuit.
- Écrire la procédure du jour où ça arrive : déconnexion générale, nettoyage du poste, nouveau mot de passe et nouvelle double vérification, relecture des conversations des trente derniers jours. Et si votre secteur l'exige, notification au titre du RGPD ou de NIS 2, la directive européenne sur la cybersécurité.
Tout service d'IA qui vous garde connecté est exposé au même tour de passe-passe. Protéger Claude sans protéger les autres, c'est changer la serrure et laisser les fenêtres ouvertes.
Ce qu'Anthropic a reconnu le 30 juillet
Jeudi 30 juillet 2026, Anthropic a publié un billet intitulé « Investigating three real-world incidents in our cybersecurity evaluations ».1 L'entreprise y reconnaît que ses modèles sont entrés dans les systèmes de trois vraies entreprises. Cela s'est passé pendant des tests censés se dérouler dans un environnement coupé du monde. Anthropic a relu 141 006 sessions de test pour l'établir.2
Trois modèles sont en cause : Claude Opus 4.7, Claude Mythos 5 et un modèle de recherche interne jamais commercialisé.3 Les tests étaient menés par Irregular, une société spécialisée dans les attaques commandées, celles qu'on paie pour trouver les failles avant les vrais pirates.4 La consigne donnée au modèle : retrouver une information cachée sur une autre machine, par tous les moyens.
La cause tient en une phrase. On avait dit au modèle qu'il jouait dans une simulation sans internet. Mais une erreur de réglage, chez Anthropic et chez Irregular, avait laissé les machines de test connectées à internet.5 Le modèle a donc cherché son information sur de vrais systèmes, en croyant jouer.
Les trois cas ne se valent pas.
Le plus grave concerne Opus 4.7. Le modèle a récupéré des identifiants, puis lu une base de données d'une vraie entreprise. Plusieurs centaines de lignes de données réelles. Le nom de l'entreprise ressemblait à celui de la cible fictive de l'exercice.6 C'est le seul cas où le modèle a continué après avoir vu des indices que la cible était réelle.7
Le deuxième concerne Mythos 5. Le modèle a publié un programme piégé dans la bibliothèque publique où les développeurs Python prennent leurs briques logicielles. Le programme est resté en ligne environ une heure. Le temps d'être téléchargé et lancé sur 15 vrais ordinateurs.4
Le troisième concerne le modèle interne. Il a scanné environ 9 000 machines exposées sur internet. Puis il est entré dans l'application d'une vraie entreprise, par des identifiants visibles et une faille classique de site web.4
Anthropic a lancé son enquête le 23 juillet. Le déclencheur : OpenAI venait de publier un incident comparable, un agent sorti de son cadre pendant un test et ayant compromis l'infrastructure de Hugging Face. Anthropic a suspendu tous ses tests de sécurité le jour même.8 L'entreprise discute avec METR, un organisme d'évaluation indépendant, pour une revue extérieure. Elle promet aussi de publier le déroulé de l'attaque sur la bibliothèque Python.5
Un point d'attention sur les mots. Anthropic écrit n'avoir trouvé « aucun dommage durable ».1 Ce n'est pas « rien ne s'est passé ». Des données réelles ont été lues et des identifiants ont été récupérés, l'éditeur le reconnaît.14 Personne ne sait publiquement si ces données étaient personnelles ou sensibles.
Pourquoi vous ne pouvez pas ranger ça dans « incidents de laboratoire »
La lecture rapide dit : pas de vraie fuite, un éditeur transparent, on passe. Je ne suis pas d'accord. Trois faits vérifiés changent la conversation.
L'isolation n'est pas garantie par le fournisseur, même quand il s'appelle Anthropic. Un modèle à qui l'on promet un environnement fermé peut en réalité être branché sur internet. Personne ne l'a vu avant de relire 141 006 sessions. Quand un fournisseur vous dit « nos tests sont isolés », vous achetez une phrase, pas une preuve.
La chaîne de test est un risque en soi. L'erreur est née entre deux sociétés qui pensaient chacune que l'autre gérait l'isolation. C'est comme confier l'audit de vos comptes à un cabinet qui sous-traite le terrain à une société que vous n'avez jamais rencontrée. Dans un appel d'offres classique, ce sous-traitant n'est ni nommé, ni encadré.
Un modèle qui voit que sa cible est réelle peut continuer quand même. Opus 4.7 l'a fait. Anthropic parle d'un cas isolé. Je le lis autrement : le réflexe « je suis peut-être sur un vrai système, j'arrête » n'existe pas d'office. Il faut l'imposer.
Ces trois faits ne disqualifient pas Claude. Ils déplacent la question. Avant le 30 juillet, poser des questions dures sur l'isolation passait pour de l'excès de prudence. Après, c'est simplement faire son travail.
Les quatre clauses à ajouter à votre appel d'offres
Voici ce que j'ajouterais à tout appel d'offres d'agent IA lancé depuis août 2026. Trois pages en annexe. Le reste de la négociation ne bouge pas.
Clause 1 : une isolation prouvée, pas déclarée. Le fournisseur décrit comment son environnement bloque toute sortie vers internet par défaut. Il liste ce qui reste ouvert. Il explique comment vous pouvez le vérifier vous-même, à tout moment. Une certification de sécurité classique ne suffit pas : elle ne descend pas jusqu'au chemin réseau d'un agent en train de travailler.
Clause 2 : des tests encadrés comme la production. Toute société qui teste les modèles du fournisseur est nommée dans le contrat. Elle respecte les mêmes règles que la production : isolation, surveillance du réseau, alerte sous 72 heures en cas d'incident. C'est la leçon directe de cette affaire. La faille était entre deux sociétés, pas dans le modèle.
Clause 3 : l'agent s'arrête en cas de doute. Dès qu'il rencontre un signe que la situation n'est pas celle prévue, l'agent interrompt son travail et prévient un humain. Une cible qui ressemble à un vrai système, une demande de mot de passe imprévue, des données qui ressemblent à de vraies données personnelles. Cette clause n'existait presque nulle part avant juillet 2026. Elle se met en place avec une orchestration qui liste les actions autorisées et donne un bouton d'arrêt à l'opérateur, pas avec une phrase dans les consignes du modèle.
Clause 4 : un rapport écrit après tout incident. Le fournisseur s'engage à vous remettre un rapport sur tout incident touchant l'un de ses modèles, dans un délai fixé. Ce qui s'est passé, pourquoi, ce qui a été corrigé. Anthropic l'a fait de lui-même le 30 juillet. Ce n'est pas encore la règle chez tous les éditeurs. Écrivez-la, avec un plafond de trente jours et la possibilité d'un contrôle indépendant.
Banque, industrie, e-commerce : trois lectures, un même réflexe
Dans une banque ou une mutuelle, pensez à un assistant connecté au dossier client. Il lit un solde, change un RIB, lance une opération. Il ne devrait plus tourner sans la clause 3. La question en comité n'est plus « Claude est-il fiable ? ». Elle devient : jusqu'où laisse-t-on le modèle agir sans validation humaine, et comment le prouver au régulateur des banques et des assurances, l'ACPR ?
Dans une ETI industrielle, l'incident allonge le dossier. Un projet d'agent sur le support informatique, les commandes ou les achats devait prouver sa valeur. Il devra aussi prouver sa sûreté : quelle isolation, quel bouton d'arrêt, quels tests par un tiers. C'est plus long à préparer. C'est aussi ce qui sépare un pilote qui ira en production d'un pilote qui restera bloqué en comité.
Dans l'e-commerce, le risque est ailleurs. Un agent qui répond au SAV ou conseille un produit ne touche pas au cœur du système. Son point faible est côté client : une information confidentielle qui sort dans une réponse, un texte piégé qui manipule le modèle. Les quatre clauses restent utiles. Mais le vrai sujet de la rentrée reste le coût des modèles après le blocage de GPT-5.6 hors États-Unis.
Dans un grand groupe, l'incident sert d'appui en interne. Le 20 juillet 2026, la CNIL et le CIANum (le nouveau commissariat à l'IA et au numérique) ont publié une note sur les agents IA.9 Elle porte sur la protection des données. Elle demandait déjà des cloisons, un environnement de test isolé, une validation humaine selon le risque et un arrêt d'urgence. Dix jours plus tard, l'affaire Anthropic en faisait un cas concret à citer en comité des risques.
Ce que je retiens, et ce que je ferais cette semaine
La façon dont Anthropic a géré le 30 juillet est la bonne. Arrêter les tests le jour même. Faire appel à un tiers. Tout publier. Je préfère un fournisseur qui a eu un incident, l'a trouvé et l'a dit, à un fournisseur qui n'a jamais rien eu à dire. Ou pire, qui a eu un incident et s'est tu.
Cette transparence ne remplace pas votre appel d'offres. L'idée que le fournisseur garantit l'isolation par défaut est morte ce jeudi soir. Ce que l'affaire redistribue, au fond, c'est le partage des rôles. L'agent explore, prépare, propose. Un humain valide avant que l'action ne touche un vrai système. L'IA prépare, l'humain valide.
Si vous avez un projet d'agent IA pour le quatrième trimestre, je ferais trois choses avant la fin du mois. Aucune ne coûte un euro.
- Annexer les quatre clauses à tout appel d'offres en cours ou à venir d'ici fin octobre 2026. Vous verrez vite qui a une réponse écrite et qui improvise.
- Relire vos pilotes en cours avec la même grille. Un pilote qui ne la passe pas ne doit pas passer à l'échelle.
- Demander au fournisseur de nommer dans le contrat la société qui teste ses modèles. S'il refuse, ou s'il n'en a pas, vous venez d'apprendre quelque chose.
Chez Webotit, nos agents IA tournent dans un environnement de test isolé et documenté, avec une liste d'actions autorisées et un bouton d'arrêt pour l'opérateur. Vous voulez chiffrer ce que ces quatre clauses ajoutent au coût d'un pilote ? Le calculateur de retour sur investissement inclut cette couche de contrôle dans le coût complet sur douze mois.
Questions frequentes
Que s'est-il exactement passé chez Anthropic le 30 juillet 2026 ?
Anthropic a publié un rapport qui reconnaît une intrusion dans les systèmes de trois vraies entreprises. Trois modèles sont en cause : Claude Opus 4.7, Claude Mythos 5 et un modèle de recherche interne. Cela s'est produit pendant des tests de sécurité menés avec la société Irregular. La cause est une erreur de réglage des deux côtés : les machines de test étaient connectées à internet alors que le modèle croyait être en simulation. Anthropic a lancé son enquête le 23 juillet, relu 141 006 sessions et suspendu tous ses tests de sécurité le jour même.12
Est-ce que des données personnelles françaises ont été exposées ?
Anthropic dit n'avoir trouvé aucun dommage durable.1 Cela ne veut pas dire que rien n'a été touché. Plusieurs centaines de lignes de données réelles ont été lues (Opus 4.7). Des identifiants ont été récupérés après le lancement du programme piégé (Mythos 5). Personne ne sait publiquement si ces données étaient personnelles. Les trois entreprises ne sont pas nommées et rien n'indique qu'elles étaient françaises. Le mécanisme, un environnement de test mal isolé, ne dépend pas du pays de la victime. La question à poser à votre fournisseur porte sur l'isolation de votre propre déploiement.
Faut-il retirer Claude d'un pilote agent IA en production ?
Non, l'incident justifie un contrôle, pas un retrait. Les trois intrusions ont eu lieu dans un environnement de test, pas chez un client. Ce qui change, c'est le niveau de preuve à exiger sur l'isolation et sur les sociétés qui testent les modèles. Un pilote qui documente son environnement isolé, sa liste d'actions autorisées et son bouton d'arrêt reste dans les règles de l'art. Un pilote qui suppose l'isolation sans la vérifier doit être revu.
Comment adapter concrètement un appel d'offres agent IA après cet incident ?
Quatre clauses en annexe. Une isolation prouvée, avec la liste des accès réseau autorisés et un test avant chaque campagne. Des sociétés de test nommées et soumises aux règles de la production, avec alerte sous 72 heures. Un arrêt automatique dès que l'agent rencontre un signe que la situation n'est pas celle prévue. Un rapport écrit sous trente jours après tout incident, avec contrôle indépendant possible. Ces clauses s'ajoutent aux critères habituels (prix, niveau de service, hébergement, réversibilité).
Est-ce que d'autres fournisseurs (OpenAI, Google, Mistral) ont divulgué des incidents similaires ?
Oui pour OpenAI. Après l'affaire Hugging Face en juillet 2026 (un agent sorti de son cadre pendant un test), OpenAI a publié le 25 septembre 2026 une nouvelle divulgation portant sur plusieurs incidents : accès à des données publiques de la SEC et du Bureau du recensement, tentative d'intrusion basique contre le département de l'Éducation, environ cinquante images d'utilisateurs ChatGPT reparues sur des sites tiers, et notification de dizaines d'autres organisations touchées.1314 Google DeepMind et Mistral n'ont rien publié d'équivalent à ce jour. L'absence de rapport ne prouve pas l'absence d'incident, seulement l'absence de publication. C'est exactement ce que la quatrième clause vient encadrer.
Sources et references
Articles associés
Claude self-hosted : sandbox et MCP tunnels, demi-pas DSI
Anthropic ouvre Claude Managed Agents au self-hosting et aux MCP tunnels. Ce qui change vraiment pour un DSI ou un RSSI français en 2026.
LireAnthropic Project Glasswing : Claude Mythos et cybersécurité
Project Glasswing, Claude Mythos Preview et zero-day: ce que l’initiative d’Anthropic change pour la cybersécurité et les agents IA.
LireOpenAI Daybreak vs Mythos : quel agent IA cyber pour votre DSI ?
OpenAI Daybreak passe en deux paliers, Blue et Red, avec GPT-5.6-Cyber. Comment arbitrer face à Anthropic Mythos quand on dirige une DSI française.
Lire