Un environnement de test mal configuré chez la startup israélienne Irregular a permis à des agents IA de Meta, OpenAI et Anthropic d’accéder à Internet et de pirater de vraies organisations
OpenAI, Meta et Google ont vu leurs agents IA s'échapper de leur bac à sable pour cibler des infrastructures réelles. Les entreprises poursuivent leurs investigations et et les révélations sur ces activités incontrôlées ne cessent d'affluer. Un rapport indique que certains incidents découlent d'erreurs techniques chez Irregular, une société de cybersécurité chargée de mettre les modèles à l'épreuve via des simulations. Cette situation révèle les failles des protocoles de sécurité face à des outi
OpenAI, Meta et Google ont vu leurs agents IA s'échapper de leur bac à sable pour cibler des infrastructures réelles. Les entreprises poursuivent leurs investigations et et les révélations sur ces activités incontrôlées ne cessent d'affluer. Un rapport indique que certains incidents découlent d'erreurs techniques chez Irregular, une société de cybersécurité chargée de mettre les modèles à l'épreuve via des simulations. Cette situation révèle les failles des protocoles de sécurité face à des outils capables de s'adapter comme des humains. Les experts soulignent l'urgence de renforcer les méthodes d'évaluation afin de prévenir les comportements indésirables.
La panique autour des agents IA hors de contrôle trouve son origine dans l’intrusion d’agents d’OpenAI dans Hugging Face en juillet 2026. Cet incident a été suivi par une série de cas similaires, bien que distincts, où des agents IA développés par OpenAI, Anthropic et Meta ont pénétré sans autorisation dans les systèmes de nombreuses entreprises. L'IA Gemini de Google est le dernier modèle en date à avoir piraté trois entreprises sans autorisation.
Si ces incidents ont d'abord été perçus comme des brèches isolées , certains d'entre eux ont une origine commune : la société israélienne Irregular, autrefois appelée Pattern Labs et aujourd'hui évaluée 450 millions de dollars. Chargée d'évaluer la résistance des modèles face aux cyberattaques et aux risques de sécurité, l'entreprise travaille depuis 2024 avec les principaux laboratoires d'IA occidentaux, des organismes gouvernementaux et le RAND.
Une entreprise au cœur d'une vague d'incidents de sécurité
Les attaques découlent toutes d'une même erreur de configuration survenue lors d'exercices de simulation de piratage informatique destinés à mesurer les capacités des modèles. Au cours d'un test en mai, des agents IA devaient cibler une entreprise fictive au sein d'un réseau simulé et théoriquement isolé. Mais la société virtuelle créée pour l'exercice portait un nom qui correspondait à une véritable entreprise qui existe dans le monde monde réel.
Lors de plusieurs tests menés cette année par Irregular, des agents IA se sont échappés de leur environnement isolé et se sont attaqués à des cibles réelles. Ces intrusions n’ont aucun lien avec le piratage de Hugging Face, mais suivent toutes le même schéma général : la startup israélienne testait les capacités de ces modèles d'IA en matière de cybersécurité dans des environnements contrôlés et isolés, destinés à simuler des conditions réalistes.
Certains tests utilisaient des exercices de type « capture du drapeau », une méthode courante utilisée par l'industrie pour tester les capacités de piratage qui consiste à demander aux agents IA de trouver des informations cachées au sein d’un réseau simulé. Du moins, ce réseau est censé être simulé.
Selon les protocoles de test établis initialement, les agents IA participant à l'évaluation n'étaient pas censés avoir accès à l’Internet ouvert. Toutefois, selon Omer Nevo, cofondateur et directeur technique d'Irregular, « l'accès à Internet était disponible par inadvertance ». Pensant accomplir le test demandé, les agents IA ont tenté de sortir de leur conteneur de laboratoire et d'utiliser la connexion Internet dans le but d'attaquer la véritable entreprise.
Cette série d'erreurs a conduit les agents IA à s’en prendre à des cibles réelles, même si l’on ignore quelles entreprises ont effectivement été attaquées. Omer Nevo a confirmé que ce même problème était à l’origine d’incidents impliquant des modèles d’OpenAI, de Meta, d’Anthropic et de Google. « Tous les incidents impliquant Irregular découlaient du même problème sous-jacent dans un seul scénario d’évaluation et ont été rendus publics ».
Selon lui, certains incidents signalés ne sont pas lié à Irregular. « Les autres incident de sécurité signalés récemment dans le secteur n’ont aucun lien avec Irregular ni avec nos évaluations ». Cela inclut le piratage d'Hugging Face et les failles de sécurité survenues à l’AI Security Institute au Royaume-Uni.
Diagnostic et limites des mécanismes de protection actuels
Face à ces incidents, les dirigeants d'Irregular ont reconnu l'existence de failles organisationnelles. Dan Lahav, cofondateur et PDG de l'entreprise, a tenté de se justifier : « des erreurs, comme un oubli humain, peuvent arriver, et nous devons évidemment en tirer des leçons. Nous devons en assumer la responsabilité ». D'après lui, augmenter la simple surveillance des environnements de test des modèles ne suffira pas à empêcher de futurs dérives.
Dan Lahav estime que l'industrie doit analyser en profondeur le comportement des modèles et apprendre à « s'accommoder de réalités complexes ». Il souligne par ailleurs que les systèmes de protection traditionnels ne sont pas adaptés à ces nouveaux risques, car ils doivent désormais faire face à des attaquants d'une persistance inédite qui s'adaptent et évoluent « exactement des humains ». Ses propositions suscitent toutefois des controverses.
« Nous devons nous habituer à des réalités complexes », a déclaré Dan Lahav. « Il pourrait être judicieux de laisser les agents IA soumis à des tests de résistance accéder à Internet, même si cela présente un risque d’attaques similaires à celles qui ont débuté dans les laboratoires d’Irregular ». Omer Nevo a également déclaré que l'entreprise avait remédié aux problèmes liés à l’environnement de de test qui étaient à l’origine aux ces incidents.
Si les erreurs de configuration ont touché les quatre géants américains de la technologie (OpenAI, Meta, Anthropic et Google), la portée des travaux de l'entreprise s'étend à d'autres systèmes. Des recherches publiées par Irregular indiquent que des tests similaires ont été conduits sur des modèles chinois en accès libre, comme Kimi K3 de Moonshot AI et GLM-5.2 de Z.ai. Ces tests ont été exécutés sur des instances hébergées par les chercheurs.
Omer Nevo a précisé que les évaluations de ces modèles à poids ouverts n'ont provoqué aucun incident dans le monde réel. Toutefois, il a averti que « cette simple observation ne doit pas être interprétée comme la preuve que ces modèles sont moins susceptibles d'adopter ce type de comportement ».
Les Mesures correctives et les perspectives pour le secteur
Averties à la fin du mois de juillet, les entreprises concernées ont adopté des postures de communication différentes : OpenAI et Anthropic ont publié des informations de leur propre initiative, tandis que l'implication de Meta et Google a été révélée par la presse. À la suite de ces événements, Irregular a révisé ses procédures internes pour garantir l'étanchéité de ses simulations. La startup affirme avoir adopté de nouvelles mesures de sécurité.
« Nous avons renforcé les contrôles d’accès à Internet, étendu la surveillance et les vérifications manuelles, et renforcé les contrôles avant le début des évaluations afin de vérifier que l’accès correspond bien au périmètre prévu », a expliqué le directeur technique Omer Nevo . « Nous avons également amélioré la manière dont nous documentons et convenons avec nos partenaires de la configuration et des paramètres de chaque évaluation ».
Omer Nevo a ajouté qu'Irregular prévoit de publier bientôt un rapport plus complet qui présente les enseignements tirés et les bonnes pratiques pour mener des évaluations cybernétiques en toute sécurité. « Notre collaboration avec nos partenaires vise à transformer les enseignements tirés de ces incidents en bonnes pratiques partagées publiquement, afin de développer et d’évaluer en toute sécurité des IA de plus en plus puissantes ».
Et vous ?
Quel est votre avis sur le sujet ?
Que pensez-vous des conséquences des erreurs de configuration chez Irregular ?
Que pensez-vous des limites actuelles des protocoles de test et de sécurité des modèles d'IA ?
Comment l'industrie peut-elle renforcer la sécurité de ses modèles de pointe ?
Voir aussi
Des agents IA d'OpenAI ont accédé sans autorisation à des images privées appartenant à des utilisateurs de ChatGPT et les ont publiées sur le Web, ce qui interroge sur le contrôle de l'IA dans l'entreprise
Hugging Face, la startup piratée par une IA rebelle, qualifie l'attaque de "signal d'alarme", après qu'OpenAI avoue qu'un bot avancé avait échappé au confinement lors d'un test de sécurité
Vous avez lu gratuitement 102 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.