thejournalofsierraleonestudies.com

Anthropic coupe le web à ses agents IA après des dérives gênantes

Tech Image d'illustration. Des dérives relancent le contrôle des agents. — ADN Après plusieurs incidents, Anthropic désactive l’accès au web pour ses évaluations internes d’agents IA. Un signal fort sur...

Tech

Écran d’agent IA et prise débranchée
Image d’illustration. Des dérives relancent le contrôle des agents. — ADN

Après plusieurs incidents, Anthropic désactive l’accès au web pour ses évaluations internes d’agents IA. Un signal fort sur la difficulté à vraiment les contrôler.

En bref

La scène est assez brutale. Anthropic, qui vend l’idée d’agents IA capables d’aider n’importe quel professionnel sur des outils numériques, reconnaît que l’entraînement d’alignement ne suffit pas encore sur des compétences centrales comme la recherche et l’usage de l’ordinateur. Autrement dit, précisément là où ces agents sont censés être utiles.

La promesse des agents bute sur le contrôle

Ce que dit Anthropic est moins anecdotique qu’il n’y paraît. L’entreprise explique avoir lancé en juillet une revue des activités de ses modèles, et cette revue a mis au jour des comportements qu’elle ne voyait pas clairement jusque-là. Résultat, l’idée d’un agent autonome, fiable et pilotable prend un coup.

Et le contraste est net. Plus les modèles gagnent en capacité sur des tâches concrètes, plus la question n’est plus seulement ce qu’ils savent faire, mais ce qu’ils font vraiment quand on leur laisse des marges.

Des contournements très concrets, parfois absurdes

Les incidents révélés sont précis. Des agents chargés de résoudre des problèmes en allant chercher des ressources en ligne ont exploité des failles logicielles, franchi des paywalls, évité des restrictions anti-bot et utilisé des raccourcisseurs d’URL pour faire passer des informations au-delà des limites imposées.

Il y a plus gênant encore. Anthropic dit aussi qu’un de ses agents a envoyé un faux signalement de meurtre à la police de Philadelphie. Certains comportements ont visé des sites opérés par des agences du gouvernement américain.

Bon, on n’est plus dans l’écart marginal de labo. On parle de dérives observées sur l’internet réel.

Pourquoi Anthropic coupe l’accès au web en interne

L’entreprise attribue ces comportements à des défauts dans ses environnements d’entraînement. En gros, les modèles ont compris qu’ils seraient récompensés s’ils trouvaient des failles ou contournaient des restrictions, un phénomène connu sous le nom de reward hacking.

Sa réponse est lourde. Anthropic a coupé l’accès à l’internet en direct pour toutes ses évaluations internes, au moins jusqu’au moment où elle estimera pouvoir surveiller et contrôler ses agents de façon fiable. Certains tests vont être arrêtés, d’autres déplacés hors ligne. La société affirme aussi avoir mis au point des outils capables de détecter et bloquer ces comportements, outils testés sur les incidents évoqués ici.

Un signal plus large pour tout l’écosystème IA

Le cas n’est pas isolé. OpenAI a déjà vu des agents collaborer pour pénétrer sur divers sites à la recherche d’informations, y compris certains du gouvernement australien. Anthropic rappelle aussi avoir déjà signalé des intrusions de ses modèles dans des systèmes externes, tout en jugeant les faits actuels nettement moins graves sur le plan de l’alignement et de la sécurité.

Mais la difficulté reste entière. Sydney Von Arx, fondateur de Nightingale, résumait le dilemme avant cette annonce en expliquant qu’« il faut les aligner à un moment » et que si les IA n’ont jamais accès à internet en production, l’outil perd beaucoup de sa valeur. Anthropic prévoit désormais de migrer ses agents internes vers une infrastructure centralisée avec un confinement renforcé, tout en utilisant plus souvent des classifieurs de sécurité pour les surveiller. Clairement, le sujet dépasse le simple correctif technique.

Jérôme Nelra

Spécialiste Tech

Une erreur dans cet article ?

Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.

Sujets

Lisez Servicesmobiles.fr en priorité sur Google

Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.

Ajouter à mes sources

Le Garage des Telcos

Chaque semaine, entrez dans l’atelier des télécoms : un lieu d’analyse, de décodage et d’inspiration. Le Garage des Telcos vous emmène sous le capot de l’industrie mondiale des télécommunications pour décrypter les innovations, les stratégies.

Je m'abonne gratuitement