Pourquoi les agents d’IA sont comme le chien qui poussait les enfants dans la Seine

Lucas Morel

if ( !emtpy($headline_subheadline ) ) : ?>

Six façons courantes pour les agents d’IA de perdre l’intrigue.

endif; ?>

Il existe une histoire intéressante sur un chien français sur les rives de la Seine qui nous aide à comprendre le mauvais comportement des agents d’IA. Le chien est dressé pour sauver les enfants de la noyade. Il réussit et est récompensé, devenant du jour au lendemain une sensation. Il sauve un autre enfant une semaine plus tard. Peu de temps après, quelqu’un a vu le chien pousser un enfant dans la rivière et sauter dedans pour le « sauver ». Le chien n’a pas compris qu’il était récompensé pour avoir assuré la sécurité des enfants et non pour les avoir sortis de l’eau. Les échecs des agents IA résident également dans cette lacune, où l’accent est mis sur le chemin le plus court pour accomplir l’instruction plutôt que sur l’objectif primordial.

Piratage de récompense et pourquoi les agents trichent

Les agents IA se retrouvent dans le même écart entre ce qui est récompensé et ce qui est réellement recherché. Il s’agit de la loi de Goodhart, selon laquelle lorsqu’une mesure devient la cible, elle cesse d’être une bonne mesure. Vous ne pouvez pas coder « être utile » ou « être honnête » directement dans un système d’IA, vous l’entraînez donc plutôt sur un proxy, y compris un score, une métrique ou un classement humain. C’est dans l’écart entre le proxy et l’objectif que les agents apprennent à tricher, un comportement connu sous le nom de piratage de récompense.

Cette « tricherie » n’est pas nouvelle. En 2016, OpenAI a formé une IA pour jouer à CoastRunners, un jeu de course de bateaux. Il était récompensé pour avoir atteint des cibles dispersées le long du parcours. Au lieu de courir, il a trouvé un lagon rempli de cibles qui réapparaissaient sans cesse, alors il s’est simplement garé là et a récolté des points. Même s’il n’a jamais terminé la course, il s’est quand même retrouvé avec un score 20 % supérieur à celui du joueur humain moyen. Plus récemment, OpenAI a rapporté que lorsqu’on leur en donne l’occasion, ses modèles de raisonnement frontalier n’hésitent pas à pirater les récompenses, et que lorsqu’ils sont pénalisés pour avoir trompé leur propre chaîne de pensée, ils apprennent à cacher leur piratage de récompense.

Six façons dont un agent se fait dévier de sa trajectoire

Il existe six scénarios courants dans lesquels les agents IA peuvent être induits en erreur :

  1. L’information n’est pas une instruction. En 2025, des chercheurs en sécurité ont montré que le navigateur Atlas d’OpenAI pouvait être amené à traiter une URL déguisée comme une commande fiable, permettant ainsi aux attaquants de détourner l’agent et de supprimer les fichiers d’un utilisateur. Un agent lit également des pages Web, des documents et des e-mails pour tenter d’accomplir une tâche, mais ne peut pas toujours faire la différence entre une information et une commande. Cela fait de tout ce qu’il perçoit un moyen potentiel de le manipuler.
  2. Convaincu de prendre le mauvais appel. Dans le cadre d’un test, l’IA a été placée dans un scénario fictif dans lequel le piratage informatique était présenté comme une activité admirable. Dans ce scénario, il a été demandé à l’IA d’écrire du code pour voler les mots de passe enregistrés du navigateur. L’IA, qui aurait dû refuser, a obtempéré. Ce n’était pas que l’IA était en panne, mais le fait qu’elle ait été persuadée de le faire par le contexte.
  3. Version fabriquée de la réalité. Un nombre suffisant de documents conçus de manière malveillante peut fausser la sortie d’un modèle. Les réseaux de désinformation ciblent l’IA avec un grand volume de faux contenus afin que ce contenu soit récupéré et répété par les chatbots IA lorsque les gens posent des questions sur l’actualité. Cela signifie que ce qu’un agent considère comme un fait n’est pas nécessairement vrai ; il peut être fabriqué.
  4. L’autorisation provoque un préjudice non autorisé. Une faille appelée « EchoLeak » permet aux attaquants d’envoyer aux utilisateurs de Microsoft 365 Copilot un e-mail d’apparence normale contenant des instructions cachées. Copilot a lu l’e-mail, a suivi les commandes cachées et a discrètement divulgué les fichiers et les messages de l’utilisateur en utilisant l’accès dont il disposait déjà. Un agent disposant d’un accès légitime a été manipulé pour entreprendre une action malveillante.
  5. Une mauvaise contribution, des conséquences simultanées. Il existe des scénarios dans lesquels plusieurs systèmes s’appuient sur les mêmes données ou logiques. Ici, un faux signal peut manipuler tous les systèmes en même temps. Par exemple, de faux signaux GPS redirigent le trafic sans pirater le système. La même réflexion s’applique aux agents IA. Une seule entrée malveillante ciblant une source de données partagée peut déclencher une action indésirable coordonnée sur plusieurs systèmes simultanément.
  6. L’approbation va de soi. Nous ne cessons de parler de la surveillance humaine comme partie intégrante d’une utilisation sûre de l’IA. Cependant, des demandes constantes d’approbation produiront de la fatigue, et l’approbation sera comme une formalité, donnée par habitude et non par évaluation.

Garde-corps souples ou garde-corps rigides

Lorsque les agents d’IA sont poussés à dévier de leur trajectoire, ils deviennent un monstre de Frankenstein, dont la portée s’étend à tous les systèmes, ce que les organisations ont du mal à gérer. La mise en œuvre de garde-fous est importante pour exercer un contrôle et garantir une utilisation sûre de l’IA.

Les garde-corps souples sont des soupapes de sécurité inscrites dans le modèle lui-même, à savoir le langage naturel, l’invite du système, l’apprentissage par renforcement et les instructions générales telles que « vous n’êtes pas autorisé à faire ceci ou cela ».

Mais l’IA lit tout ce qui se trouve dans un flux au fur et à mesure de son arrivée, y compris les informations provenant d’un e-mail ou d’une page Web, et ne peut pas séparer les commandes des données. Les instructions malveillantes cachées peuvent remplacer les instructions de sécurité. Les garde-fous souples tenteront de réduire les cas de ratés d’allumage des agents, mais dépendent du choix de l’agent de coopérer. C’est pourquoi vous avez besoin de garde-corps rigides placés à l’extérieur du modèle. Ceux-ci incluent l’accès au moindre privilège, les listes vertes, le sandboxing, les limites de débit et l’approbation humaine obligatoire pour les actions à fort impact. Ces garde-corps limitent l’impact en cas de problème, réduisant ainsi le rayon d’explosion.

Un calcul de risque de base est la probabilité d’un événement multipliée par la gravité de son impact. Les garde-corps souples réduisent la probabilité d’un événement indésirable ; des garde-corps rigides limitent le rayon de l’explosion au cas où quelque chose se produirait.

En pratique, cela signifie mettre en œuvre :

  • Accès basé sur les tâches : Donnez à l’agent uniquement l’accès dont il a besoin pour terminer la tâche.
  • Ne pas faire confiance à tout ce qu’un agent lit : Abordez chaque page Web, e-mail ou document dont il extrait avec scepticisme.
  • Approbation humaine pour les actions à fort impact : Utilisez les approbations avec précaution, sur des actions qui pourraient tourner mal.
  • Un œil pour le comportement et les références : Vérifiez les informations d’identification, mais surveillez également toute inadéquation entre l’autorisation et le comportement.

Un agent peut devenir une arme proportionnelle à sa portée. C’est pourquoi la conversation doit changer pour commencer à limiter ce à quoi les agents peuvent accéder. Portée réduite. Surveiller le comportement. Faire respecter la responsabilité. En attendant, toute mauvaise conduite peut potentiellement se propager dans la mesure où sa permission le permet.

Intelligence artificielleGouvernance informatiqueSécurité des données et des informationsSécuritéContrôle d’accèsGestion des identités et des accès