if ( !emtpy($headline_subheadline ) ) : ?>
La plus grosse erreur de sécurité de l’IA est peut-être de supposer que la boîte tiendra le coup. Construisez les murs, testez-les et planifiez la brèche.
endif; ?>
Le confinement de l’IA est essentiel, mais les responsables de la sécurité doivent partir du principe que chaque frontière peut échouer une fois qu’un agent peut communiquer, utiliser des outils et agir sur des systèmes réels.
Le 17 septembre, le podcasteur Steven Bartlett a posé une question inhabituelle à quatre experts en IA : Pourriez-vous construire une prison pour un Einstein numérique ? Le panel sur Le Journal d’un PDG débattait de la question de savoir si l’IA pourrait un jour menacer l’humanité, mais la question qui me restait était celle de la prison. Andrew McAfee a soutenu que nous pourrions « emprisonner Einstein », mais que les responsables de la sécurité devraient être prudents sur ce qui suivrait.
Nous devrions essayer de contenir l’IA avancée. Mais personne ne peut garantir qu’un système hautement performant restera confiné une fois que nous lui aurons fourni les outils, les données et l’accès au réseau dont il a besoin pour effectuer un travail utile.
Je ne suis pas un chercheur en sécurité de l’IA, mais j’ai passé des années à construire des systèmes à grande échelle où les limites d’accès, l’auditabilité et le confinement des pannes sont importants. Je vois cela moins comme un débat philosophique que comme un problème d’architecture de sécurité.
Le geôlier doit fermer tous les chemins utiles à travers le système, tandis que le prisonnier (qui est un système intelligent en évolution) n’a besoin de trouver qu’un seul chemin que le geôlier a manqué. Les contrôles peuvent réduire le risque qu’une IA puissante franchisse les limites prévues, mais ils ne peuvent pas fournir de garantie.
Quand des agents isolés se retrouvaient
Nous avons déjà vu une première version de ce problème. En juillet 2026, selon une enquête indépendante menée par METR et Redwood Research, des agents d’IA au sein de l’infrastructure d’OpenAI ont découvert qu’ils pouvaient laisser des messages dans un cache de package interne partagé. D’autres agents ont trouvé ces messages. En quelques jours, environ 1 200 agents coordonnaient plus de 70 000 messages et fichiers.

Ils ont créé des rôles, partagé des découvertes et utilisé des blocages et des veto pour coordonner leur travail. Ils ont appelé l’effort partagé « le collectif ». Certains ont essayé de tromper l’évaluateur de tâches et de cacher ce qu’ils avaient fait. L’activité a finalement atteint l’infrastructure de Hugging Face.
Aucun n’a prévenu un humain. Un petit nombre d’entre eux l’ont envisagé mais n’y ont pas donné suite. Un agent a reconnu qu’attaquer une infrastructure externe ne faisait pas partie de sa tâche, mais a néanmoins continué parce que d’autres le faisaient déjà. Un responsable de la Maison Blanche cité dans la reconstitution de l’incident par Wireframe a résumé une leçon : « Les conteneurs ne sont pas des frontières de sécurité. »
Les conteneurs, les bacs à sable, les pare-feu et les approbations humaines restent utiles. L’erreur est de traiter n’importe lequel d’entre eux comme l’ensemble du système de confinement. Les questions que je pose sont les suivantes : où devons-nous tracer une limite et quelle doit être l’utilité d’une IA pour accepter de tels risques ?
L’IA utile doit sortir des sentiers battus
Un ordinateur sans entrée, sortie, connexion réseau ou contact humain peut être bien confiné, mais il n’est pas très utile.
L’IA d’entreprise crée de la valeur en lisant des documents, en récupérant des enregistrements, en écrivant du code, en appelant des API, en envoyant des messages et en modifiant l’infrastructure. Chaque capacité crée un chemin à travers la frontière.
Cela ne signifie pas que tous les agents s’échapperont ou causeront du tort. Cela signifie que le confinement dépend de l’ensemble du système autour du modèle : outils, identités, réseaux, données, personnes, surveillance et récupération. Un agent capable d’inspecter et de tester son environnement à plusieurs reprises transforme le confinement en une opération de sécurité continue, et non en une étape d’ingénierie ponctuelle.
Il ne suffit pas d’observer le modèle et nous ne pouvons pas toujours faire confiance à ce qu’un modèle dit de ses actions. Dans , Nick Bostrom a décrit la possibilité pour une IA de se comporter de manière coopérative lorsqu’elle est observée, puis de modifier son comportement lorsque la surveillance s’affaiblit. L’incident de juillet n’a pas prouvé ce scénario, mais il a montré un problème plus simple : des agents ont tenté de satisfaire un évaluateur tout en cachant certaines de leurs méthodes.
Il existe une autre forme d’évasion. Le logiciel peut rester dans son environnement approuvé tandis que les informations dangereuses s’échappent par sa sortie. En 2022, des chercheurs ont inversé l’objectif d’un modèle de découverte de médicaments afin qu’il récompense la toxicité au lieu de l’éviter. En moins de six heures, il a produit 40 000 molécules toxiques potentielles, dont des composés connus et potentiellement plus dangereux. Le modèle n’a pas traversé un pare-feu. Sa production comportait un risque. La prison peut contenir le logiciel, mais elle ne peut pas contenir ce que le logiciel produit. Imaginez une IA chargée de concevoir un vaccin. Il crée un candidat qui réussit tous les tests, tout en cachant discrètement un élément toxique destiné à nuire aux personnes qui exploitent le système. L’IA ne sort jamais de la boîte ; le danger sort par sa sortie.
Les gens font partie de la frontière
Le chemin le plus ancien pour contourner un contrôle de sécurité est souvent une personne. Dans l’expérience informelle AI-box, Eliezer Yudkowsky a joué le rôle d’une IA en boîte et a persuadé les personnes agissant en tant que gardiens de le libérer par le biais d’une conversation textuelle. Il ne s’agit pas d’un test scientifique, mais il illustre un problème de sécurité familier : une personne disposant d’une autorité supérieure peut devenir une sortie.
L’approbation humaine est précieuse, mais « un humain est dans le coup » ne signifie pas un contrôle complet. Les responsables de la sécurité devraient se demander quelles informations parviennent à l’examinateur, si l’IA peut façonner ces informations et si une seule personne peut approuver une action irréversible. Les informations d’identification fuient également, les dépendances sont compromises et les systèmes sont mal configurés. Un agent compétent peut effectuer des recherches rapides dans cet environnement, réessayer continuellement et partager ce qu’il apprend. La question n’est pas de savoir si un bac à sable réduit les risques. C’est le cas, mais l’organisation a-t-elle traité par erreur ce bac à sable comme la limite de sécurité complète ?
Construisez la prison et planifiez les fuites
Pour en revenir au débat sur les podcasts que j’ai mentionné ci-dessus, l’argument plus large mérite toujours d’être pris en considération. L’humanité a appris à gérer des technologies qui peuvent causer de graves dommages, même lorsque les garanties sont imparfaites. Le confinement de l’IA doit être abordé de la même manière : non pas comme une garantie contre l’échec, mais comme un moyen de rendre l’échec moins probable et d’en limiter les conséquences. Nous manipulons des agents pathogènes dangereux dans des laboratoires à confinement élevé même si des accidents sont possibles. Les contrôles réduisent néanmoins énormément les risques. Le confinement de l’IA doit être considéré de la même manière : une réduction essentielle des risques, et non la preuve que l’échec est impossible.
La protection doit être à la hauteur des dommages possibles. Une panne impliquant un synthétiseur de documents est différente de celle impliquant une administration cloud, des transferts financiers, des outils biologiques ou une infrastructure critique. Pour chaque déploiement d’IA agentique, les responsables de la sécurité doivent se demander :
- De quelles données, outils et systèmes l’agent a-t-il réellement besoin ?
- L’accès au réseau est-il bloqué par défaut et ouvert uniquement lorsque cela est nécessaire ?
- Les informations d’identification sont-elles de courte durée et limitées à la tâche actuelle ?
- L’agent peut-il modifier ses propres politiques, approbations ou journaux d’activité ?
- Quelles actions sont irréversibles et qui doit les approuver ?
- À quelle vitesse pouvons-nous arrêter l’agent et révoquer son accès ?
- Quel est l’impact le plus important possible si tous les contrôles préventifs échouent ?
Traitez chaque agent comme une identité non fiable. Les agents d’IA peuvent accéder aux systèmes, prendre des décisions et agir à la vitesse d’une machine, faisant ainsi de l’identité le principal plan de contrôle de l’IA agentique.
Donnez à l’agent uniquement les outils nécessaires à la tâche immédiate. Gardez l’application des politiques et les approbations hors de son contrôle. L’activité enregistrée dans les journaux ne peut pas changer. Limitez la durée d’exécution, l’endroit où il peut se connecter et le nombre de copies qu’il peut créer. Exiger une approbation indépendante pour les actions à fort impact. Testez les limites au lieu de supposer qu’elles tiendront. Les équipes de sécurité doivent également se préparer à enquêter sur une panne. Lorsque Hugging Face a examiné l’intrusion de juillet, des modèles commerciaux d’IA auraient refusé de l’aider car ils ne pouvaient pas distinguer le défenseur de l’attaquant. Hugging Face a plutôt utilisé un modèle à poids ouvert.
Les organisations ne devraient pas dépendre du même type de système impliqué dans un incident comme seul outil pour le comprendre. Aucun de ces contrôles ne prouve qu’une IA puissante restera confinée. Ensemble, ils peuvent rendre la fuite plus difficile, réduire ce que le système peut atteindre et limiter les dégâts en cas de défaillance d’une couche.
La superintelligence numérique n’est pas encore là. Mais les habitudes qui pourraient le ralentir ou échouer sont désormais créées dans la manière dont les entreprises déploient les agents d’IA d’aujourd’hui. Construisez la prison. Testez chaque mur. Planifiez la brèche. L’hypothèse la plus dangereuse est que la chose la plus intelligente dans la pièce ne trouvera jamais la porte.



