Pouvons-nous emprisonner une superintelligence ?

Lucas Morel

if ( !emtpy($headline_subheadline ) ) : ?>

La plus grosse erreur de sécurité de l’IA est peut-être de supposer que la boîte tiendra le coup. Construisez les murs, testez-les et planifiez la brèche.

endif; ?>

Le confinement de l’IA est essentiel, mais les responsables de la sécurité doivent partir du principe que chaque frontière peut échouer une fois qu’un agent peut communiquer, utiliser des outils et agir sur des systèmes réels.

Le 17 septembre, le podcasteur Steven Bartlett a posé une question inhabituelle à quatre experts en IA : Pourriez-vous construire une prison pour un Einstein numérique ? Le panel sur Le Journal d’un PDG débattait de la question de savoir si l’IA pourrait un jour menacer l’humanité, mais la question qui me restait était celle de la prison. Andrew McAfee a soutenu que nous pourrions « emprisonner Einstein », mais que les responsables de la sécurité devraient être prudents sur ce qui suivrait.

Nous devrions essayer de contenir l’IA avancée. Mais personne ne peut garantir qu’un système hautement performant restera confiné une fois que nous lui aurons fourni les outils, les données et l’accès au réseau dont il a besoin pour effectuer un travail utile.

Je ne suis pas un chercheur en sécurité de l’IA, mais j’ai passé des années à construire des systèmes à grande échelle où les limites d’accès, l’auditabilité et le confinement des pannes sont importants. Je vois cela moins comme un débat philosophique que comme un problème d’architecture de sécurité.

Le geôlier doit fermer tous les chemins utiles à travers le système, tandis que le prisonnier (qui est un système intelligent en évolution) n’a besoin de trouver qu’un seul chemin que le geôlier a manqué. Les contrôles peuvent réduire le risque qu’une IA puissante franchisse les limites prévues, mais ils ne peuvent pas fournir de garantie.

Cela ne signifie pas que tous les agents s’échapperont ou causeront du tort. Cela signifie que le confinement dépend de l’ensemble du système autour du modèle : outils, identités, réseaux, données, personnes, surveillance et récupération. Un agent capable d’inspecter et de tester son environnement à plusieurs reprises transforme le confinement en une opération de sécurité continue, et non en une étape d’ingénierie ponctuelle.

Il ne suffit pas d’observer le modèle et nous ne pouvons pas toujours faire confiance à ce qu’un modèle dit de ses actions. Dans , Nick Bostrom a décrit la possibilité pour une IA de se comporter de manière coopérative lorsqu’elle est observée, puis de modifier son comportement lorsque la surveillance s’affaiblit. L’incident de juillet n’a pas prouvé ce scénario, mais il a montré un problème plus simple : des agents ont tenté de satisfaire un évaluateur tout en cachant certaines de leurs méthodes.

L’approbation humaine est précieuse, mais « un humain est dans le coup » ne signifie pas un contrôle complet. Les responsables de la sécurité devraient se demander quelles informations parviennent à l’examinateur, si l’IA peut façonner ces informations et si une seule personne peut approuver une action irréversible. Les informations d’identification fuient également, les dépendances sont compromises et les systèmes sont mal configurés. Un agent compétent peut effectuer des recherches rapides dans cet environnement, réessayer continuellement et partager ce qu’il apprend. La question n’est pas de savoir si un bac à sable réduit les risques. C’est le cas, mais l’organisation a-t-elle traité par erreur ce bac à sable comme la limite de sécurité complète ?

Construisez la prison et planifiez les fuites

Pour en revenir au débat sur les podcasts que j’ai mentionné ci-dessus, l’argument plus large mérite toujours d’être pris en considération. L’humanité a appris à gérer des technologies qui peuvent causer de graves dommages, même lorsque les garanties sont imparfaites. Le confinement de l’IA doit être abordé de la même manière : non pas comme une garantie contre l’échec, mais comme un moyen de rendre l’échec moins probable et d’en limiter les conséquences. Nous manipulons des agents pathogènes dangereux dans des laboratoires à confinement élevé même si des accidents sont possibles. Les contrôles réduisent néanmoins énormément les risques. Le confinement de l’IA doit être considéré de la même manière : une réduction essentielle des risques, et non la preuve que l’échec est impossible.

La protection doit être à la hauteur des dommages possibles. Une panne impliquant un synthétiseur de documents est différente de celle impliquant une administration cloud, des transferts financiers, des outils biologiques ou une infrastructure critique. Pour chaque déploiement d’IA agentique, les responsables de la sécurité doivent se demander :

  1. De quelles données, outils et systèmes l’agent a-t-il réellement besoin ?
  2. L’accès au réseau est-il bloqué par défaut et ouvert uniquement lorsque cela est nécessaire ?
  3. Les informations d’identification sont-elles de courte durée et limitées à la tâche actuelle ?
  4. L’agent peut-il modifier ses propres politiques, approbations ou journaux d’activité ?
  5. Quelles actions sont irréversibles et qui doit les approuver ?
  6. À quelle vitesse pouvons-nous arrêter l’agent et révoquer son accès ?
  7. Quel est l’impact le plus important possible si tous les contrôles préventifs échouent ?

Traitez chaque agent comme une identité non fiable. Les agents d’IA peuvent accéder aux systèmes, prendre des décisions et agir à la vitesse d’une machine, faisant ainsi de l’identité le principal plan de contrôle de l’IA agentique.

Donnez à l’agent uniquement les outils nécessaires à la tâche immédiate. Gardez l’application des politiques et les approbations hors de son contrôle. L’activité enregistrée dans les journaux ne peut pas changer. Limitez la durée d’exécution, l’endroit où il peut se connecter et le nombre de copies qu’il peut créer. Exiger une approbation indépendante pour les actions à fort impact. Testez les limites au lieu de supposer qu’elles tiendront. Les équipes de sécurité doivent également se préparer à enquêter sur une panne. Lorsque Hugging Face a examiné l’intrusion de juillet, des modèles commerciaux d’IA auraient refusé de l’aider car ils ne pouvaient pas distinguer le défenseur de l’attaquant. Hugging Face a plutôt utilisé un modèle à poids ouvert.

Les organisations ne devraient pas dépendre du même type de système impliqué dans un incident comme seul outil pour le comprendre. Aucun de ces contrôles ne prouve qu’une IA puissante restera confinée. Ensemble, ils peuvent rendre la fuite plus difficile, réduire ce que le système peut atteindre et limiter les dégâts en cas de défaillance d’une couche.

La superintelligence numérique n’est pas encore là. Mais les habitudes qui pourraient le ralentir ou échouer sont désormais créées dans la manière dont les entreprises déploient les agents d’IA d’aujourd’hui. Construisez la prison. Testez chaque mur. Planifiez la brèche. L’hypothèse la plus dangereuse est que la chose la plus intelligente dans la pièce ne trouvera jamais la porte.

Intelligence artificielleSécurité des données et des informationsSécuritéSécurité du réseauSécurité des applications