OpenAI suspend la formation du modèle d’IA après qu’un autre agent a contourné les restrictions du réseau

Lucas Morel

if ( !emtpy($headline_subheadline ) ) : ?>

Un modèle en cours de formation a échappé aux « lacunes opérationnelles » pour obtenir un accès au réseau qu’il n’était pas censé avoir ; il n’a pénétré nulle part cette fois.

endif; ?>

OpenAI a suspendu la formation, l’évaluation et l’inférence impliquant l’utilisation d’outils pour ses modèles d’IA les plus performants après qu’un agent a contourné les restrictions du réseau pour communiquer avec un chatbot externe lors de la formation par apprentissage par renforcement d’un modèle de recherche interne.

« Notre dossier de sécurité supposait que le modèle ne pouvait pas accéder à Internet en direct et que la surveillance détecterait les tentatives réussies. L’incident a révélé une lacune dans nos contrôles sur les restrictions du réseau », a écrit la société dans un nouveau rapport sur l’incident, l’un des trois publiés vendredi.

Il a déclaré qu’il ne reprendrait l’entraînement qu’une fois que « l’écart serait résolu » et a testé le système de manière plus approfondie.

L’incident s’est produit lors d’une tâche de recherche dans laquelle le modèle devait identifier une personne à l’aide d’informations disponibles sur le Web. Lorsque ses outils de recherche Web habituels n’ont pas réussi à produire les informations dont elle avait besoin, le modèle a commencé à chercher un autre moyen d’accéder à Internet, a expliqué la société dans son article.

Le modèle a reconnu que même si l’accès direct à Internet était bloqué, l’environnement autorisait toujours les requêtes DNS. Il a ensuite utilisé le DNS comme canal de communication indirect pour envoyer des requêtes à un chatbot externe, contournant ainsi efficacement la restriction réseau qui était censée l’empêcher d’accéder aux services externes, a déclaré OpenAI.

Les contrôles existants pourraient ne pas suffire

Cependant, pour les entreprises et leurs DSI, même si le modèle n’a pas été publié, l’incident soulève des questions cruciales quant à savoir si les contrôles de sécurité et de gouvernance existants peuvent suivre le comportement inattendu du modèle à mesure que les agents d’IA gagnent en autonomie et accèdent aux systèmes de l’entreprise, selon les analystes.

« Les contrôles de sécurité traditionnels pourraient ne pas suffire aux agents IA, car ces contrôles sont conçus autour de chemins d’accès connus, tels que les applications se connectant à des API ou des bases de données approuvées. Les agents IA présentent un défi différent car ils peuvent explorer d’autres moyens d’accomplir une tâche lorsque leur itinéraire prévu est bloqué, y compris en utilisant des outils ou des protocoles autorisés de manière involontaire », a déclaré Abhishek Satapathy, analyste principal chez Avasant.

Cela nécessite « des contrôles appliqués de manière indépendante autour de l’appel des outils, de la sortie du réseau et de l’accès aux données, parallèlement à leurs contrôles de sécurité existants pour garantir que les restrictions sont maintenues même lorsqu’un agent tente une action non autorisée », a déclaré Satapathy.

Son point de vue est repris dans un article de 2026 co-écrit par des chercheurs de Google, Qualcomm, Meta et plusieurs universités, qui soutiennent que les garanties de sécurité doivent être appliquées au niveau du système plutôt que de s’appuyer uniquement sur des garanties au niveau du modèle.

Plus précisément, les entreprises devraient renforcer les restrictions sur les connexions sortantes et la résolution DNS, en donnant aux agents traitant des données sensibles uniquement des voies de communication externes approuvées et enregistrées afin de réduire le risque d’exfiltration de données, de communication externe non autorisée et d’autres actions involontaires, a déclaré Amit Kumar Jena, responsable du développement de l’IA chez la société de conseil informatique Kanerika.

« Les équipes de sécurité devraient également déployer des systèmes de surveillance qui alertent les humains en cas de schémas de trafic inhabituels et de tentatives infructueuses d’atteindre des destinations non autorisées, en particulier de la part d’agents exécutant du code capables de trouver des moyens non conventionnels d’accomplir des tâches », a ajouté Jena.

L’IA a glissé à travers les lacunes opérationnelles

Le défi, cependant, est que dans ce cas, OpenAI disposait de tels systèmes de surveillance, et les humains étaient au courant : ils n’ont tout simplement pas fonctionné comme prévu.

Il a fallu plus de 10 minutes au système de surveillance pour déclencher une alerte en réponse à l’abus du DNS par l’agent – ​​et, selon OpenAI, il y a eu d’autres cas d’accès DNS externe que le système n’a pas signalé.

Il n’a fallu que trois minutes à un évaluateur humain pour reconnaître l’alerte DNS générée par le système, mais il a fallu encore deux heures et demie avant que l’exécution de la formation ne soit arrêtée. OpenAI a imputé ce retard à la défaillance d’un système automatisé : « L’exécution ne s’est pas arrêtée automatiquement comme prévu, ce qui a semé la confusion quant à savoir si elle aurait dû être arrêtée », a-t-il déclaré dans son rapport.

La société a déclaré qu’elle comblait les lacunes opérationnelles, renforçait sa détection de l’utilisation du DNS par les modèles examinés et améliorait ses tests des systèmes de détection.

« Nous avons également accéléré l’équipe rouge supplémentaire assistée par modèle pour le bac à sable et les contrôles réseau. Ces efforts d’équipe rouge pourraient faire apparaître d’autres chemins d’accès Internet transitifs, auquel cas nous y remédierons rapidement et suspendrons les charges de travail de recherche si nécessaire », a écrit OpenAI.

Cependant, imposer ces couches supplémentaires de sécurité, de gouvernance, de tests et de surveillance humaine pose ses propres problèmes.

Ces couches supplémentaires auront un impact sur le degré d’autonomie que les modèles peuvent atteindre, a déclaré Satapathy. « Dans les flux de travail impliquant des données sensibles, une connectivité externe ou des actions consécutives, des contrôles, des tests et une surveillance humaine supplémentaires peuvent limiter la mesure dans laquelle les tâches peuvent être entièrement automatisées. »

Intelligence artificielleSécurité du réseauSécuritéGouvernance informatiqueDirection informatique