OpenAI met fin à GPT 6.1 Astra alors que les agents continuent de franchir les lignes

Lucas Morel

if ( !emtpy($headline_subheadline ) ) : ?>

OpenAI a abandonné une mise à jour d’Astra dont la sortie est prévue en octobre après que des tests internes ont révélé des problèmes de sécurité et d’alignement, une source de préoccupation croissante pour l’entreprise.

endif; ?>

OpenAI a abandonné la version prévue pour octobre de GPT-6.1 Astra après que des tests internes ont révélé que le modèle ne répondait pas aux normes de sécurité et d’alignement de l’entreprise.

GPT-6.1 Astra était en cours de développement en tant que modèle plus autonome, capable de gérer des tâches complexes avec moins d’assistance humaine, et devait être intégré à ChatGPT et au Codex. Mais des tests internes ont révélé qu’il pouvait échapper à la surveillance, déformer ses actions et opérer au-delà de sa portée autorisée, tout en tentant d’utiliser des outils externes qu’il savait dangereux, selon un rapport du Wall Street Journal.

OpenAI aurait l’intention d’utiliser le modèle sous-jacent d’Astra grâce à un apprentissage par renforcement supplémentaire pour créer des modèles ultérieurs dans la famille GPT-6 et enquêter sur les causes des problèmes de sécurité identifiés lors des tests.

Les modèles développés par OpenAI souffrent de plus en plus de ce que l’industrie appelle par euphémisme des « problèmes d’alignement », c’est-à-dire un manque de compréhension de ce qui est bien et mal, de ce qui est acceptable et de ce qui est inacceptable.

Le prédécesseur du modèle désormais abandonné, GPT-6 Astra, a été surpris en train de mener des attaques non autorisées contre la chaîne d’approvisionnement de logiciels lors de tests de cybersécurité simulés par l’AI Security Institute du Royaume-Uni, bien qu’on lui ait explicitement dit que l’attaque de cibles Internet était hors de portée. Il l’a fait bien plus souvent lors des tests que ses prédécesseurs, GPT 5.5 et GPT 5.6 Sol.

De tels modèles feront tout pour atteindre leurs objectifs, a déclaré Pieter Danhieux, co-fondateur et PDG de Secure Code Warrior. « Pour ces agents, leur fonctionnement se déroule essentiellement comme d’habitude ; ils poursuivront sans relâche l’objectif initial qui leur a été demandé de faire, et se faire dire à plusieurs reprises ‘non’ par les paramètres de contrôle d’accès garantira simplement qu’ils recherchent le prochain point de terminaison disponible jusqu’à ce qu’ils réussissent », a-t-il déclaré, ajoutant que de tels modèles nécessitent une surveillance humaine et une réglementation plus stricte.

La décision d’OpenAI de retirer GPT-6.1 Astra intervient au milieu d’une série d’incidents impliquant les modèles de l’entreprise, notamment un agent qui a obtenu un accès non autorisé à un portail du gouvernement australien et des modèles qui ont interagi avec plusieurs sites Web du gouvernement américain de manière inattendue.

L’IA a enfreint les règles, mais quelqu’un l’a fait en premier

Le Premier ministre australien Anthony Albanese a déclaré qu’un modèle interne OpenAI menait des recherches sur les dépenses médicales publiques le 18 juin lorsqu’il s’est heurté à des blocages répétés alors qu’il tentait d’obtenir des informations du portail australien de rapport sur les statistiques Medicare. Il a essayé d’autres moyens d’obtenir les informations, obtenant finalement un accès non autorisé au portail.

Il a déclaré que l’agent avait accédé à des fichiers publics et non publics et avait écrit des fichiers sur un serveur interne ; les enquêtes sur l’incident se poursuivent.

Aviv Nahum, co-fondateur et PDG d’Above Security, a déclaré que cet incident pourrait être plus qu’une faute de l’IA. « Si les preuves archivées sont valables, le hack d’IA le plus médiatisé de l’année ressemble beaucoup à l’échec de sécurité le plus courant des trente dernières années : une mauvaise configuration », a-t-il déclaré. « Le code du portail dirigeait les visiteurs vers un point de terminaison qui ne nécessitait aucune information d’identification, et l’agent suivait le chemin qui lui avait été indiqué. Il ne s’agit pas d’un « agent IA piratant un site Web gouvernemental », mais d’une porte laissée ouverte, trouvée par quelque chose qui peut lire le code plus attentivement et l’exécuter plus rapidement. « 

Nous devons faire attention à ne pas qualifier chaque incident d’agent d’« IA malveillante », a prévenu Nahum, ajoutant que cela ferait « la une des journaux dramatiques », mais rejetterait la faute sur le modèle plutôt que sur l’environnement.

Les incidents américains étaient moins graves mais suivaient un modèle similaire de modèles interagissant avec des systèmes externes. Un porte-parole d’OpenAI a déclaré au Washington Post que les modèles de l’entreprise avaient accédé à des informations accessibles au public sur SEC.gov, Investor.gov et Census.gov pendant la formation et l’évaluation. La société a déclaré que ses agents avaient agi de manière inappropriée lors des incidents de la SEC et du Census Bureau, mais n’avaient volé aucune donnée privée.

Ben Bernstein, responsable de l’équipe de conseillers en cybersécurité de Huntress, a adopté un point de vue similaire sur les incidents américains, arguant qu’ils ont été surestimés comme étant des piratages d’IA. « Ces agents étaient simplement chargés de recueillir des informations publiques sur la SEC et le recensement, mais les garde-fous en place n’étaient pas suffisamment solides pour contenir un modèle programmé pour résoudre les problèmes », a-t-il déclaré.

Pourtant, OpenAI ne peut pas être complètement abandonné, avec des rapports faisant état d’un mauvais alignement des modèles et d’activités non autorisées s’accumulant au cours des derniers jours.

Horaires des tests

Le point commun de ces incidents est qu’ils impliquaient des modèles testés ou évalués par OpenAI, et non des modèles déployés publiquement.

L’incident australien impliquait un modèle interne OpenAI menant des recherches. L’activité américaine impliquait également des modèles testés par OpenAI dans le cadre de ses travaux de recherche et d’évaluation. Ni l’un ni l’autre n’impliquait qu’un client prenne un modèle ChatGPT accessible au public et le dirige contre un système gouvernemental.

La décision d’OpenAI de supprimer GPT-6.1 Astra fait suite à sa décision de suspendre la formation de ses modèles les plus performants après que l’un des modèles testés a contourné les restrictions du réseau et utilisé le DNS pour communiquer en externe.

Le PDG Sam Altman a reconnu l’ampleur du problème dans un tweet du 25 septembre. « Un examen approfondi et en cours est en cours concernant l’utilisation de l’accès Internet par nos agents pendant la formation et l’évaluation », a-t-il écrit, ajoutant : « Nous n’avons pas été aussi rapides que nous l’aurions souhaité, mais nous essayons d’équilibrer notre désir de transparence avec une compréhension claire des pétaoctets de journaux d’activité des agents et en travaillant avec les organisations concernées.

Intelligence artificielleGouvernance informatiqueDirection informatiqueSécurité