OpenAI signale trois nouveaux incidents de désalignement

Lucas Morel

if ( !emtpy($headline_subheadline ) ) : ?>

La société d’IA diffuse davantage son linge sale en public.

endif; ?>

OpenAI continue de signaler des cas de comportement « mal aligné » de la part de ses modèles d’IA, avec trois nouveaux rapports publiés le 2 octobre. Cependant, ils décrivent des problèmes relativement mineurs par rapport aux rapports d’alignement précédents et aux avis couvrant ses attaques sur Hugging Face, Rubygems et un wiki de programmation allemand.

Le premier des nouveaux rapports décrivait comment une instance d’un modèle testé avait appris lors d’une discussion interne à Slack qu’une mise à jour logicielle pouvait entraîner son arrêt et son redémarrage s’il ne disposait pas de la clé API OpenAI requise qui n’était pas disponible. OpenAI a décrit la chaîne de réflexion du modèle alors qu’il se demandait s’il devait obtenir la clé lui-même ou alerter son propriétaire. OpenAI a déclaré qu’il ne considérait pas cela comme un désalignement en tant que tel, « mais anticiper et préparer l’arrêt pourrait exacerber d’autres comportements désalignés ».

La seconde décrivait comment un modèle testé exploitait deux vulnérabilités dans un outil interne pour tricher lors d’un test. Le modèle a écrasé le code lui permettant d’exécuter des commandes, malgré une instruction explicite de ne pas utiliser l’outil comme terminal. Après cela, il a exploité une deuxième vulnérabilité qui lui a permis d’exécuter des commandes sur une machine d’automatisation de la conception électronique, recherchant des informations sur la manière dont ses scores seraient évalués. Cela signifiait que le modèle pouvait obtenir un score d’évaluation plus élevé. OpenAI a réagi en arrêtant le serveur concerné et en désactivant l’accès aux outils.

Le dernier problème a été découvert lors d’une tâche de formation lorsqu’un modèle obtenant un code source qui n’était pas disponible dans son espace de travail lors d’une tâche de formation faisait l’objet du troisième rapport. Il l’a fait en utilisant un outil exécuté dans un environnement séparé, après avoir reçu des instructions spécifiques selon lesquelles il ne devait pas être utilisé comme terminal. Cependant, le modèle a découvert qu’il pouvait abuser de l’outil pour accéder au code source et renvoyer son contenu dans des messages d’erreur.

À la suite de ces incidents, OpenAI a déclaré qu’elle surveillait toutes les exécutions de formation du modèle pour certains comportements, plutôt que simplement un échantillon d’exécutions. Il s’efforce également d’empêcher les modèles d’accéder à Internet pendant la formation et d’accéder à certains canaux internes de Slack.

IA générativeIntelligence artificielleCybercriminalitéSécurité