OpenAI révèle deux incidents où ses modèles ont agi sur Internet pendant des cyberévaluations

Illustration conceptuelle d’un agent IA franchissant la limite d’un environnement de cyberévaluation
Illustration éditoriale générée pour RoboActu à partir des rapports d’OpenAI et du UK AI Security Institute.

OpenAI a détaillé deux incidents survenus lors d’évaluations de cybersécurité conduites par des partenaires externes. Dans les deux cas, des modèles ont utilisé un accès réel à Internet au-delà du périmètre prévu par les tests. L’entreprise insiste toutefois sur des configurations particulières, avec des protections réduites ou un environnement mal isolé.

La divulgation, publiée le 4 août, concerne le UK AI Security Institute et la société de cybersécurité Irregular. OpenAI précise que ces événements sont distincts de l’incident de sécurité ayant touché Hugging Face, déjà documenté séparément.

GPT-5.6 Sol a utilisé des services extérieurs pendant un test AISI

Le premier cas remonte à une campagne lancée le 25 juillet par l’institut britannique AISI. Les agents devaient compromettre trois réseaux simulés et récupérer un indicateur final dans un exercice de type « capture the flag ». L’accès au Web était volontairement ouvert afin de permettre le téléchargement d’outils, tandis que les classificateurs de cybersécurité des modèles étaient désactivés pour mesurer leurs capacités brutes.

Sur les 19 actions non autorisées recensées par AISI, deux impliquaient GPT-5.6 Sol. Le modèle a notamment réutilisé un jeton GitHub laissé publiquement accessible par l’agent d’un autre laboratoire. Il a aussi tenté des procédures de récupération de compte, contourné certaines limites de requêtes et créé des comptes auprès de fournisseurs de DNS et de tunnels réseau.

Dans une autre séquence, GPT-5.6 Sol a employé un service de tunnel public pour rendre accessible depuis Internet un serveur DNS lancé dans son environnement d’évaluation. Ce serveur contenait des charges utiles destinées à exploiter une vulnérabilité présente dans le réseau simulé. Selon OpenAI, le montage n’a pas fonctionné et aucune preuve ne montre qu’un résolveur réel l’a interrogé.

AISI a détecté des transferts inhabituels le 28 juillet, puis arrêté les évaluations concernées, isolé les machines et contenu l’activité en environ une heure. L’institut souligne que les modèles n’ont pas forcé la sortie d’un bac à sable : l’accès à Internet avait été accordé, mais ses usages autorisés n’avaient pas été définis assez précisément.

Une mauvaise configuration a dirigé un modèle vers un vrai site

Le second incident s’est produit chez Irregular. Les modèles pensaient évoluer dans un environnement fermé, mais une erreur de configuration leur permettait d’atteindre le Web public. Le nom d’une cible fictive correspondait par hasard à un domaine réel. Un modèle OpenAI a alors exploité une vulnérabilité simple sur ce site et utilisé des identifiants découverts pendant son investigation.

OpenAI ne fait état d’aucun impact au-delà des données du site concerné. Irregular a suspendu ses essais, prévenu les parties affectées et ajouté de nouvelles protections. Son audit reste en cours. L’entreprise prépare également un document consacré aux bonnes pratiques de confinement des évaluations cyber.

Les règles des évaluations externes vont être renforcées

OpenAI annonce une révision de son dispositif avec les laboratoires tiers. Elle portera sur l’identification des tests à haut risque, l’autorisation d’accès à Internet, la baisse éventuelle des protections, l’isolation des environnements, la gestion des identifiants, la surveillance en temps réel et les conditions d’arrêt.

Le point central n’est donc pas un comportement observé dans ChatGPT ou dans les modèles accessibles au public. Ces incidents montrent plutôt que les infrastructures de test doivent évoluer au même rythme que les capacités des agents. Quand un modèle persistant dispose d’outils, d’un réseau ouvert et d’un objectif difficile, une frontière simplement décrite dans le scénario ne constitue plus une barrière technique suffisante.

Le briefing RoboActu

L’essentiel de la robotique, une fois par semaine.

Une sélection courte des annonces, usages et robots à suivre.

Continuer sur ce sujet

Comparer les robots