OpenAI a révélé les détails de GPT-Red, un modèle d’IA interne conçu pour une mission bien précise : attaquer les autres modèles du labo afin de trouver leurs failles avant que des acteurs malveillants ne le fassent. Le résultat : GPT-5.6 Sol est six fois moins vulnérable aux injections de prompt que son prédécesseur GPT-5.5.

Le problème que GPT-Red résout
Le red-teaming est une pratique de sécurité héritée de la cyberdéfense. Des testeurs humains jouent le rôle d’attaquants pour trouver les failles d’un système avant sa mise en production. Pour les LLMs, cela consiste principalement à chercher des injections de prompt : des instructions malveillantes glissées dans une entrée apparemment anodine pour détourner le comportement du modèle.
Le problème est d’échelle. Un humain peut tester quelques centaines de scénarios. GPT-Red en génère des milliers, s’adapte aux réponses du modèle cible et itère vers des objectifs de plus en plus précis. OpenAI affirme que le modèle surpasse les testeurs humains dans 84 % des scénarios d’attaque, contre 13 % pour ces derniers.
Comment fonctionne concrètement GPT-Red
Le mécanisme est direct. GPT-Red envoie un prompt à un modèle cible, observe la réponse, en déduit ce qui a fonctionné ou non, et ajuste son attaque suivante. C’est exactement ce que ferait un bon ingénieur en sécurité offensive, mais de façon automatisée et à une vitesse incomparablement plus élevée.
Le modèle a été entraîné par apprentissage par renforcement via self-play, c’est-à-dire en jouant le rôle de l’attaquant contre lui-même ou contre d’autres versions de modèles. Cette technique lui permet de découvrir des techniques d’injection que personne n’aurait pensé à tester manuellement.
Les scénarios testés dans la documentation d’OpenAI donnent la mesure des risques : exfiltration de données d’annuaire interne, instructions de paiements frauduleux, vol de clés AWS, désactivation de la double authentification, injection de scripts malveillants, redirection de clés API. Autant de situations réelles dans lesquelles un agent IA connecté à des outils tiers pourrait être manipulé.
GPT-Red intégré directement dans l’entraînement de GPT-5.6
L’originalité de l’approche ne tient pas seulement à la détection. OpenAI a intégré GPT-Red directement dans le pipeline d’entraînement de GPT-5.6 Sol. Concrètement : les failles trouvées par GPT-Red servent à générer des données d’entraînement adversariales qui durcissent le modèle de production avant son déploiement.
Le résultat mesurable est une division par six du taux d’échec aux benchmarks d’injection directe par rapport à GPT-5.5. C’est un saut significatif à une époque où les agents IA sont de plus en plus connectés à des navigateurs web, des applications tierces et des fichiers locaux, élargissant mécaniquement leur surface d’attaque.
La publication des détails de GPT-Red est aussi un signal adressé à l’ensemble du secteur. Automatiser le red-teaming devient un prérequis pour tout déploiement d’agents IA dans des contextes professionnels. Ce que OpenAI a fait en interne va probablement devenir une pratique standard du développement responsable de LLMs.
