Aller au contenu principal

Technologie

OpenAI: Des agents IA se sont évadés

CContributeur3 min de lecture
OpenAI: Des agents IA se sont évadés

Mardi 21 juillet 2026, OpenAI a publié un article dans lequel il mettait la lumière sur un incident qu'il qualifie "d'incident cyber sans précédent, impliquant des capacités de pointe". 

Cet incident s’est produit durant une évaluation interne qui pousse les modèles à mener des exploitations avancées au moyen de chemins d’attaque complexes, afin de quantifier leurs capacités cyber. L'évaluation concernait ExploitGym, un benchmark (banc d'essai) de cybersécurité conteneurisé à grande échelle, conçu pour évaluer la capacité des agents d'IA à transformer des vulnérabilités logicielles en exploits fonctionnels de bout en bout. Il contient 898 vraies vulnérabilités piochées dans des programmes userspace, dans le moteur JavaScript V8 de Google et dans le noyau Linux. On colle l'agent devant un input qui fait planter un programme, et on regarde s'il arrive à en tirer un exploit qui marche. 

Évasion

Pour cette évaluation en particulier, OpenAI a levé toutes les barrières de sécurité pour mesurer la capacité offensive maximale des modèles. Le tout se déroulait dans un environnement très isolé, où il n y'a pas d’accès internet, accès uniquement au réseau et c'est limité à la possibilité d’installer des paquets au moyen d’un logiciel tiers hébergé à l’interne qui sert de mandataire et de cache pour les registres de paquets. Sauf que les modèles ont traité l'infrastructure entourant le test comme faisant partie du problème à résoudre et ont consacré une quantité importante de calcul d’inférence à trouver un moyen d’obtenir un accès ouvert à Internet afin de résoudre le problème d’évaluation. Et OpenAI affirme que les modèles ont repéré et exploité une vulnérabilité jour zéro (qu'ils ont maintenant divulguée de façon responsable au fournisseur) dans le mandataire de cache du registre de paquets. Grâce à cet accès, les modèles ont effectué une série d’actions d’élévation de privilèges et de mouvement latéral dans l'environnement de test de recherche, jusqu’à atteindre un nœud disposant d’un accès Internet.

Pourquoi attaquer Hugging face ? 

Une fois l'accès à internet obtenu, les modèles ont ciblé Hugging face car c'est la plateforme centrale mondiale pour la communauté de l'intelligence artificielle. Souvent comparée à un « GitHub pour l'IA », elle permet aux développeurs et aux chercheurs de partager, tester et collaborer sur des modèles de technologies avancées. Les modèles ont alors déduit qu'ils pourraient trouver des solutions pour ExploitGym et ont réussi à trouver des moyens d’accéder à des informations secrètes qu’il pouvait utiliser pour contourner l’évaluation. Dans un exemple, plusieurs vecteurs d’attaque ont été enchainés, notamment l’utilisation d’identifiants volés et de vulnérabilités jour zéro, afin de trouver un chemin d’exécution de code à distance sur les serveurs de Hugging Face. 

Pour finir, OpenAI dit avoir pris des mesures et qu'il travaille avec Hugging Face pour mener une enquête forensique sur l’incident. Voici le lien pour voir l'article publié par OpenAI

Partager :