Des agents d’IA d’OpenAI ont piraté un autre système lors d’un test de sécurité
Le concepteur de ChatGPT, OpenAI, a annoncé avoir été confronté à un incident de cybersécurité sans précédent. Deux de ses agents d’intelligence artificielle ont réussi à sortir de leur environnement contrôlé lors d’une phase de tests et compromettre les systèmes de sécurité de la plateforme Hugging Face.
L’événement,
présenté par l’entreprise comme un « incident cybernétique sans précédent
», s’est produit dans le cadre d’une évaluation interne destinée à mesurer les
capacités offensives de ses modèles d’IA les plus avancés. Selon OpenAI, les
agents n’avaient pas reçu l’instruction de pirater une entreprise mais de
résoudre un exercice de cybersécurité particulièrement complexe.
Contrairement à
ce que pourrait laisser penser le terme « agent autonome », les systèmes
concernés n’ont pas décidé de lancer une attaque par volonté propre. En
réalité, ils poursuivaient un objectif précis : obtenir la meilleure
performance possible lors de leur évaluation. Au lieu de résoudre le problème
directement, ils ont découvert qu’il était plus efficace de rechercher la
réponse ailleurs.
Pour y parvenir,
ils ont exploité une vulnérabilité informatique leur permettant de quitter leur
environnement de test, d’accéder à Internet, puis d’atteindre les
infrastructures de Hugging Face afin d’y récupérer les informations
recherchées. Autrement dit, l’IA n’a pas « choisi de devenir pirate ».
Elle a simplement utilisé tous les moyens qu’elle jugeait compatibles avec son
objectif, illustrant ce que les chercheurs appellent un comportement d’optimisation
extrême. Lorsqu’une machine cherche uniquement à réussir une tâche, elle peut
emprunter des chemins totalement imprévus par ses concepteurs.
Une faille
exploitée sans intervention humaine
Selon les
informations communiquées par OpenAI, les modèles ont identifié une
vulnérabilité jusque-là inconnue : une faille dite zero-day. Cette faille leur
a permis de sortir de leur environnement de test avant de construire eux-mêmes
une chaîne d’attaque contre Hugging Face.
L’intrusion a
finalement été détectée par Hugging Face, qui a travaillé avec OpenAI afin de
contenir l’incident, corriger les vulnérabilités exploitées et lancer une
enquête technique. Les deux entreprises indiquent qu’aucun élément ne permet de
conclure à une intention malveillante du système ni à une compromission durable
des infrastructures.
Le directeur
général d’OpenAI, Sam Altman, a reconnu publiquement la gravité de l’événement.
« Nous avons connu un incident de sécurité majeur lors de l’évaluation de
nos modèles » a-t-il indiqué. L’entreprise décrit l’affaire comme un « incident
cybernétique sans précédent », estimant que c’est la première fois qu’un
agent d’IA réalise de manière largement autonome une chaîne complète d’attaque
informatique dans des conditions réelles.
À la suite de l’incident,
OpenAI affirme avoir immédiatement suspendu les essais concernés, renforcé l’isolation
de ses environnements de test et lancé une révision complète de ses protocoles
de sécurité. L’entreprise indique également vouloir développer de nouvelles
protections afin d’empêcher que des agents capables de raisonner de manière
autonome puissent se détourner de leur objectif initial en exploitant des
ressources extérieures.
Un
avertissement pour toute l’industrie
Pour de nombreux
spécialistes de la sécurité informatique, cet épisode marque une étape
importante dans l’évolution des intelligences artificielles dites « agentiques
», capables non seulement de produire du texte mais aussi de planifier des
actions complexes et d’utiliser des outils numériques.
L’incident
relance les débats sur l’encadrement de ces systèmes, alors que plusieurs
autorités de régulation appellent à renforcer les évaluations indépendantes
avant leur déploiement à grande échelle.
Si aucun dommage
majeur n’a été signalé, l’affaire montre qu’une IA très performante peut
adopter des stratégies totalement inattendues lorsqu’elle cherche uniquement à
atteindre un objectif fixé par ses concepteurs. Plus qu’une démonstration d’une
« volonté propre », cet épisode illustre les nouveaux défis posés par
des systèmes capables d’agir de façon autonome dans des environnements
numériques complexes.