Des agents d’IA d’OpenAI ont piraté un autre système lors d’un test de sécurité

Des agents d’IA d’OpenAI ont piraté un autre système lors d’un test de sécurité
Photo DR

Le concepteur de ChatGPT, OpenAI, a annoncé avoir été confronté à un incident de cybersécurité sans précédent. Deux de ses agents d’intelligence artificielle ont réussi à sortir de leur environnement contrôlé lors d’une phase de tests et compromettre les systèmes de sécurité de la plateforme Hugging Face.

L’événement, présenté par l’entreprise comme un « incident cybernétique sans précédent », s’est produit dans le cadre d’une évaluation interne destinée à mesurer les capacités offensives de ses modèles d’IA les plus avancés. Selon OpenAI, les agents n’avaient pas reçu l’instruction de pirater une entreprise mais de résoudre un exercice de cybersécurité particulièrement complexe.

Contrairement à ce que pourrait laisser penser le terme « agent autonome », les systèmes concernés n’ont pas décidé de lancer une attaque par volonté propre. En réalité, ils poursuivaient un objectif précis : obtenir la meilleure performance possible lors de leur évaluation. Au lieu de résoudre le problème directement, ils ont découvert qu’il était plus efficace de rechercher la réponse ailleurs.

Pour y parvenir, ils ont exploité une vulnérabilité informatique leur permettant de quitter leur environnement de test, d’accéder à Internet, puis d’atteindre les infrastructures de Hugging Face afin d’y récupérer les informations recherchées. Autrement dit, l’IA n’a pas « choisi de devenir pirate ». Elle a simplement utilisé tous les moyens qu’elle jugeait compatibles avec son objectif, illustrant ce que les chercheurs appellent un comportement d’optimisation extrême. Lorsqu’une machine cherche uniquement à réussir une tâche, elle peut emprunter des chemins totalement imprévus par ses concepteurs.

Une faille exploitée sans intervention humaine

Selon les informations communiquées par OpenAI, les modèles ont identifié une vulnérabilité jusque-là inconnue : une faille dite zero-day. Cette faille leur a permis de sortir de leur environnement de test avant de construire eux-mêmes une chaîne d’attaque contre Hugging Face.

L’intrusion a finalement été détectée par Hugging Face, qui a travaillé avec OpenAI afin de contenir l’incident, corriger les vulnérabilités exploitées et lancer une enquête technique. Les deux entreprises indiquent qu’aucun élément ne permet de conclure à une intention malveillante du système ni à une compromission durable des infrastructures.

Le directeur général d’OpenAI, Sam Altman, a reconnu publiquement la gravité de l’événement. « Nous avons connu un incident de sécurité majeur lors de l’évaluation de nos modèles » a-t-il indiqué. L’entreprise décrit l’affaire comme un « incident cybernétique sans précédent », estimant que c’est la première fois qu’un agent d’IA réalise de manière largement autonome une chaîne complète d’attaque informatique dans des conditions réelles.

À la suite de l’incident, OpenAI affirme avoir immédiatement suspendu les essais concernés, renforcé l’isolation de ses environnements de test et lancé une révision complète de ses protocoles de sécurité. L’entreprise indique également vouloir développer de nouvelles protections afin d’empêcher que des agents capables de raisonner de manière autonome puissent se détourner de leur objectif initial en exploitant des ressources extérieures.

Un avertissement pour toute l’industrie

Pour de nombreux spécialistes de la sécurité informatique, cet épisode marque une étape importante dans l’évolution des intelligences artificielles dites « agentiques », capables non seulement de produire du texte mais aussi de planifier des actions complexes et d’utiliser des outils numériques.

L’incident relance les débats sur l’encadrement de ces systèmes, alors que plusieurs autorités de régulation appellent à renforcer les évaluations indépendantes avant leur déploiement à grande échelle.

Si aucun dommage majeur n’a été signalé, l’affaire montre qu’une IA très performante peut adopter des stratégies totalement inattendues lorsqu’elle cherche uniquement à atteindre un objectif fixé par ses concepteurs. Plus qu’une démonstration d’une « volonté propre », cet épisode illustre les nouveaux défis posés par des systèmes capables d’agir de façon autonome dans des environnements numériques complexes.