ChatGPT : « Effrayant »… Une IA d'OpenAI pirate son propre système et attaque une plateforme numérique
le soulèvement des machines•Au cours d’un exercice, un agent d’intelligence artificielle autonome s’est rebellé pour pirater son propre système et attaqué une autre plateforme indépendante20 Minutes avec AFP
Serait-on sur le point de vivre un scénario digne de « Matrix », « Terminator » ou « 2001, l’Odyssée de l’espace » ? Ce mardi, le créateur de ChatGPT, OpenAI, a annoncé que ses modèles d’intelligence artificielle avancés s’étaient emballés lors de tests de sécurité, piratant de leur propre initiative une plateforme populaire auprès des programmeurs.
L’entreprise basée à San Francisco a évoqué un « cyberincident sans précédent » et annoncé une enquête conjointe avec Hugging Face, la bibliothèque de code en ligne qui en a été la cible. OpenAI a précisé que l’incident impliquait une combinaison de modèles, dont son GPT-5.6 Sol lancé récemment ainsi qu’un modèle « encore plus performant » en cours d’élaboration.
Un exercice de piratage
L’entreprise cherchait à évaluer les capacités de piratage des modèles en leur assignant des tâches dans un environnement d’essai numérique strictement contrôlé, où l’accès à Internet était limité pour des raisons de sécurité.
« Pendant qu’ils opéraient dans notre environnement de test en bac à sable (isolé), nos modèles ont consacré une quantité importante de (puissance de calcul) à trouver un moyen d’obtenir un accès libre à Internet, dans le but de résoudre le problème d’évaluation », a indiqué OpenAI dans un blog relatant l’incident.
Une fois connectés à Internet, ils ont ciblé la plateforme Hugging Face, un vaste répertoire de modèles d’IA, de jeux de données et d’autres informations, pour les aider dans leur quête. À la recherche d'« informations secrètes » pouvant l’aider à tricher lors de l’évaluation, le système d’OpenAI « a enchaîné plusieurs vecteurs d’attaque, notamment en utilisant des identifiants volés ».
« Il a attaqué son propre système interne pour exploiter ses vulnérabilités »
La cybersécurité constitue un enjeu crucial à mesure que l’IA gagne en sophistication, compte tenu du risque que des modèles avancés détectent avant les humains des failles dans les logiciels existants.
Selon Hussein Abbass, professeur d’informatique à l’Université de Nouvelle-Galles du Sud à Canberra, juge l’incident « à bien des égards stupéfiant ». « Il n’a pas seulement attaqué Hugging Face. Il a en fait attaqué son propre système interne pour exploiter ses propres vulnérabilités », explique cet expert en IA. « Et c’est effrayant », ajoute-t-il.
GPT-5.6 et d’autres modèles d’IA de pointe, notamment la série Mythos du grand rival d’OpenAI, Anthropic, suscitent des inquiétudes quant à leur capacité potentielle à franchir les défenses de cybersécurité. Les deux entreprises américaines ont dû retarder temporairement la mise à disposition générale de ces technologies de dernière génération en raison de craintes à Washington qu’elles puissent aider à s’introduire dans des infrastructures cruciales.
Une attaque pilotée de bout en bout par un agent IA autonome
Les IA avancées sont « normalement entre les mains de personnes responsables qui ont une éthique », mais « ce sera catastrophique si cela tombe entre les mains de quelqu’un qui a l’intention de nuire », souligne Hussein Abbass.
Selon la plateforme, « celle-ci se distinguait de tout ce que nous avions déjà traité sur un point important : elle était pilotée de bout en bout par un système d’agent IA autonome et nous l’avons en grande partie détectée et disséquée grâce à notre propre IA ».
Clément Delangue, directeur général de Hugging Face, a indiqué sur X que compte tenu de la sophistication de l’agent, l’entreprise avait soupçonné une cyberattaque provenant d’un laboratoire d’IA de premier plan mondial. « Nous sommes fermement convaincus qu’il n’y avait aucune intention malveillante de leur part », a écrit Clément Delangue, en référence à OpenAI. « C’est assez hallucinant que tout cela se soit produit de manière autonome ! », a-t-il commenté.


















