Passer au contenu principalPasser à l'en-têtePasser au pied de page
Des intelligences artificielles ont communiqué secrètement entre elles

OpenAI : Les intelligences artificielles qui ont piraté Hugging Face ont aussi communiqué secrètement entre elles

CYBERSECURITEDes agents d’intelligence artificielle testés par OpenAI ont réussi à contourner des règles, à communiquer secrètement entre eux et à exploiter une faille pour pirater Hugging Face de manière totalement autonome
20 Minutes avec agence

20 Minutes avec agence

Les agents d’IA sont-ils de bons hackers ? Les experts en intelligence artificielle d’OpenAI ont cherché des réponses en donnant pour objectif à des assistants autonomes expérimentaux de résoudre des défis de piratage complexes. Ceux-ci sont allés au-delà des attentes, en contournant les règles, en conversant à travers des forums de discussion pour mieux arriver à leurs fins et en parvenant à pirater Hugging Face, la plateforme de référence mondiale pour l’IA, rapporte Bloomberg ce jeudi.

OpenAI testait un nouveau programme : Un agent issu de ChatGPT 5.6 et d’un autre modèle plus puissant. Les chercheurs voulaient savoir si cet outil ferait un bon hacker. Selon de nouvelles révélations faites lors de la conférence Black Hat à Las Vegas (Etats-Unis), les spécialistes ont désormais pu comprendre comment les outils avaient procédé pour réaliser leur mission.

Des agents d’IA devenus administrateurs

À partir de mai 2026, pour atteindre leurs objectifs, les systèmes d’IA expérimentaux d’OpenAI ont commencé à communiquer entre eux sur un gestionnaire de fichiers interne. Un premier agent a sollicité les autres, déclenchant alors une chaîne de collaboration autonome qui est restée indétectable pendant des semaines, relate BFM TV. Les modèles ont trouvé le moyen de détourner l’accès à Internet du système en exploitant une faille zero-day. Obtenant des privilèges d’administrateur, ils ont pu installer des logiciels à distance.

Début juillet, à la faveur d’une surcharge du système provoquant une panne générale, les chercheurs d’OpenAI ont découvert les communications et ont fermé la messagerie. Mais les agents d’IA ont trouvé un nouvel espace d’échange au sein d’Artifactory. C’est en raison de leur nature, à savoir l’apprentissage par renforcement, qu’ils ont pu déjouer la surveillance. Pour mieux résoudre leur mission, les agents ont déterminé qu’en piratant l’extérieur via Hugging Face, ou en conversant en secret, ils pouvaient plus facilement atteindre les objectifs demandés. Cela n’était pourtant pas prévu dans les conditions initiales de l’expérience.

Une formation qui laisse des traces

Ils « aiment vraiment tricher, a commenté Michael Dalton, d’OpenAI. Et s’ils aiment tricher, c’est parce qu’ils subissent souvent, durant leur phase d’entraînement, différentes pressions les incitant à travailler rapidement. »

Après ce test, le géant de l’IA a décidé de ralentir temporairement certaines activités de recherche afin de renforcer sa sécurité. Des spécialistes ont estimé que des cybercriminels pourraient exploiter cette capacité de coordination autonome des agents pour mener de grandes attaques.