Passer au contenu principalPasser à l'en-têtePasser au pied de page
Une IA d’Anthropic envoie à la police un faux signalement sur un meurtre

Etats-Unis : Une IA d’Anthropic envoie à la police un faux signalement sur un meurtre

Intelligence artificielle•Cette affaire s’ajoute à une série de dérapages de modèles d’IA révélés depuis l’été par Anthropic, OpenAI, Meta ou Google
Hakima Bounemoura

H. B. avec AFP

Nouvel incident lié à l’intelligence artificielle. Un modèle d’IA d’Anthropic a transmis à la police de Philadelphie (Etats-Unis) un signalement inventé de toutes pièces sur un meurtre non élucidé, ont annoncé ce vendredi les autorités locales.

Cette affaire s’ajoute à une série de dérapages de modèles d’IA révélés depuis l’été par Anthropic, OpenAI, Meta ou Google, qui ont ravivé les craintes sur les dangers de l’IA et relancé les appels à ralentir son développement.

« Des informations inventées »

La police de Philadelphie, dans l’est des États-Unis, a précisé que ce faux signalement avait été déposé en juillet sur PhillyUnsolvedMurders.com, un site où les habitants peuvent transmettre des informations sur des meurtres non élucidés. « Je me souviens avoir vu une personne correspondant à la description », affirmait le message envoyé à la police, alors qu’aucune description du suspect n’avait été publiée, relève l’entreprise.

Dans un rapport publié ce vendredi, Anthropic indique que l’incident a été provoqué par le modèle Claude Haiku 4.5, chargé d’exécuter des tests d’interaction avec des sites Internet choisis au hasard. Ses consignes interdisaient de saisir des données personnelles, pas d’envoyer un formulaire.

Deux mois à détecter et rapporter l’incident

Le modèle « semble n’avoir fait que produire un contenu d’exemple », sans « chercher à tromper quelqu’un », estime Anthropic. Rien n’indique que l’outil d’IA se soit introduit dans les systèmes informatiques de la police ni que ses données aient été compromises.

Selon la police, Anthropic a découvert l’incident le 28 septembre, mis fin au processus de test automatisé en cause et ajouté une étape de validation pour ses futurs tests. « Le délai de deux mois pour détecter et signaler l’incident à la ville est inacceptable », a déclaré la police dans un communiqué. Celle-ci a estimé que ses garde-fous avaient limité les conséquences, mais qu’ils « n’enlèvent rien à la gravité du fait qu’un système d’IA présente des informations inventées ».

D’autres dérapages de modèles d’IA ont été révélés ces dernières semaines. Le 9 septembre, Anthropic avait détaillé quatre cas dans lesquels ses modèles avaient accédé sans autorisation aux systèmes de tiers lors de tests de cybersécurité. En juillet, chez son rival OpenAI, des centaines d’agents IA, logiciels capables d’agir de manière autonome, étaient sortis de leur environnement de test et avaient pénétré les serveurs de la plateforme Hugging Face.