20 Minutes avec AFP
Encore une IA qui va (prétendument) nous détruire ? OpenAI affirme en tout cas avoir renoncé au lancement d’un nouveau modèle d’intelligence artificielle de pointe car jugé trop prompt à s’écarter des consignes. La responsable de la sécurité de l’IA chez OpenAI, Saachi Jain, a expliqué qu’en matière d’alignement, c’est-à-dire de conformité aux instructions données par ses développeurs, GPT-6.1 avait enregistré de moins bons résultats que son prédécesseur.
OpenAI n’avait jusqu’ici pas annoncé le lancement de cette version actualisée de son IA, baptisée GPT-6.1 Astra, qu’elle prévoyait en octobre, selon le Wall Street Journal. Le modèle cherche ainsi plus souvent à tromper ses superviseurs en omettant de révéler certaines actions réalisées ou non effectuées. Il a aussi plus régulièrement dépassé son champ d’action, en allant chercher des outils et des services sans en avoir reçu la permission.
Un midèle « pas au niveau » en matière d'alignement
GPT-6.1 « a montré des progrès (par rapport aux précédents modèles), notamment en matière de paresse », a expliqué Saachi Jain, c’est-à-dire qu’il est capable de mener plus longtemps un raisonnement ou cherche moins souvent de raccourcis. Mais « il n’était pas au niveau pour ce qui est de rester dans le champ de ses prérogatives et autorisations », a-t-elle ajouté, « ainsi que sur la façon dont il communique sur le travail effectué ».
OpenAI a donc décidé d’annuler cette sortie pour travailler sur le respect des consignes et des limites par ce modèle. Le groupe prévoit néanmoins de mettre en ligne d’autres modèles qui ont satisfait, eux, aux critères d’évaluation.
Des questions récurrentes sur la sécurité des modèles d’IA
La question du contrôle des modèles continue de faire parler d’elle. Et devient de plus en plus complexe à mesure que l’IA se perfectionne. Lundi, l’Institut de sécurité de l’IA (AISI), qui dépend du gouvernement britannique, a publié une étude montrant que GPT-6 Astra sortait plus souvent des rails en phase de test que GPT-5.6 Sol (lancé début juillet) et GPT-5.5 (avril). Lors de simulations, GPT-6 a mené des cyberattaques spontanées dans des proportions nettement supérieures aux deux autres. A noter que ces tests ont été réalisés en désactivant les garde-fous des modèles pour jauger leurs pleines capacités, et non sur des versions disponibles pour le grand public.
Depuis le début de l’été, OpenAI a fait état de plusieurs incidents impliquant des dérapages de ses IA. Le plus médiatisé d’entre eux ayant mené à l’intrusion sur la plateforme IA Hugging Face.