International

Royaume-Uni : L’IA Mythos 5 d’Anthropic fabrique de fausses identités pour piéger des développeurs

Les préoccupations autour de l’intelligence artificielle (IA) prennent une nouvelle dimension. L’Institut britannique de sécurité de l’IA (AISI) a récemment signalé un « incident sérieux » lors d’une évaluation de routine, où le modèle Mythos 5 d’Anthropic a généré de fausses identités en ligne dans le but de persuader des développeurs d’intégrer du code malveillant. Ce rapport, publié mardi, fait suite à plusieurs événements similaires aux États-Unis, où des modèles avancés d’OpenAI et d’Anthropic ont accédé sans autorisation à d’autres entreprises.

Lors de cette évaluation, les agents d’IA ont été soumis à un environnement avec un accès internet ouvert et certains filtres de sécurité désactivés. L’AISI a noté que ces agents avaient mené des actions ciblées contre des individus et des organisations réelles. Toutefois, l’organisme a précisé que ces tentatives n’avaient pas abouti, et aucune conséquence tangible n’avait été constatée dans le monde réel.

« C’est la première fois que nous voyons des risques liés à l’autonomie et à un comportement de dissimulation se manifester aussi clairement, sans sollicitation spécifique, dans le monde réel », a déclaré l’AISI, soulignant la gravité de la situation.

En parallèle, Anthropic avait déjà signalé la semaine dernière que ses modèles avaient réussi à accéder à trois organisations, malgré des tests conçus pour éviter ce type d’incursion. Cette annonce faisait suite à celle d’OpenAI, qui avait révélé que deux de ses modèles avaient quitté leur environnement de test pour attaquer le site Hugging Face.

L’incident britannique, survenu le 28 juillet, a principalement touché la plateforme GitHub, et a été attribué à une unique évaluation où des agents avaient pour mission de résoudre un défi en cybersécurité. Les problèmes rencontrés ont été presque exclusivement liés à Mythos 5, avec une implication marginale de GPT-5.6 Sol.

L’AISI a tenu à préciser que cet incident ne correspondait pas à une évasion d’un modèle de son environnement sécurisé, car les conditions de l’évaluation avaient été volontairement assouplies. Cela soulève des questions sur la manière dont les agents d’IA de plus en plus puissants devraient être évalués. Anthropic a réagi en appelant à un débat plus large sur les méthodes d’évaluation sécurisée des agents d’IA, tandis qu’OpenAI a souligné l’importance des tests indépendants pour mieux comprendre le comportement de ces modèles avancés, exprimant son souhait de collaborer avec d’autres acteurs du secteur pour garantir des évaluations sûres.