High-tech

Tatouage de Claude, Gemini et GPT : vérification du code de protection, résultats révélés

Une agitation récente sur X et Reddit a suscité des débats autour de la technologie de filigrane d’Anthropic, qui aurait pour but de marquer les textes générés par son IA, Claude. Ce phénomène, déjà observé avec l’IA Gemini de Google depuis mai 2024, a conduit certains utilisateurs à annuler leurs abonnements, tandis qu’un développeur a mis en ligne un outil prétendant pouvoir effacer cette marque. Cependant, une analyse approfondie révèle que de nombreuses informations circulant à ce sujet sont erronées ou mal interprétées.

Pour clarifier, il est essentiel de comprendre ce qu’est un filigrane numérique. Il s’agit d’une marque destinée à identifier l’origine d’un contenu, qui peut se manifester par des métadonnées pour les images, mais pour le texte, la situation est plus complexe. Actuellement, le filigrane de Claude n’est pas encore actif sur aucun modèle, et aucune étude n’a réussi à le contourner.

Le fonctionnement du filigrane repose sur un mécanisme subtil : lorsque Claude génère du texte, il utilise des mots alternatifs qui peuvent être choisis de manière aléatoire. Toutefois, au lieu d’une sélection totalement aléatoire, une règle secrète, désignée comme la « clé », influence ce choix. Ainsi, bien que le texte semble identique, ceux qui possèdent la clé peuvent vérifier la conformité des choix effectués.

Il est surprenant de constater que plus un texte est long et varié, plus le filigrane est marqué. Paradoxalement, un texte factuel ou un code, qui nécessite une précision stricte, laisse peu de place à la marque. De plus, la technologie sous-jacente, SynthID, développée par Google DeepMind et publiée dans la revue Nature en 2024, est utilisée par Anthropic dans une version adaptée.

Concernant la situation actuelle des différentes IA, bien que Gemini ait commencé à marquer ses textes, cela se limite à son application et à son interface web, sans API disponible pour les développeurs. Anthropic, de son côté, n’a pas encore déployé cette fonctionnalité sur ses modèles, et ChatGPT d’OpenAI ne propose pas de filigrane public à ce jour.

Cette agitation récente est également liée à l’AI Act, un règlement européen qui exige que les contenus générés par IA soient détectables pour les nouveaux modèles lancés depuis le 2 août 2026. Anthropic a décidé d’appliquer cette mesure à l’échelle mondiale, faute de moyens pour la restreindre à l’Europe.

En ce qui concerne l’outil prétendant avoir contourné le filigrane de Claude, le dépôt nommé « claude-awm » ne contient qu’une mention du mot « Claude » dans un commentaire, sans aucune référence à son fonctionnement. L’auteur de cet outil a en réalité réimplémenté SynthID avec ses propres clés et a testé des modèles ouverts, sans inclure Claude. Les résultats montrent que la détection reste efficace, et aucune méthode simple ne permet d’effacer la marque sans détruire le texte.

Il est important de noter que l’auteur de l’outil reconnaît lui-même que personne en dehors d’Anthropic ne possède la clé nécessaire pour vérifier le filigrane, et il refuse de fournir une méthode de contournement. Les informations erronées qui circulent proviennent principalement du nom de l’outil et des messages qui l’ont relayé. Actuellement, aucun outil public ne permet de vérifier la présence d’un filigrane, et Anthropic a promis une interface de détection à venir, sans préciser de date.

Enfin, il est essentiel de souligner que lorsque le filigrane sera opérationnel, il ne contiendra aucune donnée permettant d’identifier une personne ou une organisation. Les expériences menées par Google n’ont pas montré de différence significative dans la satisfaction des utilisateurs entre les textes marqués et non marqués.