Claude : Anthropic détaille le fonctionnement de son watermark textuel

Anthropic précise comment fonctionnera le watermark intégré aux futurs textes générés par Claude et dans quelles conditions il pourra être détecté. Le dispositif repose sur un motif statistique dans le choix des mots, sans caractère caché ni métadonnée ajoutée au texte.

Code
Illustration générée par IA — Position Zéro
Partager
Dans cet articleSommaire
  1. Le watermark repose sur le choix des mots
  2. Anthropic utilise une version de SynthID-Text
  3. Une réécriture importante peut supprimer le watermark
  4. Les textes courts sont plus difficiles à identifier
  5. Anthropic prévoit une API de détection

Anthropic a publié de nouvelles précisions sur le watermark textuel qui accompagnera les futures générations de Claude dans le cadre de ses engagements liés à l’AI Act européen.

Le groupe explique notamment que le watermark est créé pendant la génération elle-même. Il ne repose ni sur des caractères Unicode invisibles, ni sur des signes de ponctuation particuliers, ni sur des tournures de phrases supposées typiques des modèles de langage.

Le watermark repose sur le choix des mots

Lorsqu’un modèle génère un texte, il sélectionne successivement des mots ou des tokens parmi plusieurs possibilités, avec une part de hasard.

Avec le système présenté par Anthropic, la source de cette randomness est modifiée. Une clé de watermark et les mots précédemment générés participent au choix de la suite du texte.

Le résultat reste lisible normalement et les mots choisis restent plausibles dans leur contexte. En revanche, leur succession forme un motif statistique détectable par un système disposant de la clé correspondante.

Anthropic utilise une version de SynthID-Text

Le système repose sur une version de SynthID-Text, la méthode présentée par Google DeepMind en 2024.

Le détecteur peut ensuite examiner la séquence de mots produite pour déterminer si elle correspond au motif qui aurait été généré avec la clé du watermark.

Anthropic indique également que cette méthode n’entraîne pas de coût supplémentaire en tokens et n’a qu’un impact négligeable sur la vitesse de génération.

Une réécriture importante peut supprimer le watermark

Anthropic confirme que le watermark peut être affaibli ou supprimé lorsque le texte est suffisamment réécrit.

Publicité

De légères modifications ne devraient généralement pas suffire. Une reformulation complète, dans laquelle une grande partie des mots est remplacée, peut en revanche faire disparaître le motif statistique utilisé pour la détection.

Anthropic souligne qu’une réécriture intégrale pose également la question de savoir si le résultat peut toujours être considéré comme le texte initialement généré par l’IA.

Les textes courts sont plus difficiles à identifier

La quantité de texte disponible joue également sur la détection.

Anthropic indique que les petits échantillons donnent de moins bons résultats, le système disposant alors de moins de choix de mots à analyser pour retrouver le motif.

Le watermark peut aussi être moins marqué dans des contenus très factuels. Lorsque le contexte impose fortement certains mots ou formulations, la marge de choix du modèle diminue, ce qui réduit les possibilités d’intégrer le signal.

Le même problème apparaît lorsqu’un utilisateur demande uniquement à Claude de corriger quelques fautes de grammaire ou de ponctuation. Le watermark ne peut alors être présent que dans les rares éléments effectivement modifiés.

Anthropic prévoit une API de détection

Anthropic annonce également la future publication d’une API de détection destinée à vérifier la présence du watermark dans un texte.

Cette technologie concernera les sorties textuelles des futurs modèles Claude concernés par le dispositif.

Pour les formats non textuels comme les fichiers JPG, PNG ou SVG, Anthropic prévoit en revanche d’utiliser des métadonnées C2PA pour fournir des informations sur la provenance du contenu.

Jordan Belly
Auteur

Jordan Belly

Rédacteur web SEO à Toulouse, j’interviens depuis plus de vingt ans sur le contenu éditorial, dont plus de douze ans dédiés au référencement naturel. J’accompagne les entreprises dans la construction de leur visibilité en ligne, en m’appuyant sur une veille continue des évolutions de Google et des moteurs basés sur l’IA. Je continue par ailleurs à écrire pour la presse spécialisée (Système D, Le Particulier, UFC Que Choisir…) et suis l’auteur du Guide du rédacteur web (Edi.Pro).

Voir ses publications
À lire aussi

À lire ensuite