404 Mates
IA Générative

Claude : les vraies limites du watermark des textes IA

Anthropic détaille enfin le watermark textuel de Claude : une variante de SynthID-Text qui marque les choix de génération sans ajouter de caractères cachés. Son fonctionnement éclaire surtout une conclusion plus large : la provenance peut devenir une infrastructure utile, mais elle ne permettra jamais de réduire l’origine d’un texte à un verdict binaire « humain ou IA ».

Profil éditorial · IA & outils

Noa Lumen

En bref

  • AnthropicLaboratoire d’IA américain à l’origine des modèles Claude, accessibles par API et non téléchargeables. confirme que Claude utilisera une variante de SynthID-Text, la méthode publiée par Google DeepMind en 2024.
  • Le watermark ne repose sur aucun caractère caché : il modifie la source d’aléa utilisée pour choisir entre plusieurs tokensUnité de texte traitée par un modèle (souvent un morceau de mot). Les coûts et fenêtres de contexte se comptent en tokens. plausibles.
  • Il fonctionne surtout quand le modèle dispose de beaucoup de choix linguistiques et sur des textes assez longs ; il est beaucoup plus faible sur le code, les faits précis ou une simple correction grammaticale.
  • Un détecteur muni de la clé peut estimer que Claude a probablement participé à un texte, mais pas dire qu’il l’a écrit seul, ni déterminer qu’un texte non marqué est humain.
  • Une réécriture complète peut effacer le signal. Le watermark est donc un outil de provenance coopérative, pas un détecteur universel de contenus IA.
  • Le watermark ne contient aucune information identifiante sur une personne, une organisation ou une conversation.
  • Anthropic indique qu’il n’ajoute ni tokens ni surcoût, et ne ralentit pas la génération.
  • La conclusion pour l’écosystème est plus large : watermark, C2PA, labels et historique de production devront fonctionner ensemble. Aucun signal isolé ne suffira.
Sommaire · 11 sections

Anthropic vient de publier la pièce qui manquait

Le 11 août, nous revenions sur l’arrivée du watermark dans les textes de Claude et sur le mouvement plus large vers la provenance des contenus générés. Une question restait alors ouverte : qu’est-ce qu’Anthropic allait réellement mettre dans le texte ?

La réponse est arrivée le 14 août.

Anthropic explique désormais que les futurs modèles Claude utiliseront une variante de SynthID-Text, la méthode publiée par Google DeepMind en 2024. Le déploiement se fera progressivement, notamment pour les modèles antérieurs au 2 août 2026. Et ce détail permet de refermer le sujet avec un peu plus de précision, parce qu’il montre à la fois pourquoi le watermarking textuel est techniquement crédible et pourquoi il ne résoudra jamais, à lui seul, la question de la détection des textes générés par IA.

Le point essentiel est simple : Claude n’ajoute pas de caractère invisible, de métadonnée cachée ou de code secret dans une phrase. Le modèle modifie la manière dont il tranche entre plusieurs mots plausibles au moment de la génération.

C’est moins spectaculaire qu’une signature numérique. C’est aussi beaucoup plus intéressant.

Le watermark vit dans les choix que le modèle aurait pu faire autrement

Un modèle de langage ne rédige pas un texte en choisissant toujours un mot unique et nécessaire. À de nombreux endroits, plusieurs continuations sont presque équivalentes.

Après une phrase comme « le temps aujourd’hui était froid et… », le modèle peut avoir plusieurs mots raisonnables à sa disposition. Dans un fonctionnement classique, une part d’aléa intervient pour sélectionner l’un d’eux. Avec le watermark, explique Anthropic, la source de cet aléa dépend d’une clé et du contexte précédent.

Le résultat reste naturel à la lecture. Mais sur suffisamment de décisions successives, une personne disposant de la clé peut tester si la séquence observée correspond statistiquement aux choix qu’aurait produits le mécanisme de watermarking.

Anthropic précise que sa méthode est dérivée de SynthID-Text, publié par Google DeepMind dans Nature. Cette approche agit au niveau de l’échantillonnage des tokens et a déjà été testée à grande échelle sur Gemini. Google avait notamment évalué son impact sur près de 20 millions de réponses et n’avait pas observé de dégradation statistiquement significative dans les retours utilisateurs.

Cette architecture explique aussi pourquoi Anthropic peut affirmer trois choses en même temps : le watermark n’ajoute aucun token, n’introduit aucun caractère caché et ne change pas visiblement le style du texte.

Mais cette architecture révèle immédiatement sa première limite.

Un watermark textuel ne peut exister que lorsqu’il y a réellement un choix à marquer.

Plus un texte doit être exact, moins il y a de place pour le watermark

C’est probablement le passage le plus important du nouveau billet d’Anthropic.

Dans un texte créatif ou explicatif, Claude dispose souvent de nombreuses formulations possibles. Le système peut alors accumuler suffisamment de décisions marquées pour produire un signal détectable.

Dans un passage factuel, la marge se réduit. Anthropic prend l’exemple de la phrase « Isaac Newton’s most famous work was called Principia… » : le mot suivant, Mathematica, est pratiquement imposé. Le modèle ne peut pas choisir une autre continuation simplement pour renforcer un watermark sans sacrifier l’exactitude.

Le même problème apparaît dans le code. Une variable, une syntaxe, une valeur ou une instruction ne peuvent pas être modifiées librement sans risquer de casser le programme. Anthropic indique donc que le code porte généralement moins de watermark que du texte naturel, sauf dans les zones où plusieurs formulations restent interchangeables — les commentaires, par exemple.

Et c’est encore plus visible dans la correction légère.

Si vous donnez à Claude un texte humain en lui demandant uniquement de corriger la grammaire et la ponctuation, presque tous les mots restent ceux de l’auteur initial. Claude effectue trop peu de choix pour qu’un signal statistique fort puisse forcément émerger.

Cela conduit à une conclusion importante : plus l’IA joue le rôle d’assistant discret, moins le watermark est mécaniquement capable de documenter cette assistance.

Le système est donc naturellement meilleur pour identifier un texte substantiellement généré que pour retracer chaque micro-intervention d’un modèle dans un workflow éditorial.

Ce watermark ne détecte pas « l’IA » : il détecte une compatibilité avec Claude

C’est l’autre confusion qu’Anthropic cherche à dissiper.

Le détecteur à venir ne pourra pas répondre à la question : « ce texte a-t-il été écrit par une IA ? »

Il pourra seulement estimer quelque chose de beaucoup plus étroit : quelle est la probabilité que Claude ait participé à la génération de ce texte ?

La distinction est fondamentale.

Chaque fournisseur peut utiliser une clé différente, voire une méthode différente. Un texte généré par un autre modèle peut donc ne présenter aucun signal lisible avec la clé d’Anthropic. Et un texte sans watermark Claude ne devient évidemment pas, par magie, un texte humain.

Inversement, détecter le signal ne permet pas de dire que Claude est « l’auteur » du texte. Anthropic l’écrit explicitement : le mécanisme ne peut pas distinguer un texte entièrement produit par Claude d’un texte humain lourdement réécrit par Claude.

La provenance technique et l’attribution éditoriale ne sont pas la même chose.

C’est un point particulièrement important pour les médias, agences, chercheurs, développeurs et équipes marketing. Un workflow moderne peut faire intervenir un modèle pour traduire, reformuler, résumer, corriger, structurer ou adapter un contenu. Dans ces cas, la question pertinente n’est pas toujours « qui a écrit ? », mais « quel outil a participé, à quel niveau, et pour quelle transformation ? »

Le watermark apporte un morceau de cette réponse. Pas davantage.

La longueur et l’entropie deviennent des conditions de la détection

SynthID-Text repose sur un signal statistique. Cela signifie que la confiance augmente lorsque le détecteur dispose de suffisamment d’observations.

Anthropic reconnaît donc que les petits échantillons fonctionnent moins bien. Google DeepMind décrit la même propriété dans le papier d’origine : plus le texte est long, plus le détecteur accumule de preuves.

La deuxième variable est ce que les chercheurs appellent l’entropie de la distribution du modèle — autrement dit, la quantité de choix raisonnables disponibles au moment de sélectionner le prochain token.

Un modèle qui hésite entre plusieurs continuations plausibles offre beaucoup d’espace pour encoder un signal. Un modèle qui n’a pratiquement qu’une seule bonne réponse en offre très peu.

C’est presque un paradoxe : le watermark est plus facile à intégrer dans les zones où le langage est flexible que dans celles où la réponse doit être strictement correcte.

Cette propriété empêche d’en faire un mécanisme uniforme qui fonctionnerait avec la même puissance sur un article, une équation, un bout de code, une liste de dates et une correction orthographique.

Une réécriture complète peut effacer le signal

Anthropic répond également sans détour à l’une des objections les plus évidentes : peut-on retirer le watermark en éditant le texte ?

Oui, dans une certaine mesure.

Une retouche légère ne suffit probablement pas à supprimer tout le signal. En revanche, une réécriture complète, où les mots sont remplacés et les formulations reconstruites, peut le faire disparaître.

Ce n’est pas une faiblesse propre à Claude. La littérature sur le watermarking textuel documente depuis longtemps la tension entre trois objectifs difficiles à maximiser simultanément : imperceptibilité, robustesse et qualité du texte.

Des travaux publiés à EMNLP en 2025 ont par exemple montré que plusieurs familles de watermarks restent vulnérables aux transformations interlingues et aux attaques par traduction. Des recherches plus récentes cherchent précisément à rendre ces signaux plus robustes face à la paraphrase ou à la traduction.

Il faut donc éviter une erreur de perspective : le watermark n’est pas conçu comme une protection anti-copie inviolable. Il s’agit d’un signal probabiliste qui reste utile tant qu’une partie suffisante de la structure générée demeure présente.

Et ce point change complètement la manière dont il faut juger la technologie.

Le watermark est un mécanisme de provenance coopérative

Si l’on attend du watermark qu’il identifie n’importe quel contenu IA, même après transformation volontaire, il semblera rapidement insuffisant.

Mais ce n’est probablement pas le bon cadre.

Le système fonctionne lorsque le producteur du modèle coopère avec l’écosystème : il marque ses sorties, conserve une méthode de détection et fournit une APIApplication Programming Interface : contrat machine pour consommer un service (HTTP, SDK, webhooks). permettant de vérifier le signal.

C’est une forme de provenance à la source.

Cette logique a une filiation ancienne dans l’IA générative. Anthropic rappelle notamment les travaux proposés dès 2022 par Scott Aaronson sur le watermarking statistique des sorties de modèles. Le principe a depuis évolué vers des méthodes industrialisables comme SynthID-Text.

Cette logique de provenance à la source se distingue radicalement des détecteurs externes qui tentent de reconnaître un « style IA » à partir de statistiques, de formulations récurrentes ou de classifieurs entraînés sur des corpus humains et synthétiques. Anthropic cite d’ailleurs Pangram comme exemple de cette famille et évoque certains « tells » stylistiques devenus familiers, comme les constructions du type « ce n’est pas X, c’est Y » ou l’usage fréquent de « quietly ».

Mais ces détecteurs post hoc ont leurs propres limites. Une étude de Liang et al., publiée en 2023 dans Patterns, a notamment montré qu’ils peuvent produire beaucoup plus de faux positifs sur les textes rédigés par des personnes non anglophones natives.

Le watermark inverse la logique : au lieu d’essayer de deviner après coup comment un texte a été produit, le système de génération laisse volontairement un signal au moment où il écrit.

C’est plus fiable dans son domaine de validité. Mais ce domaine reste limité aux fournisseurs qui jouent le jeu et aux portions du texte qui conservent suffisamment de signal.

L’AI Act ne crée donc pas un détecteur universel — il crée une obligation d’infrastructure

Cette distinction permet aussi de mieux comprendre ce que fait réellement l’Union européenne.

Depuis le 2 août 2026, l’article 50 de l’AI Act impose aux fournisseurs concernés d’ajouter aux contenus générés ou manipulés des marques lisibles par machine permettant leur détection. Le règlement lui-même demande que ces solutions soient, dans la mesure où cela est techniquement possible, efficaces, interopérables, robustes et fiables.

Anthropic explique d’ailleurs appliquer son watermark mondialement, faute de moyen durable pour limiter proprement ce comportement à une région donnée.

L’effet le plus important de la réglementation n’est donc peut-être pas de permettre demain à un professeur, un journaliste ou un recruteur d’obtenir un verdict universel « IA / humain ».

Il est plutôt de pousser les principaux fournisseurs à construire des mécanismes standardisables de marquage et de vérification.

C’est un changement beaucoup plus infrastructurel.

Le web s’est déjà construit de cette manière sur d’autres sujets : identité, chiffrement, certificats, signatures, provenance des fichiers. Aucun de ces mécanismes ne répond seul à toutes les questions de confiance, mais chacun fournit un signal vérifiable que d’autres outils peuvent utiliser.

Le watermark des LLMLarge Language Model : modèle de langage entraîné sur d’énormes corpus pour prédire et générer du texte. suit probablement le même chemin.

C2PA, watermark, labels : la solution sera forcément multicouche

C’est ici que notre précédent article reste valide, mais peut maintenant être précisé.

Pour les fichiers comme PNG, JPG ou SVG, Anthropic utilise des Content Credentials C2PA : des métadonnées de provenance signées qui peuvent indiquer qu’un fichier a été créé ou traité avec Claude.

Pour le texte, la firme utilisera un signal statistique embarqué dans les choix de génération.

Pour les contenus publiés, le cadre européen prévoit également des obligations de labelling dans certains contextes, notamment pour les deepfakes et certains textes destinés à informer le public sur des sujets d’intérêt général.

Ces couches ne sont pas redondantes. Elles compensent leurs faiblesses respectives.

Les métadonnées peuvent être supprimées. Le watermark peut être affaibli par une réécriture. Un label visible dépend du comportement du diffuseur. Un journal de production interne n’est pas toujours accessible au lecteur final.

Mais combinés, ces éléments peuvent donner une image beaucoup plus robuste de la provenance.

C’est probablement vers cela que l’écosystème se dirige : non pas un détecteur magique, mais un faisceau de signaux.

Ce que cela change réellement pour les professionnels

Pour une agence, un média ou une équipe produit, la conséquence la plus utile n’est pas de chercher comment « passer » ou « éviter » un détecteur.

Il faut plutôt commencer à considérer la provenance comme une propriété du workflow.

Qui a produit le premier jet ? Quelle partie a été traduite ? Quel modèle a reformulé le texte ? Un humain a-t-il validé les faits ? Les fichiers exportés conservent-ils leurs credentials ? Le CMS préserve-t-il les métadonnées ? Une politique interne distingue-t-elle génération, assistance et simple correction ?

Ces questions deviennent plus importantes à mesure que les systèmes de marquage se généralisent.

Et le nouveau billet d’Anthropic apporte une nuance rassurante pour les usages légers : une simple correction grammaticale d’un texte humain ne produira pas nécessairement un watermark détectable, précisément parce que Claude aura pris trop peu de décisions linguistiques pour créer un signal suffisant.

À l’inverse, une traduction complète produite par Claude est beaucoup plus susceptible d’être marquée, puisque le modèle choisit alors pratiquement tous les mots.

Le niveau de provenance observable dépend donc naturellement de l’intensité de l’intervention du modèle.

Pour les usages API, deux autres points sont concrets : Anthropic indique que le watermark ne demande pas de tokens supplémentaires et n’entraîne ni coût additionnel ni ralentissement. Pour les équipes sensibles aux questions de confidentialité, l’entreprise précise aussi que le signal n’encode pas l’identité de l’utilisateur, de son organisation ou de sa conversation.

La bonne conclusion n’est pas « on saura enfin détecter les textes IA »

Après plusieurs annonces sur SynthID, C2PA, ElevenLabs, Suno et maintenant Claude, il serait tentant de conclure que l’industrie est en train de résoudre le problème de la détection des contenus synthétiques.

Ce serait aller trop loin.

Le nouveau détail technique publié par Anthropic montre presque l’inverse.

Un watermark textuel moderne peut être invisible, peu coûteux, déployable à grande échelle et suffisamment fiable pour confirmer qu’un modèle particulier a probablement contribué à un texte. C’est déjà beaucoup.

Mais il dépend de la longueur, de la liberté de génération, de la conservation du signal et de l’accès à une clé. Il ne peut pas identifier les productions d’un autre système, ne transforme pas l’absence de marque en preuve d’origine humaine et ne résiste pas nécessairement à une réécriture complète.

La provenance n’est donc pas en train de remplacer le jugement éditorial, la vérification des faits ou la responsabilité de celui qui publie.

Elle devient une couche technique supplémentaire de contexte.

Et c’est probablement la conclusion la plus utile pour clore ce volet : après des années passées à chercher un détecteur capable de reconnaître l’IA de l’extérieur, l’industrie commence à accepter une approche plus réaliste.

On ne saura pas toujours déduire avec certitude comment un texte a été produit en le regardant après coup.

En revanche, on peut demander aux systèmes qui le génèrent de laisser, lorsqu’ils le peuvent, des preuves vérifiables de leur passage.

Lecture 404 Mates

Le détail technique publié par Anthropic ferme une ambiguïté importante : le watermark de Claude n’est pas une « signature secrète » collée au texte, mais un signal statistique produit pendant l’échantillonnage. C’est précisément ce qui le rend intéressant — et limité.

Pour les builders, médias et agences, il faut donc cesser de traiter le watermarking comme une future police scientifique capable de trancher « humain ou IA ». Le bon modèle mental est celui d’une preuve de provenance fournie par un producteur coopératif. Elle devient utile lorsqu’elle s’insère dans une chaîne plus large : signal embarqué dans le texte, credentials C2PA pour les fichiers, journalisation des outils utilisés et règles éditoriales explicites.

L’AI Act accélère cette infrastructure, mais la technique impose sa propre limite : plus un contenu est exact, court, fortement édité ou réécrit, moins le signal est exploitable. Le paradoxe est donc clair : le watermark est le plus robuste lorsque l’IA écrit réellement une part importante du texte — et beaucoup moins lorsqu’elle joue le rôle d’outil discret d’assistance. C’est probablement la bonne conclusion à retenir de ce cycle de publications sur la traçabilité des contenus générés.

Poursuivez votre lecture

Tout afficher