Face à l'AI Act, le choix d'Anthropic du watermark est-il waterproof ?

Google, Anthropic, OpenAI : l’AI Act impose de marquer le texte IA. Le régulateur sait qu’un seul mécanisme ne suffit pas — sauf dans la loi elle-même.

Depuis le 2 août 2026, l’AI Act impose à tout fournisseur d’IA générative de marquer ses textes — Google le fait discrètement depuis 2024, Anthropic vient de le documenter publiquement, OpenAI promet de s’y mettre. Le régulateur sait qu’un seul mécanisme de marquage ne suffit jamais : il l’écrit noir sur blanc dans son propre Code of Practice. Il ne l’écrit jamais dans la loi elle-même.

Madagascar, le grille-pain, le vélo violet et la stéganographie

Jason Gibson ↗, professeur d’histoire à l’université d’Alcorn State (Mississippi), suspicieux de l’usage « raisonné » des LLM par ses étudiants étant donné l’homogénéité de devoir, a caché une consigne dans le sujet de son devoir à mi-année : un texte blanc sur fond blanc, invisible à l’œil, demandant d’intégrer le mot « Madagascar » dans la copie, sans logique apparente. Un étudiant qui lit l’énoncé ne voit rien. Une IA à qui l’on copie-colle l’énoncé entier, elle, lit tout, y compris l’instruction invisible, et l’exécute docilement. Résultat : 32 copies sur 35 contenaient le mot, parfois dans des phrases absurdes ( « Madagascar porte un grille-pain à un match de basket » ou encore « Madagascar, le vélo violet, murmure au plafond »), preuve que leurs auteurs avaient délégué la rédaction sans même relire ce qu’ils rendaient.

@iamjasongibson I can’t make this stuff up. #professor #highereducation #college #midterm ♬ Piano famous song Chopin Deep deep clear beauty - RYOpianoforte

Ce piège n’a rien à voir avec le watermarking, mais il illustre exactement le principe qui le sous-tend, et pourquoi un texte peut cacher un message de deux façons distinctes :

  1. La cryptographie chiffre le message : sans la clé, le texte codé reste illisible, et casser le chiffrement consiste à retrouver cette clé.

  2. La stéganographie ne chiffre rien, elle cache le message dans un support qui n’éveille aucun soupçon : le message est là, à la vue de tous, mais indétectable sans savoir où et comment chercher. Le mot « Madagascar » en texte blanc sur fond blanc en est un exemple presque scolaire.

Représentation antique de stéganographie : message caché sur le crâne rasé d’un messager

Dans l’Antiquité, on pouvait marquer le message sur le crâne d’un messager rasé que ses cheveux, repoussés, cachaient. Bon d’accord, il vaut mieux que ça ne soit pas urgent…

Le watermarking de texte IA appartient à la seconde famille, mais dans l’autre sens : ce n’est plus l’énoncé qui piège le rédacteur, c’est le modèle qui signe sa propre sortie. SynthID-Text et KGW ne codent aucun message secret dans le texte, ils biaisent discrètement le choix des mots pour y laisser une trace statistique repérable, un peu comme un filigrane caché dans le grain du papier plutôt qu’un coffre-fort verrouillé par une combinaison. Casser un coffre-fort et repérer un filigrane dans le bruit du papier ne sont pas la même opération, et pourtant l’AI Act traite les deux comme si « marquer » un texte suffisait à « garantir » son origine.

Retirer un watermark, ou refuser sa logique

Je voulais vérifier un outil de contournement du watermarking IA sur GitHub. Dans une première session sur Opus, Claude a refusé de l’installer, malgré le cadre de recherche et de sécurité posé dès le départ. Mais le refus n’a pas tenu longtemps : sur une nouvelle session, cette fois sur Sonnet, la même demande est passée sans friction, avec le même cadrage. Le jugement de sécurité d’un modèle n’était donc pas une règle stable pour cette requête, mais une évaluation statistique qui varie d’une session à l’autre, sans qu’aucune règle explicite n’ait changé entre les deux. C’est le même écart, en miniature, que celui que cet article décrit pour le watermark : une apparence de garantie qui se révèle, à y regarder de près, être un jugement probabiliste.

Guillaume Meyer, fondateur de Memo, a publié ‘watermarks-remover’ ↗ quatre heures après avoir lu l’annonce d’Anthropic. Sa motivation, il l’a explicitée dans une tribune ↗ publiée quelques jours plus tard : « I’d rather argue about this with my hands dirty than from the sidelines » (je préfère en débattre les mains dans le cambouis plutôt que depuis les gradins). Il ne s’agit pas d’un contournement opportuniste, mais d’un geste de curiosité technique doublé d’une objection de principe qu’il pose d’emblée : « Je ne suis pas contre l’attribution du contenu. Je suis contre la technique du watermarking. » Meyer ne conteste pas qu’un texte généré par IA mérite d’être tracé, il conteste que le watermark statistique soit le bon mécanisme pour le faire.

Son argument le plus fort est structurel, et il recoupe exactement ce que Google DeepMind et Anthropic admettent chacun de leur côté (voir plus haut et plus bas) : le watermark tient d’autant mieux que le texte a été le moins retouché. Plus un auteur relit, restructure, traduit, discute la sortie du modèle et la corrige, plus la marque statistique s’estompe. Meyer le formule sans détour : « The system punishes exactly the people doing the most authorship work, and rewards, with invisibility, the people who did none. » Ce n’est pas un défaut d’implémentation qu’un futur correctif réglerait, c’est une conséquence directe du principe même du watermarking par biais de tokens : moins de retouche, plus de biais préservé, plus de retouche, moins de biais détectable.

Le reste du projet consiste à réécrire le texte par un autre modèle de langage et à mesurer l’écart lexical produit avec un indice de Jaccard sur les bigrammes (on découpe les deux textes en paires de mots consécutifs, on compte la proportion de paires communes). Plus l’indice est bas, plus la marque statistique a de chances de s’être diluée avec la reformulation. L’objectif n’est pas de décoder le signal, mais de le noyer, exactement le geste que Meyer décrit dans sa tribune : refuser la marque en la faisant sienne au point qu’elle en disparaisse.

Ce que le repo teste, ce n’est donc pas « peut-on casser le watermark ? » mais « peut-on le rendre méconnaissable en changeant la formulation ? » Il s’appuie sur MarkLLM, un ensemble d’outils académique de référence pour évaluer des watermarks (Tsinghua, EMNLP 2024), pour vérifier ses propres résultats. Son README pose lui-même la limite de l’exercice : la détection via MarkLLM n’est valide que contre le même schéma et la même clé qu’à la génération, et aucun outil ne peut certifier honnêtement qu’un détecteur commercial échouera, faute d’accès aux clés et détecteurs propriétaires des fournisseurs. Cette honnêteté sur ses propres limites est rare pour ce genre de projet, et cohérente avec la posture de Meyer dans sa tribune : il ne prétend jamais avoir « vaincu » le watermarking, seulement avoir montré jusqu’où une reformulation honnête peut le rendre indiscernable du bruit.

Le repo procède en deux couches. La première, Layer A, nettoie l’hygiène Unicode du texte (caractères invisibles, homoglyphes) qui pourrait elle-même porter une marque. La seconde, Layer B, fait réécrire le texte par un second modèle puis mesure l’écart lexical produit. Aucune des deux ne touche à la clé de génération ni au mécanisme de sélection de tokens, l’une nettoie la surface, l’autre noie le signal par changement de représentation. Le pari du Layer B n’a d’ailleurs rien de spéculatif : Anthropic l’admet elle-même ↗ pour son propre watermark, une légère édition ne le supprimera probablement pas complètement, mais une réécriture où chaque mot est remplacé, si. C’est exactement la stratégie que le repo automatise, et exactement le geste que Meyer défend comme légitime, pas un contournement furtif, mais l’exercice normal de la réécriture d’un auteur qui s’approprie un texte.

Ce que Meyer propose à la place n’est pas l’absence de traçabilité, mais un autre étage pour la porter : des métadonnées de provenance signées au niveau du fichier ou de la plateforme, sur le modèle du standard ouvert C2PA qu’Anthropic utilise déjà pour ses images, plutôt qu’un filigrane invisible dans le grain du texte. Un label visible, porté par qui partage, plutôt qu’une empreinte cachée que personne n’a accepté de porter.

Ce que la loi - l’AI Act - présuppose

Depuis le 2 août 2026, l’article 50 de l’AI Act ↗ (règlement 2024/1689) pose deux obligations distinctes, portées par deux acteurs différents. Le paragraphe 2 impose aux fournisseurs de systèmes d’IA générative (Anthropic, Google, OpenAI) de marquer leurs sorties d’une manière « lisible par machine » : c’est l’obligation technique, à la source. Le paragraphe 4 impose aux « déployeurs », ceux qui utilisent le système pour publier un texte informatif, de divulguer au lecteur que le contenu est généré par IA. Ces deux obligations ne se recouvrent pas : la première marque le texte en profondeur, la seconde prévient le lecteur en surface.

Le paragraphe 4 porte une exception qui change tout pour qui publie avec de l’IA : la divulgation ne s’impose pas si le texte « a fait l’objet d’une révision humaine ou d’un contrôle éditorial, et qu’une personne physique ou morale assume la responsabilité éditoriale ». Autrement dit, un éditeur qui utilise Claude pour un premier jet, le relit, l’édite et publie sous sa responsabilité, n’a aucune obligation de mentionner l’usage de l’IA, alors même que le texte final peut continuer à porter, invisible, la marque technique imposée au fournisseur par le paragraphe 2. Le watermark ne disparaît pas quand l’obligation de le signaler disparaît.

Anthropic a déployé un tel marquage sur Claude ↗ dès le 2 août 2026, sur l’ensemble de ses usages mondiaux, pas seulement européens. La controverse a suivi dans l’heure sur Hacker News ↗ : dégradation perçue de la qualité de sortie, et pari des utilisateurs que le marquage tombera vite (« cleanClaude » a commencé à circuler comme nom de projet de contournement avant même la fin de la semaine, cf. cette analyse de la controverse ↗).

Le texte de loi impose la présence d’un mécanisme technique. Il ne qualifie aucun seuil de robustesse. Le Code of Practice qui l’accompagne ↗ (finalisé le 10 juin 2026, guidelines publiées le 20 juillet) exige une approche multicouche, combinant plusieurs techniques de marquage. C’est un aveu réglementaire implicite : le régulateur lui-même ne considère aucune technique isolée, watermarking statistique compris, comme suffisante. Mais cet aveu reste enfermé dans le Code of Practice. Il n’est jamais répercuté dans le texte de l’article 50, qui continue de lire comme si « marquer » et « garantir » étaient la même opération.

Gros plan sur un mécanisme de marquage invisible, métaphore du filigrane statistique

Comment le filigrane tient, et jusqu’où

Le mécanisme derrière SynthID-Text ↗ (Google DeepMind) et KGW ↗ (Kirchenbauer et al., 2023) fonctionne par un biais pseudo-aléatoire dans le choix des mots. À chaque token généré, le modèle dispose d’une clé dérivée du contexte qui favorise discrètement certains mots plutôt que d’autres, sans jamais changer le sens de la phrase. La détection consiste à repérer statistiquement ce biais sur un texte suffisamment long, un mécanisme entièrement distinct de la détection stylométrique, qui devine la source d’un texte sans qu’aucune marque n’y ait jamais été insérée.

Le SRI Lab de l’ETH Zürich ↗ a mesuré un taux de succès supérieur à 90 % pour « effacer » (scrub) la marque SynthID-Text avec des paraphraseurs standards, sans avoir jamais touché à la clé. Google DeepMind reconnaît lui-même ↗, dans son propre blog, que SynthID s’affaiblit face à la paraphrase, la traduction et les éditions lourdes. Ce n’est pas une faille découverte par des attaquants extérieurs : c’est une propriété admise par le concepteur de l’outil.

La dégradation, en revanche, n’est pas un interrupteur binaire. Le papier fondateur de KGW ↗ montre que le signal reste statistiquement détectable si l’on observe suffisamment de tokens, environ 800 après une paraphrase humaine forte. Le watermark ne disparaît pas d’un coup avec la première reformulation venue, il s’estompe progressivement selon l’intensité de l’attaque et le schéma employé, moins un interrupteur qu’un filigrane qui pâlit à mesure qu’on froisse le papier.

La fragilité face à la paraphrase n’est d’ailleurs qu’une des deux limites. L’autre tient à la nature même du texte à marquer, et Anthropic la documente elle-même ↗ pour Claude : le mécanisme dépend de décisions « à faible enjeu », des mots interchangeables sans perte de sens, sur lesquels le modèle peut se permettre de biaiser son choix. Un texte factuel en offre peu ; une suite de chiffres ou une formule mathématique n’en offre aucune, une fois « 2 + 2 = » écrit, il n’y a qu’une suite plausible ; du code en offre nettement moins que de la prose ; et quand Claude relit un texte rédigé par un humain sans le réécrire, il n’y a presque rien sur quoi le watermark puisse s’accrocher. Ce n’est pas un défaut d’implémentation à corriger, c’est une conséquence directe du principe : le watermark vit dans les marges de liberté du texte, et certains textes n’en ont quasiment pas.

La dissuasion ne garantit rien

Une objection revient naturellement : le watermark n’a pas besoin d’être infaillible, il doit seulement décourager l’usage de bonne foi. C’est vrai, et ça marche : contre quelqu’un qui copie-colle une sortie de Claude sans y toucher, la marque tient. La preuve avec nos étudiants de tout à l’heure. Mais l’article 50 de l’AI Act ne distingue à aucun moment l’usager naïf de l’acteur déterminé. Le texte impose un mécanisme de marquage, point. Il ne dit jamais « suffisant pour dissuader » ou « suffisant pour garantir » ; il laisse cet écart à la charge de qui s’y fie.

Comme on l’a vu plus haut, Google DeepMind, le concepteur de SynthID, l’a lui-même écrit noir sur blanc : sa technique s’affaiblit face à la paraphrase. C’est l’acteur le mieux placé pour connaître les limites de son propre outil qui les documente publiquement, un aveu qui pèse plus lourd venant de lui que d’un tiers. Si même lui ne présente jamais le watermarking comme une garantie contre un usage malveillant, un texte de loi qui laisse planer l’ambiguïté fait porter à l’utilisateur final un risque que le fournisseur, lui, ne prend pas.

L’ambiguïté va plus loin qu’une simple absence de seuil. Anthropic le précise elle-même ↗ : le watermark ne confirme jamais qu’un texte est d’origine humaine, et il ne distingue pas un texte rédigé par Claude d’un texte relu ou lourdement édité par Claude. Il répond à une seule question, « Claude a-t-il probablement participé ? », jamais à « dans quelle mesure ? ». Un consultant qui recommande la conformité article 50 recommande donc un outil qui ne sait pas dire ce qu’il détecte réellement.

Ce que ça change selon votre poste

Un consultant qui recommande un dispositif de conformité IA à un client doit distinguer « le fournisseur a implémenté un marquage » de « le marquage tiendra avec adversaire déterminé ». Ce sont deux affirmations différentes, et seule la première est vérifiable à ce stade. La question à poser au fournisseur n’est donc pas « êtes-vous conforme à l’article 50 ? », mais « quel taux de dégradation votre marquage tolère-t-il avant qu’une paraphrase standard ne le rende indétectable ? ». Si le fournisseur ne peut pas répondre par un chiffre, la conformité affichée ne dit rien de la robustesse réelle.

Pour un manager qui publie ou fait publier du contenu généré par IA, l’exception éditoriale du paragraphe 4 change l’arbitrage : relire et endosser un texte dispense de le signaler comme généré par IA, mais ne dispense pas de la marque technique qu’il porte peut-être encore. Cocher la case « conforme à l’AI Act » ne dit donc rien sur ce que le texte révèle, ou pas, à un lecteur qui saurait où chercher.

Le cas n’est pas théorique. Une note clinique rédigée par un scribe IA ambiant, relue et signée par le médecin, illustre bien l’angle mort du dispositif : au Permanente Medical Group, 7 260 médecins ont utilisé ce type d’outil sur 2,5 millions de consultations en un an, avec une adoption croissante et une expérience jugée très positive par les praticiens (Liu et al., NEJM Catalyst, 2025 ↗). Rien dans cette étude ne porte sur le watermarking — mais elle nomme précisément la situation que l’article 50 traite mal : le médecin, auteur et responsable légal de la note, en a peut-être réécrit l’essentiel. Si le texte porte malgré tout une marque statistique résiduelle, cette marque ne distingue jamais « le médecin a rédigé » de « le médecin a validé » — c’est Anthropic elle-même qui le concède pour Claude (§ plus haut). Guillaume Meyer, dans sa tribune contre le watermarking, pousse le raisonnement jusqu’au risque patient : un dossier étiqueté « généré par IA » peut entamer la confiance dans un diagnostic dont le médecin reste pourtant seul responsable. Une marque mal comprise, brandie contre un dossier que le médecin a pourtant validé, ne menace donc pas qu’une image : la médecine elle-même reconnaît ce mécanisme, au point d’organiser ses essais en double aveugle pour isoler l’effet placebo — la part du soin qui tient à la confiance, indépendamment du traitement administré.

Si vous évaluez ou choisissez un outil de watermarking en tant que professionnel technique, comprendre le mécanisme exact (biais de sélection de tokens) change ce que vous testez. Un test de robustesse pertinent mesure la dégradation sous paraphrase, pas la résistance à une attaque cryptographique qui n’a jamais existé. Le critère de passage n’est donc jamais « la clé résiste-t-elle ? » mais « à partir de quel volume de reformulation le détecteur décroche-t-il ? ».

Ce que j’en retiens

Le mot « watermark » emprunte au vocabulaire de la filigrane papier et laisse entendre une preuve matérielle, quasi-physique, comme pour les billets de banque. Ici, le mécanisme réel est statistique, probabiliste, et se dégrade en fonction de l’effort investi à le noyer. Si on cherche à identifier les contenus générés par l’IA et qu’un humain le transforme significativement pour en dissiper l’origine, alors… ce n’est plus véritablement un contenu généré par l’IA. « Tout va bien. »

Le problème n’est donc pas que le watermarking IA soit une mauvaise technique. C’est que le texte réglementaire qui l’impose ne nomme jamais cette limite, alors même que le régulateur la connaît suffisamment pour exiger une approche multicouche en pratique. Tant que cet écart reste implicite, chaque acteur qui s’appuie sur un seul mécanisme de marquage pour sa conformité prend un risque qu’il n’a pas mesuré : celui de confondre la présence d’un signal avec une garantie de marquage.

Pour prolonger

Simon Singh, Histoire des codes secrets : de l’Égypte des pharaons à l’ordinateur quantique, Livre de Poche, 2001. Point d’entrée accessible sur les techniques liées aux codes secrets. La vision historique permet d’expliquer la dynamique créateur de code / casseur de code avec des exemples historiques réels, connus et moins connus.

Écrire avec l’IA : ce que la machine fait mieux que moi prolonge cette limite structurelle : si ni la détection ni le marquage ne peuvent trancher, il reste une seule source possible, l’auteur lui-même.


Les opinions exprimées ici sont personnelles et n'engagent pas mon employeur.