11 août 2026 · 11 min de lecture

Claude met désormais un filigrane dans ses textes, y compris dans ce qui m'a aidé à écrire celui-ci

Aujourd'hui, Anthropic a confirmé que Claude glisse discrètement un filigrane invisible dans les textes qu'il produit. Chaque modèle sorti à partir du 2 août le fait au moment de la génération, partout dans le monde, sans possibilité de le désactiver et sans exception pour les entreprises. Si vous avez lu mes autres notes, vous savez que je suis team Claude, et vous devinez sans peine que Claude a aussi donné un coup de main pour rédiger celle-ci. Donc, selon les propres règles d'Anthropic, une partie des mots que vous lisez en ce moment sont marqués. Beau sujet pour tester la chose.

Le titre qui circule, c'est « Claude sait maintenant repérer les textes écrits par une IA ». Ce n'est pas ce qui s'est passé. Ce qui s'est passé est plus étroit, plus étrange, et sur un point précis presque l'inverse de ce que les gens supposent. Reprenons dans l'ordre.

Ce qu'Anthropic a réellement dit

L'annonce n'est pas un article de recherche. C'est une page d'aide mise à jour, « How Claude marks AI-generated content ». Le mécanisme, dans leurs mots : quand un modèle Claude compatible génère du texte, il tisse un filigrane imperceptible directement dans le texte. Vous ne le voyez pas, et ça ne change ni le sens, ni la qualité, ni la lisibilité.

Deux choses que ce n'est explicitement pas. Ce ne sont ni des métadonnées, ni des caractères cachés. C'est cuit dans le choix des mots, donc ça survit au copier-coller et « peut persister à travers certaines modifications ». C'est appliqué au niveau du modèle, ce qui veut dire sur toutes les surfaces : claude.ai, l'API, Claude Code, et Claude utilisé via AWS, Google Cloud ou Microsoft Foundry. Les développeurs ne peuvent pas le couper. Aucune exemption documentée pour les offres Team, Enterprise ou zéro-rétention.

Les fichiers sont traités à part. Pour les sorties .svg, .png et .jpg, Anthropic attache à la place des métadonnées de provenance C2PA signées, ce qui est une tout autre chose (j'y reviens plus bas). C'est le filigrane textuel qui compte.

Pourquoi maintenant ? Parce que les règles de transparence de l'article 50 du règlement européen sur l'IA sont devenues applicables le 2 août, et qu'Anthropic a signé le Code de bonnes pratiques de la Commission sur le marquage des contenus d'IA. Le non-respect grimpe jusqu'à 15 millions d'euros ou 3 % du chiffre d'affaires mondial, donc « on marque tout, partout » est la réponse la moins chère. C'est une manœuvre de conformité déguisée en fonctionnalité de provenance. Ce n'est pas présenté comme un outil anti-triche, et il ne faut pas le lire comme tel.

Un dernier point sur lequel ils ont été étonnamment honnêtes : il n'existe pas encore de détecteur public. Il « arrive ». Donc pour l'instant, personne en dehors d'Anthropic ne peut réellement vérifier un texte. On marque d'abord, on détectera plus tard.

Comment marche un filigrane textuel invisible

Un modèle de langage écrit un token à la fois, en piochant dans une distribution de probabilités. La plupart du temps, plusieurs options quasi équivalentes se présentent : « grand », « gros », « imposant ». Un filigrane statistique se sert d'une clé secrète pour biaiser discrètement ce choix vers un sous-ensemble pseudo-aléatoire de tokens autorisés. Chaque phrase prise isolément se lit toujours naturellement. Mais sur quelques centaines de tokens, le biais s'accumule en une empreinte statistique qu'un détenteur de la clé peut mesurer, avec une p-value, sans aucune marque visible.

Le terrain est bien balisé côté recherche. Le schéma de la « liste verte » (Kirchenbauer, 2023) découpe le vocabulaire à chaque étape et pousse vers la moitié « verte », puis la détection compte les tokens verts par rapport au hasard. L'approche Gumbel d'Aaronson fait la même chose via un échantillonnage cryptographique. Le SynthID-Text de Google est le seul déployé à grande échelle, en service dans Gemini depuis 2024 et validé sur près de 20 millions de réponses. Anthropic n'a pas dit à quelle famille appartient le sien.

Voici le point qui décide de tout le reste : le filigrane ne loge que là où le modèle avait un vrai choix. La prose à forte entropie, la partie créative qui coule, porte un signal fort. Le texte à faible entropie n'en porte quasiment aucun, parce qu'il n'y avait rien à biaiser. Ce qui signifie :

  • Le code est à peine marqué. Les identifiants, la syntaxe et la structure sont imposés. Passez un linter ou un formateur dessus et le maigre signal qui existait a disparu. Le code produit par Claude Code est donc presque invisible pour ce dispositif, alors que ses messages de commit et ses explications, eux, sont marqués normalement.
  • Les réponses courtes sont à peine marquées. Une ligne unique ou une seule phrase passe sous le seuil. Une détection fiable réclame en général quelques centaines de mots. La propre mise en garde d'Anthropic (« très court, laissant trop peu de texte pour un signal fiable ») dit la même chose en plus doux.

Le piège de la relecture

C'est le point sur lequel j'aimerais que chaque professionnel s'arrête vraiment, parce qu'il fonctionne à rebours de l'intuition.

Disons que vous écrivez un paragraphe vous-même, puis que vous demandez à Claude de le relire, de le resserrer ou de le traduire. La sortie est générée par Claude, donc elle peut porter la marque, alors même que chaque idée vient de vous. Anthropic le dit noir sur blanc : un texte que vous faites « relire, traduire, résumer ou convertir » peut porter une marque Claude « même si les idées, le texte ou les données d'origine viennent d'ailleurs ».

Inversez maintenant. Vous générez un premier jet entièrement avec Claude, puis vous le réécrivez lourdement avec votre propre voix, ou vous le faites passer dans une autre langue et revenir. La marque s'amincit et disparaît probablement.

Lisez ces deux cas ensemble et l'absurdité saute aux yeux. Un rédacteur humain qui n'a utilisé Claude que pour peaufiner en ressort marqué. Quelqu'un qui s'est fortement appuyé dessus mais a tout réécrit en ressort propre. Le signal est presque l'inverse de « qui a fait le travail de réflexion ». Comme l'a résumé le chercheur Ian Miers, un filigrane ne sait pas distinguer un humain assisté par l'IA d'une IA tout court. Il n'a jamais été conçu pour ça.

Ça ne résiste pas à une bagarre

Les filigranes tiennent bien face à une manipulation ordinaire. Copier-coller, quelques mots changés, une prose légèrement reformatée : le signal reste. Face à quelqu'un qui cherche vraiment à l'enlever, la recherche n'est pas tendre.

  • La paraphrase. Une attaque par paraphrase récursive (Sadasivan et al.) a fait chuter la détection d'un texte marqué de 99,3 % à 9,7 % de vrais positifs, la paraphrase étant jugée de bonne qualité par des évaluateurs humains. Évasion quasi totale, à peine un coût sur la qualité.
  • Les allers-retours de traduction. Faites passer un texte dans une autre langue et revenir, et les marques au niveau du token se dissolvent. C'est l'une des raisons qu'OpenAI a données pour remiser son propre filigrane.
  • Le vol et l'usurpation. Une équipe de l'ETH Zurich a montré qu'en interrogeant une API marquée, on peut reconstituer assez de la règle pour à la fois l'effacer et, pire, l'usurper, « pour moins de 50 dollars » avec « plus de 80 % » de réussite. L'usurpation est l'inverse inquiétant : coller la marque sur un texte humain ou malveillant pour faire passer un labo ou une personne pour l'auteur. Ils ont confirmé que SynthID est usurpable de cette manière.

Donc une détection positive ne prouve pas qu'on a utilisé une IA, et une absence de détection ne prouve pas le contraire. La marque peut être fabriquée sur un texte innocent et arrachée d'un texte coupable par quiconque s'en donne la peine.

Trois choses que les gens continuent de mélanger

La plupart des mauvaises couvertures viennent d'une confusion entre des technologies qui n'ont rien à voir. Gardez-les séparées :

Technique Ce que c'est Survit au copier-coller ? Survit à une édition décidée ?
Filigrane statistique / dans le token Biais tissé dans le choix des mots (Claude, Gemini) Oui Non : la paraphrase ou la traduction le tue
Caractères cachés Espaces de largeur nulle, U+202F, Unicode bizarre Parfois Non : n'importe quel « suppresseur de caractères invisibles » l'enlève
Métadonnées C2PA Manifeste signé attaché à côté d'un fichier Non Sans objet : une capture d'écran ou un ré-enregistrement l'efface

La ligne du milieu, c'est la panique « tirets cadratins et espaces bizarres » de ChatGPT l'an dernier. Il s'est avéré que c'étaient surtout des artefacts d'entraînement, pas un filigrane volontaire, et de toute façon on les enlève d'un clic. La C2PA, ligne du bas, est cryptographiquement certaine quand elle est là, mais elle tombe dès que vous faites une capture ou un ré-encodage, ce qui est précisément pourquoi c'est la moitié « fichiers » de l'approche d'Anthropic et pas la moitié « texte ». La marque textuelle de Claude, c'est la ligne du haut, et rien qu'elle. Quand un titre parle de « métadonnées », il se trompe.

Le cimetière des détecteurs

Si je tiens à mettre ça au clair, c'est qu'on sait déjà comment le film se termine quand les institutions traitent un signal probabiliste comme un verdict.

OpenAI a sorti un classificateur de texte IA début 2023 et l'a tué six mois plus tard. Ses propres chiffres finaux : il repérait correctement 26 % des textes d'IA tout en signalant à tort 9 % des textes humains. Une pièce de monnaie sous anxiolytiques.

Pire encore, le biais. L'étude décisive de Stanford (publiée dans Patterns) a fait tourner sept détecteurs sur des copies rédigées par des non-anglophones et les a vus signaler à tort 61,3 % de cette écriture humaine comme étant de l'IA, contre environ 5,1 % pour les natifs. Simplifiez le vocabulaire et vous déclenchez le détecteur, qu'une machine ait été dans les parages ou non. De vrais étudiants ont été convoqués en conseil de discipline pour exactement ça, et c'est pour cette raison qu'une bonne partie des universités ont discrètement éteint leurs détecteurs.

Un filigrane est un meilleur signal que ces détecteurs. Mais « mieux qu'un truc cassé » ne veut pas dire « preuve », et la tentation de traiter chaque voyant vert comme un aveu va être énorme. Ajoutez le risque d'usurpation vu plus haut, et vous obtenez un signal falsifiable dans le sens de l'accusation. De grâce, ne bâtissez pas une politique qui condamne quelqu'un là-dessus.

Où j'atterris

La marque en soi ne me dérange pas trop. Elle est imperceptible, elle ne touche pas à la qualité, et je préfère que les grands labos respectent une loi de transparence plutôt que de la combattre. Lucas Beyer l'a appelée la première bonne chose sortie de la régulation européenne sur l'IA, et un jour de beau temps je suis à moitié d'accord.

Ce qui me dérange, c'est l'écart entre ce que c'est et ce pour quoi on va le prendre. C'est un signal faible, dicté par la conformité, du genre « traité par Claude », qui meurt à la moindre vraie réécriture, ne survit pas à une traduction, s'efface pour le prix d'un sandwich, et qui, de l'aveu même d'Anthropic, n'est « pas pleinement concluant ». Ce n'est pas un détecteur de mensonge pour la paternité d'un texte, et le groupe le plus susceptible de se brûler à ce qu'on le prenne pour tel, c'est, une fois de plus, le rédacteur honnête qui a utilisé l'IA pour peaufiner plutôt que pour réfléchir.

Donc le bon réflexe n'est ni de craindre la marque, ni d'essayer de la déjouer. C'est de dire ce que vous avez fait. J'utilise Claude en permanence, cette note comprise, et je continuerai à vous le dire noir sur blanc plutôt que de vous faire lancer un détecteur qui, de toute façon, ne peut pas répondre à la question. Écrivez « marqué veut dire traité, pas rédigé » dans votre politique de contenu avant votre premier litige, pas après. Et quand Anthropic sortira ce détecteur, les chiffres à surveiller seront le taux de faux positifs et la longueur minimale. Si l'un des deux est mauvais, la déclaration honnête valait de toute façon plus que le filigrane.

Ce billet porte un filigrane. Je vous le dis moi-même. C'est la version de la transparence qui, elle, fonctionne vraiment.


Tiré de la page d'aide d'Anthropic « How Claude marks AI-generated content », de l'article SynthID-Text paru dans Nature (oct. 2024), de Kirchenbauer et al. sur le filigrane à liste verte, de Sadasivan et al. sur les attaques par paraphrase, des travaux de l'ETH Zurich sur le vol de filigrane, de l'étude Stanford dans Patterns sur le biais des détecteurs contre les non-anglophones, de la note de fermeture du classificateur d'OpenAI, et du texte de l'article 50 du règlement européen sur l'IA. Instantané au 11 août 2026. Le détecteur d'Anthropic et ses vrais chiffres de fiabilité ne sont pas encore publics, donc vérifiez support.claude.com avant de me citer sur l'efficacité réelle de tout ça.