Le premier fournisseur de visibilité IA à bloquer un robot n'a pas écrit la règle
Balayage de 77 fournisseurs de visibilité IA, dont un seul interdit des robots, via un robots.txt géré qui vise l'entraînement et non l'accès.
Le 17 août 2026 nous avons balayé les robots.txt de cette catégorie : 68 fournisseurs en servaient un et 0 n’interdisaient aucun des 14 robots d’IA que nous suivons. Nous avons relancé le même balayage le 21 août sur un catalogue plus large. 77 servent un fichier et 1 bloque. L’intéressant n’est pas le compte. C’est que le fournisseur qui bloque n’a pas écrit la règle, et que ce que la règle exclut est l’entraînement et non l’accès, ce qui partage nos 14 robots en exactement 7 bloqués et 7 autorisés.
Transparence et méthode : EchoWi vend de la mesure de visibilité IA, et chaque fournisseur de ce balayage est un concurrent. C’est précisément pour cela que la méthode est mécanique et non éditoriale : nous récupérons le
robots.txtde chaque fournisseur sur son propre hôte, nous évaluons les règles pour 14 robots nommés au chemin que chaque fichier indique, et nous rapportons ce que le fichier dit. Aucun user-agent n’est falsifié, car un agent falsifié ne prouve rien sur l’accès. 78 entrées du catalogue interrogées, 77 ont servi un fichier, 1 derrière un défi anti-robot et placée dans son propre seau plutôt que comptée comme conforme, 21 août 2026. Les comptes sont dans notre registre de mesures, et le fichier est public, donc n’importe qui peut refaire cela contre nous.
La version courte
- Un zéro publié a disparu. Le 17 août 2026, 68 fournisseurs servaient un fichier et 0 n’interdisaient aucun robot d’IA. Le 21 août, 77 servent et 1 bloque.
- La règle est un réglage géré par défaut, pas la phrase du fournisseur. Le fichier porte
# BEGIN Cloudflare Managed contentet tous les blocages sont dedans. Une fois cette section refermée, la contribution propre du fournisseur est un seulDisallowsur un chemin. - Elle bloque l’entraînement et laisse l’accès ouvert. Sur nos 14 robots, 7 sont interdits et 7 ne le sont pas, et la ligne entre les deux moitiés suit ce à quoi sert chaque robot.
- Les robots qui apportent les citations sont tous dans la moitié autorisée, donc sur cette base le fournisseur perd sa présence dans les corpus et garde les réponses.
- La liste gérée n’est pas exhaustive, et le trou est nommé plus bas.
- C’est un avant-goût du 15 septembre, ce qui est la raison d’y prêter attention et se trouve dans la dernière section.
Quel fournisseur, et pourquoi nous le nommons
Le fournisseur est Knowatoa, et knowatoa.com/robots.txt dit tout cela en public. L’apex et le www servent des fichiers identiques octet pour octet de 1 968 octets, vérifiés séparément, car un hôte et son www peuvent différer et ce registre s’est déjà fait prendre une fois à supposer le contraire.
Nous le nommons pour la même raison que nous publions le prompt exact de chaque mesure : un chiffre que vous ne pouvez pas vérifier n’est pas un chiffre. N’importe qui peut récupérer ce fichier en une commande et voir si nous l’avons bien lu.
Et nous allons être prudents sur ce que cela signifie, car le titre évident est faux. « Un fournisseur de visibilité IA bloque des robots d’IA » est une bonne phrase et une mauvaise description. Le blocage est à l’intérieur d’une section gérée, c’est-à-dire un réglage et non une phrase que quelqu’un a écrite, et il arrête les robots qui construisent des corpus d’entraînement tout en laissant tranquille chaque robot qui récupère une page pour répondre à une question.
Ce que le fichier contient réellement
Trois parties, dans cet ordre.
Un préambule. Vingt-six lignes qui définissent le vocabulaire des Content Signals et se terminent par une déclaration selon laquelle toute restriction exprimée par ce biais est une réserve expresse de droits au titre de l’article 4 de la directive européenne sur le droit d’auteur. C’est du texte type livré avec le fichier géré, non rédigé par le fournisseur, mais il fait un travail juridique quand même.
Le bloc géré. Il s’ouvre sur un groupe * portant Allow: / et Content-Signal: search=yes,ai-train=no,use=reference, puis interdit neuf agents sans détour : Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, CloudflareBrowserRenderingCrawler, Google-Extended, GPTBot et meta-externalagent.
La règle propre du fournisseur, après # END Cloudflare Managed Content. C’est une ligne : un second groupe * avec un Disallow sur un seul chemin du site.
La politique de robots propre au fournisseur est donc un chemin. Tout ce qui se lit comme une position sur l’IA est une liste gérée, et la ligne Content-Signal dit la même chose dans l’autre vocabulaire : indexer et citer des extraits est acceptable, entraîner ne l’est pas.
Il y a une subtilité de structure à connaître pour quiconque audite ce genre de fichier. Il y a deux groupes *, un dans chaque section. Un analyseur qui s’arrête à la première correspondance voit Allow: / et rapporte le site comme entièrement ouvert ; un analyseur qui garde la dernière ne voit que la règle de chemin. Aucun des deux n’est le fichier entier. Nous avons commis exactement cette erreur, sur le fichier de quelqu’un d’autre, et c’est pour cela que notre balayage lit chaque groupe et non le premier qu’il trouve.
Entraînement et accès sont deux permissions distinctes, et une seule est bloquée
C’est la distinction que la catégorie n’arrête pas d’écraser, et ce fichier la trace à peu près aussi nettement qu’elle peut l’être.
| Bloqués, sur les 14 suivis | Autorisés, sur les 14 suivis |
|---|---|
| GPTBot | OAI-SearchBot |
| ClaudeBot | ChatGPT-User |
| Google-Extended | Claude-User |
| CCBot | Googlebot |
| Applebot-Extended | PerplexityBot |
| Bytespider | Perplexity-User |
| meta-externalagent | anthropic-ai |
Cela fait 7 et 7. Chaque robot de la colonne de gauche existe pour collecter des corpus. 6 des 7 de la colonne de droite existent pour récupérer une page pendant qu’ils répondent à la question de quelqu’un. Une marque qui bloque la colonne de gauche perd sa présence dans l’entraînement et garde ses citations. Une marque qui bloque la colonne de droite disparaît des réponses.
C’est pourquoi le compte brut induirait en erreur. La moitié des robots suivis bloquée, cela sonne sévère. La moitié bloquée alors qu’aucun de cette moitié ne porte de citation, c’est un autre fait et il pointe dans l’autre sens.
Le fichier bloque aussi Amazonbot et CloudflareBrowserRenderingCrawler, qui sont en dehors des 14 que nous suivons et ne figurent donc pas dans ce tableau. Nous les mentionnons parce que les omettre du texte ferait paraître le fichier plus petit qu’il n’est.
Le trou dans la liste gérée
anthropic-ai est dans la colonne des autorisés, et il n’y a pas sa place selon la logique du reste du fichier. C’est l’ancien nom d’agent qu’Anthropic utilisait pour la collecte d’entraînement. La liste gérée bloque ClaudeBot et le manque.
Ce n’est pas une critique du fournisseur, qui n’a pas écrit la liste. C’est l’argument contre le fait de traiter un blocage géré comme une politique : c’est un instantané de la vision d’un prestataire sur les noms d’agents qui comptent, il est maintenu au calendrier de quelqu’un d’autre, et un nom qui tombe en dehors n’est simplement pas couvert. Si l’intention est ai-train=no, ce fichier ne la tient pas entièrement, et rien sur le site du fournisseur ne le lui dirait.
Est-ce que cela a changé, ou l’avons-nous manqué ?
C’est ici qu’il faut être prudent sur ce que l’on peut réellement prouver.
Le fournisseur est entré dans notre catalogue le 7 août, dix jours avant le balayage qui a trouvé 68 fournisseurs servant un fichier et aucun bloquant. Le seul fournisseur exclu de ce balayage était derrière un défi anti-robot et c’est une autre entreprise. L’inférence est donc que ce fichier a changé entre le 17 et le 21 août 2026.
C’est une inférence, pas une observation enregistrée. Ce balayage a consigné des agrégats, 68 servant et 0 bloquant, et non une ligne par fournisseur. Il n’existe aucune ligne dans notre registre disant que ce fournisseur autorisait tout le 17 août. Ce que nous avons est un total sans place pour un bloqueur, et un catalogue qui contenait déjà ce fournisseur. C’est solide, et c’est plus faible qu’un diff.
Le correctif est le correctif évident et c’est désormais le plan : enregistrer le résultat par fournisseur plutôt que le total, pour qu’un changement soit la prochaine fois un diff et non une déduction. Nous l’écrivons publiquement parce que le même défaut est probablement dans votre propre surveillance. Un agrégat suffit à remarquer que quelque chose a bougé et jamais à dire quoi.
Pourquoi cela comptera plus le 15 septembre que maintenant
Cloudflare change ses réglages par défaut pour les robots d’IA le 15 septembre 2026. Deux points de cette annonce concernent ce fichier.
Le premier est que le changement s’applique aux règles gérées, c’est-à-dire à la section qui fait ici tout le blocage. Personne chez le fournisseur n’a besoin de toucher à quoi que ce soit pour que le comportement de son site change.
Le second, et celui qui mérite d’être noté, est que les robots qui font à la fois recherche et entraînement deviennent bloqués par tout réglage qui bloque l’entraînement, y compris les réglages choisis avant le changement.
Pour une entreprise qui vend de la visibilité dans les réponses d’IA, c’est la direction coûteuse. Un blocage d’entraînement est bon marché : vous perdez la présence dans les corpus et gardez les citations, ce qui est un échange cohérent. Un blocage d’entraînement qui attrape aussi les robots mixtes ne l’est pas, car les robots mixtes sont ceux qui récupèrent une page pour la citer.
Rien ici ne dit que cela s’est produit. Le fichier d’aujourd’hui bloque l’entraînement et laisse l’accès ouvert, ce qui est exactement ce que devrait vouloir une entreprise qui veut être citée et non absorbée. Le point est que cette position est aujourd’hui tenue par un réglage par défaut, et les réglages par défaut bougent le 15 septembre 2026.
Ce que cela ne démontre pas
Un fournisseur n’est pas une tendance. Le résumé honnête est qu’un zéro est devenu un un, sur une population qui a par ailleurs grandi. Le contenu est le mécanisme, pas le taux, et nous dirions la même chose si le compte revenait à zéro la semaine prochaine.
Une déclaration n’est pas un comportement. Un robots.txt énonce ce qu’on demande à un robot. Il n’établit pas que le robot a obéi, que les pages sont citées, ni que quelque chose a changé dans une réponse. Chacun de nos chiffres d’accès de robots porte cette limite et celui-ci ne fait pas exception.
Nous ne pouvons pas prouver que le fichier a changé, seulement que notre propre agrégat de quatre jours plus tôt ne laisse pas de place pour cela.
Et nous n’avons pas interrogé le fournisseur. Ceci est la lecture d’un fichier public, pas un rapport sur l’intention de quiconque. Un blocage géré est un réglage, et un réglage peut être actif pour des raisons sans rapport avec une position sur l’IA.
Et les 76 autres sont le constat qui se trouve sous celui-ci. 76 sur 77 servent un fichier qui n’interdit aucun des 14 robots que nous suivons. Quoi que cette catégorie débatte en public, ses propres portes d’entrée sont ouvertes.
Questions fréquentes
Bloquer les robots d’entraînement est-il une erreur pour une marque ?
Pas en soi, et l’échange est lisible. Bloquer GPTBot, ClaudeBot et Google-Extended vous retire des corpus d’entraînement tout en laissant OAI-SearchBot, Claude-User et Googlebot libres de récupérer vos pages quand un assistant répond à une question. Si votre inquiétude est d’être absorbé et votre objectif d’être cité, c’est le réglage cohérent. Cela devient un problème quand une règle pensée pour l’entraînement attrape aussi les robots qui récupèrent, et c’est ce qui change le 15 septembre 2026.
Comment vérifier mon propre fichier ?
Récupérez votredomaine.fr/robots.txt et cherchez # BEGIN Cloudflare Managed content. S’il est là, la liste de blocage à l’intérieur n’est pas la vôtre et elle bougera quand les réglages par défaut du prestataire bougeront. Lisez chaque groupe et pas seulement le premier, car un fichier géré et vos propres règles peuvent tous deux viser *. Vérifiez l’apex et le www séparément, car ils peuvent servir des fichiers différents.
Un robots.txt géré peut-il remplacer celui que j’ai écrit ?
Oui, et c’est le risque qu’il faut connaître. Le fichier géré peut être servi à la place du vôtre, de sorte qu’une déclaration que vous avez commitée peut cesser d’être servie sans que rien ne change dans votre dépôt. Nous auditons notre propre réglage exactement pour cela, car pour une entreprise qui publie des déclarations de robots, se les faire remplacer en silence serait l’échec le plus embarrassant disponible.
Pourquoi une liste de robots et pas un seul chiffre ?
Parce que l’entraînement et l’accès sont des permissions distinctes et qu’un compte unique cache la différence. La liste couvre les deux côtés de chaque grand prestataire, de sorte qu’un fichier qui bloque l’un et autorise l’autre apparaît comme tel au lieu de s’effondrer en un score. Ce fichier en est l’illustration : un seul chiffre se serait lu comme une demi-liste bloquée, alors que le fait utile est laquelle des deux moitiés.
Content-Signal fait-il quelque chose à lui seul ?
C’est une déclaration, pas une exécution, et c’est jeune. Cela vaut la peine de le poser parce que cela énonce l’intention de façon lisible par machine et, selon le préambule livré avec ces fichiers, cela se présente comme une réserve de droits au titre du droit d’auteur européen. Ce que cela ne fait pas, c’est arrêter un robot. Les lignes Disallow sont ce qu’un robot conforme respecte, et ni l’un ni l’autre n’engage un robot qui ignore le fichier.
Interrogez une IA sur cet article
Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.
- ChatGPT (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Claude (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Perplexity (ouvre un nouvel onglet)
- Google AI Mode (ouvre un nouvel onglet)
Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.