Aller au contenu
AI VisibilityGEO
FR

La plupart des domaines qui obtiennent des citations IA ne publient pas de llms.txt. La plupart des fournisseurs qui vendent l'idée, si.

Nous avons demandé leur llms.txt à 69 fournisseurs de visibilité IA et à 122 domaines vus cités, le même jour. Les fournisseurs le publient bien plus souvent.

· Mis à jour · 18 min de lecture

Le 14 août 2026 nous avons demandé leur llms.txt à deux groupes, avec le même script et le même jour : les 69 fournisseurs de notre catalogue d’outils de visibilité IA, et les 122 domaines que notre registre a notés comme cités trois fois ou plus dans des réponses IA. Parmi les fournisseurs joignables, 44 sur 68 en publient un. Parmi les domaines cités, 49 sur 112. C’était le premier bras. Il a depuis été répété sur deux autres strates disjointes de domaines cités, dont le registre donne les tailles, et le taux tient trois fois. Ceux qui vendent la convention la publient à environ deux tiers. Les sites qui obtiennent vraiment les citations la publient à moins de la moitié.

Transparence : EchoWi vend de la mesure de visibilité IA et publie lui-même un llms.txt, nous sommes donc dans la ligne des fournisseurs et nous avons un intérêt dans ce que vaut ce fichier. La méthode est un GET sur /llms.txt à l’origine de chaque domaine, un seul jour, en comptant les défis de bot et les échecs réseau à part des fichiers absents. Les comptes sont dans notre registre de mesures, la règle de population est écrite plus bas, et le refaire contre nous prend un après-midi.


La version courte

  1. Les fournisseurs publient un llms.txt sur 44 des 68 domaines joignables. C’est le groupe dont le produit consiste à vous rendre lisible pour les machines.
  2. Les domaines que nous avons vus cités le publient sur 49 sur 112. C’est le groupe que les machines citent réellement.
  3. L’écart va dans le sens contraire de l’argument de vente. Si le fichier était ce qui rapporte des citations, le groupe cité devrait être devant, et il est derrière d’une vingtaine de points.
  4. Ce n’est pas la preuve que le fichier nuit, ni qu’il ne fait rien. Deux populations qui diffèrent sur une convention ne sont pas un mécanisme, et nous n’allons pas prétendre le contraire.
  5. Cela suffit pour une affirmation étroite, et elle est utile : obtenir des citations n’exige pas de llms.txt, car la plupart des domaines qui en obtiennent n’en ont pas.
  6. Six fichiers de fournisseur font moins de 2 Ko, donc présents et trop petits pour indexer quoi que ce soit.
  7. Une troisième strate de 1 221 domaines cités une seule fois tranche quelle moitié du croisement de robots se réplique. Le nommage oui, z 5,47. Le blocage non, z 1,87.

Ce qu’un llms.txt prétend être

llms.txt est une convention proposée : un fichier markdown à la racine d’un site qui donne à un modèle de langage une carte curatée de ce qui compte, dans l’ordre qu’un humain recommanderait. L’argument est simple et pas déraisonnable. Un robot qui atterrit sur un grand site doit déduire la structure de la navigation et des liens internes ; un fichier qui dit « voici les douze pages qui comptent et voici ce que fait chacune » lui enlève ce travail de devinette.

Il n’a pas de spécification derrière lui au sens où les Content Signals en ont une, pas de registre, et aucune déclaration publiée par un grand moteur disant qu’il le lit. Ce dernier point compte et nous y reviendrons, car une convention dont personne n’a démontré la consommation est autre chose qu’une convention dont le consommateur est connu.

Ce qu’il a, c’est une adoption dans une industrie précise : les outils qui vendent de la visibilité IA. C’est l’observation d’où part cette pièce.

Deux populations, un jour, un instrument, puis une troisième strate

La comparaison ne veut dire quelque chose que si les deux moitiés ont été mesurées pareil et en même temps, alors c’est comme ça que ça a été fait.

La population de fournisseurs, ce sont les 69 outils de notre catalogue vérifié de logiciels de visibilité IA et d’optimisation pour moteurs de réponse. Elle nous inclut.

La population citée, c’est chaque domaine que notre registre de mesures a noté comme apparaissant dans trois lignes de sonde distinctes ou plus : 122 des 1 019 domaines distincts qu’il a vus. Le seuil est arbitraire et nous le déclarons plutôt que de l’enterrer. Trois ou plus veut dire qu’un domaine est ressorti sur plusieurs questions et pas une seule, ce qui est la différence entre un site vers lequel la couche de réponse se tourne et un site qui se trouvait là. En abaissant la barre à deux, la population fait 286 ; en la montant à cinq, 44.

L’instrument est un GET sur /llms.txt à l’origine de chaque domaine, en suivant les redirections. Trois de ses choix décident du résultat :

GET, jamais HEAD. Un serveur n’est pas tenu de répondre à une requête HEAD. Un vérificateur de liens antérieur de ce projet a signalé deux pages parfaitement vivantes comme mortes exactement pour cette raison, alors celui-ci demande la chose qu’il veut lire.

Un défi n’est pas un fichier absent. Les statuts 401, 403, 429 et 999 signifient qu’un contrôle anti-bot s’est mis en travers, ce qui est une preuve sur la bordure et non sur l’existence d’un fichier. Sept domaines cités et un fournisseur tombent là. Les ranger dans « pas de llms.txt » aurait fabriqué un chiffre dans le sens de notre propre titre, et c’est exactement le moment d’être prudent.

Un 200 n’est pas un fichier. Certains hébergeurs répondent à n’importe quel chemin par leur page marketing. Un corps qui ouvre un document HTML n’est pas un llms.txt quoi qu’ait dit la ligne de statut, et neuf domaines cités ont répondu ainsi.

C’est pourquoi le tableau ci-dessous porte deux dénominateurs. Interrogés, c’est la population entière. Joignables, c’est interrogés moins les défis et les échecs réseau. Les deux sont publiés parce qu’un lecteur a le droit de vérifier si le choix du dénominateur fait le travail.

Les chiffres

FournisseursDomaines vus cités
Interrogés69122
Joignables68112
Publient un llms.txt4449
Part des joignables65 pour cent44 pour cent
Moins de 2 Ko63
Taille médiane9 535 octets15 378 octets

Deux choses sont à lire dans ce tableau avant de bâtir un argument dessus.

La première est l’écart lui-même : 65 pour cent contre 44. Si publier ce fichier était ce qui rapporte des citations, le groupe cité devrait être le groupe qui le publie, et la relation est inverse.

La seconde est la taille médiane, qui va contre la façon la plus facile de balayer le fichier. Parmi les domaines cités qui en publient un, la médiane dépasse 15 Ko : ce ne sont pas des gestes symboliques. Et six fichiers de fournisseur font moins de 2 Ko, présents et trop petits pour être l’index de quoi que ce soit, si bien que le chiffre des fournisseurs leur est un peu généreux.

Reposée sur quatre fois et demie plus de domaines, et elle tient

Le chiffre ci-dessus compte des domaines cités, c’est donc l’axe à élargir plutôt qu’à répéter. La règle qui donnait 122 domaines le 14 août en donne 547 aujourd’hui, parce que le registre a grandi, et il existe une seconde strate de 379 domaines cités exactement deux fois qui ne partage aucun membre avec elle. Les deux ont été interrogées le 25 août 2026, le protocole et trois seuils écrits d’abord.

Cités 3 fois ou plusCités exactement deux fois
Domaines interrogés547379
Ont dit si le fichier existe503349
En servent un209153
Part de ceux qui ont répondu41,6 pour cent43,8 pour cent

43,8, c’est le chiffre publié à la décimale près. Le premier bras sort à 41,6, et l’intervalle autour de l’original allait de 34,9 à 53,0 : les deux tombent dedans. Un nombre mesuré sur 112 domaines a tenu sur 503, puis sur 349 disjoints.

Croisé avec les règles de robots des mêmes sites

C’est la partie que l’étude précédente ne pouvait pas faire. Les mêmes domaines ont été lus pour leur robots.txt la veille, donc publier un llms.txt et bloquer un robot d’IA se croisent sur un même site au lieu de se comparer comme deux totaux.

La prédiction, écrite avant la requête, était que les publieurs bloqueraient moins, puisque le fichier existe pour servir du contenu à un modèle. En cumulant les deux strates :

Sur les domaines ayant répondu aux deuxPublient llms.txtNon
Domaines360479
Nomment une règle de robot d’IA34 pour cent24 pour cent
En interdisent au moins un9 pour cent16 pour cent

Les publieurs écrivent des règles d’IA plus souvent et leurs règles disent non moins souvent. Les deux directions tiennent en cumulé, z de 3,37 pour nommer et 3,14 pour bloquer. Le fichier n’est donc pas décoratif : il voyage avec une posture.

Et les bras ne s’accordent pas sur laquelle des deux moitiés est réelle, ce qui vaut mieux que le chiffre cumulé. Dans la strate très citée l’écart de blocage fait 10 points et sort net, z de 3,18, tandis que l’écart de nommage n’est rien. Dans la strate citée deux fois c’est l’inverse : nommer sépare fort, z de 4,02, et bloquer tombe à 3 points, ce que le protocole gelé appelle ne rien distinguer.

La prédiction est donc confirmée dans un bras et pas dans l’autre, et c’est ainsi qu’elle est publiée. Une troisième strate, plus grande, a été lancée ensuite et elle tranche : le nommage se réplique, le blocage non, et la section ci-dessous donne les six cellules. Rien de ce paragraphe n’est retiré, mais ne vous arrêtez pas ici. La direction est la même des deux côtés. La taille non, et ce protocole ne peut pas dire pourquoi.

Et cela tranche une question qu’une étude sœur avait laissée ouverte. En croisant llms.txt avec le markdown chez des fournisseurs, faire l’une ne prédit pas faire l’autre : 62 % contre 57 %, un écart plus petit qu’un seul fournisseur. La différence entre les deux résultats n’est pas la convention, c’est la nature de ce qu’on croise. Publier un fichier et servir du markdown sont deux corvées, et leur adoption suit le coût. Ce que dit un robots.txt d’un robot d’IA est une posture. Croiser deux corvées ne sépare rien ; croiser une corvée avec une posture, si.

Le résultat sur le nommage n’était pas prédit du tout. Il est donné comme observation, car un constat qui arrive après les données est une hypothèse pour le bras suivant et non un résultat de celui-ci.

Une troisième strate, et elle dit quelle moitié se réplique

Les deux bras ci-dessus ne s’accordaient pas, donc la démarche honnête était de lancer le bras qui a la puissance de trancher. Il y a 1 221 domaines enregistrables que notre registre a vus cités exactement une fois, disjoints des deux strates précédentes et plus grands que les deux réunies. Le protocole, la statistique décisive et quatre seuils ont été gelés et commités avant la première requête.

Publieurs contre non-publieursCités 3+Cités deux foisCités une fois
Domaines croisés4953441 102
Nomment une règle d’IA34 contre 2934 contre 1635 contre 20
z sur le nommage1,244,025,47
En interdisent au moins un9 contre 209 contre 117 contre 10
z sur le blocage3,180,891,87

Le nommage se réplique, le blocage non. La règle gelée disait que si une seule des deux différences survivait à la plus grande strate, celle-là est l’effet et l’autre appartenait à la strate d’où elle venait. Le nommage sépare dans deux bras sur trois, avec les deux plus grandes valeurs de z. Le blocage sépare dans un seul, le plus petit et le plus cité.

Mais la direction est la même dans les six cellules, et cela compte plus que les seuils. Les publieurs nomment davantage dans les trois bras, de 5, 18 et 15 points. Les publieurs bloquent moins dans les trois, de 11, 2 et 3. Ce qui ne se réplique pas n’est pas le signe, c’est la taille, et dans les deux lignes c’est la strate très citée qui s’écarte des deux autres.

Le chiffre cumulé ci-dessus n’est donc pas retiré, et il ne suffit pas à lui seul. Un z cumulé sur des strates qui divergent d’un facteur cinq est de l’arithmétique et non la preuve d’un effet stable, et voici le paragraphe qui le dit à propos de notre propre chiffre.

En cumulant les trois strates, le nommage donne 35 contre 22 %, z de 6,32. Nous citons celui-là et pas son jumeau de blocage, et la raison est le paragraphe ci-dessus et non le résultat : le nommage se réplique entre les strates, donc le cumuler veut dire quelque chose, et le blocage non, donc le cumuler ne ferait que blanchir le chiffre d’un seul bras dans un dénominateur plus grand.

La prédiction qui a payé portait sur les publieurs

Avant de mesurer, nous avions écrit que si les publieurs formaient une population stable ils reviendraient près de 34 % au nommage et 9 % au blocage, avec des bandes de 27 à 41 et de 4 à 15. Ils sont revenus à 35 et 7.

Sur trois strates disjointes allant d’une citation à plus de trois, les publieurs donnent 34, 34 et 35 % au nommage et 9, 9 et 7 au blocage. C’est la même population trois fois. Ceux qui bougent sont les non-publieurs, 29, 16 et 20 au nommage, et c’est pourquoi la prédiction qu’ils baisseraient de façon monotone avec la citation a échoué : il n’y a pas de tendance, le bras du milieu est simplement celui qui s’écarte.

Ce que les sites écrivent vraiment

La statistique cache quelque chose de plus simple que la strate de la queue rend visible. Sur les 1 132 domaines qui ont servi un robots.txt, 306 nomment un robot d’IA et seulement 104 en interdisent un. Donc 204 ont écrit la règle et ont dit oui. Deux bloquent sans nommer personne, pris par un User-agent: * général.

Cela recadre tout le croisement. La différence entre publieurs et non-publieurs n’est pas que les premiers refusent davantage. C’est qu’ils ont un avis écrit, et deux fois sur trois cet avis est une autorisation.

Et 29 des 104 bloqueurs sont une valeur par défaut gérée, un blocage écrit par un CDN et non par le site. Nous les séparons parce qu’une déclaration n’est pas un auteur, et qu’un décompte du web coupant l’entraînement de l’IA est en partie un décompte de la décision produit d’un fournisseur.

Le taux de llms.txt lui-même n’a pas bougé : 41,6, 43,8 et 44,0 % sur les trois strates. Publier le fichier n’est pas une propriété de combien on vous cite.

Ce que ceci ne montre pas

C’est la section qui compte le plus, parce que le titre est du genre qu’on cite sans elle.

Cela ne montre pas que le llms.txt ne fait rien. Deux populations qui diffèrent sur une convention ne sont pas un mécanisme. Nous n’avons pas mené d’intervention, il n’y a pas d’avant et d’après, et rien ici n’isole le fichier de tout le reste de ces sites.

Les deux populations ne se ressemblent pas, mais la composition n’est pas l’explication. L’ensemble cité contient youtube.com, reddit.com, forbes.com et pcmag.com, de grands éditeurs avec leurs standards de publication et leur revue juridique, et la première version de cette section disait qu’une part inconnue de l’écart venait de là. Ce n’est pas le cas. En découpant la population citée selon la fréquence à laquelle nous l’avons vue citée, la tranche la plus citée publie le fichier à 8 sur 17 joignables et tout ce qui est en dessous à 41 sur 95, soit le même taux, et les deux bien en dessous des fournisseurs. L’écart, ce ne sont pas les grands noms.

La sélection passe au milieu. La population citée est définie par nos propres sondes, sur nos marchés, avec nos questions. Un autre jeu de questions donnerait d’autres 122.

Une convention sans consommateur démontré est difficile à tester. Aucun grand moteur n’a publié qu’il lit le llms.txt. Nous n’avons pas observé de requête du nôtre par un robot IA nommé que nous puissions attribuer au fichier plutôt qu’au crawl ordinaire, et nous n’allons pas en revendiquer une.

Nous n’avons pas mesuré si le publier a changé quoi que ce soit pour quiconque. Cela demanderait les mêmes sites avant et après, avec un contrôle, ce qui est une autre étude et bien plus lente.

Ce qui répondrait vraiment à la question

Puisque nous refusons d’y répondre, il est juste de dire ce qui le ferait.

La version propre est une intervention : prendre un ensemble de sites comparables qui ne publient pas le fichier, l’ajouter à la moitié, laisser l’autre moitié fixe, et observer les taux de citation sur un jeu de prompts gelé pendant une période assez longue pour survivre au bruit que ce registre a déjà mesuré dans les réponses IA. Ce bruit est grand, donc la période est longue et l’échantillon n’est pas petit.

La version bon marché, que personne ne semble avoir publiée, est côté serveur : regardez vos propres logs et voyez si un robot IA nommé demande /llms.txt tout court, et à quel rythme comparé à /robots.txt. C’est une requête contre les logs d’accès et cela trancherait la question du consommateur pour un site. Nous préférerions voir dix sites publier cela qu’un comptage d’adoption de plus, le nôtre compris.

Questions fréquentes sur llms.txt

Qu’est-ce qu’un fichier llms.txt ?

llms.txt est une convention proposée : un fichier markdown à la racine d’un domaine qui donne à un modèle de langage un guide curaté du site, listant les pages qui comptent et ce que fait chacune. Ce n’est pas une spécification avec un registre derrière, et aucun grand moteur n’a publié de déclaration disant qu’il lit le fichier.

Combien de fournisseurs de visibilité IA publient un llms.txt ?

44 des 68 fournisseurs que nous avons pu joindre, sur 69 interrogés, mesuré le 14 août 2026. Un a renvoyé un défi de bot, que nous comptons à part d’un fichier absent parce qu’un défi est une preuve sur la bordure et non sur l’existence du fichier. Six des fichiers qui existent font moins de 2 Ko, trop petits pour indexer un site de n’importe quelle taille.

Les sites cités dans les réponses IA publient-ils un llms.txt ?

Moins souvent que les fournisseurs. Sur 122 domaines que notre registre a notés comme cités trois fois ou plus, 112 étaient joignables et 49 en publient un, soit 44 pour cent contre 65 chez les fournisseurs. C’est une comparaison de deux populations et non un mécanisme, et les deux ne se ressemblent pas, donc cela ne montre pas que le fichier est inutile. Cela montre qu’obtenir des citations ne l’exige pas.

Le llms.txt aide-t-il la visibilité IA ?

Personne n’a publié de preuve dans un sens ou dans l’autre que nous ayons pu trouver, et cette étude ne tranche pas. Ce qu’elle exclut, c’est la version forte de l’affirmation : le fichier ne peut pas être nécessaire à la citation, puisque la plupart des domaines qui obtiennent des citations n’en ont pas. Savoir s’il aide à la marge demanderait une intervention avec contrôle, pas un comptage d’adoption.

Devrais-je ajouter un llms.txt à mon site ?

C’est peu coûteux, ce n’est pas nuisible, et si votre site est grand et mal structuré c’est une chose raisonnable à tendre à un robot. Ce que nous ne ferions pas, c’est l’acheter comme produit de visibilité, ni le laisser déplacer le travail sur ce que ce registre a vraiment mesuré varier avec la citation, c’est-à-dire ce qu’une page dit et si quelqu’un d’autre le dit aussi. Regardez d’abord vos propres logs d’accès : si aucun robot IA n’a jamais demandé le fichier, vous avez appris plus en une requête que n’importe quel comptage d’adoption.

Comment vérifier ce qu’un domaine publie ?

Demandez /llms.txt à l’origine du domaine avec un GET et non un HEAD, et lisez le corps avant de croire le code de statut. S’il ouvre un document HTML on vous a donné une page marketing, pas un fichier. Si la réponse est 401, 403, 429 ou 999, vous avez rencontré un défi de bot et n’avez rien appris sur la présence du fichier.

Interrogez une IA sur cet article

Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.

Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.

Écrit par

Maher El Ouahabi

CTO et cofondateur d’EchoWi

Construit le logiciel qui montre aux marques ce que l’IA dit vraiment d’elles, puis quoi changer pour que la réponse suivante soit meilleure. Douze moteurs, mesurés avant et après.

LinkedIn Maher El Ouahabi (ouvre un nouvel onglet)