Nous avons demandé à 71 pages citées par une IA ce qu'elles déclarent d'elles-mêmes. Moins de la moitié dit ce qu'elle est.
Sur 46 pages lisibles que des réponses d'IA ont citées, 93 % portent du JSON-LD et 41 % déclarent ce qu'est la page. Trois n'ont rien du tout.
Toutes les listes de contrôle de cette catégorie vous disent de baliser vos pages. Presque personne n’a demandé aux pages que les réponses d’IA citent vraiment ce qu’elles déclarent. Nous l’avons fait : 93 % portent du JSON-LD, 41 % portent un type qui dit ce qu’est la page, et trois n’ont rien.
L’intéressant, c’est la population. Ce ne sont pas des pages que nous avons choisies comme bons exemples. Chaque URL ici a été renvoyée comme source par une réponse d’IA dans une mesure que nous avions déjà faite et gelée, donc l’échantillon a été choisi par les moteurs.
Comment cela a été mesuré : 71 URL citées comme sources sur 9 questions de catégorie dans 4 marchés, chacune demandée une fois avec un client HTTP ordinaire le 18 août 2026, avec une seconde lecture pour celles qui échouaient. Chaque bloc JSON-LD a été analysé et ses valeurs de
@typecollectées. Les pages qui ont répondu presque sans texte dans le corps sont comptées comme coquilles et non comme pages qui ne déclarent rien, et celles qui ont renvoyé un défi de bot ou aucune réponse restent hors de tous les comptes. Les lignes complètes sont dans notre registre de mesures.
Transparence : EchoWi vend de la mesure de visibilité IA, et un résultat disant que les données structurées ne sont pas ce qui sépare ces pages est un résultat contre une chose sur laquelle plusieurs outils de notre catégorie vous notent. Les URL, les seaux, la date et la méthode sont tous ici, et la population est sortie de nos propres mesures gelées plutôt que d’une liste que nous aurions montée, donc n’importe qui peut le refaire contre nous.
La version courte
- 93 % des pages citées lisibles portent du JSON-LD. L’armature d’éditeur est quasi universelle :
Organization,WebPage,BreadcrumbList,Article. - 41 % portent un type qui dit ce qu’est la page. Une comparaison, un avis, un produit, un ensemble de questions, un logiciel. Le reste ne déclare que qui l’a publiée.
FAQPageest le type que ces pages portent vraiment, sur 17 des 46.ItemListapparaît sur 6 etReviewsur 3.- Trois pages citées ne portent aucune donnée structurée, et elles ne sont pas vides : 29 724, 12 429 et 6 737 caractères de texte visible.
- Toutes les pages illisibles de l’ensemble sont des plateformes. 17 URL YouTube, deux Reddit et une Facebook répondent presque sans texte dans le corps, ce qui est un fait sur l’endroit où ces plateformes gardent leur contenu.
Ce qui a été compté, et ce qui a été refusé
L’unité est une URL qu’une réponse d’IA a nommée comme source. Neuf questions les ont produites, en comptabilité, paie, CRM, cartes de voyage et casques audio, aux États-Unis, en Espagne, en France et en Allemagne.
Pour chaque URL, chaque <script type="application/ld+json"> a été analysé et les valeurs de @type collectées partout à l’intérieur, imbriquées comprises. Ensuite les types ont été séparés en deux groupes, et cette séparation est tout l’intérêt de l’étude.
Les types d’éditeur disent qui a mis la page là : Organization, WebSite, Person, BreadcrumbList, ImageObject, WebPage, Article. Tout gestionnaire de contenu les émet, et leur présence ne dit rien à une machine sur ce qu’elle regarde.
Les types de nature de page disent ce qu’est la chose : ItemList pour une comparaison, Review pour un avis, Product pour un produit, SoftwareApplication pour un logiciel, FAQPage pour un ensemble de questions et réponses. Ce sont ceux qu’une couche de récupération pourrait utiliser pour décider qu’une page répond à une question comparative.
Trois états restent séparés au lieu d’être fondus, parce que les fondre est la façon la plus courante pour un relevé comme celui-ci de publier un nombre qui veut dire autre chose :
- Lue, c’est-à-dire que la page a répondu avec un corps qu’un client ordinaire peut lire. Seules celles-là comptent.
- Coquille, c’est-à-dire qu’elle a répondu avec moins de 500 caractères de texte visible. C’est un fait sur l’endroit où elle garde son contenu, pas sur le fait d’en avoir.
- Bloquée ou sans réponse, c’est-à-dire que nous n’avons jamais vu la page. Quatre ont renvoyé un défi de bot et une n’a jamais répondu.
Le résultat
| Sur 46 lues | |
|---|---|
| Du JSON-LD | 43 (93 %) |
| Un type qui dit ce qu’est la page | 19 (41 %) |
| Aucune donnée structurée | 3 (7 %) |
Et la répartition par type est là où le conseil standard et les données se séparent :
| Type | Pages |
|---|---|
| FAQPage | 17 |
| ItemList | 6 |
| Product | 6 |
| Review | 3 |
| SoftwareApplication | 2 |
Le conseil que tout le monde donne sur le contenu comparatif est de le baliser en ItemList, parce que c’est le type qui déclare « cette page est un ensemble ordonné de N choses ». Parmi les pages qu’une IA a réellement citées pour ces neuf questions, ItemList apparaît six fois. FAQPage apparaît presque trois fois plus.
Certaines des pages au balisage le plus fourni sont exactement celles auxquelles on s’attend : thepointsguy.com et lesnumeriques.com portent FAQPage, ItemList, Product et Review ensemble. Mais bankrate.com, creditcards.com et nytimes.com sont dans les mêmes réponses avec deux types chacune, et frandroid.com et soundcore.com avec un seul.
Les trois qui ne déclarent rien, et pourquoi elles comptent plus que le reste
bakedwith.com, zoho.com et capitalone.com ont chacune été citées par une réponse d’IA et ne portent ni JSON-LD, ni microdonnées, ni RDFa. Ni page réduite, ni redirection : 29 724, 12 429 et 6 737 caractères de texte lisible respectivement.
C’est l’observation qui limite ce que l’on peut affirmer ici. Si les données structurées étaient une condition de citation dans cette catégorie, ces pages ne pourraient pas être dans l’ensemble. Elles y sont, donc ce n’en est pas une.
La lecture honnête est étroite, et il vaut la peine de l’énoncer précisément parce que la large est très tentante. Cela ne dit pas que le balisage ne sert à rien. Cela ne dit pas qu’ajouter du schéma ne vous aidera pas. Cela dit une chose : vous ne pouvez pas regarder une citation dans cette catégorie et en déduire que la page était balisée, puisque 7 % ne l’étaient pas du tout et 59 % ne déclaraient pas ce qu’elles étaient.
Toutes les coquilles de l’ensemble sont des plateformes
Vingt des 71 URL ont répondu avec presque rien qu’un client ordinaire puisse lire. Les vingt sont des plateformes : 17 pages de vidéo YouTube à 254 caractères visibles chacune, deux fils Reddit à cinq caractères, et une page Facebook à 44.
Nous l’avons déjà mesuré sur une autre population, et le résultat se réplique exactement : ces plateformes gardent la matière dans l’en-tête du document et dans leur propre couche de rendu, pas dans le corps. Une page YouTube porte son titre, sa description et un VideoObject complet en JSON-LD pendant que son corps ne dit presque rien.
La conséquence pratique ne porte pas sur YouTube. Elle porte sur le fait que tout relevé comptant les « pages sans contenu visible » rapportera des URL de plateforme comme des pages vides s’il ne les sépare pas, et les URL de plateforme sont une part importante de ce que citent les réponses d’IA. Dans cet ensemble, elles font 28 % de tout ce que les moteurs ont nommé.
Le groupe de comparaison, ajouté
La section précédente disait que cette étude ne pouvait pas dire ce que portent les pages non citées, puisque chaque URL y avait déjà été citée. Ce manque est comblé par le contrôle le moins cher possible : les mêmes neuf questions posées aux résultats organiques de Google, et chaque URL qui se classe et que la réponse d’IA n’a pas citée, demandée avec le même client et analysée avec le même code. 103 d’entre elles, 71 lisibles.
La direction était écrite avant le premier appel. Si les contrôles arrivaient à plus de 15 points sous le côté cité sur les types qui disent ce qu’est une page, alors le balisage séparerait les deux groupes dans cet échantillon, l’association rapportée par d’autres se répliquerait sur notre propre population, et c’est cela que nous publierions.
| Citées | Classées, non citées | |
|---|---|---|
| Pages lues | 46 | 71 |
| Du JSON-LD | 93 % | 77 % |
| Un type qui dit ce qu’est la page | 41 % | 31 % |
| Aucune donnée structurée | 7 % | 14 % |
L’écart sur les types qui disent ce qu’est une page est de 10 points, et le seuil était de 15. Le titre ne bascule donc pas. Ce qui est vrai, et mérite d’être dit sans le gonfler, c’est que les trois lignes pointent dans le même sens : les pages citées portent un peu plus de balisage que les pages non citées qui se classent sur la même question, avec des marges trop faibles pour faire du balisage ce qui les sépare.
Le détail par type est plus précis que les totaux :
| Type | Citées, sur 46 | Non citées, sur 71 |
|---|---|---|
| FAQPage | 17 | 17 |
| ItemList | 6 | 2 |
| Product | 6 | 11 |
FAQPage apparaît le même nombre de fois des deux côtés, ce qui sur des dénominateurs différents veut dire qu’il est proportionnellement plus fréquent chez les citées. ItemList est trois fois plus fréquent chez les citées. Et Product va dans l’autre sens, plus fréquent chez les pages qui se classaient sans être citées, et c’est la ligne qui empêche d’en faire une histoire sur le balisage en général.
Une autre différence ne porte pas du tout sur le schéma : 12 des 103 URL de contrôle ont répondu à notre requête par un défi de bot, contre 4 des 71 citées. Cela fait 12 % contre 6 %, sur de petits nombres, et pointe vers quelque chose de plus plausible que le balisage comme mécanisme. Ce n’est pas non plus une preuve sur les robots d’IA, car une page qui défie le client HTTP de ce relevé ne défie pas nécessairement GPTBot, et nous ne l’avons pas testé ici.
Ce que nous en retiendrions si nous étions acheteurs
N’achetez pas une note qui est surtout un audit de balisage. Plusieurs outils de cette catégorie vous notent sur la couverture du balisage. Avec ces données, cette note mesure quelque chose de réel sur votre page et quelque chose de faible sur vos chances d’être cité, puisque 59 % des pages qui ont été citées ne portent pas les types que la note récompense.
Si vous n’ajoutez qu’un type, ajoutez celui que ces pages portent. FAQPage est sur 17 des 46, et il a un mécanisme évident derrière lui : une question avec une réponse autonome est l’unité qu’une couche de récupération peut prélever entière. C’est la raison pour laquelle notre propre corpus met un FAQPage sur presque toutes ses pages, une pratique adoptée avant cette mesure et non à cause d’elle.
N’en concluez pas que le balisage ne compte pas. Cette étude ne peut pas soutenir cela, et la raison est dans la section suivante.
Ce que cela ne démontre pas
- La population est sélectionnée sur le résultat. Toutes les URL ici ont été citées. Cela rend l’étude peu coûteuse et concluante pour tuer une affirmation, que les pages citées de cette catégorie sont fortement balisées, et inutile pour sa réciproque. Un groupe de contrôle a été ajouté plus haut, à partir des mêmes neuf questions, et il resserre l’écart sans clore la question : les pages qui se classent sans être citées portent du balisage à un rythme voisin. L’étude à la comparaison bien plus large est celle d’AirOps, qui rapporte 61 % des pages citées par ChatGPT portant trois types de schéma ou plus contre 25 % des résultats de première page non cités, sur plus de 12 000 URL. La nôtre est un échantillon plus petit posant une question plus étroite sur une population choisie par les moteurs, et les deux ne sont pas en conflit : la leur trouve une association sur un ensemble bien plus grand, et le test contrôlé mené par Ahrefs sur 1 885 pages n’a trouvé aucune hausse significative des citations en ajoutant du schéma. Association, aucune hausse mesurée, et aucun balisage commun parmi les pages citées que nous avons pu atteindre : trois mesures pointant dans le même sens sur le poids à donner à une note de balisage.
- Une lecture, un client. Une page construisant son JSON-LD dans le navigateur nous paraîtrait nue. Cela pousse les vrais chiffres vers le haut et non vers le bas, donc les 41 % sont un plancher et non une estimation.
- Neuf questions, quatre marchés, un jour. Cinq catégories de produit et un instantané. Un autre jeu de questions donnerait un autre jeu d’éditeurs.
- Rien ici n’est causal. Nous pouvons dire ce que déclarent les pages citées. Nous ne pouvons pas dire que le déclarer soit la raison de leur citation, et nous n’avons testé aucune intervention.
Questions fréquentes sur le balisage et la citation par l’IA
Les données structurées aident-elles une page à être citée par une IA ?
Cette étude ne peut pas y répondre, et il vaut mieux le dire franchement : toutes les pages ici étaient déjà citées, donc il n’y a pas de groupe de comparaison non cité. Ce à quoi elle peut répondre, c’est la question plus étroite que les gens veulent généralement dire, à savoir si les pages qui gagnent des citations dans une catégorie sont celles qui sont fortement balisées. Sur ces neuf questions, elles ne le sont pas : 41 % déclarent ce qu’est la page et 7 % ne portent aucune donnée structurée.
Quel type de schéma les pages citées portent-elles vraiment ?
FAQPage, sur 17 des 46 pages lisibles, devant ItemList sur 6, Product sur 6, Review sur 3 et SoftwareApplication sur 2. Cet ordre va contre le conseil habituel pour le contenu comparatif, qui met ItemList en tête.
Pourquoi les pages YouTube sont-elles comptées à part ?
Parce qu’une page de vidéo YouTube répond à un client HTTP ordinaire avec environ 254 caractères de texte visible dans le corps tout en portant son titre, sa description et un VideoObject dans l’en-tête du document. La compter comme une page qui ne déclare rien serait une affirmation fausse sur YouTube. 17 des 20 coquilles de cet ensemble sont YouTube.
Comment une page sans aucun schéma peut-elle être citée ?
Nous ne le savons pas, et c’est la bonne réponse plutôt qu’une esquive. Trois pages de l’ensemble n’en portent aucun et sont des articles longs, ordinaires et lisibles. Quoi qu’ait utilisé la couche de récupération pour les choisir, ce n’était pas leur balisage, puisqu’il n’y en avait aucun à lire.
Comment faire tourner cela sur ma propre catégorie ?
Prenez les réponses que vous mesurez déjà, gardez les URL des sources, demandez chacune et analysez son JSON-LD. Les deux seules décisions qui comptent sont de séparer les pages que vous n’avez pas pu lire de celles qui ne déclarent rien, et de séparer les types qui disent qui a publié la page de ceux qui disent ce qu’elle est. C’est là qu’un relevé comme celui-ci se trompe d’habitude.
Cela change-t-il ce que recommande EchoWi ?
Cela resserre une recommandation. Nous continuons de mettre une réponse autonome et un FAQPage sur nos propres pages, et notre catalogue vérifié d’outils porte toujours un ItemList décrivant exactement ce qu’il liste. Ce que nous ne dirions plus, c’est que la couverture du balisage prédit la citation, puisque dans le seul échantillon dont nous disposons de pages réellement citées, elle ne les sépare pas.
Interrogez une IA sur cet article
Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.
- ChatGPT (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Claude (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Perplexity (ouvre un nouvel onglet)
- Google AI Mode (ouvre un nouvel onglet)
Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.