Vingt questions d'achat dans quatre marchés, et une catégorie où l'aperçu ne s'affiche presque pas
Vingt questions d'achat dans quatre marchés, une lecture chacune, sans réessai. Dix-sept ont répondu à chaque passage. Les trois autres, même catégorie.
Tous les produits de visibilité IA rapportent un zéro de la même façon. Aucun ne peut vous dire si le moteur a répondu en vous laissant de côté, ou s’il n’a pas répondu du tout. Nous avons posé des questions d’achat aux États-Unis, en Espagne, en Allemagne et en France, une lecture par cellule, trois passages chacune, sans réessai quoi qu’il revienne, et l’étude a grandi jusqu’à 84 lectures sur 10 catégories, 5 formes de question et 2 surfaces. 37 des 40 cellules ont renvoyé un AI Overview à chaque passage. Les 3 qui ne l’ont pas fait sont la même catégorie, et dans cette catégorie la surface a renvoyé 3 passages sur 3 en Allemagne, 2 aux États-Unis, 1 en France et 0 en Espagne.
Que l’aperçu s’affiche est bien plus une propriété de la question que du marché. Mais pour la question où il n’est pas fiable, il ne l’est pas de la même manière dans chaque marché, et c’est la partie qu’un tableau de bord ne peut pas vous montrer.
Disclosure : EchoWi vend de la mesure de visibilité IA, donc une étude affirmant que certains chiffres de visibilité décrivent une surface qui ne s’est pas affichée est une étude intéressée. Tout ce qu’il faut pour la refaire est ici : chaque chaîne exacte, les surfaces, les quatre marchés dans leur propre langue, trois passages par cellule, les dates, et les 84 lectures dans notre registre de mesures. Chaque bras tient en vingt appels, donc n’importe qui peut en lancer un contre nous.
La version courte
- 40 cellules : 10 questions d’achat dans 4 marchés, chacune dans sa propre langue. Une lecture chacune, trois passages demandés, sur l’AI Overview de Google.
- 37 sur 40 ont renvoyé un aperçu aux trois passages. Pour la plupart des questions d’achat dans la plupart des marchés, la surface est simplement là.
- Les 3 déficits sont une seule catégorie, les gestionnaires de mots de passe. Toutes les autres cellules de tous les marchés ont répondu entièrement.
- Cette catégorie parcourt tout l’intervalle. Allemagne 3 sur 3, États-Unis 2 sur 3, France 1 sur 3, Espagne 0 sur 3, la même nuit.
- Sans réessai, délibérément. Une lecture courte est le résultat, pas un échec à corriger, et ne relire que les courtes est la façon dont un échantillon se retrouve sélectionné par son propre résultat.
- La prédiction que nous avions écrite d’abord était fausse, et la section qui en parle dit comment.
Pourquoi le dénominateur compte
Un rapport de visibilité vous dit que vous n’avez pas été cité. Derrière cette phrase il y a deux mondes complètement différents.
Dans le premier, le moteur a produit une réponse, choisi huit sources, et aucune n’était vous. C’est un problème de contenu et d’autorité, c’est celui que chaque outil de cette catégorie est construit pour décrire, et le travail qui en découle est celui que nous vendons.
Dans le second, le moteur n’a rien produit. Pas de réponse, pas de liste de citations, pas de huit sources. Personne n’a été cité, ni vos concurrents, ni ceux déjà installés. Votre zéro est identique à celui de tout le monde et ne dit strictement rien de vos pages.
Les deux se ressemblent dans chaque tableau de bord que nous avons vu, le nôtre compris. Le chiffre est zéro dans les deux cas.
Nous sommes arrivés à cette distinction deux fois par des chemins différents. Un balayage de questions d’achat local a trouvé une forme de question entière où l’AI Overview de Google ne s’affichait jamais, alors qu’AI Mode répondait à chaque fois dans le même appel. Et dans une étude de mots-clés contre questions, une expression française de mots-clés n’a rien renvoyé en six passages tandis que la forme question de la même intention s’affichait et citait cinq sources stables. Les deux fois, le fait intéressant n’était pas qui était cité, c’était qu’il n’y avait rien où être cité.
Ce qu’aucune des deux n’a dit, c’est à quelle fréquence cela arrive pour des questions d’achat ordinaires, qui sont l’objet de presque toute la mesure.
Le dispositif, et la seule règle qui le rend utile
Cinq catégories, choisies parce que deux bras antérieurs de notre étude de forme les utilisaient déjà, donc les chaînes sont des chaînes déjà mesurées et vérifiables dans le registre. Chacune posée dans quatre marchés, dans la langue de ce marché, en forme de mots-clés pour que la formulation reste fixe. Trois passages par cellule sur l’AI Overview. Vingt cellules au total.
Une lecture par cellule, et aucun réessai, quoi qu’il revienne. Cette règle est l’étude.
Compter les passages répondus sur toutes les lectures d’AI Overview déjà présentes dans notre registre produit un gradient de marché d’apparence impeccable. Il ne vaut rien, pour trois raisons distinctes dont chacune suffit. Les bras couvrent des ensembles de questions différents, dix-neuf catégories dans un marché et cinq dans les autres. Ils ont été lus des jours différents. Et les lectures courtes ont été relues, donc le bras qui a produit le plus de lectures courtes a récolté le plus de lignes supplémentaires, ce qui veut dire que l’échantillon a été sélectionné par exactement le résultat mesuré.
Ce dernier point est le piège que ce registre documente déjà dans ses propres chiffres de contrôle, et il mérite d’être nommé sans détour : si vous réessayez les lectures revenues minces, votre politique de réessai devient votre résultat.
Donc aucun réessai. Une cellule ayant répondu une fois sur trois est enregistrée comme une sur trois et y reste.
Ce qui est revenu
| Catégorie | États-Unis | Espagne | Allemagne | France |
|---|---|---|---|---|
| CRM | 3 | 3 | 3 | 3 |
| Gestionnaires de mots de passe | 2 | 0 | 3 | 1 |
| Hébergement web | 3 | 3 | 3 | 3 |
| Boutiques en ligne | 3 | 3 | 3 | 3 |
| Comptes professionnels | 3 | 3 | 3 | 3 |
| Répondus sur 15 | 14 | 12 | 15 | 13 |
Seize de ces vingt cellules sont à trois sur trois. La dix-septième complète est celle des gestionnaires de mots de passe en Allemagne, ce dont parle la ligne en dessous.
Tous les déficits de l’étude sont une seule catégorie. Quatre marchés, cinq catégories, et le seul type de cellule qui ait jamais manqué un passage est les gestionnaires de mots de passe.
Cette catégorie fait ensuite quelque chose qu’aucune autre ne fait. Elle renvoie trois sur trois en Allemagne, deux sur trois aux États-Unis, une sur trois en France, et rien du tout en Espagne, la même nuit, avec le même outil, en posant l’expression équivalente dans chaque langue. Les quatre autres catégories sont plates dans les quatre marchés.
Cinq catégories, ce n’était pas assez de catégories, alors nous en avons ajouté cinq
« Les trois déficits sont une seule catégorie » repose sur le nombre de catégories que vous avez posées. Avec cinq, cela peut être vrai parce qu’il existe une catégorie mal élevée dans le monde, ou parce que cinq ne suffisent pas à trouver la seconde. L’étude ne pouvait pas les séparer et un lecteur non plus.
Cinq autres sont donc parties : gestion de projet, emailing, comptabilité, VPN et créateurs de sites, dans les mêmes quatre marchés, même règle, sans réessai. Le seuil a été écrit d’abord : rien de nouveau en déficit et l’affirmation est publiée sur dix catégories ; quoi que ce soit de nouveau en déficit et le titre est réécrit en quatre langues pour nommer le nombre de catégories concernées.
Les 20 nouvelles cellules ont répondu à chaque passage. L’étude est donc à 37 sur 40 pour 10 catégories, et chacun de ses déficits reste une catégorie sur dix.
Nous n’allons pas l’expliquer, parce que nous n’avons mesuré aucun mécanisme. Ce qu’on peut dire, c’est ce que cela fait à un chiffre qu’on est en train de vendre à quelqu’un : en Espagne, un rapport sur cette catégorie construit à partir d’une seule lecture aurait montré zéro citation pour tout le marché, et la lecture correcte de ce zéro est qu’il n’y avait rien où être cité.
Nous avons relu la seule cellule intéressante avant d’écrire dessus
Une lecture unique qui produit un gradient net est exactement la forme qui a déjà brûlé ce registre. La règle que nous nous sommes écrite est que lorsqu’une cellule donne un résultat spectaculaire, l’appel suivant est la réplication et non la rédaction. La question des gestionnaires de mots de passe a donc été posée une seconde fois dans les quatre marchés, mêmes chaînes, mêmes trois passages, même règle sans réessai.
| Gestionnaires de mots de passe | Première lecture | Seconde lecture |
|---|---|---|
| Allemagne | 3 | 3 |
| États-Unis | 2 | 3 |
| France | 1 | 1 |
| Espagne | 0 | 0 |
L’ordre a tenu et personne n’a croisé personne. L’Allemagne reste en haut, l’Espagne reste en bas, et la seule cellule qui a bougé a bougé vers le haut : les États-Unis sont passés de deux sur trois à trois sur trois, ce qui les met à égalité avec l’Allemagne plutôt que de réordonner quoi que ce soit.
Deux choses valent plus que l’ordre.
L’Espagne est maintenant à 0 sur 6 passages répondus sur deux lectures et deux dates. Six demandes d’AI Overview sur une question d’achat commerciale ordinaire, et six fois rien ne s’est affiché, alors que l’expression allemande équivalente s’est affichée à ses six. Un rapport de visibilité pour cette catégorie dans ce marché, avec le nombre de passages qu’on voudra, montrerait chaque fournisseur à zéro.
La France a renvoyé exactement une sur trois, deux fois. C’est autre chose qu’une cellule simplement bruyante. Deux lectures indépendantes tombant sur la même fraction ressemble davantage à un taux d’affichage partiel qu’à une mauvaise nuit, et c’est la première cellule de cette étude qu’on puisse décrire ainsi.
Les deux lectures sont imprimées et aucune ne remplace l’autre. Une moyenne de deux cacherait les deux seuls chiffres qu’un lecteur peut vérifier, et avec des comptes aussi petits la moyenne est la chose la moins informative disponible.
Le compte du titre, 17 sur 20, reste délibérément la première lecture de chaque cellule. Y intégrer une réplication voudrait dire que le nombre change chaque fois que nous relisons quelque chose, et c’est ainsi qu’un chiffre cesse d’être vérifiable.
Quatre autres choses qu’un acheteur tape
Toutes les cellules jusqu’ici ont la même forme, le meilleur X. C’est une des plusieurs choses que l’on tape avant d’acheter. On demande aussi combien ça coûte, comment les options se comparent, comment choisir, et s’il en existe une gratuite, et un rapport disant qu’une catégorie n’a pas de visibilité les met toutes dans le même sac.
Les cinq catégories d’origine ont donc été posées de quatre façons de plus, aux États-Unis, même règle et sans réessai, marché et catégorie tenus fixes pour que la forme soit la seule chose qui bouge. La ligne du meilleur existait déjà, ce qui en fait une comparaison dans la catégorie autant que dans le marché.
| Répondus sur 3 | CRM | Mots de passe | Hébergement | Boutiques | Comptes |
|---|---|---|---|---|---|
| meilleur | 3 | 2 | 3 | 3 | 3 |
| prix | 3 | 2 | 3 | 0 | 3 |
| comparatif | 3 | 1 | 3 | 3 | 3 |
| comment choisir | 1 | 3 | 3 | 3 | 3 |
| gratuit | 3 | 3 | 3 | 3 | 3 |
16 des 20 nouvelles cellules ont répondu à chaque passage. Les 4 restantes se divisent en deux espèces, et les tenir séparées est tout l’objet de cette étude : 2 sont revenues courtes parce que la surface ne s’est pas affichée, et 2 parce que l’outil s’est arrêté tôt. Le zéro de la cellule prix des boutiques est de la seconde espèce, pas de la première.
Les deux déficits de surface sont les gestionnaires de mots de passe. En comptant aussi sa cellule du meilleur, cette catégorie est courte dans 3 de ses 5 formes, tandis qu’aucune autre catégorie n’est courte là où la mesure est allée au bout.
La forme ne semble donc pas être ce qui décide de l’affichage, et la lecture par catégorie survit à quatre manières de plus de la poser. Cela vaut plus que le bras d’origine, parce que « une catégorie est peu fiable » mesuré de cinq façons est une affirmation différente de la même phrase mesurée d’une seule.
Un marché, et cette section ne dit rien des trois autres. Les formes n’ont été posées qu’en anglais et aux États-Unis.
Les mêmes vingt questions sur l’autre surface
Le bras ci-dessus ne peut pas dire pourquoi une cellule est revenue courte, et il n’essaie pas. Il peut dire à bas prix une chose qui change le conseil : si l’autre surface répond à la même question.
Les mêmes 20 cellules sont donc allées sur AI Mode. Mêmes chaînes, mêmes marchés et langues, mêmes trois passages, même règle sans réessai.
| Répondus sur 15 | AI Overview | AI Mode |
|---|---|---|
| États-Unis | 14 | 15 |
| Espagne | 12 | 15 |
| Allemagne | 15 | 15 |
| France | 13 | 14 |
Toutes les cellules revenues courtes sur l’AI Overview ont renvoyé trois sur trois complets sur AI Mode. Les 3. Appariés dans la cellule, AI Mode est plus haut dans 3 cellules, égal dans 16 et plus bas dans 1.
Le cas le plus net est celui autour duquel cette étude tourne. L’expression espagnole de gestionnaires de mots de passe en est à 0 sur 6 passages demandés d’AI Overview sur les deux lectures de cette étude. Sur AI Mode, la même chaîne dans le même marché le même jour a répondu 3 sur 3 et cité seize domaines.
Cela tranche ce qu’est le zéro espagnol. Ce n’est pas une question à laquelle personne ne peut répondre, ni une catégorie sans sources. C’est une surface qui décide de ne pas s’afficher pendant que l’autre répond à la même question et distribue seize citations. Un rapport de visibilité montrant zéro pour ce marché et cette catégorie décrit la mise en page de Google, pas le contenu de qui que ce soit.
Le seuil avec lequel ce bras a été gelé demandait 20 sur 20 et il en a renvoyé 19. L’exception est l’hébergement web français à deux sur trois, et son résultat porte le drapeau d’arrêt anticipé de l’outil lui-même, donc ce qui a manqué est la mesure et non la surface qui refuse. Nous traitons cela comme la première branche avec l’exception nommée plutôt que comme un troisième motif, et cette phrase existe pour qu’un lecteur puisse contester ce choix.
Une chose que ceci ne peut pas faire, et c’est la raison pour laquelle il n’y a aucun pourcentage combiné plus haut : les deux bras ont été lus des jours différents. Toute comparaison ici se fait dans une cellule, où la question et le marché s’annulent, et rien de tout cela n’est un taux entre surfaces.
La prédiction que nous avions écrite d’abord, et pourquoi nous avions tort
Le dispositif a été gelé avant le premier appel, avec la prédiction et le seuil écrits dedans. Les deux méritent d’être cités parce que la prédiction a échoué.
Nous avions prédit que l’ordre du gradient contaminé antérieur se reproduirait à peu près : les États-Unis en haut et la France en bas. Le seuil disait que s’il ne se reproduisait pas, nous publierions qu’il ne s’était pas reproduit, et corrigerions l’observation antérieure au lieu de l’adoucir.
L’Allemagne a répondu à tous les passages demandés et l’Espagne est celle qui a le moins répondu. La France est à un passage des États-Unis. Aucune des deux extrémités de la prédiction n’a survécu.
Le gradient antérieur était donc les ensembles de questions, les jours différents et la sélection par réessai, pas les marchés. Une note d’instrument de notre étude de forme disait que la France livrait moins de lectures complètes que l’Allemagne, et une fois la sélection retirée, la France est à un passage du bras américain et l’Allemagne est parfaite. Cette note est corrigée dans ses quatre langues plutôt que retirée en silence, et la correction est ici pour qu’un lecteur ayant vu la première version trouve la seconde.
Il y a une chose plus petite à admettre à côté. La même expression française de gestionnaires de mots de passe n’avait rien renvoyé en six passages sur deux lectures la veille, et une sur trois ici. Une seule lecture de cette cellule aurait pu rapporter honnêtement que « la surface ne s’affiche jamais ici » ou que « la surface s’affiche un tiers du temps », et ce sont des affirmations différentes.
Ce que cela change si vous achetez ou construisez de la mesure
Demandez à n’importe quel fournisseur ce que signifie son zéro. Pas s’il mesure les AI Overviews, à quoi tout le monde répond oui. Demandez si un zéro dans son rapport distingue « le moteur a répondu et ne vous a pas cité » de « le moteur n’a pas répondu ». S’il ne sait pas répondre, ce chiffre est deux chiffres sous une seule étiquette.
Demandez combien de passages sont derrière une cellule, et ce qu’il advient des courtes. Un seul passage est un tirage à pile ou face déguisé en mesure, et un outil qui réessaie en silence jusqu’à obtenir une réponse rapporte sa politique de réessai.
Ne généralisez pas un échec d’affichage entre marchés. La seule catégorie qui a échoué ici a échoué d’une quantité différente dans chaque marché, et les quatre qui n’ont pas échoué n’ont échoué nulle part. Ce qui gouverne cela n’est pas un réglage national qu’on peut consulter.
Et ne le généralisez pas non plus entre surfaces. Ceci ne concerne que l’AI Overview de Google. Notre propre travail a trouvé à plusieurs reprises qu’un résultat mesuré sur une surface ne voyage pas vers une autre, et le balayage local en est l’exemple le plus net : la surface qui refusait de répondre était répondue à chaque fois par l’AI Mode de Google lui-même, dans le même appel.
La version pratique, pour qui fait ses propres vérifications : notez combien de passages ont répondu, à côté du nombre de citations, à chaque fois. Cela ne coûte rien, c’est la différence entre les deux zéros, et presque personne ne le fait.
Limites
40 cellules. Dix catégories dans quatre marchés suffit à montrer que les deux résultats existent et pas du tout à estimer à quelle fréquence chacun se produit. Chaque chiffre ici est un compte.
Une lecture par cellule, sauf une. C’est le dispositif et c’est aussi la limite principale : une lecture unique ne peut pas séparer une catégorie qui s’affiche un tiers du temps d’une qui a été mesurée une mauvaise nuit. La seule cellule ayant donné un résultat qui mérite d’être rapporté a été relue dans les quatre marchés, et ces 4 lectures sont rapportées à côté de la première et non fondues dedans. Toutes les autres cellules restent une lecture unique.
2 surfaces, et une seule partout. L’AI Overview de Google dans tous les bras, et AI Mode sur les vingt cellules de la section appariée. Rien ici ne décrit ChatGPT, Gemini ou Perplexity.
5 formes de question, et une seule dans tous les marchés. L’expression de mots-clés est tenue fixe dans les quatre marchés pour qu’ils soient comparables ; les quatre autres formes n’ont été posées qu’aux États-Unis. Nous savons déjà que la forme question d’une requête française de gestionnaires de mots de passe s’est affichée quand celle en mots-clés ne s’affichait pas, donc la forme compte et cette étude en mesure désormais une partie au lieu de seulement la fixer.
2 dates de calendrier. La première session a franchi minuit local, ses lignes portent donc deux dates pour moins de quarante minutes écoulées. Tout ce qui a été ajouté ensuite a été lu à la seconde de ces dates. Aucun bras ici ne s’étale sur un jour.
Rien ici n’est causal. Aucune page n’a été modifiée et rien n’a été mesuré avant et après. C’est ce que la surface a renvoyé.
Questions fréquentes sur l’affichage de l’AI Overview
Un AI Overview apparaît-il toujours pour une recherche commerciale ?
Non. Dans cette étude 37 cellules sur 40 en ont renvoyé un à chaque passage, donc pour les questions d’achat c’est le cas d’habitude, mais une catégorie n’a rien renvoyé dans un marché et un passage sur trois dans un autre. Un balayage distinct de questions de service local a trouvé une forme de question entière où il n’apparaissait jamais. « D’habitude » est donc le mot juste et « toujours » ne l’est pas.
Si l’AI Overview ne s’affiche pas, cela veut-il dire que je ne suis pas visible ?
Cela veut dire l’inverse de ce que suggère un tableau de bord. Si l’aperçu ne s’est pas affiché, personne n’y a été cité : ni vous, ni vos concurrents, ni ceux déjà installés. Un zéro venant d’un passage où rien ne s’est affiché ne dit absolument rien de vos pages, alors qu’un zéro venant d’un passage où le moteur a répondu en choisissant huit autres sources en dit énormément. C’est le même chiffre et il appelle des réponses opposées.
L’AI Overview s’affiche-t-il moins hors des États-Unis ?
Pas dans cette étude, et nous avions prédit que oui. L’Allemagne a renvoyé un aperçu aux 30 passages demandés, les États-Unis à 29, la France à 28 et l’Espagne à 27. Le bras allemand a été le plus complet et le bras américain n’était pas en tête. Un compte antérieur de notre part suggérait le contraire et mesurait sa propre politique de réessai.
Pourquoi une catégorie se comporte-t-elle autrement que toutes les autres ?
Nous ne le savons pas, et nous n’avons mesuré aucun mécanisme, donc nous n’allons pas en proposer un. Ce qu’on peut dire est que ce n’est pas un réglage de marché : la même catégorie a renvoyé trois sur trois, deux sur trois, une sur trois et aucune sur trois dans quatre marchés différents la même nuit, tandis que les quatre autres catégories renvoyaient trois sur trois partout.
Combien de passages une mesure de visibilité devrait-elle utiliser ?
Plus d’un, et le nombre devrait être visible dans le rapport. Un seul passage ne distingue pas une citation stable d’une coïncidence, et il ne distingue pas une citation absente d’une réponse absente. Trois est le minimum que nous utilisons pour tout ce qui est publié, et même trois est mince : une barre stricte de « citée à chaque passage » écarte entièrement une source si un passage s’égare.
Où cela vous laisse
La conclusion utile n’est pas que les AI Overviews ne sont pas fiables. Pour quatre des cinq catégories ici, ils se sont affichés à chaque passage dans chaque marché, ce qui est une surface stable selon n’importe quel critère raisonnable.
La conclusion est que la fiabilité n’est pas uniforme, qu’elle ne suit pas le marché, et que le mode de défaillance est invisible dans le seul chiffre que rapportent la plupart des outils. Une catégorie de cette petite étude a produit en Espagne un zéro qui ne dit rien du contenu de personne, et il serait apparu dans un rapport identique à un zéro qui dit tout.
Si vous retenez une habitude d’ici, retenez la moins chère : comptez les réponses, pas seulement les citations.
Interrogez une IA sur cet article
Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.
- ChatGPT (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Claude (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Perplexity (ouvre un nouvel onglet)
- Google AI Mode (ouvre un nouvel onglet)
Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.