Aller au contenu
Visibilité IARecherche
FR

Nous avons posé deux fois la même question à Google. Aux États-Unis rien n'a changé, en France la moitié.

Une question d'achat reposée quelques minutes après, dans quatre marchés. Les sources qui tiennent reviennent à 100 % aux États-Unis et à 50 % en France.

· 15 min de lecture

Posez à Google une question d’achat, notez les sources que son AI Overview cite à chaque passage, puis reposez la chaîne identique quelques minutes plus tard. Aux États-Unis vous récupérez la même liste, nom pour nom. En France vous en récupérez la moitié.

Cet écart ne vient pas de la question, puisque c’est la même. Il ne vient pas du jour, puisque les deux lectures sont à quelques minutes d’intervalle. C’est une propriété du marché dans lequel vous mesurez, et elle décide si une lecture unique de votre visibilité veut dire quoi que ce soit.

Comment cela a été mesuré : une question d’achat nue par marché, localisée, posée à l’AI Overview de Google avec nos propres outils de mesure. Chaque lecture garde les domaines cités à tous les passages, puis la chaîne identique est reposée dans la même session et les deux ensembles sont comparés. Toutes les lectures sont à un seuil apparié de deux passages, donc aucune comparaison ici n’oppose un ensemble plus dur à un plus souple. Quatre marchés, trois catégories, le 18 août 2026, avec un second bras qui rejoue six cellules à des seuils de trois, quatre et cinq passages. Les lignes complètes sont dans notre registre de mesures, et les prompts exacts sont plus bas, pour que n’importe qui puisse le refaire contre nous.

Transparence : EchoWi vend de la mesure de visibilité IA, donc un résultat sur le peu de fiabilité d’une lecture unique est un résultat sur ce que nous vendons. Les prompts, la surface, les marchés, le seuil et la date sont tous ici, et c’est ce qui rend le travail vérifiable au lieu d’être à croire sur parole.


La version courte

  1. La même question, posée deux fois, renvoie les mêmes sources durables 100 % du temps aux États-Unis et 50 % en France.
  2. Chaque marché a un noyau stable. Entre 3 et 6 domaines reviennent à chaque fois que vous demandez, dans les quatre.
  3. Ce qui diffère, c’est la marge. Le nombre de sources présentes dans une lecture et pas dans l’autre va de 0 aux États-Unis à 4 en France.
  4. Le marché en fait l’essentiel, et un marché intermédiaire montre qu’il n’en fait pas tout. Sur 3 catégories dans les deux marchés extrêmes, les lectures françaises ne passent jamais au-dessus des américaines. Mais l’Allemagne renvoie 67 % sur le CRM et 100 % sur la comptabilité, les deux à seuil apparié, donc à l’intérieur d’un seul marché la question déplace le chiffre d’un tiers.
  5. La conséquence pratique est une règle de lecture pour n’importe quel rapport de visibilité IA : si vous êtes dans le noyau, vous y êtes à chaque fois ; si vous êtes sur la marge, une lecture unique est un tirage à pile ou face.
  6. Une lecture parfaite se périme. La question américaine de CRM a renvoyé 4 domaines durables plus tôt dans la journée et 12 plus tard, au même seuil de cinq passages, avec chaque lecture individuelle impeccable.

Ce que nous avons mesuré, exactement

L’unité est une question d’achat nue de la forme « le meilleur X pour une petite entreprise », écrite comme un acheteur de ce marché l’écrirait, dans la langue de ce marché.

Pour chaque lecture, la surface est interrogée deux fois et nous ne gardons que les domaines cités les deux fois. Cet ensemble est la lecture. Ensuite la chaîne identique est reposée dans la même session, ce qui produit un second ensemble, et les deux sont comparés par un Jaccard : les domaines présents dans les deux, divisés par les domaines présents dans l’un ou l’autre.

Deux détails font tout le travail ici et aucun des deux n’est décoratif.

Chaque lecture est au même seuil de deux passages. Un ensemble de domaines qui a survécu à cinq passages est plus petit et plus dur qu’un qui en a survécu deux, donc comparer entre seuils mesure le seuil autant que le monde. Une version antérieure de cette mesure avait exactement ce défaut, avec un marché comparé à cinq passages contre deux et un autre à quatre contre trois, et c’est pour cela que ces chiffres ne sont pas dans cet article.

Les prompts sont gelés et publiés. Les voici :

MarchéCatégoriePrompt
États-UnisCRMwhat is the best CRM for a small business?
AllemagneCRMbeste CRM Software für kleine Unternehmen
EspagneCRMmejor CRM para una pequeña empresa
FranceCRMmeilleur CRM pour une petite entreprise

Le résultat

MarchéRevientNoyauMarge
États-Unis100 %40
Allemagne86 %61
Espagne83 %51
France50 %44

Cela fait 57 points entre le plus large et le plus étroit. Avant de lancer les lectures manquantes nous avions écrit un seuil de retrait : si les quatre marchés tombaient à moins de quinze points les uns des autres, il n’y avait pas de différence de marché digne d’être rapportée et l’observation devait être abandonnée. Ils n’y sont pas tombés.

La cellule américaine mérite qu’on s’y arrête. Les mêmes quatre domaines sont revenus sur trois lectures distinctes, dont une prise à un seuil de cinq passages et non de deux. Ce n’est pas un résultat à peu près stable, c’est la liste identique à chaque fois que nous avons demandé.

La France était la cellule spectaculaire, donc nous l’avons répliquée avant d’écrire quoi que ce soit. Une troisième lecture française, prise à un seuil plus strict de trois passages, a renvoyé cinq domaines, dont quatre figurent dans les deux autres. Le noyau français est réel. Ce qui bouge, c’est tout ce qu’il y a autour.


Le bon résumé est noyau et marge, pas « la France est instable »

La phrase tentante est que la réponse française n’est pas fiable, et elle est fausse d’une façon qui compte pour quiconque essaie d’agir dessus.

Chaque marché a un noyau qui revient toujours, et les noyaux sont proches en taille : 4 aux États-Unis, 6 en Allemagne, 5 en Espagne, 4 en France. Une marque assise dans ce noyau est recommandée de façon constante, en France exactement autant qu’aux États-Unis.

Ce qui diffère d’un facteur quatre, c’est la marge : 0 domaine aux États-Unis, 1 en Allemagne et en Espagne, 4 en France. La marge est la partie de la réponse qu’une lecture unique décide à pile ou face.

Donc la question à poser sur n’importe quel chiffre de visibilité IA n’est pas « à quel point ce marché est stable ». C’est dans lequel des deux je me trouve, et une lecture ne peut pas vous le dire. Deux, oui.


Marché ou catégorie ? Le test qui tranche

Un tableau de quatre marchés mesuré dans une seule catégorie n’est pas un résultat sur les marchés. Ce pourrait tout aussi bien être un résultat sur le CRM, et notre propre recherche antérieure est la raison de prendre cela au sérieux : quand nous avons mesuré dix-neuf questions d’achat d’agence dans quatre marchés, la dispersion à l’intérieur d’un marché entre verticales était aussi grande que tout ce qui séparait les marchés, et cette étude concluait noir sur blanc que le marché n’est pas un coefficient qu’on applique à un chiffre.

Donc avant de publier ceci nous avons lancé deux catégories de plus dans les deux marchés extrêmes, avec la règle de retrait écrite d’abord : si une catégorie française passait au-dessus d’une catégorie américaine, c’était de la variation de catégorie et le résultat était mort.

CatégorieÉtats-UnisFrance
CRM100 %50 %
Comptabilitéensemble identique60 %
Gestion de projet100 %43 %

Les bandes ne se croisent pas. La lecture française la plus haute est 60 % et l’américaine la plus basse est 100 %.

Et cela ne renverse pas l’étude sur les agences, parce que les deux mesurent des choses différentes. Cette étude demandait, à l’intérieur d’une seule lecture, quelle fraction de tout ce qui était cité survivait à chaque passage. Celle-ci demande si l’ensemble survivant revient quand on repose la question. Un marché peut citer énormément de sources ponctuelles, marquer bas sur la première mesure, et reproduire parfaitement son noyau durable, marquer haut sur celle-ci. Les deux chiffres sont réels et ce sont des réponses à des questions différentes.

La ligne comptabilité des États-Unis porte un astérisque exprès. Sa seconde lecture est revenue à un seuil d’un passage et non de deux, donc elle ne peut entrer dans aucune comparaison et n’est comptée nulle part au-dessus. Elle est mentionnée pour ce qu’elle a montré : à cet autre seuil, elle a renvoyé les mêmes treize domaines, nom pour nom.


À un seuil plus strict, et reposée plus tard le même jour

Toutes les cellules ci-dessus sont lues à un seuil de deux passages, le plus souple que nous utilisions. La question évidente est de savoir si quoi que ce soit y survit quand on en demande plus, donc 6 de ces cellules ont été relues à des seuils de trois, quatre et cinq passages, chaque paire appariée, et gardées à part du tableau précédent plutôt que fusionnées : un Jaccard entre deux lectures n’est pas comparable entre seuils, parce que l’unanimité sur cinq est un test plus dur que l’unanimité sur deux.

MarchéCatégorieSeuilRevient
États-UnisCRM5 passages100 %
États-UnisComptabilité3 passages100 %
AllemagneComptabilité5 passages100 %
EspagneComptabilité2 passages100 %
FranceComptabilité4 passages75 %
AllemagneCRM3 passages67 %

4 des 6 reviennent identiques et la plus basse est 67 %. Donc l’effet n’est pas un artefact d’un seuil souple. La France reste le marché le plus bas des présents, et les cellules américaines restent parfaites à des seuils où l’ensemble compte douze domaines et non quatre.

Et une ligne d’ici retire une phrase que nous avons publiée le matin même. L’Allemagne répond 67 % sur le CRM et 100 % sur la comptabilité, les deux à seuil apparié, soit un tiers de l’ensemble qui bouge à l’intérieur d’un seul marché. « C’est le marché et pas la catégorie » n’était disable que des deux extrêmes, là où la catégorie n’a plus rien à déplacer : la France ne peut pas descendre sous le plancher américain parce que ce plancher est à 100 %. Un marché intermédiaire est l’endroit où une telle affirmation peut échouer, et elle échoue.

La même question, le même seuil, cinq heures plus tard

La chaîne américaine de CRM est la cellule la plus reproductible de cette étude. À un seuil de cinq passages elle renvoie les mêmes douze domaines deux fois, et une troisième lecture à un seuil de quatre renvoie ces douze de nouveau. Plus tôt le même jour, la chaîne identique au même seuil de cinq en a renvoyé quatre.

Les quatre sont dans les douze, donc rien n’a été perdu. La réponse s’est élargie d’un facteur trois en quelques heures, et ce n’est pas le seuil qui le fait : relever un seuil d’unanimité ne peut qu’enlever des domaines à un ensemble durable, jamais en ajouter, donc la réponse de l’après-midi cite au moins douze domaines à chacun de ses cinq passages là où celle du matin en citait quatre à chacun des siens.

C’est la moitié inconfortable de tout ce qui précède. À l’intérieur d’une session, cette cellule est aussi fiable qu’une mesure de ce genre peut l’être. Sur un après-midi, deux tiers de ce qu’elle dit aujourd’hui n’étaient pas là ce matin. Qu’une lecture se répète à l’intérieur d’une session ne prouve pas qu’une lecture prise plus tard le même jour sera d’accord avec elle, et un tableau de bord qui échantillonne une fois par jour échantillonne un ensemble qui peut tripler entre deux échantillons.


Quoi en faire

N’agissez jamais sur une seule lecture. C’est tout le contenu pratique de l’étude et cela coûte un appel de plus à satisfaire. Si une source apparaît dans deux lectures prises à quelques minutes d’intervalle, elle est dans le noyau. Si elle apparaît dans une seule, vous n’avez presque rien appris sur elle.

Demandez à un prestataire de combien de lectures vient son chiffre, ce qui est une question différente de combien de passages. Un outil peut moyenner dix passages à l’intérieur d’une lecture et vous montrer quand même un ensemble qui ne se reproduira pas quand il redemandera demain. Les passages dans une lecture et les lectures répétées ne sont pas le même contrôle et ne corrigent pas le même problème.

Attendez-vous à ce qu’un rapport français et un rapport américain diffèrent en fiabilité, et ne lisez pas cela comme le site d’un client qui serait moins bon que celui d’un autre. Avec ces données, l’essentiel de la différence est dans le marché et une partie est dans la question : l’Allemagne bouge d’un tiers entre deux catégories.


Ce que cela ne démontre pas

  • Une seule surface. Il s’agit uniquement de l’AI Overview de Google. ChatGPT, Gemini et AI Mode récupèrent différemment et demanderaient leur propre mesure, et notre propre travail trouve régulièrement qu’un résultat sur une surface dit peu de chose d’une autre.
  • Deux lectures par cellule. Un Jaccard entre deux lectures est une observation, pas une distribution. Une troisième lecture par cellule transformerait cet écart en une fourchette, et c’est l’étape suivante évidente plutôt que d’ajouter des marchés.
  • Trois catégories, quatre marchés, un jour. La comparaison entre marchés à travers les catégories ne repose que sur les États-Unis et la France. L’Allemagne et l’Espagne n’ont qu’une catégorie chacune.
  • Des minutes, puis un après-midi. Les tableaux sont à l’intérieur d’une session. La seule cellule que nous avons relue des heures après avait triplé, donc ce qui reste non testé ici, ce sont des jours et des semaines, pas seulement des mois, et une cellule n’est pas un taux.
  • Rien ici n’est causal. Nous pouvons dire que les marchés diffèrent sur cette mesure. Nous ne pouvons pas dire ce qui, dans ces marchés, produit la différence, et nous n’avons testé aucune explication.

Questions fréquentes sur le fait de répéter une mesure

Que veut dire « revient » exactement ici ?

C’est un indice de Jaccard entre deux lectures de la question identique. Chaque lecture ne garde que les domaines cités à chaque passage de cette lecture, donc c’est déjà un ensemble durable et non tout ce qui a été mentionné. Le chiffre est la taille du recouvrement divisée par la taille de l’union : 100 % veut dire que les deux lectures ont nommé exactement les mêmes domaines, et 50 % que la moitié de ce qui est apparu sur les deux lectures n’est apparu que dans une seule.

Pourquoi deux passages par lecture et pas plus ?

Parce que chaque lecture de la comparaison doit se tenir au même seuil, et deux était le seuil que tous les marchés pouvaient effectivement livrer dans une session. Un ensemble durable construit sur cinq passages est plus dur qu’un construit sur deux, donc les mélanger mesurerait le seuil et non le marché. Là où une cellule est revenue à un autre seuil, nous l’avons sortie de la comparaison et nous le disons.

Est-ce que cela veut dire qu’un outil de visibilité IA ne sert à rien en France ?

Non, et la séparation noyau et marge est la raison. Une marque française dans le noyau est citée à chaque fois que nous demandons, aussi régulièrement qu’une américaine. Ce qu’une lecture française unique ne peut pas vous dire, c’est de quel côté de cette ligne vous êtes, et le remède est une lecture de plus et non un autre outil.

Est-ce la même chose que dire que les réponses des IA sont aléatoires ?

C’est presque le contraire. Entre 3 et 6 domaines reviennent à chaque fois dans chaque marché mesuré, y compris le moins reproductible. Il y a une structure stable dans les quatre. Le désaccord entre lectures vit entièrement sur les bords de la réponse.

Comment vérifier cela sur ma propre catégorie ?

Prenez votre question d’achat, posez-la deux fois dans la même heure avec le même nombre de passages à chaque fois, et notez les domaines cités à chaque passage de chaque lecture. Comparez les deux listes. Si elles coïncident, vous regardez un noyau ; si elles coïncident à moitié, tout rapport à lecture unique sur votre catégorie vous en dit moins qu’il n’en a l’air.

Pourquoi la ligne comptabilité des États-Unis n’a-t-elle pas de chiffre ?

Parce que sa seconde lecture a répondu un passage là où la première en a répondu deux, et une lecture à un passage rend chaque domaine cité « durable » par construction. La mettre dans le tableau aurait comparé deux choses différentes. Elle reste dans l’article parce que ce qu’elle a montré vaut la peine d’être su : à cet autre seuil, elle a renvoyé les treize domaines identiques.

Interrogez une IA sur cet article

Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.

Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.

Écrit par

Maher El Ouahabi

CTO et cofondateur d’EchoWi

Construit le logiciel qui montre aux marques ce que l’IA dit vraiment d’elles, puis quoi changer pour que la réponse suivante soit meilleure. Douze moteurs, mesurés avant et après.

LinkedIn Maher El Ouahabi (ouvre un nouvel onglet)