Aller au contenu
AI VisibilityGEO
FR

La moitié de ce qu'une IA cite a disparu en six jours. L'autre moitié ne bouge presque pas.

14 questions d'achat mesurées deux fois en août puis six jours plus tard. L'ensemble cité se recoupe à 50 % et le noyau tient à 73 %.

· Mis à jour · 16 min de lecture

Tous les outils de visibilité IA veulent vous vendre une courbe de vos sources les plus citées dans le temps. Nous en avons construit une à partir de mesures réelles, puis nous avons posé la question à laquelle la courbe ne peut pas répondre : quand une source en disparaît, est-elle vraiment partie ?

Quatorze questions d’achat, posées les 15 et 16 août puis de nouveau le 22. Même surface, même marché, même langue et le même nombre de passages chaque fois. L’ensemble cité complet se recoupe à 50 % entre la référence et six jours plus tard. L’ensemble des domaines revenus dans les deux lectures de référence tient à 73 %.

Donc la moitié de ce qu’un assistant cite est différente en une semaine, et la moitié durable est autre chose et se comporte autrement. Une courbe qui donne un seul chiffre ne peut pas vous dire laquelle des deux a bougé.

Transparence et méthode : EchoWi vend de la mesure de visibilité IA, donc une étude sur la valeur de ces courbes est une étude sur sa propre catégorie. Le protocole, la statistique décisive, les deux prédictions et le seuil de retrait ont été écrits et commités avant le premier appel. Les questions, la surface, le marché, les dates et le nombre de passages répondus par cellule sont dans notre registre de mesures, et avec cela n’importe qui peut le refaire contre nous.

La version courte

  1. L’ensemble cité complet se renouvelle à peu près de moitié en six jours. Recouvrement médian de 50 % sur 12 cellules comparables.
  2. Le noyau tient à 73 %. Noyau veut dire que le domaine est revenu dans les deux lectures de référence, pas qu’il est apparu une fois.
  3. La durabilité est une propriété de la question, pas de la méthode. 4 cellules ont gardé tout leur noyau. 4 en ont gardé exactement la moitié. Même surface, même marché, même barre, mêmes six jours.
  4. Trois cellules qui semblaient parfaitement stables ne l’étaient pas. Les trois ont gagné du bruit dès qu’un troisième point a existé.
  5. Reformuler la question ne coûte presque rien. 5 intentions sur 6 ont rendu le même ensemble depuis une forme mot-clé et une forme question le même jour.

Pourquoi une part est la mauvaise unité

Avant la question du temps il y a une question de mesure, et se tromper dessus invente la réponse.

Posez deux fois la même chose et le nombre de sources citées une fois bouge beaucoup. Le nombre de celles citées à chaque fois bouge à peine. Un pourcentage construit comme durables sur total a donc un numérateur presque constant et un dénominateur qui erre, ce qui produit un chiffre qui ressemble à une mesure et se comporte comme un tirage à pile ou face.

Il y a un deuxième piège dessous, et il vaut plus cher qu’on ne le devinerait. Plus de passages répondus, ce sont plus d’occasions qu’un domaine apparaisse au moins une fois, donc une lecture à dix passages a un ensemble plus grand qu’une à trois. Comparez une lecture à dix contre une référence à trois et le noyau aura l’air de s’être effondré, alors que ce qui s’est passé, c’est que la seconde lecture a eu plus d’occasions d’ajouter des inconnus.

Ce facteur de confusion, nous l’avons mesuré directement sur les cellules de notre registre ayant deux dates ou plus :

CellulesNoyauBordPart du noyau
Nombre de passages différent10145418 %
Même nombre de passages668543 %

Les 18 % mesuraient la barre et pas le monde. Vingt-cinq points d’écart, dus à une variable que personne ne met dans la courbe. Tous les chiffres de cette étude viennent de cellules ayant répondu au même nombre de passages aux deux dates, et les deux qui ont répondu moins restent dehors et comptées à part plutôt que comparées à une barre plus basse.

Six jours plus tard

12 cellules se qualifient. La rétention est la fraction du noyau de référence encore citée le 22 août.

QuestionNoyauToujours citéRétention
best grammar checker44100 %
best note taking app22100 %
what is the best payroll service for a small business?5480 %
best crm for small business4375 %
what is the best AI coding assistant?10770 %
best vpn service3267 %
best payroll service for a small business10550 %
best website to book flights2150 %
what are the best running shoes for beginners?4250 %

Médiane de 73 %, contre un recouvrement médian de 50 % pour l’ensemble cité complet. Le noyau est la moitié durable, de 23 points.

Et la distribution compte plus que la médiane. 4 cellules ont tout gardé et 4 exactement la moitié. Il n’y a pas grand-chose entre les deux. Que votre catégorie ait une réponse stable est une propriété de votre catégorie, et aucune quantité d’échantillonnage ne rend stable une catégorie qui ne l’est pas.

Les cellules parfaites étaient celles qui n’avaient rien à rater

3 cellules ont rendu une référence où chaque domaine cité apparaissait dans les deux lectures. Zéro bruit. Lu vite, c’est le rêve : un ensemble fixe de sources sur lequel travailler.

Nous avions prédit avant de mesurer qu’au moins 2 des 3 gagneraient du bruit avec un troisième point, parce qu’un ensemble qui coïncide sur deux lectures a franchi une barre très basse et n’a rien prouvé.

Les 3 l’ont fait. L’une est passée de dix domaines sans bruit à sept domaines partageant cinq avec la référence. Une autre de dix à onze en partageant sept.

C’est la partie qu’une courbe hebdomadaire cache. Une source apparue deux fois n’est pas installée, et un outil qui vous montre deux points et une droite entre eux vous montre une droite.

Pourquoi la moitié qui se renouvelle existe

Un assistant replanifie la récupération à chaque requête. Il ne lit pas un index fixe de sources fiables pour en citer, et les sources qui survivent à chaque lecture d’une question n’ont pas la même allure que celles qui apparaissent une fois. Dans ces cellules la moitié durable est dominée par quelques grandes destinations qui sortent sur beaucoup de questions sans rapport, tandis que la moitié qui se renouvelle est longue, fine et faite surtout de pages qui collent à une formulation d’une question un jour donné.

C’est pourquoi les deux moitiés se rapportent séparément et ne s’additionnent pas. Travailler la moitié durable est un autre métier que travailler celle qui se renouvelle, et une seule des deux se planifie.

Reformuler ne coûte presque rien, et l’exception est deux fois la même

Six des quatorze cellules sont la même intention d’achat sous deux formes, un mot-clé nu et une question entière. Le même jour et à la même barre :

5 sur 6 ont rendu un ensemble identique de domaines. Pas semblable, identique.

La sixième est celle de la paie, et elle divergeait déjà dans la référence. Deux lectures à une semaine d’écart, et c’est la même intention qui se sépare les deux fois pendant que les cinq autres tiennent. Ce n’est pas du bruit, c’est une propriété de cette question.

Pour qui achète un outil de suivi, c’est la moitié utile. La crainte que vos chiffres dépendent de la formulation exacte du prompt est réelle, et elle se concentre sur une minorité d’intentions au lieu d’être répartie. Mais vous ne pouvez pas savoir laquelle de vos intentions est l’instable sans la poser de plusieurs façons, et presque rien sur le marché ne le fait.

Ce que cela veut dire si vous achetez de la mesure de visibilité IA

La courbe n’est pas inutile. Elle rapporte deux choses différentes additionnées, et l’utile est la plus petite.

  • Demandez ce que compte le chiffre. Un pourcentage de sources durables sur sources totales bouge surtout avec le total. Demandez l’ensemble.
  • Demandez combien de passages, et si ce nombre est fixe. Une comparaison entre semaines où le nombre de passages répondus dérive mesure la dérive. Nous l’avons mesurée à vingt-cinq points.
  • Demandez si l’outil lance plus d’une formulation par intention. 5 intentions sur 6 s’en moquent, et trouver la sixième est toute la valeur.
  • Et demandez s’il sépare le noyau du bruit, parce que six jours ont déplacé la moitié de l’ensemble et laissé les trois quarts du noyau tranquilles. Ce sont deux histoires différentes sur votre visibilité et une seule mérite qu’on agisse.

Si vous voulez cette séparation sur votre propre catégorie plutôt que sur la nôtre, c’est ce que fait notre produit, et la méthode ci-dessus est celle qu’il utilise.

La surface n’est pas l’axe majeur, et nous avions prédit le contraire

La limite déclarée de cette étude était une seule surface, donc nous l’avons fermée : les mêmes 12 cellules lues sur AI Mode le même jour, donc l’appariement est dans la cellule et seule la surface change.

La prédiction, écrite et commitée avant le premier appel, était que la surface compterait plus qu’une semaine. Ce n’est pas le cas.

Recouvrement médian
Même surface, six jours d’écart50 %
Les deux surfaces, le même jour50 %

C’est le seuil de retrait que le protocole avait nommé, donc l’affirmation selon laquelle mélanger les surfaces ajoute plus de bruit qu’un mois de dérive est retirée ici plutôt qu’abandonnée en silence.

Et ce que le Jaccard cachait vaut mieux que notre prédiction. Un faible recouvrement entre un ensemble large et un étroit peut décrire une inclusion et pas un désaccord, et c’est une inclusion : une médiane de 94 % de l’ensemble AI Overview tient dans celui d’AI Mode, 1,52 fois plus large. 6 des 12 cellules sont entièrement incluses et 2 seulement passent sous la moitié.

Les deux surfaces de Google ne répondent donc pas avec des sources différentes. L’une répond avec un sur-ensemble de l’autre, et le Jaccard punit le côté étroit d’être étroit. Si vous êtes cité dans AI Overview, vous l’êtes presque à coup sûr dans AI Mode, et l’inverse est un tirage à pile ou face.

Les deux cellules qui cassent cela méritent d’être nommées parce qu’elles sont un vrai désaccord et pas une question de largeur : les deux formulations de la question sur les vols ne partagent que 3 sur 7, AI Mode répondant depuis Skyscanner, Frommers et US News là où AI Overview répondait depuis Kayak, Expedia et Quora. Même jour, même marché, même question, deux sections voyage différentes.

Deux surfaces Google s’emboîtent. La troisième non.

L’inclusion est le résultat ci-dessus, et il vient de deux surfaces qui partagent un index. Cela laisse une question qu’un acheteur doit voir tranchée : une surface en contient-elle une autre parce que la récupération fonctionne ainsi, ou parce que ces deux-là sont la même récupération vue à deux largeurs ?

Gemini sur les mêmes 12 cellules, le même jour, tranche. Il ne s’emboîte pas.

Mêmes 12 cellules, même jourInclusion médiane
AI Overview dans AI Mode94 %
Gemini dans AI Mode42 %
Gemini dans AI Overview37 %

C’était le seuil de retrait nommé par le protocole, donc l’affirmation qu’un ensemble étroit tient dans un large est bornée à la paire sur laquelle elle a été mesurée, et n’est pas publiée comme une propriété des surfaces.

Et la paire de chiffres est tout l’enjeu. Gemini contre AI Overview donne un Jaccard de 0,25, AI Overview contre AI Mode donne 0,50. Cela ressemble à la même sorte de chiffre, deux fois plus d’accord dans un cas. Ce n’est pas du tout la même sorte de chiffre. L’un est un ensemble étroit logé dans un large ; l’autre, deux ensembles qui ne partagent réellement pas de sources. Seule l’inclusion les sépare, et aucun outil du marché ne la publie.

Gemini est aussi un peu plus étroit qu’AI Overview, médiane 0,87 de sa taille, donc il ne s’agit pas de largeur. C’est une autre récupération portant le nom de la même entreprise.

Ce que cela veut dire si vous payez pour de la mesure : surveiller AI Overview vous dit presque tout ce que vous apprendriez d’AI Mode, et presque rien de Gemini. Cinq des huit cellules comparables partagent moins de la moitié des sources de Gemini avec AI Overview. Si votre outil publie un chiffre Google, demandez de quelle surface il vient, parce que l’autre est un autre marché.

Et l’emboîtement est américain

Si une surface Google en contient une autre parce qu’elles partagent un index, cela doit apparaître dans n’importe quel marché. Donc les mêmes huit intentions en allemand, en Allemagne, sur les deux surfaces, chaque paire en un seul appel pour que les deux lectures ne puissent pas diverger.

Cela apparaît plus faiblement.

Inclusion médiane, AI Overview dans AI Mode
États-Unis94 %
Allemagne, toutes les cellules comparables50 %
Allemagne, les 5 cellules lues à trois passages67 %

50 % était le seuil de retrait nommé par le protocole, donc le chiffre américain devient une affirmation sur ce marché et pas sur l’architecture de Google.

Les deux chiffres allemands sont honnêtes tous les deux, et ils diffèrent pour une raison qu’il vaut mieux dire à voix haute. L’inclusion est une fraction de l’ensemble AI Overview, donc quand les deux surfaces répondent à moins de passages les deux ensembles rétrécissent et la fraction baisse. Les deux cellules ayant répondu deux fois sont les deux plus basses du tableau. Cela biaise ce bras vers le bas, l’inverse du bras Gemini, où seule une barre bougeait et où une barre basse poussait l’inclusion vers le haut. Un nombre de passages n’est pas un réglage neutre : le sens dans lequel il tord un chiffre dépend du côté de la fraction qu’il rétrécit.

Et le contrôle est ce qui donne un sens au bras. Si les réponses allemandes avaient utilisé les mêmes sources que les américaines, ce serait un marché mesuré deux fois. Ce n’est pas le cas : jointes question par question, le recouvrement médian entre les ensembles allemand et américain est de 0,11, de 0,03 à 0,27, et les deux cellules les plus basses partagent un seul domaine sur une trentaine. L’Allemagne est un autre ensemble de sources, et à l’intérieur les deux surfaces se rapportent autrement.

Une cellule allemande n’a renvoyé aucun AI Overview sur trois passages. C’est une surface qui décline, pas un zéro, et elle est exclue et nommée plutôt que comptée.

Ce que cela coûte à un acheteur : le raccourci est local. Aux États-Unis, surveiller AI Overview vous dit presque tout d’AI Mode. En Allemagne il vous en dit entre la moitié et deux tiers, et l’ensemble allemand d’AI Mode est 1,67 fois plus large. Si vous vendez dans plus d’un pays, les deux surfaces y sont deux mesures et pas une.

Limites

  • Trois surfaces Google et deux marchés. La rétention n’est qu’AI Overview aux États-Unis ; les moitiés surface ajoutent AI Mode et Gemini sur les mêmes cellules, et la moitié marché refait la mesure d’inclusion en Allemagne. ChatGPT et Perplexity récupèrent autrement et par cette voie ChatGPT ne renvoie aucune source, donc son zéro serait l’instrument.
  • Deux marchés et deux langues. Tout ce qui précède la section marché est les États-Unis en anglais ; la mesure d’inclusion est refaite en Allemagne en allemand, et le contrôle entre marchés est dans le registre.
  • Deux points puis un troisième. Six jours sont un intervalle et pas une tendance, et rien ici ne dit que le taux de renouvellement est constant.
  • 12 cellules comparables. Une médiane sur 12 est une direction et pas un chiffre précis, et les deux cellules exclues pour avoir répondu à une barre plus basse sont nommées dans le registre plutôt qu’écartées en silence.
  • Rien de tout cela n’est causal. Nous avons mesuré ce qui a changé, pas pourquoi.

Questions fréquentes

Quelle est la différence entre le noyau et le reste ?

Le noyau est l’ensemble des domaines cités dans chaque lecture d’une question et pas seulement dans certaines. Le reste est apparu au moins une fois. La distinction compte parce que les deux se comportent différemment dans le temps : dans cette étude le noyau a retenu 73 % sur six jours et l’ensemble complet s’est recoupé à 50 %.

Poser la question plus souvent rend-il le chiffre plus stable ?

Pas comme on s’y attend. Plus de passages augmentent le nombre de sources vues au moins une fois, donc une statistique stricte du type cité à chaque fois devient plus difficile à satisfaire à mesure qu’on échantillonne. C’est pourquoi les comparaisons dans le temps doivent fixer le nombre de passages, et pourquoi nous avons mesuré vingt-cinq points d’écart entre barres mixtes et barres appariées.

Une source disparue de la courbe est-elle vraiment partie ?

Souvent non. Dans cette étude, la moitié de l’ensemble cité complet était différente au bout de six jours pendant que les trois quarts du noyau restaient. Un domaine qui sort d’une vue hebdomadaire était peut-être dans la moitié qui se renouvelle depuis le début, et c’est pourquoi la courbe utile montre le noyau et le bord séparément au lieu d’une seule ligne.

Combien de fois un outil devrait-il poser chaque question ?

Assez pour distinguer une citation stable d’une coïncidence, et le même nombre chaque fois qu’il compare. Ce qui compte plus que le chiffre exact, c’est qu’il ne dérive pas entre les semaines comparées, sinon la comparaison mesure l’échantillonnage et pas le marché.

La formulation du prompt change-t-elle la réponse ?

Pour la plupart des intentions, non. 5 intentions sur 6 ont rendu ici le même ensemble depuis une forme mot-clé et une forme question le même jour. La sixième a rendu des ensembles différents aux deux dates de mesure, et c’est pourquoi l’honnête est de poser chaque intention de plusieurs façons plutôt que de supposer la formulation sûre.

Interrogez une IA sur cet article

Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.

Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.

Écrit par

Maher El Ouahabi

CTO et cofondateur d’EchoWi

Construit le logiciel qui montre aux marques ce que l’IA dit vraiment d’elles, puis quoi changer pour que la réponse suivante soit meilleure. Douze moteurs, mesurés avant et après.

LinkedIn Maher El Ouahabi (ouvre un nouvel onglet)