Aller au contenu
Visibilité IAÉtude
FR

Une catégorie a cité les mêmes 13 sources à chaque fois. Une autre en a cité 49 sans presque aucune répétition.

42 mesures d'AI Overview sur six catégories : la stabilité allait de toutes les sources répétées à presque aucune. Remesurée un jour après, une s'est inversée.

· Mis à jour · 15 min de lecture

Demandez trois fois à Google AI Overview quel est le meilleur assistant de code IA : il cite treize sources, les mêmes treize à chaque fois. Demandez-lui trois fois à quel cabinet confier une direction financière externalisée : il en cite dix-huit, dont douze n’apparaissent qu’une seule fois.

Même surface. Même marché. Même jour. Même nombre d’exécutions. La différence tient entièrement à la catégorie sur laquelle porte la question.

Cela compte, parce que tous les produits de visibilité IA du marché, le nôtre compris, vous vendent un nombre d’exécutions. Si le bon nombre est trois dans une catégorie et trente dans une autre, appliquer le même taux d’échantillonnage à tous les clients est faux pour la plupart d’entre eux, et personne dans ce marché ne publie le chiffre qui vous dirait dans quel cas vous êtes.

Comment c’est mesuré : Google AI Overview, par scraping réel et non par l’API d’un modèle, avec pays et langue fixés explicitement à chaque appel. Cache contournée, chaque exécution étant un appel neuf, exécution en série. Dix mesures, 42 exécutions au total, du 5 au 7 août 2026. Nous comptons les domaines cités, pas les mentions de marque : ce sont deux résultats distincts et les mélanger est l’erreur la plus répandue de cette catégorie. Chaque prompt, marché, date et nombre d’exécutions est enregistré mot pour mot dans notre registre de mesures.


Le résultat

CatégorieMarchéExéc.Domaines citésÀ chaque foisUne seule fois
Assistants de code IAÉtats-Unis313130
Réservation de volsÉtats-Unis3660
Casques à réduction de bruitÉtats-Unis2440
CRM pour PMEÉtats-Unis41134
Outils de visibilité IAEspagne31154
Outils de visibilité IAFrance31337
Outils de visibilité IAEspagne317311
Direction financière externaliséeÉtats-Unis318312
Outils de visibilité IAÉtats-Unis423314
Agences GEOEspagne1449039
Assistants de code IA, États-Unis100% (13 sur 13)Réservation de vols, États-Unis100% (6 sur 6)Casques à réduction de bruit, États-Unis100% (4 sur 4)Outils de visibilité IA, Espagne45% (5 sur 11)CRM pour PME, États-Unis27% (3 sur 11)Outils de visibilité IA, France23% (3 sur 13)Outils de visibilité IA, Espagne18% (3 sur 17)Directeur financier externalisé, États-Unis17% (3 sur 18)Outils de visibilité IA, États-Unis13% (3 sur 23)Agences GEO, Espagne0% (0 sur 49)
La stabilité, lue comme la part des domaines cités qui survivent à toutes les exécutions. En haut, chaque source utilisée par la réponse l'a été à chaque fois. En bas, quarante-neuf domaines sur quatorze exécutions et aucun dans toutes. Ce sont des sessions isolées à des dates précises : la ligne CRM, remesurée un jour plus tard, est revenue à sept sur sept.
Part des domaines cités apparus à chaque exécution, par catégorie
value
Assistants de code IA, États-Unis100%
Réservation de vols, États-Unis100%
Casques à réduction de bruit, États-Unis100%
Outils de visibilité IA, Espagne45%
CRM pour PME, États-Unis27%
Outils de visibilité IA, France23%
Outils de visibilité IA, Espagne18%
Directeur financier externalisé, États-Unis17%
Outils de visibilité IA, États-Unis13%
Agences GEO, Espagne0%

Lisez les deux dernières colonnes ensemble. En haut, toutes les sources utilisées par la réponse l’ont été à chaque fois. En bas, quarante-neuf domaines ont été cités sur quatorze exécutions et aucun n’est apparu dans toutes.

La comparaison qui n’admet aucune excuse

Les nombres d’exécutions différents rendent le milieu de ce tableau difficile à comparer. Voici donc la paire qui n’a rien à justifier.

Assistants de code IA et direction financière externalisée. Les deux aux États-Unis, les deux en anglais, les deux sur Google AI Overview, les deux avec trois exécutions, les deux mesurés le 7 août 2026.

Assistants de codeDirection financière externalisée
Domaines cités1318
Cités dans les trois exécutions133
Cités une seule fois012

L’un des deux est entièrement reproductible avec trois exécutions. L’autre, au même coût et le même après-midi, ne vous apprend presque rien avec trois exécutions : deux tiers de ce que vous auriez vu était sans lendemain.

Vendre le même rapport mensuel à ces deux entreprises reviendrait à donner une mesure à l’une et du bruit avec un graphique à l’autre.

Ce qui le prédit vraiment, et ce qui ne le prédit pas

La première intuition est l’ancienneté de la catégorie. Elle est fausse dans les deux sens.

Les assistants de code IA ont environ trois ans et sont parfaitement stables. Le CRM a trente ans et n’a renvoyé que trois domaines stables sur onze. La nouveauté ne cause pas l’instabilité.

La deuxième intuition est la taille ou l’argent. Fausse également : la réservation de vols est l’une des requêtes les plus disputées commercialement du web et elle a renvoyé six domaines, les six stables.

Ce que les lignes instables ont en commun est plus subtil, et nous le donnons comme hypothèse et non comme résultat, parce que dix mesures ne suffisent pas à l’établir :

L’instabilité suit le nombre de pages interchangeables qui se disputent la réponse. Les cabinets de direction financière, les agences GEO et les éditeurs de visibilité IA ont tous produit un large corpus de pages commerciales quasi identiques, chacune avançant une affirmation semblable avec une autorité semblable. Aucune source ne s’impose, donc la récupération assemble un sous-ensemble plausible différent à chaque fois. Là où une catégorie possède quelques sources clairement primaires, Gartner et GitHub pour les outils de code ou une poignée de métamoteurs pour les vols, la récupération retrouve les mêmes et s’arrête.

Si c’est exact, la conséquence est contre-intuitive : plus une catégorie produit de contenu, moins les citations y sont stables. Cela mérite d’être testé sérieusement et nous comptons le faire.

Les deux choses que cela change dans la mesure

Une : votre taille d’échantillon est une propriété de votre catégorie, pas de votre budget.

Le produit standard de ce marché est un nombre fixe d’exécutions par prompt et par mois, vendu à l’identique à tout le monde. Notre catalogue de prix vérifiés montre l’éventail : Nightwatch donne trente réponses par prompt et par mois sur tous ses plans, Rank Prompt vend une réserve de crédits que vous répartissez vous-même, et plusieurs éditeurs ne publient tout simplement pas le chiffre.

Aucune de ces options n’est mauvaise. Ce qui l’est, c’est de choisir sans savoir dans quelle moitié de ce tableau vous vous trouvez. Trente réponses par mois sont généreuses dans une catégorie comme les outils de code et maigres dans une catégorie comme les services professionnels.

Deux : un rapport isolé ne distingue pas l’absence du bruit.

Dans les catégories instables, la plupart des domaines cités ne l’ont été qu’une fois. Si votre marque est l’un d’eux, un rapport mensuel indiquant « cité » puis un autre indiquant « non cité » ne décrit aucun changement dans le monde réel. Il faudrait beaucoup plus d’observations avant que l’écart entre ces deux mois signifie quoi que ce soit, et l’arithmétique du nombre nécessaire est impitoyable sur de petits échantillons.

C’est la même forme que nous avons trouvée en rejouant deux jours plus tard une étude sur trois marchés : l’agrégat s’est reproduit presque à l’identique pendant que les noms changeaient presque entièrement. Totaux stables, membres instables.

Le test que vous pouvez faire vous-même

Vous n’avez pas besoin de nos données. Vous avez besoin des vôtres, et voici la procédure entière :

  1. Prenez le prompt qui vous importe vraiment.
  2. Lancez-le trois fois, pays et langue fixés explicitement, cache contournée.
  3. Relevez les domaines cités à chaque exécution.
  4. Comptez combien apparaissent dans les trois.

Si presque tous y sont, trois exécutions constituent une vraie mesure dans votre catégorie et vous pouvez consacrer le reste du budget à la surface : plus de prompts, plus de marchés, plus de moteurs.

Si peu y sont, trois exécutions sont un tirage et non un taux. Dépensez en répétition, et traitez tout chiffre mensuel isolé, de n’importe quel éditeur, comme provisoire tant que vous n’avez pas assez d’exécutions pour lui donner un intervalle.

Faites-le une fois par catégorie, pas une fois par prompt. C’est une propriété de l’espace de questions dans lequel vous vendez et cela ne changera pas d’une semaine à l’autre.

Le résultat que nous ne cherchions pas

La mesure du CRM a été demandée trois fois et Google n’a renvoyé un AI Overview qu’une seule fois. Sans erreur et sans échec : deux des trois requêtes ont simplement produit une page sans réponse d’IA. Relancée sur quatre requêtes, elle en a donné quatre.

C’est un troisième état, et la plupart des rapports de cette catégorie le confondent avec le deuxième :

  • Vous figurez dans la réponse.
  • Il y a une réponse et vous n’y figurez pas.
  • Il n’y a pas de réponse.

Un outil qui annonce « 0 mention » ce mois-ci ne vous a rien dit sur lequel des deux derniers cas s’applique, et ils appellent des réactions opposées. Si une question ne déclenche souvent aucun AI Overview, votre travail n’est pas d’écrire une meilleure page pour elle. C’est de choisir une autre question, ou d’accepter que cette surface n’est pas là où cet acheteur est servi.

Nous avons déjà écrit sur les réponses qui arrivent sans aucune source, cas voisin mais distinct : là, la réponse existe et ne cite rien. Ici, la réponse n’existe pas. Les deux sont invisibles dans un pourcentage de visibilité.

Nous avons remesuré une ligne le lendemain et elle s’est inversée

Le tableau ci-dessus, ce sont dix sessions à des dates précises. Le 8 août 2026, un jour après la mesure, nous avons relancé la ligne CRM : la même chaîne de requête, la même surface, le même marché et le même nombre d’exécutions.

CRM pour PME, États-Unis, Google AI Overview7 août8 août
Exécutions44
Domaines cités117
Cités à chaque exécution37
Cités exactement une fois40

La catégorie qui a fourni à cet article son exemple d’instabilité est revenue parfaitement stable. Les 27 % sont devenus 100 % du jour au lendemain, sans rien changer de notre côté et sans rien pour l’expliquer : requête identique, même nombre d’exécutions, un jour d’écart.

Une note sur ce qui a failli mal tourner, car c’est le piège dont parle cet article. La première remesure utilisait « what is the best CRM for a small business? », qui retire un mot à la requête enregistrée, et a renvoyé sept sur sept en cinq exécutions. Cela ressemblait au même résultat et ce n’était pas le même test. La comparaison ci-dessus utilise la chaîne exacte du registre, car une requête qui diffère d’un mot est une autre requête, et nous avons publié cette règle ailleurs.

Trois choses en découlent, et les deux premières nous coûtent quelque chose.

Le classement de stabilité du tableau ci-dessus est une photo de sessions, pas une propriété des catégories. Nous avons écrit que cet article était une photographie et non une série. Voilà ce que cette phrase signifie une fois encaissée : une catégorie peut passer de la moitié instable au sommet du tableau en un jour. Qui utilise notre tableau pour décider à quelle fréquence mesurer sa propre catégorie devrait traiter la ligne comme une seule observation, ce que chaque ligne a toujours été.

Le mécanisme que nous avancions n’est pas soutenu par ceci. Nous suggérions que l’instabilité suit le nombre de pages à peu près interchangeables qui se disputent la réponse. La population de pages CRM sur internet n’a pas changé de façon notable entre un vendredi et un samedi. Ce qui a bougé se situait du côté de la récupération et non du corpus, donc un nombre stable de pages concurrentes ne peut pas être toute l’explication.

Et le conseil pratique reste intact, pour une raison qui mérite d’être dite. Rien ici ne suggère que mesurer une fois soit sûr. Cela suggère l’inverse : si une seule session peut annoncer 27 % et la suivante 100 %, une seule session est exactement ce sur quoi vous ne pouvez pas vous appuyer. Le remède ne change pas et il est désormais mieux étayé : répéter, sur des exécutions sans cache, et publier le nombre d’exécutions à côté de chaque chiffre.

Nous avons aussi ajouté une catégorie que le jeu initial ne couvrait pas, mesurée le même jour :

CatégorieMarchéExécutionsDomaines citésÀ chaque foisExactement une fois
Logiciels de gestion de projetÉtats-Unis31848

Dix-huit domaines sur trois exécutions, dont quatre survivent aux trois, ce qui la place dans la moitié instable et non avec les vols et les assistants de code.

Ce que cette étude ne démontre pas

  • Une seule surface. Google AI Overview uniquement. Nous avons depuis posé la même question à quatre surfaces et [aucune source citée n’est apparue sur les quatre] (/fr/blog/quatre-surfaces-une-question/), y compris pour la catégorie en haut de ce tableau, dont la stabilité à l’intérieur d’une surface était parfaite.
  • Dix mesures. Assez pour établir que l’écart entre catégories est large et réel. Pas assez pour classer les catégories avec précision, et certainement pas pour démontrer le mécanisme avancé plus haut.
  • Les nombres d’exécutions diffèrent. Un domaine doit sortir 3 fois sur 3 pour être stable à trois exécutions et 14 sur 14 à quatorze, donc la métrique devient plus dure à mesure que les exécutions augmentent. C’est pourquoi l’argument repose sur les paires à nombre d’exécutions identique et non sur le tableau entier. Cela n’explique pas un écart entre 0 % et 67 % de sources uniques à exécutions égales.
  • Rien de causal. Ceci est une observation. Nous n’avons rien changé et nous avons mesuré ce qui revenait.
  • Rien sur la qualité. Être cité n’est pas être bon. Cela dit ce que la couche de récupération a trouvé, pas ce qui mérite d’être acheté.
  • Une photo, pas une série. Ce sont des sessions isolées à des dates précises, et nos propres remesures montrent des sessions qui se contredisent. Traitez chaque ligne comme une observation.

Pourquoi nous publions ceci

Cela plaide contre la version la plus simple de notre propre produit. Un éditeur qui vend de la mesure de visibilité IA a tout intérêt à dire que mesurer est simple, qu’un chiffre mensuel veut dire ce qu’il semble vouloir dire, et que le même forfait convient à tout le monde.

Les données disent le contraire dans plus de la moitié des catégories testées, la nôtre comprise. Nous préférons publier le chiffre qui complique la vente plutôt que d’en défendre un plus simple qu’un client peut démonter avec trois exécutions.

Pour voir ce que chaque éditeur publie sur sa façon de mesurer, ce qui est moins que vous ne l’espéreriez, tout est dans notre comparatif de tous les outils vérifiés.

Questions fréquentes sur la stabilité des réponses d’IA

Combien de fois faut-il lancer un prompt pour mesurer la visibilité IA ?

Cela dépend de la catégorie, et vous pouvez le découvrir vous-même. Lancez le prompt trois fois avec pays et langue fixés explicitement, puis comptez combien de domaines cités apparaissent dans les trois. Dans nos mesures, ce nombre est allé de tous à aucun. Là où presque toutes les sources se répètent, trois exécutions constituent une vraie mesure. Là où peu se répètent, il en faut nettement plus avant qu’un chiffre mensuel signifie quelque chose.

Les réponses d’IA changent-elles entre des requêtes identiques ?

Dans certaines catégories, presque pas. Interrogé trois fois sur le meilleur assistant de code IA, Google AI Overview a cité treize domaines, les mêmes treize à chaque fois. Dans d’autres, énormément : quatorze exécutions sur les agences GEO en Espagne ont cité quarante-neuf domaines et aucun n’est apparu dans toutes.

Quelles catégories donnent les citations les plus stables ?

Dans notre échantillon, les catégories de produits et de grande consommation établies : réservation de vols, casques à réduction de bruit et assistants de code IA ont tous renvoyé l’ensemble de leurs domaines cités à chaque exécution. Les moins stables étaient les services professionnels et le logiciel B2B émergent, où la plupart des domaines cités n’apparaissaient qu’une seule fois.

Pourquoi une catégorie récente serait-elle plus stable qu’une ancienne ?

L’ancienneté ne semble pas être le facteur. Les assistants de code sont une catégorie jeune et parfaitement stable ; le CRM a des décennies et ne l’est pas. Notre hypothèse est que la stabilité suit le nombre de pages interchangeables qui se disputent la réponse, de sorte qu’une catégorie dotée de quelques sources clairement primaires les renvoie systématiquement, tandis qu’une catégorie saturée en renvoie un sous-ensemble différent à chaque fois. C’est une hypothèse, pas un résultat.

Que signifie apparaître un mois et pas le suivant ?

Dans une catégorie instable, possiblement rien. La plupart des domaines cités y apparaissaient exactement une fois sur trois ou quatre, donc un écart entre deux observations isolées reste dans le bruit. Avant d’y voir un mouvement réel, vérifiez combien d’exécutions se trouvent derrière chaque chiffre.

Google affiche-t-il toujours un AI Overview ?

Non, et pour la mesure cela compte. L’une de nos requêtes n’a renvoyé un AI Overview que sur une requête sur trois, sans erreur sur les deux autres. Un rapport affichant zéro mention ne distingue pas « il y avait une réponse et vous n’y étiez pas » de « il n’y avait pas de réponse », et chacune appelle une réaction différente.

Interrogez une IA sur cet article

Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.

Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.

Écrit par

Maher El Ouahabi

CTO et cofondateur d’EchoWi

Construit le logiciel qui montre aux marques ce que l’IA dit vraiment d’elles, puis quoi changer pour que la réponse suivante soit meilleure. Douze moteurs, mesurés avant et après.

LinkedIn Maher El Ouahabi (ouvre un nouvel onglet)