Aller au contenu
Visibilité IARecherche
FR

Nous avons demandé la meilleure agence dix-neuf fois sur quatre marchés. L'essentiel de ce qui était cité avait disparu à l'exécution suivante.

Dix-neuf questions d'achat, quatre marchés, trois surfaces IA, 46 exécutions. Sur 408 sources citées, 58 % ne sont apparues qu'une fois.

· Mis à jour · 22 min de lecture

Nous avons posé dix-neuf questions du type « quelle est la meilleure agence pour X » à trois surfaces IA sur quatre marchés. Elles ont cité 408 sources au total. Deux cent trente-huit d’entre elles, soit 58 %, ne sont apparues que dans une seule exécution et avaient disparu à la suivante.

C’est le chiffre qu’une agence doit connaître avant d’inscrire une mesure de visibilité IA dans un rapport client, parce qu’il décide de ce que ce rapport veut dire. Une source citée une fois n’est pas une position dans la réponse. C’est une pièce tombée du bon côté. Et la part qui tient, celle que tout le monde vend comme score de stabilité, porte le même défaut vue de l’autre côté : regroupée sur toutes nos mesures, elle dit surtout combien de sources la réponse a citées.

Transparence : EchoWi vend de la mesure de visibilité IA et concourt dans cette catégorie. C’est un conflit d’intérêts, et la réponse à un conflit est une méthode vérifiable et non une promesse de neutralité. Tout ce qu’il faut pour refaire cette étude, y compris contre nous, est ci-dessous : les questions, les surfaces, les marchés, le nombre d’exécutions et les dates.


La version courte

  1. Sur 408 sources citées, 238 ne sont apparues qu’une seule fois. Soit 58 %. C’était déjà 58 % quand cette étude comptait quatre questions de moins et deux marchés de moins, ce qui est ce qu’elle contient de plus rassurant.
  2. Un bon tiers a tenu sur toutes les exécutions. 129 sur 408, soit 32 %. Ce tiers est la seule partie d’une réponse IA sur laquelle il vaut la peine de bâtir une stratégie.
  3. Le chiffre bouge de 10 points selon le seul nombre d’exécutions. Les questions passées deux fois donnent 37 % de sources stables ; celles passées trois fois, 27 %. Même méthode, mêmes surfaces, même semaine.
  4. Le marché change la réponse, mais pas de façon fiable. Sur quatre comparaisons appariées par secteur et par nombre d’exécutions, deux diffèrent de 15 et 35 points et deux de 3 et 2.
  5. Vous n’obtenez pas les exécutions que vous demandez. Dix des dix-neuf questions reposent sur deux exécutions ou une seule, parce que la mesure s’est arrêtée avant et l’a dit. Noter ce qui a tourné plutôt que ce qui a été demandé, c’est la différence entre un dénominateur et un souhait.

Ce que nous avons mesuré

Questions19, toutes de la forme « quelle est la meilleure agence marketing pour [secteur] », dans la langue de chaque marché. 18 portent un chiffre de stabilité ; une n’a renvoyé qu’une exécution et sort de tous les pourcentages
SecteursHôtels, cabinets d’avocats, cliniques, e-commerce, santé, SaaS B2B, SEO en marque blanche et enseignement supérieur
SurfacesGoogle AI Overview, Google AI Mode et Gemini, regroupées par question
MarchésÉtats-Unis et anglais, Espagne et espagnol, France et français, Allemagne et allemand, fixés explicitement
Exécutions46 au total, 45 dans l’analyse, de 1 à 3 par question, notées par question et non supposées
CacheContournée. Chaque exécution est un appel neuf
Dates9 et 10 août 2026

Trois choses dans ce tableau décident si tout le reste veut dire quelque chose.

Le marché est fixé explicitement à chaque exécution. La mesure part par défaut sur les États-Unis et l’anglais. Une question en français laissée par défaut est répondue par le marché américain et rien dans la sortie ne le signale, ce qui aurait donné quatre résultats étrangement semblables et une conclusion entièrement fausse.

Le nombre d’exécutions est celui qui a réellement tourné. Dix questions ont renvoyé moins d’exécutions que demandé et l’outil l’a dit. Écrire trois à cet endroit aurait inventé un tiers de dénominateur, et inventer des dénominateurs est précisément la faute contre laquelle ce registre existe. Chaque question ci-dessous est une ligne du registre de mesures avec le nombre revenu, pas celui demandé. Cela veut dire aussi que les questions à deux et à trois exécutions ne sont pas directement comparables, et c’est ce qui s’est révélé le plus utile de l’étude.

ChatGPT n’est pas là. C’est la surface dont on parle le plus et celle que nous pouvons le moins défendre par cette voie, car la route utilisée ne renvoie pas sa liste de sources. Un zéro d’instrument est indiscernable d’un zéro réel, alors il sort de l’étude au lieu d’être publié comme une absence.


Quelle part d’une réponse IA tient en place

Regroupez les trois surfaces par question et vous obtenez un ensemble de domaines cités. Séparez-le entre ceux présents à chaque exécution, ceux présents une seule fois, et ceux du milieu :

SourcesSur 408
Citées à chaque exécution12932 %
Citées plus d’une fois, pas toujours4110 %
Citées exactement une fois23858 %
citées à chaque exécutionsources distinctes citéesÉtats-Unis · avocats, 2 exéc.13 → 20Espagne · hôtels, 2 exéc.9 → 16France · cliniques, 2 exéc.8 → 16États-Unis · SaaS B2B, 2 exéc.7 → 19États-Unis · hôtels, 3 exéc.6 → 17Espagne · e-commerce, 3 exéc.9 → 28États-Unis · SEO marque blanche, 2 exéc.8 → 25France · avocats, 3 exéc.7 → 22France · e-commerce, 2 exéc.9 → 29États-Unis · santé, 2 exéc.6 → 20États-Unis · e-commerce, 3 exéc.7 → 24Allemagne · avocats, 2 exéc.7 → 25France · hôtels, 3 exéc.7 → 26États-Unis · enseignement sup., 3 exéc.6 → 23Espagne · cliniques, 3 exéc.5 → 22Allemagne · hôtels, 2 exéc.5 → 24Allemagne · cliniques, 3 exéc.6 → 29Espagne · avocats, 3 exéc.4 → 23
Chaque ligne est une question d'achat. Le point de gauche est ce qui a tenu sur toutes les exécutions, celui de droite tout ce qui a été cité, et l'écart entre les deux est la part qui ne sera plus là la prochaine fois. Google AI Overview, AI Mode et Gemini regroupées, cache contournée, 9 et 10 août 2026.
Sources citées à chaque exécution face à toutes les sources distinctes citées, pour les dix-huit questions d'achat d'agence
citées à chaque exécutionsources distinctes citées
États-Unis · avocats, 2 exéc.1320
Espagne · hôtels, 2 exéc.916
France · cliniques, 2 exéc.816
États-Unis · SaaS B2B, 2 exéc.719
États-Unis · hôtels, 3 exéc.617
Espagne · e-commerce, 3 exéc.928
États-Unis · SEO marque blanche, 2 exéc.825
France · avocats, 3 exéc.722
France · e-commerce, 2 exéc.929
États-Unis · santé, 2 exéc.620
États-Unis · e-commerce, 3 exéc.724
Allemagne · avocats, 2 exéc.725
France · hôtels, 3 exéc.726
États-Unis · enseignement sup., 3 exéc.623
Espagne · cliniques, 3 exéc.522
Allemagne · hôtels, 2 exéc.524
Allemagne · cliniques, 3 exéc.629
Espagne · avocats, 3 exéc.423

Aucune des dix-huit questions n’a de majorité stable. La meilleure est une question américaine sur les cabinets d’avocats, 13 sur 20, et celle-là a tourné deux fois. Elle est aussi tombée à 7 sur 24 quand nous l’avons reposée le lendemain, ce qui a sa propre section plus bas. La pire est une question espagnole sur les cabinets, 4 sur 23, sur trois exécutions.


Le nombre d’exécutions déplace le chiffre, et voici de combien

« Citée à chaque exécution » est une barre plus facile à franchir sur deux exécutions que sur trois. C’est de l’arithmétique, pas un résultat. Le résultat, c’est qu’on peut lui donner une taille depuis l’intérieur d’une même étude, parce que les deux groupes ont été mesurés la même semaine avec la même méthode :

QuestionsPart stableCitées une seule fois
Deux exécutions937 %63 %
Trois exécutions927 %54 %
Questions à deux exécutions37%Questions à trois exécutions27%
Même méthode, mêmes surfaces, même semaine. La seule différence est le nombre de fois où la question a été posée. Dix points d'un score apparent de stabilité sont le nombre d'exécutions et rien d'autre.
Part des sources citées à chaque exécution, pour les questions passées deux fois face à celles passées trois fois
value
Questions à deux exécutions37%
Questions à trois exécutions27%

Dix points. Sur une diapositive, 37 % et 27 % racontent deux histoires différentes de la position d’un client, et ce qui les sépare ici n’est ni le client, ni le marché, ni le secteur, ni la semaine. C’est le nombre de fois où quelqu’un a appuyé sur le bouton.

Voilà la conséquence pratique, et elle mérite d’être dite sans détour. Un chiffre de visibilité cité sans son nombre d’exécutions n’est pas une mesure, c’est un titre. Si un outil annonce qu’une marque apparaît dans une certaine proportion de réponses IA, la première question est dans combien de réponses, et la seconde est si ces exécutions viennent d’une session ou de plusieurs jours. Les nôtres viennent de sessions uniques, et c’est exactement pourquoi nous n’affirmons pas que ces pourcentages décrivent le mois d’août : ils décrivent ces exécutions.

La même instabilité apparaît quand on change de marché au lieu de changer de jour : nous avons posé la même question dans trois pays et comparé qui était nommé.

Nous avons mesuré à part la version d’un jour sur l’autre, et c’est pire : reposer la même question deux jours plus tard a reproduit les comptes presque exactement en changeant presque tous les noms. Et en mesurant six catégories au lieu d’une, le nombre d’exécutions dont une catégorie a besoin pour être décrite allait d’environ trois à environ trente, ce qui explique qu’un standard maison unique ne survive pas au contact d’un deuxième secteur.


Vous n’obtenez pas les exécutions demandées, et ce n’est pas une note de bas de page

Chaque question de cette étude a demandé trois exécutions. Dix des dix-neuf sont revenues avec deux ou une, et la mesure l’a dit à chaque fois au lieu de compléter le total. Quand nous sommes revenus le 10 août ajouter quatre questions en France et en Allemagne, trois des quatre se sont arrêtées avant et une n’a renvoyé qu’une exécution, et c’est pourquoi celle-là ne porte aucun pourcentage dans cet article.

Cela mérite d’être publié à soi seul. Un chiffre de stabilité est une fraction, et le dénominateur n’est pas quelque chose que vous choisissez, c’est quelque chose qu’on vous donne. Si un outil demande dix exécutions à un assistant, en reçoit six, et publie « citée dans 60 % des exécutions » contre un dénominateur de dix, le chiffre est faux dans une direction qui n’avantage personne en particulier et trompe tout le monde.

La vérification est simple et personne ne la propose : demandez à votre fournisseur ce qui se passe quand une exécution échoue. Si la réponse est que le nombre demandé est celui qui est publié, les pourcentages portent un dénominateur inventé, et sa taille est invisible de l’extérieur. La nôtre est une colonne du registre : le nombre d’exécutions est ce qui est revenu.


Nous en avons reposé deux le lendemain, et la meilleure s’est effondrée

Tout ce qui précède est mesuré dans des sessions uniques, ce que les limites en bas de cet article disent depuis toujours être la faiblesse. Le 10 août, nous avons donc reposé deux des questions du 9, même marché, mêmes surfaces, même méthode.

Question9 août10 août
Avocats, États-Unis13 sur 20 stables, 65 %, 2 exécutions7 sur 24 stables, 29 %, 2 exécutions
E-commerce, États-Unis7 sur 24 stables, 29 %, 3 exécutions7 sur 23 stables, 30 %, 2 exécutions

La question la plus stable de toute l’étude est la moins reproductible. Les cabinets d’avocats sont passés de 65 % à 29 % en un jour, avec le même nombre d’exécutions les deux jours, donc ce n’est pas l’effet arithmétique décrit plus haut. C’est la même question qui reçoit une autre réponse.

L’e-commerce, résultat ordinaire de milieu de tableau, est revenu à peu près au même chiffre. Là, les nombres d’exécutions diffèrent, deux contre trois, donc ce n’est pas une comparaison propre et nous ne la traitons pas comme telle. Ce qu’on peut dire, c’est que le chiffre banal s’est reproduit et que le chiffre remarquable, non.

Cela inverse l’instinct. Un score de stabilité élevé et isolé ressemble à la preuve la plus solide de la page et c’est celui dont il faut le moins se fier, parce qu’il y a beaucoup plus de façons d’être instable que stable et qu’une valeur extrême a plus de chemin à parcourir vers le bas. Si vous devez revérifier un seul chiffre d’un rapport client avant de l’envoyer, revérifiez le meilleur.

Et parfois il survit, et c’est bien pour cela que le conseil est de vérifier et non de douter. Une question de réservation de voyage mesurée la même semaine, sur les mêmes trois surfaces et les mêmes deux exécutions, est revenue avec 24 sources stables sur 25, puis 24 sur 26 dans une seconde session, avec les mêmes vingt-quatre domaines les deux fois. Un chiffre élevé n’est pas suspect parce qu’il est élevé. Remesurer est ce qui sépare un vrai noyau d’une session chanceuse, et une seule des deux mérite qu’on lui écrive un brief de contenu.

Une chose que nous ne pouvons pas vous dire, et la faute est la nôtre et non celle de la méthode. Les lignes du 9 août ont noté combien de sources étaient stables, pas lesquelles, donc ces deux jours se comparent en taille et non en identité.

Une troisième session, le même jour, répond à la partie qui manquait. Nous avons reposé la question des cabinets une fois de plus le 10 août, dans une session neuve. Elle s’est arrêtée après une seule exécution, donc elle ne produit aucun taux de stabilité et nous n’en dérivons aucun. Une exécution peut tout de même répondre à autre chose : quelles sources sont revenues.

Les sept sources stables de la deuxième session sont toutes revenues : reddit.com, answeringlegal.com, natlawreview.com, exults.com, rebuttalpr.com, mycase.com et lawyerist.com. Dix des dix-sept sources uniques de cette session sont revenues aussi, trois domaines étaient nouveaux, et les deux ensembles cités se recouvrent à 0,63 selon Jaccard.

Donc le pourcentage est plus volatil que les sources qu’il décrit. Un chiffre qui a bougé de 36 points repose sur un noyau qui n’a pas bougé du tout. Cela mérite d’être séparé dans un rapport client : « votre score de stabilité a baissé » et « les pages qui portent la réponse ont changé » sont deux phrases différentes, et cette semaine seule la première était vraie.

La raison est mécanique et non mystérieuse. « Citée à chaque exécution » est un critère sans tolérance à deux ou trois exécutions : une source absente d’une exécution quitte entièrement le numérateur, et avec un numérateur à un chiffre cela transforme un petit changement de réponse en un grand écart de pourcentage. Le noyau survit ; la statistique qui le décrit, non.

La correction évidente ne marche pas, et cela vaut un paragraphe. Si « citée à chaque exécution » est trop fragile, le remplaçant naturel est le taux moyen de citation, qui tolère qu’une source manque une exécution au lieu de l’écarter. Appliqué à ces deux sessions il semble bien mieux se tenir : 0,825 tombant à 0,646, une baisse relative de 22 % contre 55 % pour la part stable.

Cette amélioration est une illusion, et l’algèbre le dit. Avec deux exécutions une source est citée une fois ou deux, donc son taux vaut 0,5 ou 1, et la moyenne vaut exactement 0,5 + 0,5 × (part stable). C’est le même chiffre remis à l’échelle sur un intervalle deux fois plus étroit. Il ne peut pas être moins volatil d’une manière qui signifie quoi que ce soit, et il ne porte aucune information que le premier ne portait déjà.

À trois exécutions il y a trois niveaux, un tiers, deux tiers et un, et la moyenne cesse d’être une transformation linéaire de la part stable. La tolérance s’achète donc avec des exécutions, pas avec des formules. Une statistique plus maligne sur deux exécutions est du maquillage, et nous avons failli publier celle-ci comme un résultat.


Même secteur, marché différent : les quatre comparaisons propres

La plupart des comparaisons entre marchés dans ces données sont contaminées par le nombre d’exécutions. Quatre ne le sont pas, parce qu’elles coïncident sur le secteur et sur les exécutions :

SecteurExécutionsÉcart
Hôtels2Espagne 56 % (9 sur 16)Allemagne 21 % (5 sur 24)35 points
Avocats3France 32 % (7 sur 22)Espagne 17 % (4 sur 23)15 points
E-commerce3Espagne 32 % (9 sur 28)États-Unis 29 % (7 sur 24)3 points
Cliniques3Espagne 23 % (5 sur 22)Allemagne 21 % (6 sur 29)2 points

La ligne des cliniques est celle que nous sommes allés chercher. La première version de cette étude avait trois de ces comparaisons et deux d’entre elles divergeaient, ce qui ne suffit pas à distinguer une régularité d’une coïncidence, alors nous avons mesuré l’e-commerce et les cliniques en France et en Allemagne précisément pour ajouter des paires propres. Cela en a acheté une : la question allemande sur les cliniques est la seule des quatre à avoir rendu ses trois exécutions.

Deux des quatre divergent beaucoup et deux presque pas. C’est le résumé honnête et il est plus utile qu’une règle nette ne l’aurait été. Le marché n’est pas un coefficient qu’on applique à un chiffre. Une mesure plus tardive en a bien trouvé un sur une autre question, en reposant la chaîne identique au lieu de compter à l’intérieur d’une seule lecture, et les deux chiffres ne se contredisent pas parce qu’ils mesurent des choses différentes. Les hôtels espagnols donnent la deuxième réponse la plus stable de toute l’étude et les cabinets espagnols la moins stable, sur le même marché, dans la même langue, le même jour.

S’il y a une régularité là-dedans, cette étude ne la voit pas. Ce qu’elle peut dire, c’est qu’une agence qui lance la même mesure pour deux clients dans deux pays doit s’attendre à ce que la fiabilité des deux rapports diffère, et ne doit pas supposer que l’écart vient du client.


La quantité citée bouge moins que ce qui est cité, et l’Allemagne fait exception

MarchéQuestionsMoyenne de sources distinctes par question
États-Unis721,1
Espagne422,3
France423,3
Allemagne326,0

Cinq sources entre le plus large et le plus étroit, sur des comptes de trois à sept questions. Aucun marché ne construit sa réponse avec beaucoup moins de matière, et le plus grand marché est celui qui en utilise le moins.

Cela compte pour qui prépare une entrée sur un marché en supposant qu’un marché plus petit est une réponse plus facile à occuper. Sur cette preuve il n’est pas plus mince, il est un peu plus large et moins stable : l’Allemagne cite le plus de sources par question et en retient le moins d’une exécution à l’autre.


Quoi en faire si vous rendez des rapports à des clients

Mettez le nombre d’exécutions à côté de chaque pourcentage. C’est le seul changement qui rend défendable un rapport de visibilité IA, et presque personne dans cette catégorie ne le fait. Nos propres chiffres bougent de dix points rien qu’avec ça.

Rapportez l’ensemble stable séparément de la longue traîne. Un client qui voit vingt sources citées et s’entend dire qu’il n’est dans aucune réagit autrement qu’un client à qui on explique que la réponse a un noyau de six et une traîne de quatorze qui change à chaque fois. La seconde version est vraie et la première est une frayeur.

Ne bâtissez pas un plan de contenu contre une citation unique. 58 % de ce contre quoi vous planifieriez ne sera plus là quand vous vérifierez. Le tiers qui tient est l’endroit où un brief vaut la peine d’être écrit, et il est assez petit pour être nommé page par page.

Demandez à votre fournisseur si ses exécutions répétées contournent le cache. Si elles ne le contournent pas, une courbe de tendance quotidienne est une ligne plate par construction, et un score de stabilité bâti dessus mesure son infrastructure et non votre visibilité. C’est une question qui a une bonne réponse et elle ne coûte rien.

Et mesurez le marché où vous vendez, pas celui que votre outil prend par défaut. Chaque exécution ici avait pays et langue fixés explicitement, ce qui n’est le réglage par défaut nulle part, et c’est la différence entre quatre résultats et un résultat copié quatre fois.


Ce que cette étude ne démontre pas

  • Dix-neuf questions, c’est peu. Quatre marchés, huit secteurs, et seuls quatre secteurs apparaissent sur plus d’un marché. Chaque pourcentage ici a un dénominateur en dizaines, pas en milliers.
  • Une question sort de tous les pourcentages. La question allemande sur l’e-commerce n’a rendu qu’une exécution, et à cette taille toute source est trivialement stable et trivialement unique. Elle est au registre parce que le registre note ce qui s’est passé, et hors de l’analyse parce qu’elle ne peut pas répondre à ce que l’analyse demande.
  • Deux exécutions et trois exécutions ne sont pas la même expérience, et c’est pourquoi elles sont publiées à part plutôt qu’agrégées en un seul titre. Le 32 % mélange les deux et se lit comme un point médian, pas comme un taux. Il a survécu au passage de l’étude de quinze à dix-neuf questions et de deux à quatre marchés, ce qui est une preuve qu’il s’agit d’un point médian stable, pas une démonstration.
  • Deux questions ont un deuxième jour, dix-sept n’en ont pas. Les exécutions d’une session parlent de cette session, et les deux que nous avons reposées ne sont pas d’accord sur l’importance de ce fait.
  • Trois surfaces, pas quatre. ChatGPT est écarté parce que la route utilisée ne renvoie pas sa liste de sources, et publier cela comme un zéro reviendrait à publier notre instrument.
  • Une seule formulation par question. Une étude espagnole sur la même classe de question a utilisé quatre formulations et trouvé 49 sources citées sans qu’aucune n’apparaisse dans les quatre, donc ces ensembles appartiennent à ces formulations et non à l’intention derrière.
  • Citer n’est pas recommander, et l’absence n’est pas un verdict. Une source citée a bien répondu à la question. Une source absente peut être excellente et simplement ne pas avoir été décrite.
  • Rien ici n’est causal. Nous n’avons rien changé et nous avons noté ce qui revenait.
  • La question allemande sur les hôtels est irrégulière. AI Overview a répondu une fois là où les deux autres surfaces ont répondu deux fois, et elle est notée à deux exécutions plutôt que lissée.

Questions fréquentes sur cette étude

Les réponses IA sont-elles stables sur les questions d’achat d’agence ?

Un bon tiers des sources citées a tenu sur toutes les exécutions, et 58 % ne sont apparues qu’une fois. Sur dix-neuf questions et quatre marchés, aucune question n’a de majorité stable : la meilleure fait 13 sources sur 20 en deux exécutions et la pire 4 sur 23 en trois. Une réponse IA isolée à une question d’achat est faite en majorité de sources qui ne seront pas dans la suivante.

Pourquoi le nombre d’exécutions change-t-il un score de visibilité IA ?

Parce que « citée à chaque exécution » est une barre plus facile sur deux exécutions que sur trois. Dans cette étude, les questions passées deux fois donnent 37 % de sources stables et celles passées trois fois 27 %, mesurées la même semaine avec la même méthode. Dix points d’un score apparent de stabilité sont le nombre d’exécutions et rien d’autre, et c’est pourquoi un pourcentage publié sans son dénominateur ne se compare à rien.

Les réponses IA diffèrent-elles d’un pays à l’autre pour la même question ?

Parfois beaucoup et parfois pas du tout. En ne comparant que des questions de même secteur et de même nombre d’exécutions, les réponses hôtelières espagnoles et allemandes diffèrent de 35 points de stabilité, les réponses avocats françaises et espagnoles de 15, les réponses e-commerce espagnoles et américaines de 3, et les réponses cliniques espagnoles et allemandes de 2. Deux grands écarts et deux petits, sur quatre comparaisons, ne font pas une règle sur les marchés.

Une agence doit-elle rendre compte de la visibilité IA à ses clients ?

Oui, avec deux choses attachées : le nombre d’exécutions derrière chaque pourcentage, et une séparation entre les sources qui reviennent à chaque fois et celles qui apparaissent une fois. Sans le nombre d’exécutions le chiffre ne se compare pas au rapport suivant. Sans la séparation, un client lit une longue traîne de coïncidences comme une position concurrentielle.

Quelles surfaces IA ont été mesurées ?

Google AI Overview, Google AI Mode et Gemini, regroupées par question, avec le cache contourné pour que chaque exécution soit un appel neuf. ChatGPT est délibérément absent : la route utilisée ici ne renvoie pas sa liste de sources, et un zéro produit par un instrument est indiscernable d’un zéro réel.

Comment refaire cette mesure ?

Posez la même question avec pays et langue fixés explicitement, au moins trois fois, sur chaque surface séparément, cache désactivé, et notez ce qui a réellement tourné plutôt que ce que vous aviez demandé. Cette dernière partie n’est pas du pointillisme : dix de nos dix-neuf questions sont revenues avec moins d’exécutions que demandé. Comptez ensuite trois choses : sources distinctes, sources présentes à chaque exécution, et sources présentes une seule fois. Ces trois nombres sont toute l’étude, et le troisième est celui que personne ne publie.


Où cela vous laisse

Ce que nous n’attendions pas, c’est le peu qui porte une réponse IA. Dix-neuf questions, quatre marchés, trois surfaces, et 58 % de tout ce qui a été cité n’est apparu qu’une fois. Ce chiffre n’a pas bougé quand l’étude a grandi de quatre questions et deux marchés, ce qui est ce qu’elle a de plus proche d’une réplication.

La partie sur laquelle on travaille est le tiers qui tient, et elle est assez petite pour être nommée : six ou sept sources par question. C’est un brief de contenu, pas un tableau de bord, et c’est la même conclusion qu’en mesurant ce que l’IA cite quand on l’interroge sur les universités, où le noyau stable était des résidences étudiantes et du soutien scolaire plutôt que les établissements eux-mêmes.

Si vous pilotez des rapports de visibilité pour des clients, l’amélioration la moins chère à votre portée n’est pas un meilleur outil. C’est d’imprimer le nombre d’exécutions à côté du pourcentage, et de séparer le noyau de la traîne. Les deux sont gratuites, et les deux font la différence entre un rapport sur lequel un client peut agir et un chiffre qu’il vous récitera quand il bougera.

Si vous voulez cette mesure pour vos propres comptes, nous le faisons avec des agences.

Interrogez une IA sur cet article

Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.

Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.

Écrit par

Maher El Ouahabi

CTO et cofondateur d’EchoWi

Construit le logiciel qui montre aux marques ce que l’IA dit vraiment d’elles, puis quoi changer pour que la réponse suivante soit meilleure. Douze moteurs, mesurés avant et après.

LinkedIn Maher El Ouahabi (ouvre un nouvel onglet)