Aller au contenu
Visibilité IAGEO
FR

Nous avons reposé quinze questions gelées deux jours plus tard : le meilleur score du lot n'a pas survécu à son propre contrôle

Treize catégories reposées après deux jours. Recouvrement médian des sources 0,63, et la meilleure comme la pire ligne ont bougé à la relecture.

· Mis à jour · 16 min de lecture

Tout outil de visibilité vend une courbe, et une courbe a besoin de la même question posée deux jours différents. Nous ne l’avions jamais fait. Le 10 août nous avons gelé quinze questions d’achat et noté, par leur nom, chaque domaine revenu dans les trois passages. Le 12 août nous avons reposé les mêmes quinze sur la même surface, dans les mêmes marchés, avec les mêmes trois passages. Treize lignes sont comparables, et leur recouvrement médian avec l’ensemble précédent est de 0,63.

Ce chiffre est presque exactement ce que nous coûtent déjà deux sessions du même après-midi. L’intéressant n’est pas la médiane : c’est que la ligne la plus haute et la plus basse du lot ont bougé toutes les deux en les relisant simplement.

Transparence : EchoWi vend de la mesure de visibilité IA, donc une étude qui soutient que le mouvement d’un jour à l’autre est surtout du bruit est une étude intéressée, et elle attaque une courbe que nous pourrions vendre aussi. Les quinze questions, la surface, les deux marchés, le nombre de passages et les deux dates sont indiqués plus bas, et chaque ligne, contrôles compris, se trouve dans notre registre de mesures, donc n’importe qui peut le refaire contre nous.


La version courte

  1. Treize des quinze lignes sont comparables, c’est-à-dire trois passages ayant répondu les deux jours. Le recouvrement médian des ensembles durables est de 0,63, avec une amplitude de 0,00 à 1,00.
  2. Cette médiane ne se distingue pas d’une seconde question posée le même jour. Deux sessions dans la même journée nous ont donné entre 0,67 et 0,70 dans nos travaux précédents, et les relectures à l’intérieur d’une seule session 0,63. Deux jours tombent au même endroit.
  3. Les deux contrôles ont bougé, et c’est là le résultat. La seule ligne qui avait rendu un ensemble identique après deux jours descend à 0,67 quand on la relit l’après-midi même. La seule qui n’avait rien rendu de durable monte à 0,25.
  4. Un score de stabilité quotidien parfait ne prédit rien sur deux jours. Quatre catégories ont marqué 100 % aux deux lectures. Leur recouvrement entre les jours va de 0,25 à 0,75.
  5. Ce qui persiste est une couche d’éditeurs, pas les sources propres à la catégorie. YouTube a tenu dans dix des treize catégories, Reddit dans quatre. Sur les neuf lignes américaines, 3 domaines de fournisseur sur 19 ont survécu à deux jours, contre 32 sur 59 pour tout le reste.

Ce qui a été gelé, et pourquoi c’est là qu’est toute l’astuce

Une ligne de stabilité enregistre d’habitude un décompte : cette question a cité vingt-deux domaines et sept sont revenus à chaque passage. Cela suffit pour publier un pourcentage et pas pour poser cette question-ci. Deux jours plus tard vous voyez si le décompte a bougé. Vous ne voyez pas si les sources ont bougé, et ce sont deux affirmations différentes qu’un décompte ne sépare pas.

Les lignes du 10 août ont noté les domaines durables par leur nom. C’est la seule raison pour laquelle cette étude existe. Nos propres lignes de réservation de voyage de la même semaine n’ont enregistré que des décomptes, donc elles ne pourront jamais y répondre, et c’est un défaut de conception de notre registre plutôt qu’une limite de la surface.

L’ensemble gelé, ce sont quinze questions d’achat à forte intention, neuf aux États-Unis en anglais et six en Espagne en espagnol, chacune posée sur une surface avec trois passages. Le 12 août les chaînes identiques sont reparties avec des réglages identiques. Deux lignes sortent de la comparaison et sont nommées plutôt qu’écartées en silence : la question américaine sur le support client n’a rendu aucun résumé à la seconde date, ce qui est un événement différent de ne rien citer, et la question espagnole sur les gestionnaires de mots de passe a répondu une fois sur trois, donc son ensemble durable est un ensemble à un seul passage et ne se compare pas à un ensemble à trois.

Les treize lignes

Le recouvrement, ce sont les domaines partagés divisés par l’union des deux ensembles. Conservés compte les domaines présents dans les trois passages aux deux dates.

MarchéCatégorieDurables 10 aoûtDurables 12 aoûtConservésRecouvrement
USAhébergement web5551,00
USAboutiques en ligne4540,80
ESPsupport client4540,80
USACRM7760,75
ESPboutiques en ligne3430,75
ESPcomptabilité7550,71
USAgestionnaires de mots de passe7650,63
USAbanque d’entreprise4430,60
USAgestion de projet4530,50
USApaie11650,42
USAcomptabilité13740,25
ESPhébergement web3310,20
USAemail marketing23000,00

La ligne médiane est celle des gestionnaires de mots de passe aux États-Unis, qui a partagé cinq domaines sur une union de huit. N’importe qui peut refaire cette division.

Les deux contrôles, et ce sont eux le résultat plutôt qu’une note de bas de page

Un tableau comme celui du dessus invite à lire la première ligne comme une catégorie stable et la dernière comme une catégorie volatile. Les deux lectures sont fausses, et la façon la moins chère de s’en apercevoir est de reposer ces deux questions le même après-midi.

La meilleure ligne. L’hébergement web aux États-Unis a rendu les cinq mêmes domaines à deux jours d’écart : Reddit, CNET, YouTube, Forbes et TechnologyAdvice. Un 1,00 parfait, le seul du lot. Relue quelques minutes plus tard, avec les mêmes trois passages, CNET sort et ZDNet entre. Quatre partagés sur une union de six font 0,67, donc la même ligne mesurée deux fois le même jour produit deux réponses différentes sur ce qu’ont fait deux jours.

La pire ligne. L’email marketing aux États-Unis n’a rien rendu qui survive aux trois passages, ce qui vaut 0,00 contre une base de vingt-trois domaines durables. Relue le même après-midi, elle en rend sept, et ces sept sont exactement les sept qui avaient atteint deux passages sur trois une heure plus tôt. Recalculé contre la même base, le recouvrement est de 0,25.

Le second contrôle est celui qui montre la mécanique. Les sources étaient présentes aux deux lectures. Ce qui a changé, c’est si chaque passage les attrapait, et un ensemble durable n’a aucune tolérance à trois passages : un passage distrait fait sortir un domaine entier du numérateur. Un 0,00 là ne voulait pas dire que la catégorie s’était vidée. Il voulait dire que la barre est tout ou rien et que la pièce est mal tombée.

La lecture honnête du tableau est donc qu’aucune ligne isolée n’est un résultat, dans un sens comme dans l’autre. La médiane sur treize lignes est le chiffre citable, avec les deux contrôles imprimés à côté, et même celle-là n’est qu’un tirage.

Un score quotidien parfait ne prédit rien sur la semaine

Quatre catégories ont rendu une part durable de 100 % aux deux dates, c’est-à-dire que chaque domaine cité par la réponse est revenu dans les trois passages, deux fois, à deux jours d’écart. Sur n’importe quel tableau de bord, c’est une catégorie aux citations parfaitement stables.

CatégorieStabilité quotidienne, les deux joursRecouvrement entre les joursConservés
CRM100 %0,756 sur 7
banque d’entreprise100 %0,603 sur 4
paie100 %0,425 sur 11
comptabilité100 %0,254 sur 13

La comptabilité a marqué parfaitement aux deux lectures et remplacé neuf de ses treize sources entre-temps. QuickBooks, Xero, Wave, FreshBooks, Invoicefly et Lettuce étaient durables le 10 août et aucune ne l’était le 12. Le chiffre quotidien ne s’en est pas aperçu, parce qu’il ne peut voir qu’à l’intérieur d’une lecture.

Sur les treize lignes, la corrélation entre la part quotidienne de la première date et le recouvrement entre les jours est de −0,30. Ce n’est pas une relation forte, dans un sens ou dans l’autre, et c’est bien le point : le nombre affiché aujourd’hui par votre tableau de bord ne porte pratiquement aucune information sur la présence des mêmes sources jeudi.

Ce qui persiste est une couche d’éditeurs, pas les places qu’un fournisseur peut gagner

Séparer les domaines durables selon ce qu’ils vendent change le tableau, et c’est la partie qui a un tranchant commercial.

Domaines de fournisseur conservésTout le reste conservé
États-Unis, 9 lignes3 sur 1932 sur 59
Espagne, 4 lignes7 sur 96 sur 8

Dans les lignes américaines, les sources qui vendent le produit sur lequel porte la question sont celles qui tournent, tandis que les éditeurs, les forums et la vidéo tiennent. Dans les lignes espagnoles il n’y a aucun écart. C’est une séparation réelle et elle porte sur de petits nombres, neuf observations de fournisseur en Espagne contre dix-neuf aux États-Unis, donc elle est donnée ici en décompte et non en taux, et il lui faut sa propre étude avant que quiconque l’appelle une différence de marché. Cette étude existe désormais : poser les mêmes trois catégories dans les quatre marchés montre que l’essentiel de cet écart était un effet de composition, la comptabilité étant la seule catégorie qui donne des places aux fournisseurs où que ce soit.

Ce qui traverse les catégories tient en une courte liste. En comptant dans combien des treize catégories chaque domaine a tenu aux deux dates : YouTube dans dix, Reddit dans quatre, Forbes dans trois, Zapier dans trois, PCMag dans deux et CNBC dans deux. Ces six-là sont les seuls domaines à avoir tenu dans plus d’une catégorie, et aucun ne vend de CRM, de paie ni d’hébergement.

C’est cela, la structure durable sur laquelle porte réellement la question. La liste des fournisseurs d’une catégorie tourne. La couche généraliste au-dessus, non.

Quoi en faire si vous achetez un outil de suivi

Trois questions, dans l’ordre de ce qu’elles changent à ce que vous payez.

Un mouvement de votre courbe arrive-t-il avec les domaines ? Un pourcentage tombé de 62 à 41 peut vouloir dire que les sources ont changé, ou qu’un passage sur trois en a manqué deux. Ce sont des situations opposées et seule la liste des noms les distingue. Si le produit ne peut pas vous montrer quels domaines sont entrés et sortis, la courbe n’est pas rapportable.

Combien de formulations suit-il par intention ? Nos travaux précédents ont trouvé quatre formulations de la même question hôtelière espagnole ne partageant aucun domaine tenant aux quatre. Un suivi qui poursuit une seule chaîne poursuit la stabilité d’une phrase.

Combien de passages derrière un seul point ? À trois passages, un ensemble durable est tout ou rien, et le contrôle de l’email marketing montre ce que cela coûte. La tolérance s’achète avec des passages, pas avec une statistique plus maligne.

Quatre points sur l’axe, et la dérive n’atteint pas son propre seuil

Cette pièce mesurait deux jours. Les cinq mêmes cellules états-uniennes ont depuis été relues à quatre jours et à six, toujours contre la même ligne de base du 10 août, si bien que l’axe compte désormais quatre points et non un avant et un après.

Distance à la ligne de baseCellules comparablesRecouvrement médian
Même session, même jour0,67 à 0,70
Deux jours90,60
Quatre jours50,50
Six jours40,32

Le chiffre à deux jours est ici 0,60 alors que le titre de cet article dit 0,63, parce que ce ne sont pas les mêmes ensembles : 0,63 couvre toutes les lignes comparables de tous les marchés et 0,60 les États-Unis seuls, le seul marché que couvrent les relectures suivantes. Comparer un chiffre à deux marchés avec un chiffre à un seul ferait paraître la première marche plus raide qu’elle ne l’est.

Six jours passe sous tous les points antérieurs, et n’atteint pas la barre que nous avions posée avant de le mesurer. Le seuil écrit d’abord disait qu’une affirmation de dérive exige que la médiane baisse et que quatre ou cinq des cinq cellules baissent face à leur propre lecture à quatre jours. La médiane a baissé, de 0,50 à 0,32 avec une fourchette de 0,24 à 0,42. Les cellules ont fait 3 en baisse et 1 en hausse sur 4, avec 1 exclue parce que l’hébergement web s’est arrêté à deux passages puis à un, et un ensemble durable sur deux passages est une autre barre.

Ceci est donc publié pour ce que c’est : un quatrième point qui prolonge une baisse, sur cinq cellules comparables de moins que le bras à deux jours, avec une direction par cellule en deçà de ce que nous avions dit qu’il faudrait. Qui cite 0,32 comme le taux de dérive à six jours cite une médiane de quatre nombres.

Ce qui ne se produit pas, c’est un rétrécissement des réponses. La comptabilité est passée de 13 domaines durables à 11, la paie de 11 à 15, les gestionnaires de mots de passe de 7 à 10. Le recouvrement baisse pendant que les ensembles gardent leur taille ou grandissent : c’est de la substitution et non du rétrécissement, d’autres sources et non moins de sources.


Ce que cela ne montre pas

Une surface et deux marchés. Tout ceci porte sur une seule surface de réponse, aux États-Unis en anglais et en Espagne en espagnol. Rien ici ne se transporte vers une autre surface ni un autre pays sans y mesurer.

Quinze questions, une lecture de base, une répétition. Les chiffres du 10 août sont une lecture unique, et chaque chiffre du 12 aussi. Les deux contrôles existent précisément parce que nous ne pouvons pas séparer un effet de jour du mouvement ordinaire d’une lecture à l’autre avec cet échantillon, et ils suggèrent que les deux ont la même taille.

Deux jours ne font ni une semaine ni un trimestre. Un écart aussi court est la version la moins chère possible de cette étude. Elle dit qu’un écart de deux jours ne se distingue pas d’un après-midi. Elle ne dit rien sur la visibilité d’un vrai changement saisonnier, et nous nous attendrions à ce qu’il se voie.

La barre du tout ou rien travaille. Un domaine présent dans deux passages sur trois est invisible pour un ensemble durable. Ce choix se défend et c’est un choix, et la ligne de l’email marketing montre ce qu’il coûte quand il tombe mal.

Deux des quinze lignes ne sont pas comparables, et les deux sont nommées plus haut plutôt que fondues dans le dénominateur.

Rien ici n’est causal. Ce sont des observations d’une surface qui replanifie sa récupération à chaque requête. Aucune intervention n’a été faite et aucun de ces mouvements n’a de cause établie.

Pour le comportement du pourcentage d’une seule journée et pourquoi c’est la largeur qui commande, la pièce jumelle sur ce que mesure un score de stabilité regroupe quatre-vingt-onze de nos lignes publiées.

Questions fréquentes sur le suivi des citations dans le temps

De combien les citations IA changent-elles d’un jour à l’autre ?

Sur treize questions d’achat posées sur une surface de réponse à deux jours d’écart, le recouvrement médian entre les ensembles de domaines ayant tenu à chaque passage était de 0,63, sur une échelle où 1,00 signifie un ensemble identique. L’amplitude par catégorie allait de 0,00 à 1,00. Cette médiane est au niveau de ce que nous mesurons entre deux lectures prises le même après-midi, donc avec cet échantillon un écart de deux jours ne coûte pas plus que reposer la question après le déjeuner.

Un score de stabilité élevé signifie-t-il que mes sources ne changent pas ?

Non, et c’est la mauvaise lecture la plus coûteuse qui soit. Quatre catégories ont obtenu un score de stabilité quotidien parfait aux deux dates, c’est-à-dire que chaque domaine cité est revenu à chaque passage, deux fois. Leur recouvrement de sources sur deux jours allait quand même de 0,25 à 0,75. Une catégorie a conservé quatre de ses treize sources tout en marquant parfaitement les deux jours. Un score quotidien ne voit qu’à l’intérieur d’une lecture.

Pourquoi une question n’a-t-elle rendu aucune source stable ?

Parce qu’un ensemble durable compté sur trois passages est tout ou rien : un domaine absent d’un passage sort complètement. La question sur l’email marketing n’a rien rendu de durable dans une lecture et sept une heure plus tard, et ces sept étaient exactement les domaines ayant atteint deux passages sur trois à la première lecture. Les sources étaient présentes les deux fois. Seul a changé le fait que chaque passage les attrape.

Que faut-il suivre à la place d’un pourcentage de stabilité ?

L’ensemble des domaines, et le suivre sur plusieurs catégories plutôt qu’une seule. Dans cette étude, les seules choses ayant tenu dans plus d’une catégorie sont des sources généralistes : YouTube dans dix catégories sur treize, Reddit dans quatre, Forbes et Zapier dans trois chacun. La présence d’un fournisseur dans sa propre catégorie est la partie volatile, ce qui est gênant puisque c’est aussi la partie que vous payez pour faire bouger.

Combien de passages faut-il derrière un chiffre de citation ?

Plus de trois si vous voulez un ensemble durable avec un peu de tolérance, parce qu’à trois il n’en a aucune. L’alternative consistant à passer à un taux moyen de citation ne règle rien : à deux passages, cette moyenne est un réétalonnage linéaire de la même part et n’apporte aucune information. La tolérance s’achète avec des passages, pas avec une autre formule.

Puis-je refaire cette mesure moi-même ?

Oui, et c’est pour cela que les questions sont publiées. Gelez un ensemble de questions d’achat de votre catégorie, notez pour chacune les domaines qui apparaissent à chaque passage plutôt que leur seul décompte, et reposez les mêmes chaînes sur la même surface après un intervalle. Noter les noms plutôt que le décompte est l’étape qui rend la comparaison possible.

Interrogez une IA sur cet article

Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.

Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.

Écrit par

Maher El Ouahabi

CTO et cofondateur d’EchoWi

Construit le logiciel qui montre aux marques ce que l’IA dit vraiment d’elles, puis quoi changer pour que la réponse suivante soit meilleure. Douze moteurs, mesurés avant et après.

LinkedIn Maher El Ouahabi (ouvre un nouvel onglet)