Nous avons posé 19 catégories en mot-clé et en question. Quatre ont répondu différemment.
11 catégories comparables sur 15 renvoient des sources identiques quelle que soit la forme. 4 ne partagent presque rien, et un contrôle dit pourquoi.
Tous les produits de visibilité IA posent des questions, parce qu’une question est ce que l’on tape dans un assistant. Mais un AI Overview se déclenche aussi sur l’expression de mots-clés qu’un acheteur tape dans Google, et personne dans cette catégorie ne semble avoir vérifié si les deux atteignent les mêmes sources. Nous avons posé 19 catégories des deux façons, sur la même surface, dans le même marché, le même jour, puis nous en avons repris 5 dans chacun de trois autres marchés, et enfin nous avons reposé 8 des cellules américaines le lendemain matin. Cela fait 26 paires comparables, et les 11 revenues avec des sources identiques sont toutes dans le premier. Sur les 3 marchés européens, le chiffre est 0 sur 11.
La réponse utile n’est pas que la forme compte, ni qu’elle est indifférente. C’est que la réponse dépend du marché. Aux États-Unis, la forme ne coûte presque jamais rien et coûte de temps en temps presque tout. En Espagne, en Allemagne et en France, elle a coûté quelque chose dans chaque cellule comparable, et plus que ne coûte une relecture de la même formulation. Rien de visible dans une catégorie ne dit dans lequel des deux cas vous êtes, et il semble désormais que rien de visible dans un marché ne le dise non plus. Et dans les huit cellules américaines où nous sommes revenus le lendemain matin, le jour a déplacé la réponse plus loin que ne l’a jamais fait aucune des deux formes.
**Transparence : EchoWi vend de la mesure de visibilité IA, et cette étude trouve un angle mort dans la façon dont les produits de cette catégorie posent leurs questions, le nôtre compris. Tout ce qu’il faut pour la refaire est ici : toutes les chaînes exactes, la surface, le marché, le nombre de passes, la date et chaque domaine nommé dans notre registre de mesures. Refaites-la contre nous et publiez une autre réponse.
L’angle mort, trouvé d’abord dans notre propre corpus
Cela a commencé comme un audit de notre registre, pas comme une étude.
Avant ces lignes, il contenait 184 prompts distincts issus de tout ce que nous avons publié. Deux avaient une forme de mot-clé, et tous deux étaient des syntagmes espagnols et français restés d’une expérience de formulation, pas des contrôles délibérés. Tout le reste était une question, avec un verbe et le plus souvent un point d’interrogation.
Ce n’est pas un oubli qui nous serait propre. Cela découle de ce à quoi servent ces produits. On achète de la mesure de visibilité IA parce qu’on veut savoir ce qu’un assistant dit de soi, et un assistant, cela se parle. L’unité naturelle est donc un prompt.
Le problème est que l’AI Overview de Google ne s’atteint pas seulement en parlant. Il se déclenche au-dessus des résultats ordinaires, sur l’expression que quelqu’un tape sans aucun verbe. Si les sources derrière ces deux entrées diffèrent, un produit qui ne suit que des prompts rend compte d’une entrée qu’une large part des acheteurs n’utilise jamais.
Personne ne l’avait mesuré. L’axe mérite donc une étude à lui seul, et c’est un axe différent du travail sur les formulations déjà présent dans ce registre, qui fait varier la façon dont une question est tournée tout en la gardant question.
Le protocole, figé avant le premier appel
19 catégories, chacune déjà mesurée dans notre registre comme question sur AI Overview aux États-Unis en anglais, pour que les nouvelles lectures s’ajoutent à ce que nous détenons au lieu de se placer à côté. Chacune posée sous deux formes, trois passes demandées par lecture, cache contourné.
La forme mot-clé est l’expression que tape un acheteur. La forme question est la chaîne déjà présente dans notre registre.
Une source compte comme durable quand elle est citée à chaque passe répondue, ce qui est la barre stricte utilisée par le reste de notre travail. answered est lu dans le résultat et jamais supposé d’après ce qui a été demandé, car cette surface ne répond pas toujours trois fois quand on lui en demande trois.
Les prédictions ont été écrites avant tout appel. Si la forme ne compte pas, les deux ensembles par catégorie devraient se recouvrir à peu près comme le fait une relecture de la même question. Si elle compte autant que la formulation, le recouvrement devrait tomber vers la bande où les variantes de formulation ne partagent presque rien. Et le résultat coûteux aurait été une forme mot-clé ne renvoyant aucun AI Overview, ce qui aurait fait de ceci un article différent et plus grand.
Ce qui est revenu
| Catégorie | Passes répondues | Durables, mot-clé | Durables, question | Recouvrement |
|---|---|---|---|---|
| CRM | 3 et 3 | 4 | 4 | 1,00 |
| Assistants de code IA | 3 et 3 | 10 | 10 | 1,00 |
| Chaussures de running | 3 et 3 | 7 | 7 | 1,00 |
| Réservation de vols | 3 et 3 | 7 | 7 | 1,00 |
| Correcteurs grammaticaux | 3 et 3 | 5 | 5 | 1,00 |
| Paie | 3 et 3 | 10 | 10 | 1,00 |
| Agendas | 3 et 3 | 9 | 9 | 1,00 |
| Plateformes e-commerce | 3 et 3 | 8 | 4 | 0,33 |
| Email marketing | 2 et 2 | 5 | 6 | 0,22 |
| Gestionnaires de mots de passe | 3 et 3 | 9 | 9 | 1,00 |
| Services VPN | 3 et 3 | 6 | 6 | 1,00 |
| Applis de notes | 3 et 3 | 8 | 8 | 1,00 |
| Créateurs de sites | 3 et 3 | 8 | 8 | 1,00 |
| Hébergement web | 3 et 3 | 6 | 6 | 0,33 |
| Comptes bancaires professionnels | 3 et 3 | 7 | 9 | 0,33 |
11 des 15 ne sont pas simplement proches. Ce sont les mêmes domaines, tous, dans les deux sens. Demandez à un AI Overview « best ai coding assistant » ou « what is the best AI coding assistant ?» et les dix sources qui survivent aux trois passes sont identiques.
4 n’en approchent pas. L’e-commerce partage trois domaines sur neuf vus. L’email marketing en partage deux sur neuf. L’hébergement web et les comptes bancaires professionnels, tous deux venus du second lot, en partagent trois sur neuf et quatre sur douze.
Quatre paires sont exclues, et cela mérite d’être dit plutôt que caché. Le stockage en nuage a répondu deux fois d’un côté et trois de l’autre, et l’unanimité sur deux passes est une barre différente de l’unanimité sur trois ; les comparer reviendrait à comparer deux règles. Trois autres ont échoué du côté question : la gestion de projet et le casque audio ont répondu une fois contre trois, et les services de CFO externalisé n’ont pas répondu du tout alors que leur forme mot-clé répondait deux fois. Une seule passe répondue est un tirage, pas un ensemble durable. Les quatre paires sont au registre avec leurs comptes réels.
Et voici une seconde observation que nous refusons délibérément d’appeler un résultat. Dans trois des quatre paires exclues, c’est la forme question qui a répondu le moins souvent, et dans une la forme mot-clé. Trois contre un ne vaut rien. C’est noté pour qu’un balayage plus large puisse le tester, pas parce que nous y croyons.
Le contrôle, qui est le vrai résultat
Un recouvrement de 0,22 entre formes a l’air concluant et ne prouve rien à lui seul, et c’est la partie que sautent presque toutes les études de cette forme.
Les deux catégories qui divergent sont des catégories que notre registre sait déjà instables. Une catégorie instable diverge d’elle-même quand on la lit deux fois. Un faible recouvrement entre un mot-clé et une question pourrait donc être la forme, ou pourrait être que cette catégorie vous aurait de toute façon donné deux réponses différentes à la même question.
Il y a exactement une manière de les séparer, et elle est bon marché : lire deux fois la même forme et voir ce que cela coûte.
| Catégorie | Mot-clé contre question | Question contre elle-même, relecture |
|---|---|---|
| Email marketing | 0,22 | 1,00 |
| Plateformes e-commerce | 0,33 | 0,60 |
| Comptes bancaires professionnels | 0,33 | 1,00 |
| Hébergement web | 0,33 | 0,43 |
L’email marketing est net. Posé deux fois de la même façon, il renvoie les six domaines identiques. Posé en mot-clé, il en partage deux. Rien d’instable ne se produit dans cette catégorie ce jour-là ; la forme fait tout le travail.
L’e-commerce est mixte et la lecture honnête le dit. Sa propre relecture en question partage 0,60, loin d’être identique, donc une partie de ce 0,33 est une catégorie qui bouge toute seule. Mais 0,33 est inférieur à 0,60, donc la forme coûte quelque chose en plus.
Sans ces deux lectures supplémentaires, le tableau ci-dessus aurait été un résultat sur la forme qui était en partie un résultat sur l’instabilité, et aucun lecteur n’aurait pu le distinguer.
Puis nous avons relu l’autre côté des deux, parce que la règle issue de cette étude s’applique à cette étude. Une cellule qui donne le résultat que vous cherchez est relue avant d’être comptée, et jusqu’ici seules les formes question l’avaient été. La forme mot-clé de l’e-commerce a renvoyé les 8 domaines identiques, son 0,33 repose donc sur deux lectures stables. Celle de l’email marketing a répondu trois fois au lieu de deux à la relecture, ce qui est une autre barre et n’est pas comparable, mais les deux domaines qui y ont survécu ne figurent dans aucune des deux lectures de la forme question. Les deux divergences tiennent.
La France n’est délibérément pas dans cette comparaison. Ses relectures de la même forme sont rapportées dans sa propre section, parce que deux d’entre elles comparent des lectures prises à des profondeurs différentes et que l’une d’elles est la comparaison de profondeur elle-même. Les placer à côté de contrôles mesurés à trois passages fixes serait exactement l’erreur que cette section existe pour nommer.
Ce que vaut le contrôle, en cellules
Le second élargissement est la première fois que l’on peut chiffrer le paragraphe ci-dessus, car 7 cellules de l’étude ont maintenant été lues deux fois dans la même forme. 3 des 7 ont cessé de diverger une fois que ce fut fait.
Les gestionnaires de mots de passe ressemblaient à une divergence nette : la forme question a renvoyé 4 domaines durables contre 9 pour le mot-clé, un recouvrement de 0,44. Reposée le même jour, elle a renvoyé exactement les 9 du mot-clé. Les créateurs de sites ont fait la même chose, 3 contre 8 à la première lecture et les 8 identiques à la relecture. La troisième est la cellule des agendas plus bas, où le même mécanisme a mené un ensemble durable jusqu’à zéro.
Sans ces appels supplémentaires, cette étude annoncerait 7 catégories divergentes sur 15 au lieu de 4, et la phrase disant que la forme ne coûte presque jamais rien aurait été retirée. Il était écrit avant les appels que trois nouvelles divergences ou plus forceraient ce retrait, et aux premières lectures il y en avait quatre.
Deux choses doivent être dites de ce chiffre pour que personne ne le cite comme un taux.
- La sélection n’est pas aléatoire et nous ne le cachons pas. Une cellule est relue parce que sa première lecture semblait divergente, donc « 7 sur 7 semblaient divergentes » est le protocole qui se décrit lui-même, pas un résultat. Le seul chiffre porteur d’information est les 3 qui se sont résolues.
- La relecture ne renvoie pas davantage de façon fiable. Les gestionnaires de mots de passe sont passés de 4 domaines durables à 9 et les créateurs de sites de 3 à 8, mais l’hébergement web est descendu de 6 à 4 et les comptes bancaires ont renvoyé les mêmes 9 les deux fois. Ce qui bouge n’est pas un effet de chauffe.
La version inconfortable, pour quiconque vend un chiffre de ce genre : une seule lecture d’un prompt en forme de question peut sous-estimer son propre ensemble durable au point d’inventer une différence qui n’existe pas, et rien à l’intérieur de cette lecture ne le dit. L’indice n’est pas dans la statistique. Il est dans le fait d’avoir demandé deux fois.
La cellule où la statistique disait zéro et où les sources étaient les mêmes
Les agendas méritent leur propre section, car ils ont failli entrer dans le tableau comme le plus grand désaccord de l’étude alors qu’ils n’en sont pas un.
La forme mot-clé a répondu aux trois passes et cité dix domaines. Aucun n’est apparu dans les trois, son ensemble durable était donc vide et le recouvrement avec la forme question valait zéro. La forme question, même surface et même jour, a renvoyé neuf domaines à chaque passe.
Zéro contre neuf, c’est l’écart maximal de cette mesure. Mais les neuf domaines
renvoyés par la question sont exactement les neuf que le mot-clé avait dans
deux passes sur trois. Une passe les a tous perdus d’un coup et a ajouté
google.com à la place. Relue, la forme mot-clé a renvoyé les mêmes neuf dans
les trois passes.
Les sources étaient donc identiques depuis le début et la statistique annonçait un désaccord total. C’est une propriété de la barre d’unanimité, que ce registre a déjà mesurée dans d’autres études : une seule passe dégénérée vide le numérateur, et avec trois passes aucune tolérance ne l’absorbe.
Deux choses en découlent, et la seconde est la gênante :
- Cette cellule compte comme identique, sur la meilleure de ses deux lectures en mot-clé, et ce choix est déclaré plutôt qu’enterré. Compter le zéro aurait été compter la barre plutôt que les sources.
- La mesure qu’emploie toute cette étude peut fabriquer exactement le résultat que l’étude cherche. Nous l’avons vu ici parce qu’un zéro à côté d’un neuf était trop étrange pour être accepté, et la lecture honnête est qu’un écart plus petit produit de la même façon serait allé droit dans le tableau.
Ce que cela veut dire si vous achetez ou construisez de la mesure
Un prompt n’est pas un substitut d’un mot-clé, parfois, et le marché où vous vendez décide de la fréquence. Tout ce qui suit dans cette section est le bras américain. Si votre catégorie est l’une des 11 qui ont répondu identiquement, vous pouvez suivre des prompts et dormir tranquille. Si elle est l’une des 4 qui ne l’ont pas fait, votre rapport fondé sur les prompts décrit un ensemble de sources que la moitié de vos acheteurs, celle qui arrive par mot-clé, ne voit jamais.
Vous ne pouvez pas savoir laquelle vous êtes de l’extérieur. Aucune propriété de ces catégories visible avant la mesure ne prédit la répartition, et le second lot a été choisi pour en tester une. Les quatre divergentes sont l’e-commerce, l’email marketing, l’hébergement web et les comptes bancaires professionnels, donc le soupçon évident est qu’il s’agisse des catégories proches de l’achat. Il ne survit pas à la colonne des identiques : services VPN, gestionnaires de mots de passe et créateurs de sites s’achètent de la même façon et ont répondu identique des deux côtés, et un compte bancaire professionnel ne ressemble pas à un achat e-commerce. Ni la catégorie, ni le marché, ni le secteur ne les trient.
La vérification est donc la moins chère : posez la question des deux façons, une fois. Nul besoin d’un programme. Prenez vos cinq questions les plus importantes, posez chacune sous la forme du mot-clé qu’un acheteur taperait vraiment, et comparez les sources. Si elles coïncident, arrêtez et revenez aux prompts. Sinon, vous venez d’apprendre que la moitié de votre mesure vise la mauvaise entrée.
Avant tout cela, vérifiez le jour. Dans les huit cellules américaines relues le lendemain matin, la même formulation a bougé davantage d’un jour à l’autre que les deux formes n’ont bougé l’une par rapport à l’autre. Si vous comparez le rapport de cette semaine à celui de la précédente, la première chose à écarter est le calendrier, et pour l’écarter il faut poser la même chaîne deux fois le même jour et regarder l’écart.
Et demandez à votre fournisseur laquelle il envoie. C’est une quatrième question à poser à un fournisseur, après les trois que ce corpus défend déjà : ses passes contournent-elles le cache, combien de formulations suit-il par intention, et qu’arrive-t-il à son chiffre de stabilité quand le nombre de passes augmente. Ajoutez : envoyez-vous parfois la forme mot-clé, et la rapportez-vous séparément ?
La même question sur une seconde surface
Tout ce qui précède est l’AI Overview de Google, et ce corpus a mesuré qu’un résultat sur une surface ne voyage pas vers une autre : la médiane de recouvrement des sources durables entre AI Overview et AI Mode est de 0,40, pire que de poser la même question à deux jours d’écart sur une seule surface.
La question qui valait la peine n’était donc pas de savoir si les mêmes catégories divergent sur AI Mode. C’était de savoir si l’effet de forme y existe. Nous avons pris 4 catégories, les deux qui divergeaient et deux qui étaient identiques, et posé les mêmes chaînes sur AI Mode.
| Catégorie | Sur AI Overview | Sur AI Mode |
|---|---|---|
| CRM | identique | identique, 7 domaines des deux façons |
| Correcteurs grammaticaux | identique | identique, 11 domaines des deux façons |
| Email marketing | 0,22 | 0,08 |
| Plateformes e-commerce | 0,33 | aucun ensemble durable à comparer |
L’effet de forme se reproduit. Les deux catégories identiques sur AI Overview le sont sur AI Mode, et l’email marketing diverge de nouveau et plus fort : 8 domaines durables pour la forme mot-clé, 5 pour la forme question, et seul YouTube en commun.
L’e-commerce n’a pas pu être mesuré, et c’est dit plutôt que compté. Sa forme question n’a renvoyé aucun ensemble durable sur AI Mode, lors de deux lectures distinctes, une avec 45 domaines et une avec 32 dont chacun n’est apparu que dans une seule passe. Un ensemble vide force le recouvrement à zéro quoi que tienne l’autre côté, appeler cela la plus grande divergence de l’étude aurait donc été lire la barre plutôt que les sources.
Et il y a une observation distincte sur la surface elle-même. 4 des 11 lectures d’AI Mode n’ont renvoyé aucun ensemble durable, trois avec la même signature : une rangée de domaines à exactement deux passes sur trois, soit une passe qui diverge entièrement et vide une barre d’unanimité. Relues, deux des trois sont revenues complètes. Quiconque mesure AI Mode à trois passes contre une barre stricte doit s’y attendre, et doit s’attendre à ce que cela ressemble à un résultat.
Le même protocole sur un second marché, et rien ne survit au voyage
Cette pièce dit depuis deux élargissements que ce qui la déplacerait, c’est un autre marché ou une autre surface. Le bras de surface est ci-dessus. L’Espagne est celui de marché.
Cinq catégories, chacune déjà une cellule du bras états-unien de cette même étude, si bien que la comparaison est catégorie contre catégorie et non l’Espagne contre une autre liste de questions. Deux des cinq étaient identiques aux États-Unis et trois divergeaient.
| Catégorie | États-Unis | Espagne | Espagne, relecture de la même forme |
|---|---|---|---|
| CRM | identique | 0,38 | 0,83 |
| Gestionnaires de mots de passe | identique | pas d’AI Overview pour le mot-clé | |
| Hébergement web | 0,33 | 0,40 | 0,60 |
| Plateformes e-commerce | 0,33 | 0,50 | 0,80 |
| Comptes bancaires professionnels | 0,33 | 0,40 | 0,67 |
Aucune des cinq ne reproduit son résultat états-unien. 4 des 4 cellules mesurables divergent, y compris celle qui était identique des deux façons en anglais, et dans les 4 le recouvrement entre formes se situe sous le contrôle de même forme de cette cellule. La forme fait un travail qui s’ajoute à l’instabilité dans chacune d’elles.
La cinquième cellule est le résultat le plus net qu’ait produit cette étude. Posée en question, « ¿Cuál es el mejor gestor de contraseñas? » renvoie un AI Overview. Posée sous la forme du mot-clé qu’un acheteur tape, « mejor gestor de contraseñas » n’en renvoie aucun : 2 lectures, 6 passes, zéro réponse et zéro erreur. Ce n’est pas un faible recouvrement et ce n’est pas une panne d’instrument. C’est la surface qui refuse de résumer, et cela signifie qu’un acheteur espagnol qui tape le mot-clé n’a aucune réponse d’IA où être visible, alors que le même acheteur qui pose la question en a une.
C’est aussi l’issue que le protocole d’origine désignait comme la coûteuse, écrite avant tout appel et atteinte à la cinquième catégorie du troisième lot.
Ce bras a eu besoin de sa propre barre de comparaison, et c’est un résultat et non de la comptabilité. 5 de ses 19 lectures se sont arrêtées avant les trois passes demandées, contre presque aucune dans les lots états-uniens. Une cellule espagnole n’est donc comparée que là où les deux formes ont une lecture ayant répondu trois fois, et parmi celles-là c’est le plus grand ensemble durable qui compte. Les chiffres états-uniens ci-dessus ne sont pas touchés par cette règle et restent calculés comme ils l’ont toujours été.
Ce que cela ne fait pas, c’est invalider le résultat états-unien. Cela le situe aux États-Unis et en anglais : 11 sur 15 identiques là-bas, 0 sur 4 identiques ici, même surface, même méthode, même barre.
Le troisième marché, et c’est finalement les États-Unis qui sortent du lot
Deux bras étaient en désaccord sur le titre de cette étude elle-même. Les États-Unis disaient que la forme ne coûte presque jamais rien, 11 sur 15. L’Espagne disait qu’elle coûte toujours quelque chose, 0 sur 4, et plus que ne coûte une relecture de la même formulation. Quatre cellules ne disent pas lequel des deux est le cas général, nous avons donc mené un troisième marché avec le plan et la prédiction écrits d’abord.
L’Allemagne tombe du côté de l’Espagne.
| Catégorie, Allemagne | Mots-clés contre question | Même formulation, lue deux fois |
|---|---|---|
| CRM | 40 | 57 |
| Gestionnaires de mots de passe | 20 | 100 |
| Hébergement web | 17 | 56 |
| Boutiques en ligne | 50 | 100 |
4 cellules comparables, 0 identique, et les 4 sous leur propre contrôle. La colonne de droite est la seule chose qui donne un sens à celle de gauche : c’est ce que coûte la même formulation quand on la repose simplement, donc un chiffre entre formes situé en dessous, c’est la forme qui fait quelque chose que la relecture ne fait pas.
La banque d’entreprise est au registre et n’est pas dans ce tableau. Sa forme interrogative a répondu à trois passages et les deux lectures en mots-clés se sont arrêtées à deux, et un ensemble durable sur deux passages est une autre barre sur une mesure d’unanimité. Ses deux lectures en mots-clés se comparent bien entre elles, à 57 face à une paire comparable de 4.
Ce bras a changé une chose à la méthode, et cela pèse plus que le résultat. Les bras précédents relisaient une cellule **parce qu’**elle semblait divergente, si bien que « 7 sur 7 contrôlées » décrit la procédure et non l’étude, et le registre porte une clé qui le dit. Ici chaque cellule a eu son contrôle, quelle qu’ait été son apparence. Cela coûte cinq lectures de plus et achète deux choses : un chiffre de contrôle qu’un lecteur peut prendre au pied de la lettre, et la première fois que cette étude voit ce que fait un contrôle sur une cellule qui concordait.
2 des 5 sont revenues identiques, 100 et 100. Une relecture de la même forme peut donc renvoyer exactement le même ensemble durable, ce qui rend difficile d’expliquer par le bruit le 20 et le 50 entre formes dans ces mêmes catégories.
La réserve sur ces cent, parce que c’est celle que nous voudrions qu’un lecteur soulève : les deux étaient des cellules où tous les domaines cités par la forme en mots-clés ont survécu à tous les passages, il n’y avait donc pas de queue sur laquelle la statistique pouvait diverger. Ce registre appelle déjà cela une barre basse et non un ensemble fixe, et l’hébergement montre pourquoi : sa première lecture en mots-clés avait 9 durables sur 9 et son contrôle 5 sur 9.
Le quatrième marché, et la cellule qui a failli forcer une rétractation
Trois marchés restent peu pour un mot aussi large qu’Europe, nous en avons donc lancé un quatrième : les mêmes cinq catégories, les deux formes, trois passages chacune sur AI Overview en France et en français, le 16 août 2026.
La France tombe du côté de l’Espagne et de l’Allemagne. 3 cellules comparables, 0 identique.
| Catégorie, France | Mot-clé contre question |
|---|---|
| CRM | 63 |
| Boutiques en ligne | 50 |
| Comptes professionnels | 71 |
Les deux catégories absentes de ce tableau sont la moitié la plus intéressante.
Les gestionnaires de mots de passe n’ont renvoyé aucun AI Overview pour l’expression de mots-clés. 0 passage répondu sur 6, en deux lectures séparées, alors que la forme question de la même intention s’est affichée et a cité 5 domaines stables. Ce n’est pas un ensemble de sources différent, c’est un fait différent : dans cette cellule, la forme décide s’il y a quoi que ce soit où être cité. C’est la distinction sur laquelle est bâtie notre étude locale, arrivant d’une direction que nous ne regardions pas. L’hébergement web est sorti pour une raison plus terne : sa forme mot-clé n’a jamais tenu trois passages répondus sur deux lectures.
Les comptes professionnels sont la cellule avec un contrôle, et le contrôle tient. Sa forme mot-clé a été lue deux fois à trois passages et a renvoyé les mêmes six domaines les deux fois. Le 71 contre la forme question est donc la forme qui fait quelque chose, pas une lecture en désaccord avec elle-même : la forme mot-clé garde un comparateur de finances personnelles que la question laisse tomber, et la question garde un service de comptabilité que le mot-clé laisse tomber.
Le contrôle des boutiques en ligne ne tient pas, et nous comptons quand même cette cellule comme divergente, ce qui se discute. Sa forme question, lue deux fois, partage 3 sur 5. Une cellule dont la propre forme est à ce point en désaccord avec elle-même ne peut pas porter une affirmation sur ce que fait la forme. Elle est dans le 0 sur 3 parce que le compte porte sur les cellules qui n’étaient pas identiques, ce qu’elle n’était pas, et elle est nommée ici pour que personne ne la cite comme preuve au sujet de la forme.
La lecture qui nous aurait fait retirer une phrase correcte
La cellule CRM a d’abord été lue à deux passages répondus de chaque côté, parce que la surface s’est arrêtée tôt les deux fois. Les deux formes ont renvoyé les mêmes six domaines. Identiques. C’est la première paire identique européenne, elle aurait remplacé le « 0 en Europe » par un compte en quatre langues, et elle est fausse.
Relue une heure plus tard à trois passages répondus de chaque côté, les ensembles durables sont 7 et 6 partageant 5. La forme mot-clé gagne deux domaines qui survivent à trois passages, la question en garde un que le mot-clé laisse passer sous la barre.
Le mécanisme n’a rien de subtil et ce registre l’avait déjà écrit : une barre d’unanimité sur moins de passages est une barre plus basse, donc les lectures moins profondes s’accordent davantage. Ce que la cellule ajoute, c’est la direction du dégât. Une lecture fine n’a pas produit ici un résultat prudent, elle a produit une rétractation, et une rétractation ressemble à la direction humble. Elle n’est pas automatiquement la direction sûre, et c’est la première fois dans ce corpus qu’un manque de puissance pousse à publier une correction plutôt qu’à l’éviter.
C’est aussi pourquoi toute cellule comparable de tous les bras de cette étude exige trois passages répondus des deux côtés. La règle a été écrite pour le bras allemand, et la France est là où elle a payé.
Une note d’instrument, dont la seconde moitié est retirée. 8 lectures françaises sur 17 n’ont pas livré trois passages répondus, contre 5 sur 18 dans le bras allemand. Ce compte reste, parce qu’il explique pourquoi la France a 3 cellules comparables et non 5. Ce que nous avons écrit ensuite, qu’un AI Overview s’affiche ou non semblerait varier selon le marché, ne survit pas à une mesure faite correctement.
Ces lectures ont été relues lorsqu’elles revenaient courtes, le compte ci-dessus tient donc en partie à notre propre politique de réessai et non à la surface. Posée proprement, une lecture par cellule et aucun réessai dans les quatre marchés, l’aperçu s’est affiché à chaque passage dans 37 cellules sur 40, l’Allemagne a répondu à tous les passages demandés, et tous les déficits de l’étude relevaient d’une seule catégorie. L’échec d’affichage est une propriété de la question bien plus que du marché, et la phrase qui disait le contraire est corrigée ici plutôt que supprimée en silence.
Ce que cela fait au titre
Sur quatre marchés il y a 26 paires comparables et 11 identiques, et les 11 sont aux États-Unis. En réunissant les trois marchés européens, c’est 0 sur 11.
Nous n’allons pas habiller cela en règle sur l’Europe. Trois marchés font trois, et le mécanisme n’est pas mesuré : cela peut être la langue, cela peut être la quantité de contenu comparatif présente dans chaque marché, cela peut tenir à la façon dont la surface se comporte hors de l’anglais. Ce que l’on peut dire est plus étroit et suffit à changer ce que fait un acheteur : le constat que la forme ne coûte presque jamais rien a été mesuré sur un marché et ne s’est reproduit sur aucun des deux autres que nous avons essayés.
Les chiffres de contrôle ne sont pas comparables entre les trois bras, et c’est notre faute
Toutes les paires de même forme de cette étude où les deux lectures ont répondu à trois passages, sur AI Overview :
| Bras | Paires | Recouvrement médian | Cellules contrôlées |
|---|---|---|---|
| États-Unis | 7 | 44 | 7 de ses 15 cellules comparables |
| Espagne | 4 | 74 | 4 sur ses 4 |
| Allemagne | 4 | 79 | toutes, par construction |
Ne lisez pas cette colonne du milieu comme trois marchés. Les trois bras ont relu une cellule **parce qu’**elle semblait déjà divergente, mais ce qui décide si cela compte n’est pas la règle, c’est de savoir si la règle a laissé quelque chose de côté. En Espagne, les quatre cellules comparables étaient divergentes, la règle n’a donc rien écarté. Aux États-Unis elle en a couvert 7 sur 15, et un chiffre tiré des seules cellules soupçonnées décrit le soupçon et non le marché.
Nous publions le tableau quand même, avec la troisième colonne à côté, parce que l’alternative est de publier trois médianes et de laisser un lecteur supposer qu’elles veulent dire la même chose. Deux se lisent telles quelles, et pas l’américaine.
Voilà ce qu’a acheté le changement de méthode. En Allemagne, la comparaison sur laquelle repose toute cette étude peut se faire proprement : une médiane de contrôle non sélectionnée de 79, et quatre valeurs entre formes de 40, 20, 17 et 50, toutes en dessous. L’Espagne y arrive par accident et non par construction, parce que sa règle a tout attrapé. Aux États-Unis la comparaison existe cellule par cellule, c’est ainsi qu’elle est rapportée ci-dessus, et pas en agrégat.
Une version antérieure de cette section chiffrait cette correction à cinq lectures et disait qu’elle concernait deux bras. Les deux chiffres étaient tapés et non comptés, et en les comptant on obtient 8 cellules sans contrôle aux États-Unis et aucune en Espagne. La version corrigée est le tableau ci-dessus.
Nous y sommes retournés un jour plus tard, et le jour a bougé plus que la forme
Cette section existe à cause d’une réparation ratée. La médiane de contrôle américaine repose sur les cellules relues parce qu’elles semblaient divergentes, nous sommes donc allés relire les 8 que personne n’avait soupçonnées. Toutes les lectures américaines de cette étude datent du 15 août et ces huit-là du 16, ce qui en fait la même formulation à un jour d’écart et non à quelques minutes. Elles ne peuvent pas tenir lieu de contrôle du même jour, et un contrôle du même jour ne s’ajoute pas après coup.
En échange, elles répondent à une meilleure question.
Les 8 cellules sont identiques entre les formes. Deux formulations différentes, posées le même jour, ont renvoyé exactement le même ensemble durable dans chacune. Reposées un jour plus tard avec la chaîne de mots-clés identique, le recouvrement médian est de 41, de 17 à 100.
| Cellule | Même jour, autre formulation | Même formulation, lendemain |
|---|---|---|
| CRM | 100 | 80 |
| Assistants de code | 100 | 100 |
| Chaussures de running | 100 | 31 |
| Vols | 100 | 22 |
| Correcteur grammatical | 100 | 44 |
| Paie | 100 | 100 |
| VPN | 100 | 38 |
| Prise de notes | 100 | 17 |
Six des huit bougent davantage d’un jour à l’autre qu’elles n’ont bougé entre un mot-clé et une question. Dans ces six-là, ce que nous mesurions est plus petit que ce que nous tenions constant.
Ce que cela veut dire et ne veut pas dire. Cela ne renverse pas l’étude : en une journée, dans ces huit cellules américaines, la forme n’a rien coûté, c’est bien ce que l’étude affirme. Cela lui donne une taille. Si vous mesurez votre propre visibilité et comparez un rapport en mots-clés du lundi avec un rapport en questions du mardi, l’écart que vous voyez est plus probablement lundi contre mardi que mot-clé contre question.
Cela dit aussi quelque chose sur l’achat de mesure. Un outil qui lance vos prompts une fois par jour et trace l’écart trace ceci, et huit cellules à une médiane de 41 font un graphique bien large pour y lire un mouvement.
Huit cellules, un marché, une paire de jours. Le registre porte déjà une étude à deux jours distincte, sur d’autres questions, avec une médiane autour de 62, donc ce 41 n’est pas un taux et nous ne le traitons pas comme tel. Ce qu’il est : la première fois que cette étude a le jour et la forme dans le même tableau.
Et les mêmes huit cellules en forme de question : la forme ne change pas la dérive
La suite évidente, écrite avant d’être menée : si la forme est indifférente en une journée, l’est-elle aussi d’un jour à l’autre ? Tous les produits de cette catégorie lancent des questions, donc si les questions dérivent plus que les mots-clés, le standard du secteur est le plus bruyant.
Elles ne dérivent pas plus. Les 8 mêmes cellules, en forme de question, relues contre leurs propres lectures du 15 août : le mot-clé est plus stable dans 2 cellules, la question dans 0, et il y a 6 égalités exactes. Médianes 41 et 35, et l’écart entre les deux vient entièrement des deux cellules qui ne sont pas à égalité. Le seuil fixé avant la mesure demandait 7 ou 8 sur 8 dans une direction avant d’en nommer une, c’est donc un résultat nul et nous le rapportons comme tel.
Les six égalités sont exactes, et c’est la partie que nous ne cherchions pas. Elles sont exactes parce que les deux formes ont renvoyé le même ensemble durable les deux jours, leurs recouvrements d’un jour à l’autre sont donc le même nombre. Ce qui veut dire que les deux formes s’accordaient encore le 16 dans six cellules sur huit, et divergeaient dans deux : le CRM à 56 et la paie à 28.
| Cellules où les deux formes ont complètement coïncidé | |
|---|---|
| 15 août | 8 sur 8 |
| 16 août | 6 sur 8 |
Le constat par lequel commence cet article, qu’en une journée la forme ne coûte presque jamais rien, a donc lui-même été mesuré sur une journée, et le lendemain il a coûté quelque chose dans un quart de ces cellules. Ce n’est pas une rétractation : le titre du bras américain tient au 15 août et celui du bras allemand au 16. C’est une taille, pour savoir avec quelle force le tenir.
Ce second résultat n’était pas préenregistré. Il vient d’avoir remarqué que six nombres coïncidaient exactement, ce qui est le genre de chose que l’on trouve après coup, et nous préférons l’étiqueter plutôt que de le laisser se lire comme une prédiction vérifiée.
Limites
Deux surfaces, de façon inégale. Les 13 catégories sur l’AI Overview de Google et 4 d’entre elles reprises sur AI Mode. Ceci ne dit rien de Gemini ni de ChatGPT, et notre propre travail a trouvé à plusieurs reprises qu’un résultat mesuré sur une surface ne voyage pas vers une autre.
4 marchés, 4 langues, 2 jours. Les États-Unis en anglais le 15 août 2026, et l’Espagne, l’Allemagne et la France dans leurs propres langues le 16 août 2026, plus 8 cellules américaines relues le 16 qui ne sont rapportées que dans la section sur le jour. Chaque chiffre ci-dessus dit à quel marché il appartient. Les seuls chiffres cumulés entre marchés sont les comptes des quatre bras dans la section sur le titre, et ils sont annoncés comme tels.
15 paires comparables. C’est assez pour établir que les deux issues existent et pas assez pour estimer la fréquence de chacune. Traitez « 11 sur 15 » comme l’illustration d’une répartition, pas comme un taux.
La barre stricte est stricte. Une source citée dans deux passes sur trois ne compte pas comme durable, donc une seule passe malchanceuse fait sortir un domaine entier de l’ensemble. C’est une propriété connue de cette mesure et c’est pourquoi les contrôles comptent plus que le titre.
Rien ici n’est causal. Aucune page n’a été modifiée et rien n’a été mesuré avant et après. Voici ce que les deux formes ont renvoyé, pas une preuve du pourquoi.
Questions fréquentes sur la forme de la requête
Une recherche par mot-clé et un prompt IA sont-ils la même requête ?
Ce ne sont pas la même chaîne et cette étude porte sur le fait de savoir si cela compte. Dans 11 catégories comparables sur 15, les sources derrière elles étaient identiques, donc pour celles-là la distinction est théorique. Dans 4, elles étaient presque disjointes, donc pour celles-là c’est la différence entre mesurer votre visibilité et mesurer celle d’un autre.
Pourquoi une différence de sources compte-t-elle si la réponse nomme les mêmes produits ?
Parce que les sources sont ce sur quoi on peut agir. Vous ne pouvez pas facilement changer les produits qu’un assistant recommande, mais vous pouvez être publié, cité ou évalué sur un site dont il tire ses réponses. Si deux formes de la même question puisent dans des sites différents, la liste des endroits où il vaut la peine d’apparaître change avec la forme.
Quelles catégories étaient identiques et lesquelles ne l’étaient pas ?
CRM, assistants de code IA, chaussures de running, réservation de vols, correcteurs grammaticaux, paie, agendas, gestionnaires de mots de passe, services VPN, applis de notes et créateurs de sites ont renvoyé les mêmes sources durables des deux façons. Plateformes e-commerce, email marketing, hébergement web et comptes bancaires professionnels non. Nous ne voyons aucune propriété de ces catégories qui prédise la répartition, et c’est la partie inconfortable.
Comment faire cette vérification moi-même ?
Prenez une question que vous suivez déjà. Écrivez l’expression de mots-clés qu’un acheteur taperait pour la même intention. Posez chacune plusieurs fois sur la même surface le même jour, ne gardez que les sources qui reviennent à chaque fois, et comparez les deux ensembles. Relisez ensuite la même forme deux fois, car sans ce contrôle vous ne pouvez pas distinguer une différence due à la forme d’une catégorie qui bouge simplement.
Cela veut-il dire que les outils fondés sur les prompts se trompent ?
Non. Cela veut dire qu’ils sont incomplets d’une manière que personne n’avait chiffrée, nous compris, et que la taille de l’écart est une propriété de votre catégorie plutôt que de l’outil. Un outil qui ne pose que des prompts a raison sur les prompts.
Qu’est-ce qui vous ferait changer d’avis ?
Plus de catégories, et nous en sommes à deux élargissements. Cette pièce a d’abord publié cinq paires comparables dont trois identiques ; six de plus l’ont portée à neuf dont sept identiques ; six encore la portent à 15 dont 11 identiques. La proportion a à peine bougé sur les trois, ce qui est l’issue la moins spectaculaire possible et la raison pour laquelle nous refusons toujours d’appeler cela un taux. Ce qui le déplacerait encore, c’est un autre marché ou une autre surface, car tout ceci est les États-Unis en anglais sur AI Overview.
Où cela vous laisse
Le résultat est petit, bon marché à reproduire et gênant pour tous ceux qui vendent dans cette catégorie, nous compris. 4 catégories sur 19 répondent au mot-clé d’un acheteur avec un ensemble de sources sensiblement différent de celui par lequel elles répondent à la question équivalente, et deux de ces quatre le font tout en étant parfaitement stables quand on les interroge deux fois de la même façon.
Ce n’est pas un argument pour abandonner les prompts. C’est un argument pour passer une après-midi à savoir si votre catégorie est de celles où cela compte, parce que la vérification ne coûte presque rien et que l’alternative est de supposer une réponse qui est fausse pour 4 catégories sur 19.
Interrogez une IA sur cet article
Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.
- ChatGPT (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Claude (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Perplexity (ouvre un nouvel onglet)
- Google AI Mode (ouvre un nouvel onglet)
Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.