Toutes les mesures que nous avons publiées ont été prises sur une seule surface. Nous avons posé les mêmes cinq questions sur une autre.
Changer de surface coûte plus cher que changer de jour : recouvrement médian des sources 0,40 contre 0,63 à deux jours, sur des questions identiques.
Toutes les lignes de notre registre de mesures ont été prises sur l’AI Overview de Google. C’est la plus grande limite de tout ce que nous avons publié, parce qu’un résultat sur la façon dont les catégories diffèrent pourrait être un résultat sur la façon dont un seul produit récupère. Nous avons donc repris les cinq questions d’achat de notre étude de catégories appariées et les avons reposées sur AI Mode, même marché, mêmes trois passes, même règle pour ce qui compte comme fournisseur, sans rien changer d’autre que la surface. Le recouvrement médian entre les deux ensembles de sources durables est de 0,40. Reposer la même question deux jours plus tard donne 0,63. La surface coûte plus cher que le jour.
Une des cinq catégories ne partage aucune source durable entre les deux surfaces, une deuxième ne renvoie aucune source durable sur la nouvelle surface, et les deux surfaces ne s’accordent pas sur la catégorie la plus favorable aux fournisseurs.
Transparence : EchoWi vend de la mesure de visibilité IA, et cette pièce met un chiffre sur la partie la plus faible de notre propre travail publié, ce qu’un vendeur a intérêt à laisser dans le flou. Les cinq questions sont imprimées dans notre registre de mesures avec tous les domaines renvoyés par chaque surface, la comparaison peut donc être refaite contre nous.
La version courte
- Le recouvrement médian entre AI Overview et AI Mode est de 0,40, sur les six cellules de deux marchés où les deux surfaces ont répondu aux trois passes.
- C’est pire que deux jours. Les mêmes questions reposées à deux jours d’écart sur une seule surface ont donné une médiane de 0,63, et deux lectures le même après-midi donnent 0,67 à 0,70.
- Une catégorie ne partage rien. Les plateformes de boutique renvoient quatre domaines durables sur chaque surface et aucun n’est sur les deux listes.
- Les extrêmes survivent et l’ordre non. L’hébergement web et les plateformes de boutique donnent aux fournisseurs zéro place durable sur les deux surfaces. Mais la comptabilité est la catégorie la plus favorable sur AI Overview et le CRM l’est sur AI Mode, donc l’ordre que nous avons publié ne se transfère pas.
- Et un ensemble durable vide est une propriété d’une lecture, pas de la surface. Quatre cellules n’ont rien renvoyé de durable sur AI Mode la première fois. Reposées, les quatre sont revenues avec un ensemble, une affirmation que nous avions publiée sur cette base est donc retirée plus bas.
Pourquoi c’était l’étude à mener
Notre registre contient toutes les mesures derrière tout ce qui est sur ce blog, et jusqu’à aujourd’hui chacune de ces lignes portait la même valeur dans la colonne surface. La section des limites de chaque étude le dit. Ce qu’aucune ne pouvait dire, c’est ce que cela coûte.
L’étude de catégories appariées est ce que nous avons de plus solide : cinq questions d’achat posées dans six marchés, avec un dégradé allant de l’hébergement web à 1 place fournisseur sur 27 jusqu’aux logiciels de comptabilité à 14 sur 37. Si ce dégradé est une propriété de la récupération d’AI Overview plutôt que des catégories, le conseil pratique bâti dessus est un conseil sur un seul produit Google.
Donc : les mêmes cinq questions, le même marché, les mêmes trois passes, la même règle fournisseur, et seule la surface change.
La comparaison
| Catégorie | AI Overview | AI Mode | Partagé |
|---|---|---|---|
| Hébergement web | 0 sur 5 | 0 sur 2 | 0,40 |
| Plateformes de boutique | 0 sur 4 | 0 sur 4 | 0,00 |
| CRM | 2 sur 7 | 3 sur 9 | 0,60 |
| Paie | 5 sur 11 | aucun ensemble durable | non comparable |
| Logiciels de comptabilité | 6 sur 13 | 3 sur 12 | 0,39 |
Les deux premières colonnes sont les places tenues par des fournisseurs sur les places durables. La dernière est le recouvrement entre les deux ensembles de domaines durables, et c’est le chiffre qui compte, parce qu’une part peut coïncider pendant que les sources en dessous changent complètement. Chaque cellule de ce tableau et du suivant est la première lecture de cette question, et cela compte surtout pour les cellules marquées non comparables : elles ont toutes été reposées, et ce qui est revenu se trouve deux sections plus bas.
Six cellules sont comparables. Le recouvrement médian est de 0,40, la fourchette de 0,00 à 0,60.
Le deuxième marché, et le résultat qui n’a pas besoin de médiane
Quatre cellules comparables, c’est mince, nous avons donc mené le même protocole en Espagne : les cinq questions d’achat espagnoles déjà au registre sur AI Overview, reposées sur AI Mode, le même jour, en trois passes.
| Catégorie | AI Overview | AI Mode | Partagé |
|---|---|---|---|
| Hébergement web | 0 sur 3 | aucun ensemble durable | non comparable |
| Plateformes de boutique | 1 sur 3 | aucun ensemble durable | non comparable |
| CRM | 1 sur 6 | 0 sur 3 | 0,50 |
| Paie | 2 sur 6 | aucun ensemble durable | non comparable |
| Logiciels de comptabilité | 5 sur 7 | 0 sur 5 | 0,09 |
La médiane propre de l’Espagne est de 0,29 sur deux cellules, et en cumulant les deux marchés le chiffre principal reste exactement où il était : 0,40 sur six cellules. Le second marché a reproduit le premier au lieu de le sauver.
À la première lecture, quatre des dix cellules AI Mode n’ont renvoyé aucun ensemble durable contre aucune sur AI Overview, et nous avons publié cela comme le résultat qui n’avait pas besoin de médiane. Nous avons reposé les quatre. Les quatre sont revenues avec un ensemble durable, ce résultat est donc retiré. La paie américaine est passée de zéro à douze, et ces douze sont exactement les domaines qui étaient dans deux passes sur trois la première fois. La paie espagnole est passée de zéro à cinq, l’hébergement espagnol à deux, les boutiques espagnoles à deux.
L’ensemble vide était donc une propriété d’un après-midi et non de la surface, et la version honnête est plus étroite : AI Mode atteint la barre stricte moins fiablement qu’AI Overview, ce qui est une affirmation sur le fait de le lire une fois. Quiconque rapporte un ensemble vide à partir d’une seule lecture de cette surface rapporte la lecture.
Ce que les relectures ont fait en revanche, c’est renforcer le chiffre sur lequel nous étions prudents. En prenant la meilleure lecture de chaque cellule, il y a dix cellules comparables au lieu de six, et le recouvrement médian cumulé est de 0,33, fourchette 0,00 à 0,60. Plus bas que le 0,40 sur six cellules, sur davantage de données, et toujours très en dessous du 0,63 que coûtaient deux jours sur une seule surface.
Et la cellule la plus nette est la comptabilité espagnole. Sur AI Overview c’est la cellule la plus favorable aux fournisseurs de toute l’étude, 5 places durables sur 7 tenues par des entreprises qui vendent des logiciels de comptabilité. Sur AI Mode la même question le même jour renvoie cinq domaines durables et aucun ne vend de comptabilité : un extracteur de données de factures, un comparateur de logiciels, un hébergeur, un ERP et YouTube. Le recouvrement est de 0,09.
Ce que ce chiffre veut dire à côté de ceux que nous avions déjà
Nous avons deux autres mesures de la même forme, et c’est la première fois que les trois peuvent tenir dans un tableau.
| Ce qui a changé | Recouvrement médian |
|---|---|
| Rien, deux lectures le même après-midi | 0,67 à 0,70 |
| Deux jours, même surface | 0,63 |
| La surface, le même jour | 0,40 |
Une vérification va à côté de ce tableau, parce qu’un Jaccard divise par l’union et présente donc un petit ensemble contenu dans un grand comme un désaccord. Sur les 6 cellules où les deux surfaces ont renvoyé un ensemble durable, le rapport de taille médian est de 1,3 et le plus grand de 2,5, donc ce sont des ensembles comparables et le 0,40 dit ce qu’il a l’air de dire.
La surface est donc le plus grand des trois, et c’est justement celui que tout tableau de bord de cette catégorie écrase. Un produit qui rapporte «votre visibilité IA» comme un chiffre unique fait la moyenne de sources qui s’accordent moins entre elles qu’une même source ne s’accorde avec elle-même deux jours plus tard.
La catégorie qui ne partage rien, et le contrôle qui en fait un résultat
Les plateformes de boutique renvoient quatre domaines durables sur AI Overview et quatre sur AI Mode, et l’intersection est vide. AI Overview donne Reddit, YouTube, Zapier et une galerie de design. AI Mode donne une plateforme de logistique après-achat, un guide pour construire un site et deux agences de développement.
Ce zéro est le chiffre de cette étude qui mérite le plus d’être mis en doute, nous avons donc relu le côté AI Overview le même après-midi. Les quatre domaines du registre sont revenus, plus un. La ligne de base n’était pas périmée, et le zéro est entre surfaces et non entre jours.
L’ordre ne se transfère pas, et c’est une vraie correction
Notre pièce sur les catégories appariées publie l’ordre des catégories comme le résultat exportable, au motif que le taux est local et que l’ordre a voyagé dans six marchés. Il ne voyage pas entre surfaces.
Sur AI Overview, la comptabilité est la catégorie la plus favorable aux fournisseurs à 6 sur 13. Sur AI Mode, c’est le CRM, à 3 sur 9, et la comptabilité tombe à 3 sur 12. L’affirmation qui survit aux deux est plus étroite et reste utile : les catégories où les fournisseurs n’obtiennent rien n’obtiennent rien sur les deux surfaces, et l’hébergement et les boutiques sont à zéro deux fois.
L’ensemble vide qui ne l’était plus une heure après
Treize domaines ont été cités au fil des trois passes d’AI Mode et aucun n’est apparu dans les trois. Ce n’est pas la surface qui ne répond pas, et c’est pour cela qu’il faut le dire avec soin : les trois passes ont renvoyé une réponse avec des citations dedans, et aucune source n’était dans toutes.
Nous avons déjà vu cette forme exacte. Dans notre travail sur deux jours, une question de marketing par courriel n’a rien renvoyé de durable un après-midi et sept domaines une heure plus tard, et ces sept étaient exactement les sources qui avaient été dans deux passes sur trois. Une barre stricte et une récupération qui bouge produisent un ensemble vide sans que rien ne soit cassé.
Pourquoi il n’y a pas de colonne Gemini
Nous avons posé les mêmes cinq questions sur Gemini aussi, et les lignes sont dans le registre. Elles ne portent pas de part fournisseur, pour deux raisons qu’il vaut mieux séparer.
Trois des cinq se sont arrêtées avant trois passes, leur barre pour «citée à chaque passe» est donc de deux et non de trois, et elles ne sont comparables à rien de ce qui précède.
La raison la plus lourde est que nous ne pouvons pas distinguer une courte liste de citations d’une courte capture. Cette voie de mesure est déjà connue pour ne renvoyer aucune source pour un assistant majeur, ce qui veut dire qu’une liste courte ici a deux causes possibles et que nous ne pouvons pas les séparer de l’extérieur. Publier une part fournisseur là-dessus reviendrait à publier un artefact avec un signe pourcentage.
Un détail de ces lignes mérite quand même d’être nommé, parce qu’il est vérifiable. La seule source qui a tenu chaque passe Gemini sur la question de l’hébergement est le blog d’un hébergeur, sur une page qui se compare à ses concurrents. C’est le motif de notre travail sur qui écrit les classements d’outils, qui apparaît comme la source la plus durable d’une surface.
La colonne Gemini, une semaine plus tard, et pourquoi la liste était courte
La section ci-dessus dit qu’il n’y a pas de colonne Gemini parce que nous ne pouvions pas distinguer une liste de citations courte d’une capture courte. C’était honnête et ce n’était pas la fin, alors nous y sommes retournés avec un autre appel.
Ce n’est ni l’un ni l’autre. Interrogé par l’appel unique mis en cache plutôt que par le répété, Gemini renvoie de 9 à 18 citations par réponse, ce qui n’est pas un problème de capture. Il les répartit sur 2 à 5 domaines.
Voilà toute la réponse. Gemini imprime 3,80 citations par domaine distinct contre 1,31 pour AI Overview, médianes sur six questions dans trois marchés le même jour, et Gemini est plus élevé dans 6 des 6 cellules sans que les deux plages se recouvrent. La liste courte était réelle et ce n’était pas l’instrument : Gemini cite plusieurs passages de la même page, donc une poignée de sources porte une réponse qui semble bien sourcée.
Cela se voit dans les citations elles-mêmes. Celles de Gemini sont des fragments de texte, ancrés sur une phrase précise de la page. Celles d’AI Overview pointent vers la page.
Cela donne une troisième unité, et c’est celle qu’un outil se trompe. Sur les six réponses, Gemini a imprimé 77 citations, qui se résolvent en 23 pages et 22 domaines. Ses pages sont presque exactement une par domaine, et son nombre de citations vaut plus du triple de l’une ou l’autre. Qui compte des URL de citation comme des sources rapporte une réponse Gemini comme trois fois mieux sourcée qu’elle ne l’est, et ce registre a déjà publié une correction pour avoir commis cette erreur dans l’autre sens, en comptant des URL comme des pages dans notre propre travail.
Ce que cela fait à une comparaison
Avec une route qui capture, la comparaison que cet article ne pouvait pas mener devient possible, et elle tombe là où le reste de la pièce le prédirait. Sur ces six questions, les deux surfaces partagent 8 domaines sur 47.
Deux propriétés de Google, les mêmes questions, le même jour, et cinq sixièmes de ce que cite l’une ne sont pas cités par l’autre.
C’est le constat de surface du début de cet article, mesuré entre deux produits d’un même fournisseur plutôt qu’entre fournisseurs. C’est la version la plus forte dont nous disposions, car personne ne peut l’attribuer à un autre index ni à un autre robot : quoi qui sépare AI Overview de Gemini, ce n’est pas qu’ils soient des entreprises différentes.
Et une mise en garde sur la surface qui porte cet article
En vérifiant quelle surface cite des pages, nous avons trouvé quelque chose qui atteint le chiffre du début de cet article.
Une réponse d’AI Mode imprime des marqueurs de citation numérotés dans son propre corps, et la liste structurée que nous lisons ne les porte pas toujours tous. Sur 5 questions dans 3 marchés et trois langues, la liste d’AI Overview a porté tous les marqueurs imprimés dans les 5 cellules, et celle d’AI Mode est allée de 21 pour cent d’entre eux à la totalité. Nous avons d’abord lu cela sur deux cellules et écrit que c’était la façon dont chaque surface est analysée. Un troisième marché a renvoyé une réponse d’AI Mode portant chaque marqueur qu’elle imprimait, ce n’est donc pas cela : la capture est intermittente, pas divisée par deux, et un décompte d’AI Mode est donc un plancher dont on ignore la marge, pas un décompte qu’on corrige en le doublant. Gemini, lu sur 5 des mêmes questions le même jour, a lui aussi porté chaque marqueur qu’il imprimait. Des 3 surfaces que nous pouvons lire ainsi, 2 renvoient intacte la liste de citations de leur propre réponse et l’écart n’appartient qu’à AI Mode.
Le sens de la poussée dépend du chiffre. Là où nous rapportons qu’AI Mode cite bien plus large qu’AI Overview, un AI Mode sous-capturé rend l’écart réel plus grand, ces nombres sont donc des planchers et le constat tient.
La médiane de recouvrement du début de cet article est celle que nous ne pouvions pas déduire, alors nous l’avons mesurée. Sur chaque cellule où nous disposons de la liste complète des marqueurs sur les deux surfaces, nous avons calculé le Jaccard deux fois, une fois à partir de la liste renvoyée par l’outil et une fois à partir de tous les marqueurs imprimés par la réponse. Cela fait 4 cellules, contre 2 lors de la publication de ce paragraphe, et la correction faite alors survit à l’élargissement : 2 cellules sous-estiment l’accord et 2 le surestiment, d’un facteur de 1,4 à 2,7.
| Cellule | Avec la liste renvoyée | Avec tous les marqueurs | Domaines perdus | Cités aussi par AI Overview |
|---|---|---|---|---|
| Cartes de voyage, États-Unis | 0,07 | 0,19 | 10 | 3 |
| Comptabilité, Espagne | 0,14 | 0,19 | 11 | 2 |
| Paie, États-Unis | 0,43 | 0,29 | 7 | 0 |
| CRM, États-Unis | 0,40 | 0,16 | 15 | 0 |
La dernière colonne est tout le mécanisme, et elle relève de l’arithmétique plus que de la découverte. Rendre un domaine perdu que l’autre surface cite aussi augmente l’intersection ; rendre un domaine qu’elle ne cite pas augmente l’union. Le recouvrement monte donc exactement quand la part des domaines perdus que l’autre surface partage dépasse le recouvrement déjà mesuré, et cela vaut dans les 4 cellules parce que cela ne peut pas échouer.
Ce qui est mesuré, et ce qui rend le sens inconnaissable en pratique, c’est que cette part va de 0 à 3 sur 10 sans rien pour la prédire. Que votre chiffre soit trop haut ou trop bas dépend entièrement des domaines emportés par la troncature, c’est-à-dire précisément de la liste dont vous ne disposez pas. Quiconque publie un recouvrement entre surfaces ne peut calculer la correction qu’en récupérant d’abord ce qui a été perdu. Donc 0,40 porte une erreur de cette taille dans une direction connaissable en principe et indisponible en fait. C’est pire que le plancher que nous affirmions ici au départ, et c’est ce que dit la mesure plutôt que ce que suggérait le mécanisme.
L’une des 4 cellules exige qu’on énonce sa provenance, car les deux côtés ne sont pas symétriques. La réponse espagnole d’AI Overview a renvoyé 5 domaines et n’a imprimé aucun marqueur numéroté, si bien que son ensemble vient de la liste renvoyée tandis que celui d’AI Mode vient du corps. Elle est incluse parce que la question ici est celle de la troncature d’AI Mode, AI Overview ne fournissant que l’ensemble de comparaison. Elle est signalée parce que qui est en droit de vérifier l’arithmétique est en droit de le savoir.
Ce qui ne bouge pas, c’est la comparaison avec Gemini de cette section. La liste de Gemini porte tous les marqueurs que ses réponses impriment, comme celle d’AI Overview, donc les 8 sur 47 sont mesurés avec un seul instrument des deux côtés.
Et il y a une seconde entrée que nous n’avions jamais fait varier. Chaque lecture de cette étude est une question, parce que c’est ce que posent ces produits ; posée au contraire comme l’expression de mots-clés que tape un acheteur, 4 catégories sur 19 renvoient un ensemble de sources sensiblement différent.
La prudence qui va avec
Une lecture par question et par surface, donc rien de tout cela n’est un taux. Un domaine absent d’une réponse peut être présent dans la suivante, et ce registre a mesuré qu’une lecture isolée est un tirage et non une estimation.
Cela compte surtout pour une tentation que nous avons eue et refusée. Quatre des éditeurs de notre étude sur les robots interdisent Google-Extended, qui est le contrôle d’usage pour Gemini, et les quatre sont absents de ces réponses Gemini tout en étant cités dans AI Overview. Cela se lit comme un mécanisme confirmé. Ce n’en est pas un : seuls 8 des 43 domaines qui ne bloquent pas passent également, donc à ce taux de base le nombre attendu de bloqueurs présents était inférieur à un et nous en avons observé zéro. Observer zéro là où on attendait zéro ne distingue rien, et les lignes du registre portent cette arithmétique à côté du résultat pour que le chiffre ne puisse pas être cité sans elle.
Ce que cela ne montre pas
2 marchés, un jour, 10 questions, pour la médiane de recouvrement. Ce sont les États-Unis en anglais et l’Espagne en espagnol le 12 août 2026, trois passes par surface et par question. C’est la portée du chiffre qui ouvre l’article et non celle de la pièce entière : la section Gemini et la section capture ci-dessous ont été mesurées plus tard et atteignent un troisième marché, et chacune énonce sa propre portée là où elle se trouve. Ce n’est pas une série temporelle et rien ici n’est causal.
6 cellules comparables, c’est encore peu, et le pool de 10 issu de la meilleure lecture est la même faiblesse avec plus de lignes. La médiane de six recouvrements est une statistique faible, et nous ne la publierions pas seule. Elle est publiable parce qu’elle est posée à côté de deux autres médianes mesurées de la même façon sur plus de lignes, parce que le second marché a reproduit le premier, et parce que la direction est la même dans cinq des six cellules.
La règle fournisseur est la nôtre et elle est stricte. Un domaine compte comme fournisseur quand sa propre page d’accueil nomme le produit sur lequel porte la question. Deux pages de ce lot, Salesforce et ADP, refusent entièrement les requêtes automatiques ; Salesforce garde la classification qu’elle avait déjà dans le registre du temps où elle était lisible, et ADP est marquée non tranchée dans sa ligne plutôt que devinée.
Et une surface n’est pas un utilisateur. AI Overview et AI Mode sont toutes deux de Google, atteintes différemment. Que deux surfaces Google divergent à ce point est le résultat ; combien de personnes voient chacune est une autre question, que ceci ne mesure pas.
Questions fréquentes sur la mesure entre surfaces IA
Un score de visibilité sur une surface prédit-il les autres ?
Pas avec ces données. Poser cinq questions d’achat identiques sur AI Overview et sur AI Mode, dans le même marché et le même jour, a donné un recouvrement médian de 0,40 entre les ensembles de sources citées à chaque passe, et une catégorie n’a partagé aucune source. C’est plus bas que le 0,63 obtenu par les mêmes questions reposées à deux jours d’écart sur une seule surface.
Quelle surface IA faut-il mesurer ?
Celles qu’utilisent vos acheteurs, mesurées séparément, et la réponse honnête est que le nombre de surfaces mesurables est plus petit que le nombre de surfaces existantes. Ce contre quoi cette étude argumente, c’est un chiffre unique mélangé : faire la moyenne de surfaces qui s’accordent à 0,40 produit un nombre qui ne parle d’aucune.
Ma catégorie est-elle plus favorable aux fournisseurs sur certaines surfaces ?
Oui, et le classement change. Les logiciels de comptabilité étaient la catégorie la plus favorable des cinq sur AI Overview et le CRM l’était sur AI Mode. Ce qui a tenu sur les deux, c’est le bas : l’hébergement web et les plateformes de boutique ont donné aux fournisseurs zéro place durable sur l’une comme sur l’autre.
Que veut dire une surface qui cite des sources dont aucune n’est durable ?
Que la récupération a bougé entre les passes, pas que la surface a échoué. Notre question sur la paie sur AI Mode a renvoyé des réponses avec des citations les trois fois, treize domaines distincts au total, et aucun domaine n’est apparu dans les trois. Une barre stricte de «citée à chaque passe» rapporte cela comme un ensemble vide, ce qui est correct et se lit plus mal que ce n’est.
Pourquoi ne pas rapporter plutôt un taux moyen de citation ?
Parce qu’avec deux ou trois passes une moyenne est surtout une version rééchelonnée du même comptage, et elle achète une tolérance que seules des passes supplémentaires peuvent réellement fournir. Nous préférons publier l’ensemble des domaines, que chacun peut vérifier, plutôt qu’une statistique plus lisse bâtie sur les mêmes trois lectures.
Comment refaire ceci contre vous ?
Prenez les cinq questions du registre, posez chacune trois fois sur deux surfaces, dans un marché et un jour, ne gardez que les domaines qui apparaissent à chaque passe et calculez le recouvrement entre les deux ensembles. Tout le protocole tient dans la phrase précédente, et les domaines obtenus sont imprimés ligne par ligne.
Interrogez une IA sur cet article
Ouvre votre assistant avec cette page déjà chargée, pour vérifier les chiffres, discuter la méthode ou demander ce que cela change pour vous.
- ChatGPT (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Claude (ouvre un nouvel onglet. la question est pré-remplie, appuyez sur entrée pour l’envoyer)
- Perplexity (ouvre un nouvel onglet)
- Google AI Mode (ouvre un nouvel onglet)
Perplexity et Google répondent directement. ChatGPT et Claude remplissent le champ et attendent que vous appuyiez sur entrée, ce qui relève de leur comportement et non du nôtre.