Wir haben 19 Kategorien als Keyword und als Frage gestellt. Vier antworteten anders.
11 von 15 vergleichbaren Kategorien liefern identische Quellen, egal wie man fragt. 4 teilen fast nichts, und nur eine Kontrolle sagt, warum.
Jedes Produkt für KI-Sichtbarkeit stellt Fragen, weil man eine Frage in einen Assistenten tippt. Ein AI Overview erscheint aber auch auf die Keyword-Phrase, die ein Käufer bei Google eintippt, und niemand in dieser Kategorie scheint geprüft zu haben, ob beide dieselben Quellen erreichen. Wir haben 19 Kategorien auf beide Arten gestellt, auf derselben Oberfläche, im selben Markt, am selben Tag, danach 5 davon in jedem von drei weiteren Märkten wiederholt und schließlich 8 der amerikanischen Zellen am nächsten Morgen erneut gestellt. Das sind 26 vergleichbare Paare, und die 11, die mit identischen Quellen zurückkamen, liegen alle im ersten. In den 3 europäischen Märkten lautet die Zahl 0 von 11.
Die nützliche Antwort lautet weder, dass die Form zählt, noch, dass sie gleichgültig ist. Sie lautet, dass die Antwort vom Markt abhängt. In den Vereinigten Staaten kostet die Form meist nichts und gelegentlich fast alles. In Spanien, Deutschland und Frankreich hat sie in jeder vergleichbaren Zelle etwas gekostet, und mehr, als eine erneute Lesung derselben Formulierung kostet. Nichts Sichtbares an einer Kategorie verrät, in welchem der beiden Fälle Sie stecken, und inzwischen sieht es so aus, als verrate es auch nichts Sichtbares an einem Markt. Und in den acht amerikanischen Zellen, zu denen wir am nächsten Morgen zurückkehrten, hat der Tag die Antwort weiter bewegt als je eine der beiden Formen.
Offenlegung: EchoWi verkauft Messung von KI-Sichtbarkeit, und diese Studie findet einen blinden Fleck darin, wie die Produkte dieser Kategorie ihre Fragen stellen, unseres eingeschlossen. Alles zum Nachmachen steht hier: alle genauen Zeichenketten, die Oberfläche, der Markt, die Zahl der Durchläufe, das Datum und jede Domain, die in unserem Messregister genannt ist. Wiederholen Sie es gegen uns und veröffentlichen Sie eine andere Antwort.
Den blinden Fleck fanden wir zuerst im eigenen Korpus
Das begann als Prüfung unseres Registers, nicht als Studie.
Vor diesen Zeilen enthielt es 184 verschiedene Prompts aus allem, was wir veröffentlicht haben. Zwei hatten Keyword-Form, und beide waren spanische und französische Nominalphrasen aus einem Formulierungsexperiment, keine absichtlichen Kontrollen. Alles andere war eine Frage, mit Verb und meist mit Fragezeichen.
Das ist kein Versäumnis, das nur uns eigen wäre. Es folgt daraus, wozu diese Produkte da sind. Man kauft Messung von KI-Sichtbarkeit, weil man wissen will, was ein Assistent über einen sagt, und mit einem Assistenten spricht man. Die natürliche Einheit ist also ein Prompt.
Das Problem ist, dass Googles AI Overview nicht nur durch Sprechen erreicht wird. Es erscheint über den gewöhnlichen Suchergebnissen, auf die Phrase, die jemand ohne jedes Verb eintippt. Wenn sich die Quellen hinter diesen beiden Eingaben unterscheiden, berichtet ein Produkt, das nur Prompts verfolgt, über eine Eingabe, die ein großer Teil der Käufer nie benutzt.
Niemand hatte es gemessen. Die Achse verdient also eine eigene Studie, und sie ist eine andere Achse als die Formulierungsarbeit, die bereits in diesem Register steht und variiert, wie eine Frage gestellt wird, während sie eine Frage bleibt.
Der Aufbau, eingefroren vor dem ersten Aufruf
19 Kategorien, jede bereits in unserem Register als Frage auf AI Overview in den Vereinigten Staaten auf Englisch gemessen, damit die neuen Lesungen sich zu dem addieren, was wir schon haben, statt daneben zu stehen. Jede in zwei Formen gestellt, drei Durchläufe pro Lesung angefordert, Cache umgangen.
Die Keyword-Form ist die Phrase, die ein Käufer tippt. Die Fragenform ist die Zeichenkette, die schon im Register stand.
Eine Quelle gilt als dauerhaft, wenn sie in jedem beantworteten Durchlauf zitiert wird, was die strenge Latte ist, die der Rest unserer Arbeit verwendet. answered wird aus dem Ergebnis gelesen und nie aus dem Angeforderten geschlossen, denn diese Oberfläche antwortet nicht immer dreimal, wenn man sie dreimal fragt.
Die Vorhersagen wurden vor jedem Aufruf aufgeschrieben. Zählt die Form nicht, sollten sich die beiden Mengen je Kategorie etwa so überschneiden wie eine erneute Lesung derselben Frage. Zählt sie so viel wie die Formulierung, sollte die Überschneidung in jenes Band fallen, in dem Formulierungsvarianten fast nichts teilen. Und das teure Ergebnis wäre eine Keyword-Form gewesen, die überhaupt kein AI Overview zurückgibt, was daraus einen anderen und größeren Artikel gemacht hätte.
Was zurückkam
| Kategorie | Beantwortete Durchläufe | Dauerhaft, Keyword | Dauerhaft, Frage | Überschneidung |
|---|---|---|---|---|
| CRM | 3 und 3 | 4 | 4 | 1,00 |
| KI-Coding-Assistenten | 3 und 3 | 10 | 10 | 1,00 |
| Laufschuhe | 3 und 3 | 7 | 7 | 1,00 |
| Flugbuchung | 3 und 3 | 7 | 7 | 1,00 |
| Grammatikprüfer | 3 und 3 | 5 | 5 | 1,00 |
| Lohnabrechnung | 3 und 3 | 10 | 10 | 1,00 |
| Terminplanung | 3 und 3 | 9 | 9 | 1,00 |
| E-Commerce-Plattformen | 3 und 3 | 8 | 4 | 0,33 |
| E-Mail-Marketing | 2 und 2 | 5 | 6 | 0,22 |
| Passwortmanager | 3 und 3 | 9 | 9 | 1,00 |
| VPN-Dienste | 3 und 3 | 6 | 6 | 1,00 |
| Notiz-Apps | 3 und 3 | 8 | 8 | 1,00 |
| Website-Baukästen | 3 und 3 | 8 | 8 | 1,00 |
| Webhosting | 3 und 3 | 6 | 6 | 0,33 |
| Geschäftskonten | 3 und 3 | 7 | 9 | 0,33 |
11 der 15 sind nicht bloß ähnlich. Es sind dieselben Domains, alle, in beide Richtungen. Fragen Sie ein AI Overview «best ai coding assistant» oder «what is the best AI coding assistant?» und die zehn Quellen, die alle drei Durchläufe überstehen, sind identisch.
Zwei kommen dem nicht nahe. E-Commerce teilt drei Domains von neun gesehenen. E-Mail-Marketing teilt zwei von neun.
Vier Paare sind ausgeschlossen, und das gehört gesagt statt versteckt. Cloud-Speicher antwortete auf der einen Seite zweimal und auf der anderen dreimal, und Einstimmigkeit über zwei Durchläufe ist eine andere Latte als Einstimmigkeit über drei, sie zu vergleichen hieße also, zwei Maßstäbe zu vergleichen. Drei weitere scheiterten auf der Fragenseite: Projektmanagement und Kopfhörer antworteten einmal gegen dreimal, und die Dienste für ausgelagerte CFOs antworteten überhaupt nicht, während ihre Keyword-Form zweimal antwortete. Ein einziger beantworteter Durchlauf ist eine Ziehung, keine dauerhafte Menge. Alle vier Paare stehen mit ihren echten Zahlen im Register.
Und das ist eine zweite Beobachtung, die wir absichtlich nicht Ergebnis nennen. In drei der vier ausgeschlossenen Paare antwortete die Fragenform seltener, in einem die Keyword-Form. Drei zu eins ist nichts. Es ist notiert, damit ein größerer Durchgang es prüfen kann, nicht weil wir es glauben.
Die Kontrolle, die das eigentliche Ergebnis ist
Eine Überschneidung von 0,22 zwischen Formen sieht schlüssig aus und beweist für sich genommen nichts, und das ist der Teil, den fast alle Studien dieser Bauart überspringen.
Beide Kategorien, die auseinandergehen, sind Kategorien, die unser Register bereits als instabil kennt. Eine instabile Kategorie geht mit sich selbst auseinander, wenn man sie zweimal liest. Eine geringe Überschneidung zwischen einem Keyword und einer Frage könnte also die Form sein, oder es könnte sein, dass diese Kategorie Ihnen ohnehin zwei verschiedene Antworten auf dieselbe Frage gegeben hätte.
Es gibt genau einen Weg, das zu trennen, und er ist billig: dieselbe Form zweimal lesen und sehen, was es kostet.
| Kategorie | Keyword gegen Frage | Frage gegen sich selbst, erneute Lesung |
|---|---|---|
| E-Mail-Marketing | 0,22 | 1,00 |
| E-Commerce-Plattformen | 0,33 | 0,60 |
| Geschäftskonten | 0,33 | 1,00 |
| Webhosting | 0,33 | 0,43 |
E-Mail-Marketing ist sauber. Zweimal gleich gefragt, liefert es die identischen sechs Domains. Als Keyword gefragt, teilt es zwei davon. In dieser Kategorie geschieht an diesem Tag nichts Instabiles; die Form leistet die ganze Arbeit.
E-Commerce ist gemischt, und die ehrliche Lesart sagt das. Die erneute Lesung der eigenen Frage teilt 0,60, weit entfernt von identisch, ein Teil dieser 0,33 ist also eine Kategorie, die sich von selbst bewegt. Aber 0,33 liegt unter 0,60, die Form kostet also obendrein etwas.
Ohne diese beiden zusätzlichen Lesungen wäre die Tabelle oben ein Ergebnis über die Form gewesen, das teilweise ein Ergebnis über die Instabilität war, und kein Leser hätte es unterscheiden können.
Und dann haben wir die andere Seite beider erneut gelesen, weil die Regel, die aus dieser Studie stammt, für diese Studie gilt. Eine Zelle, die das gesuchte Ergebnis liefert, wird erneut gelesen, bevor sie gezählt wird, und bisher waren nur die Fragenformen erneut gelesen worden. Die Keyword-Form des E-Commerce lieferte die identischen 8 Domains, ihr 0,33 ruht also auf zwei stabilen Lesungen. Die des E-Mail-Marketings antwortete bei der erneuten Lesung dreimal statt zweimal, was eine andere Latte und nicht vergleichbar ist, aber die beiden Domains, die dabei überlebten, stehen in keiner der beiden Lesungen der Fragenform. Beide Abweichungen halten.
Was die Kontrolle wert ist, in Zellen
Die zweite Erweiterung ist das erste Mal, dass sich der Absatz oben beziffern lässt, denn 7 Zellen der Studie sind inzwischen zweimal in derselben Form gelesen worden. 3 der 7 hörten daraufhin auf abzuweichen.
Passwortmanager sahen nach einer klaren Abweichung aus: die Fragenform lieferte 4 dauerhafte Domains gegen 9 der Keyword-Form, ein Überlappen von 0,44. Am selben Tag erneut gefragt, lieferte sie genau die 9 der Keyword-Form. Die Website-Baukästen taten dasselbe, 3 gegen 8 in der ersten Lesung und die identischen 8 bei der erneuten. Die dritte ist die Zelle der Terminplanung weiter unten, wo derselbe Mechanismus eine dauerhafte Menge bis auf null zog.
Ohne diese zusätzlichen Aufrufe würde diese Studie 7 abweichende Kategorien von 15 melden statt 4, und der Satz, dass die Form fast nie etwas kostet, wäre zurückgezogen worden. Vor den Aufrufen war aufgeschrieben, dass drei oder mehr neue Abweichungen diesen Rückzug erzwingen würden, und in den ersten Lesungen waren es vier.
Zwei Dinge müssen zu dieser Zahl gesagt werden, damit sie niemand als Rate zitiert.
- Die Auswahl ist nicht zufällig, und wir verbergen das nicht. Eine Zelle wird erneut gelesen, weil ihre erste Lesung abweichend aussah, also ist «7 von 7 sahen abweichend aus» das Verfahren, das sich selbst beschreibt, und kein Ergebnis. Die einzige Zahl mit Informationsgehalt sind die 3, die sich auflösten.
- Die erneute Lesung liefert nicht verlässlich mehr. Passwortmanager gingen von 4 dauerhaften Domains auf 9 und Website-Baukästen von 3 auf 8, aber Webhosting fiel von 6 auf 4 und die Geschäftskonten lieferten beide Male dieselben 9. Was sich bewegt, ist kein Aufwärmeffekt.
Die unangenehme Fassung, für jeden, der eine solche Zahl verkauft: eine einzige Lesung eines Prompts in Fragenform kann ihre eigene dauerhafte Menge so stark unterschätzen, dass sie einen Unterschied erfindet, den es nicht gibt, und nichts in dieser Lesung sagt das. Der Hinweis steckt nicht in der Statistik. Er steckt darin, zweimal gefragt zu haben.
Die Zelle, in der die Statistik null sagte und die Quellen dieselben waren
Die Terminplanung verdient einen eigenen Abschnitt, denn sie wäre beinahe als größte Abweichung der Studie in die Tabelle gekommen und ist gar keine.
Die Keyword-Form beantwortete alle drei Durchläufe und zitierte zehn Domains. Keine davon erschien in allen dreien, ihre dauerhafte Menge war also leer und die Überschneidung mit der Fragenform betrug null. Die Fragenform, gleiche Oberfläche und gleicher Tag, lieferte neun Domains in jedem Durchlauf.
Null gegen neun ist der größte Abstand, den dieses Maß kennt. Aber die neun
Domains der Fragenform sind genau die neun, die die Keyword-Form in zwei von
drei Durchläufen hatte. Ein Durchlauf ließ alle neun auf einmal fallen und fügte
stattdessen google.com hinzu. Erneut gelesen, lieferte die Keyword-Form
dieselben neun in allen drei Durchläufen.
Die Quellen waren also die ganze Zeit identisch, und die Statistik meldete vollständige Abweichung. Das ist eine Eigenschaft der Einstimmigkeitslatte, die dieses Register schon in anderen Studien gemessen hat: Ein einziger entarteter Durchlauf leert den Zähler, und bei drei Durchläufen gibt es keine Toleranz, die das auffängt.
Zwei Dinge folgen daraus, und das zweite ist das unangenehme:
- Diese Zelle zählt als identisch, auf der besseren ihrer beiden Keyword-Lesungen, und diese Wahl wird erklärt statt vergraben. Die Null zu zählen hieße, die Latte zu zählen statt der Quellen.
- Das Maß, das diese ganze Studie verwendet, kann genau das Ergebnis herstellen, nach dem die Studie sucht. Wir haben es hier gesehen, weil eine Null neben einer Neun zu seltsam war, um sie hinzunehmen, und die ehrliche Lesart ist, dass ein kleinerer, auf dieselbe Weise erzeugter Abstand direkt in die Tabelle gewandert wäre.
Was das bedeutet, wenn Sie Messung kaufen oder bauen
Ein Prompt ist manchmal kein Ersatz für ein Keyword, und wo Sie verkaufen entscheidet, wie oft. Alles in diesem Abschnitt ist der amerikanische Arm. Ist Ihre Kategorie eine der 11, die identisch antworteten, können Sie Prompts verfolgen und ruhig schlafen. Ist sie eine der 4, die es nicht taten, beschreibt Ihr auf Prompts gestützter Bericht eine Menge von Quellen, die die per Keyword ankommende Hälfte Ihrer Käufer nie sieht.
Von außen können Sie nicht erkennen, welche Sie sind. Keine vor der Messung sichtbare Eigenschaft dieser Kategorien sagt die Aufteilung vorher, und der zweite Schwung wurde ausgewählt, um eine zu prüfen. Die vier abweichenden sind E-Commerce, E-Mail-Marketing, Webhosting und Geschäftskonten, der naheliegende Verdacht ist also, dass es die kaufnahen Kategorien sind. Er übersteht die Spalte der identischen nicht: VPN-Dienste, Passwortmanager und Website-Baukästen werden genauso gekauft und antworteten auf beide Arten identisch, und ein Geschäftskonto sieht keinem E-Commerce-Kauf ähnlich. Weder Kategorie noch Markt noch Branche sortieren sie.
Die Prüfung ist also die billige: Stellen Sie die Frage einmal auf beide Arten. Ein Programm braucht es nicht. Nehmen Sie Ihre fünf wichtigsten Fragen, stellen Sie jede als das Keyword, das ein Käufer wirklich tippen würde, und vergleichen Sie die Quellen. Stimmen sie überein, hören Sie auf und verfolgen Sie weiter Prompts. Tun sie es nicht, haben Sie gerade erfahren, dass die Hälfte Ihrer Messung auf die falsche Eingabe zielt.
Prüfen Sie vor alldem den Tag. In den acht amerikanischen Zellen, die wir am nächsten Morgen erneut lasen, bewegte sich dieselbe Formulierung über Nacht stärker, als sich die beiden Formen gegeneinander bewegten. Wenn Sie den Bericht dieser Woche mit dem der letzten vergleichen, ist das Erste, was auszuschließen ist, der Kalender, und ausschließen lässt er sich, indem Sie dieselbe Zeichenkette zweimal am selben Tag stellen und den Abstand ansehen.
Und fragen Sie Ihren Anbieter, welche er schickt. Das ist eine vierte Frage an einen Anbieter, nach den dreien, für die dieses Korpus schon argumentiert: Umgehen seine Durchläufe den Cache, wie vielen Formulierungen folgt er je Absicht, und was passiert mit seiner Stabilitätszahl, wenn die Zahl der Durchläufe steigt. Ergänzen Sie: Schicken Sie je die Keyword-Form, und berichten Sie sie getrennt?
Dieselbe Frage auf einer zweiten Oberfläche
Alles oben ist Googles AI Overview, und dieses Korpus hat gemessen, dass ein Ergebnis auf einer Oberfläche nicht auf eine andere reist: der Median der Überschneidung dauerhafter Quellen zwischen AI Overview und AI Mode liegt bei 0,40, schlechter als dieselbe Frage mit zwei Tagen Abstand auf einer Oberfläche.
Die lohnende Frage war also nicht, ob dieselben Kategorien auf AI Mode auseinandergehen. Sie war, ob der Formeffekt dort überhaupt existiert. Wir haben 4 Kategorien genommen, die beiden abweichenden und zwei identische, und dieselben Zeichenketten auf AI Mode gestellt.
| Kategorie | Auf AI Overview | Auf AI Mode |
|---|---|---|
| CRM | identisch | identisch, 7 Domains in beiden Formen |
| Grammatikprüfer | identisch | identisch, 11 Domains in beiden Formen |
| E-Mail-Marketing | 0,22 | 0,08 |
| E-Commerce-Plattformen | 0,33 | keine dauerhafte Menge zum Vergleichen |
Der Formeffekt reproduziert sich. Beide auf AI Overview identischen Kategorien sind es auf AI Mode, und E-Mail-Marketing weicht erneut ab, und stärker: 8 dauerhafte Domains aus der Keyword-Form, 5 aus der Fragenform, und nur YouTube gemeinsam.
E-Commerce ließ sich nicht messen, und das wird gesagt statt gezählt. Seine Fragenform lieferte auf AI Mode überhaupt keine dauerhafte Menge, in zwei getrennten Lesungen, einmal über 45 Domains und einmal über 32, von denen jede einzelne in genau einem Durchlauf erschien. Eine leere Menge zwingt die Überschneidung auf null, was auch immer die andere Seite hält, das die größte Abweichung der Studie zu nennen hieße also, die Latte zu lesen statt der Quellen.
Und es gibt eine eigene Beobachtung zur Oberfläche selbst. 4 der 11 AI-Mode-Lesungen lieferten keine dauerhafte Menge, drei davon mit derselben Signatur: eine Reihe von Domains bei genau zwei von drei Durchläufen, also ein Durchlauf, der vollständig abweicht und eine Einstimmigkeitslatte leert. Erneut gelesen kamen zwei der drei vollständig zurück. Wer AI Mode mit drei Durchläufen gegen eine strenge Latte misst, sollte das erwarten, und sollte erwarten, dass es wie ein Ergebnis aussieht.
Dasselbe Design in einem zweiten Markt, und nichts übersteht die Reise
Dieses Stück sagt seit zwei Erweiterungen, dass es ein anderer Markt oder eine andere Oberfläche wäre, die es bewegen würde. Der Oberflächen-Arm steht oben. Spanien ist der Markt-Arm.
Fünf Kategorien, jede bereits eine Zelle des US-Arms derselben Studie, sodass der Vergleich Kategorie gegen Kategorie läuft und nicht Spanien gegen eine andere Fragenliste. Zwei der fünf waren in den USA identisch und drei wichen ab.
| Kategorie | Vereinigte Staaten | Spanien | Spanien, erneute Lesung derselben Form |
|---|---|---|---|
| CRM | identisch | 0,38 | 0,83 |
| Passwortmanager | identisch | kein AI Overview für das Keyword | |
| Webhosting | 0,33 | 0,40 | 0,60 |
| E-Commerce-Plattformen | 0,33 | 0,50 | 0,80 |
| Geschäftskonten | 0,33 | 0,40 | 0,67 |
Keine der fünf reproduziert ihr US-Ergebnis. 4 der 4 messbaren Zellen weichen ab, einschließlich derjenigen, die auf Englisch auf beide Arten identisch war, und in allen 4 liegt die Überschneidung zwischen den Formen unter der Kontrolle derselben Form in derselben Zelle. Die Form leistet in jeder von ihnen Arbeit zusätzlich zur Instabilität.
Die fünfte Zelle ist das schärfste Ergebnis, das diese Studie hervorgebracht hat. Als Frage gestellt liefert «¿Cuál es el mejor gestor de contraseñas?» ein AI Overview. Als das Keyword gestellt, das ein Käufer tippt, liefert «mejor gestor de contraseñas» gar keines: 2 Lesungen, 6 Durchläufe, null Antworten und null Fehler. Das ist keine niedrige Überschneidung und kein Instrumentenfehler. Es ist die Oberfläche, die sich weigert zusammenzufassen, und es heißt, dass ein spanischer Käufer, der das Keyword tippt, keine KI-Antwort hat, in der er sichtbar sein könnte, während derselbe Käufer mit der Frage eine hat.
Es ist außerdem der Ausgang, den das ursprüngliche Design den teuren nannte, vor jedem Aufruf aufgeschrieben und in der fünften Kategorie des dritten Schwungs erreicht.
Dieser Arm brauchte seine eigene Vergleichslatte, und das ist ein Ergebnis und keine Buchhaltung. 5 seiner 19 Lesungen brachen vor den drei angeforderten Durchläufen ab, gegen fast keine in den US-Schwüngen. Eine spanische Zelle wird deshalb nur dort verglichen, wo beide Formen eine Lesung mit drei beantworteten Durchläufen haben, und darunter zählt die größere dauerhafte Menge. Die US-Zahlen oben berührt diese Regel nicht, sie werden weiter berechnet wie immer.
Was das nicht tut, ist den US-Befund falsch machen. Es verortet ihn in den Vereinigten Staaten und auf Englisch: 11 von 15 identisch dort, 0 von 4 identisch hier, gleiche Oberfläche, gleiche Methode, gleiche Latte.
Der dritte Markt, und die Ausnahme sind am Ende die Vereinigten Staaten
Zwei Arme widersprachen sich über die Schlagzeile dieser Studie selbst. Die Vereinigten Staaten sagten, die Form koste meist nichts, 11 von 15. Spanien sagte, sie koste immer etwas, 0 von 4, und mehr, als eine erneute Lesung derselben Formulierung kostet. Vier Zellen sagen nicht, welcher von beiden der allgemeine Fall ist, also haben wir einen dritten Markt gefahren, mit zuerst aufgeschriebenem Plan und aufgeschriebener Vorhersage.
Deutschland fällt auf die Seite Spaniens.
| Kategorie, Deutschland | Keyword gegen Frage | Gleiche Formulierung, zweimal gelesen |
|---|---|---|
| CRM | 40 | 57 |
| Passwortmanager | 20 | 100 |
| Webhosting | 17 | 56 |
| Onlineshops | 50 | 100 |
4 vergleichbare Zellen, 0 identisch, und alle 4 unter der eigenen Kontrolle jener Zelle. Die rechte Spalte ist das Einzige, was die linke bedeutsam macht: sie ist das, was dieselbe Formulierung kostet, wenn man sie einfach noch einmal stellt, eine Zahl zwischen den Formen darunter ist also die Form, die etwas tut, was erneutes Lesen nicht tut.
Das Firmenkonto steht im Register und nicht in dieser Tabelle. Seine Frageform beantwortete drei Durchläufe und beide Keyword-Lesungen brachen bei zwei ab, und eine dauerhafte Menge über zwei Durchläufe ist eine andere Latte auf einem Einstimmigkeitsmaß. Seine beiden Keyword-Lesungen vergleichen sich sehr wohl miteinander, bei 57 gegenüber einem vergleichbaren Paar von 4.
Dieser Arm hat eine Sache an der Methode geändert, und die wiegt schwerer als das Ergebnis. Die früheren Arme lasen eine Zelle erneut, weil sie abweichend aussah, «7 von 7 kontrolliert» beschreibt also das Verfahren und nicht die Studie, und das Register führt dafür einen eigenen Schlüssel. Hier bekam jede Zelle ihre Kontrolle, unabhängig davon, wie sie aussah. Das kostet fünf zusätzliche Lesungen und kauft zwei Dinge: eine Kontrollzahl, die eine Leserin für bare Münze nehmen kann, und den ersten Blick, den diese Studie je darauf hatte, was eine Kontrolle auf einer Zelle tut, die übereinstimmte.
2 der 5 kamen identisch zurück, 100 und 100. Eine erneute Lesung derselben Form kann also genau dieselbe dauerhafte Menge zurückgeben, was es schwer macht, die 20 und die 50 zwischen den Formen in denselben Kategorien als Rauschen zu erklären.
Der Vorbehalt zu diesen Hundertern, weil es der ist, den eine Leserin erheben sollte: beide waren Zellen, in denen jede von der Keyword-Form zitierte Domain jeden Durchlauf überstand, es gab also keinen Schwanz, über den die Statistik uneins sein konnte. Dieses Register nennt das bereits eine niedrige Latte und keine feste Menge, und das Hosting zeigt, warum: seine erste Keyword-Lesung hatte 9 von 9 dauerhaft und ihre Kontrolle 5 von 9.
Der vierte Markt, und die Zelle, die fast eine Rücknahme erzwungen hätte
Drei Märkte sind für ein Wort so groß wie Europa immer noch dünn, also lief ein vierter: dieselben fünf Kategorien, beide Formen, je drei Durchgänge auf AI Overview in Frankreich auf Französisch, am 16. August 2026.
Frankreich landet bei Spanien und Deutschland. 3 vergleichbare Zellen, 0 identisch.
| Kategorie, Frankreich | Keyword gegen Frage |
|---|---|
| CRM | 63 |
| Onlineshops | 50 |
| Geschäftskonten | 71 |
Die beiden fehlenden Kategorien sind die interessantere Hälfte.
Passwortmanager gaben für die Keyword-Phrase überhaupt kein AI Overview zurück. 0 beantwortete Durchgänge von 6, in zwei getrennten Lesungen, während die Frageform derselben Absicht erschien und 5 stabile Domains zitierte. Das ist keine andere Quellenmenge, das ist eine andere Tatsache: In dieser Zelle entscheidet die Form, ob es überhaupt etwas gibt, worin zitiert zu werden. Es ist dieselbe Unterscheidung, auf der unsere lokale Studie aufbaut, aus einer Richtung, in die wir nicht geschaut haben. Webhosting fiel aus einem langweiligeren Grund heraus: seine Keyword-Form hielt in zwei Lesungen nie drei beantwortete Durchgänge.
Geschäftskonten sind die Zelle mit Kontrolle, und die Kontrolle hält. Ihre Keyword-Form wurde zweimal mit drei Durchgängen gelesen und gab beide Male dieselben sechs Domains zurück. Die 71 gegen die Frageform ist also die Form, die etwas tut, und keine Lesung, die sich selbst widerspricht: Die Keyword-Form behält einen Finanzvergleich, den die Frage fallen lässt, und die Frage behält einen Buchhaltungsdienst, den das Keyword fallen lässt.
Die Kontrolle der Onlineshops hält nicht, und wir zählen die Zelle trotzdem als abweichend, worüber man streiten kann. Ihre zweimal gelesene Frageform teilt 3 von 5. Eine Zelle, deren eigene Form sich so stark selbst widerspricht, kann keine Aussage darüber tragen, was die Form tut. Sie steht in der 0 von 3, weil gezählt wird, welche Zellen nicht identisch waren, und das war sie nicht, und sie wird hier genannt, damit niemand sie als Beleg über die Form zitiert.
Die Lesung, die uns einen richtigen Satz hätte zurücknehmen lassen
Die CRM-Zelle wurde zuerst mit zwei beantworteten Durchgängen je Seite gelesen, weil die Oberfläche beide Male früh abbrach. Beide Formen gaben dieselben sechs Domains zurück. Identisch. Das ist Europas erstes identisches Paar, es hätte die „0 in Europa” in vier Sprachen durch eine Zahl ersetzt, und es ist falsch.
Eine Stunde später mit drei beantworteten Durchgängen je Seite erneut gelesen, sind die dauerhaften Mengen 7 und 6 mit 5 gemeinsam. Die Keyword-Form gewinnt zwei Domains, die drei Durchgänge überleben, die Frageform behält eine, die das Keyword unter die Schwelle fallen lässt.
Der Mechanismus ist nicht subtil und dieses Register hatte ihn schon aufgeschrieben: Eine Einstimmigkeitsschwelle über weniger Durchgänge ist eine niedrigere Schwelle, flachere Lesungen stimmen also häufiger überein. Was die Zelle hinzufügt, ist die Richtung des Schadens. Eine dünne Lesung erzeugte hier kein vorsichtiges Ergebnis, sie erzeugte eine Rücknahme, und eine Rücknahme fühlt sich wie die bescheidene Richtung an. Sie ist nicht automatisch die sichere, und es ist das erste Mal in diesem Korpus, dass zu wenig Aussagekraft dazu drängt, eine Korrektur zu veröffentlichen, statt davon weg.
Deshalb verlangt auch jede vergleichbare Zelle in jedem Arm dieser Studie drei beantwortete Durchgänge auf beiden Seiten. Die Regel wurde für den deutschen Arm geschrieben, und in Frankreich hat sie sich bezahlt gemacht.
Eine Instrumentennotiz, deren zweite Hälfte zurückgezogen ist. 8 von 17 französischen Lesungen lieferten keine drei beantworteten Durchgänge, gegen 5 von 18 im deutschen Arm. Diese Zählung bleibt, weil sie erklärt, warum Frankreich 3 vergleichbare Zellen hat und nicht 5. Was wir danach schrieben, dass es je nach Markt zu variieren scheine, ob ein AI Overview überhaupt erscheint, hält einer sauberen Messung nicht stand.
Jene Lesungen wurden wiederholt, wenn sie kurz zurückkamen, die Zählung oben ist also teils unsere eigene Wiederholungspolitik und nicht die Oberfläche. Sauber gefragt, eine Lesung je Zelle und keine Wiederholungen in allen vier Märkten, erschien das Overview in 37 von 40 Zellen in jedem Durchgang, Deutschland beantwortete jeden angeforderten Durchgang, und jeder Fehlbetrag der Studie entfiel auf eine einzige Kategorie. Ob das Overview erscheint, ist weit mehr eine Eigenschaft der Frage als des Marktes, und der Satz, der das Gegenteil sagte, wird hier korrigiert statt still entfernt.
Was das mit der Schlagzeile macht
Über vier Märkte gibt es 26 vergleichbare Paare und 11 identische, und alle 11 liegen in den Vereinigten Staaten. Nimmt man die drei europäischen Märkte zusammen, sind es 0 von 11.
Wir werden das nicht als Regel über Europa verkleiden. Drei Märkte sind drei, und der Mechanismus ist nicht gemessen: es kann die Sprache sein, es kann sein, wie viel Vergleichsinhalt es je Markt gibt, es kann daran liegen, wie sich die Oberfläche außerhalb des Englischen verhält. Sagen lässt sich etwas Engeres, und es genügt, um zu ändern, was eine Käuferin tut: der Befund, dass die Form meist nichts kostet, wurde in einem Markt gemessen und hat sich in keinem der beiden anderen wiederholt, die wir versucht haben.
Die Kontrollzahlen sind zwischen den drei Armen nicht vergleichbar, und das ist unsere Schuld
Alle Paare gleicher Form in dieser Studie, bei denen beide Lesungen drei Durchläufe beantworteten, auf AI Overview:
| Arm | Paare | Median-Überschneidung | Kontrollierte Zellen |
|---|---|---|---|
| Vereinigte Staaten | 7 | 44 | 7 seiner 15 vergleichbaren Zellen |
| Spanien | 4 | 74 | 4 von seinen 4 |
| Deutschland | 4 | 79 | alle, von Anfang an |
Lesen Sie die mittlere Spalte nicht als drei Märkte. Alle drei Arme lasen eine Zelle erneut, weil sie bereits abweichend aussah, aber ob das zählt, entscheidet nicht die Regel, sondern ob die Regel etwas ausgelassen hat. In Spanien waren alle vier vergleichbaren Zellen abweichend, die Regel hat also nichts aussortiert. In den Vereinigten Staaten deckte sie 7 von 15 ab, und eine Zahl nur aus den verdächtigten Zellen beschreibt den Verdacht und nicht den Markt.
Wir veröffentlichen die Tabelle trotzdem, mit der dritten Spalte daneben, weil die Alternative wäre, drei Mediane zu veröffentlichen und eine Leserin annehmen zu lassen, sie bedeuteten dasselbe. Zwei lassen sich lesen, wie sie dastehen, und die amerikanische nicht.
Das hat die Änderung der Methode gekauft. In Deutschland lässt sich der Vergleich, auf dem diese ganze Studie ruht, sauber ziehen: ein nicht ausgewählter Kontrollmedian von 79 und vier Werte zwischen den Formen von 40, 20, 17 und 50, jeder davon darunter. Spanien kommt dort zufällig hin und nicht von Anfang an, weil seine Regel alles erwischt hat. In den Vereinigten Staaten ist der Vergleich Zelle für Zelle verfügbar, so wird er oben berichtet, und nicht im Aggregat.
Frankreich steht bewusst nicht in dieser Tabelle. Seine Lesungen derselben Form werden stattdessen im eigenen Abschnitt berichtet, weil zwei davon Lesungen unterschiedlicher Tiefe vergleichen und eine davon der Tiefenvergleich selbst ist. Sie neben Kontrollen zu stellen, die mit festen drei Durchgängen gemessen wurden, wäre genau der Fehler, den dieser Abschnitt benennen soll.
Eine frühere Fassung dieses Abschnitts bezifferte diese Korrektur auf fünf Lesungen und sprach von zwei betroffenen Armen. Beide Zahlen waren getippt und nicht gezählt, und beim Zählen ergeben sich 8 Zellen ohne Kontrolle in den Vereinigten Staaten und keine in Spanien. Die korrigierte Fassung ist die Tabelle oben.
Wir sind einen Tag später zurückgegangen, und der Tag bewegte mehr als je die Form
Diesen Abschnitt gibt es wegen einer misslungenen Reparatur. Der amerikanische Kontrollmedian ruht auf den Zellen, die wir erneut lasen, weil sie abweichend aussahen, also gingen wir die 8 erneut lesen, die niemand verdächtigt hatte. Alle amerikanischen Lesungen dieser Studie stammen vom 15. August und diese acht vom 16., womit sie dieselbe Formulierung im Abstand eines Tages sind und nicht im Abstand von Minuten. Sie können keine Kontrolle desselben Tages ersetzen, und eine Kontrolle desselben Tages lässt sich nicht nachträglich hinzufügen.
Dafür beantworten sie eine bessere Frage.
Alle 8 Zellen sind zwischen den Formen identisch. Zwei verschiedene Formulierungen, am selben Tag gestellt, gaben in jeder einzelnen genau dieselbe dauerhafte Menge zurück. Einen Tag später mit derselben Keyword-Zeichenkette erneut gestellt, liegt die Median-Überschneidung bei 41, von 17 bis 100.
| Zelle | Gleicher Tag, andere Formulierung | Gleiche Formulierung, Folgetag |
|---|---|---|
| CRM | 100 | 80 |
| KI-Coding | 100 | 100 |
| Laufschuhe | 100 | 31 |
| Flüge | 100 | 22 |
| Grammatikprüfung | 100 | 44 |
| Lohnabrechnung | 100 | 100 |
| VPN | 100 | 38 |
| Notiz-Apps | 100 | 17 |
Sechs der acht bewegen sich über Nacht stärker, als sie sich zwischen einem Keyword und einer Frage bewegt haben. In diesen sechs ist das, was wir gemessen haben, kleiner als das, was wir konstant gehalten haben.
Was das heißt und was nicht. Es kippt die Studie nicht: innerhalb eines Tages hat die Form in diesen acht amerikanischen Zellen nichts gekostet, und genau das behauptet die Studie. Es gibt der Behauptung eine Größe. Wenn Sie Ihre eigene Sichtbarkeit messen und einen Keyword-Report vom Montag mit einem Frage-Report vom Dienstag vergleichen, ist der Unterschied, den Sie sehen, eher Montag gegen Dienstag als Keyword gegen Frage.
Es sagt auch etwas über den Kauf von Messung. Ein Werkzeug, das Ihre Prompts einmal am Tag stellt und die Differenz zeichnet, zeichnet dies, und acht Zellen mit einem Median von 41 sind ein sehr breites Diagramm, um darin Bewegung zu lesen.
Acht Zellen, ein Markt, ein Tagespaar. Das Register führt bereits eine eigene Zwei-Tage-Studie über andere Fragen mit einem Median um 62, diese 41 ist also keine Rate und wir behandeln sie nicht als eine. Was sie ist: das erste Mal, dass diese Studie den Tag und die Form in derselben Tabelle hat.
Und dieselben acht Zellen in Frageform: die Form ändert die Drift nicht
Die naheliegende Anschlussfrage, vor der Durchführung aufgeschrieben: wenn die Form innerhalb eines Tages gleichgültig ist, ist sie es auch von Tag zu Tag? Jedes Produkt dieser Kategorie stellt Fragen, wenn Fragen also stärker driften als Keywords, ist der Standard der Branche der lautere.
Sie tun es nicht. Dieselben 8 Zellen in Frageform, erneut gelesen gegen ihre eigenen Lesungen vom 15. August: das Keyword ist in 2 Zellen stabiler, die Frage in 0, und es gibt 6 exakte Gleichstände. Mediane 41 und 35, und der Abstand zwischen beiden kommt vollständig aus den zwei Zellen, die keinen Gleichstand hatten. Die vor der Messung gesetzte Schwelle verlangte 7 oder 8 von 8 in eine Richtung, bevor eine benannt wird, das hier ist also ein Nullbefund und wird als solcher berichtet.
Die sechs Gleichstände sind exakt, und das ist der Teil, den wir nicht gesucht haben. Sie sind exakt, weil beide Formen an beiden Tagen dieselbe dauerhafte Menge zurückgaben, ihre Überschneidungen über Nacht also dieselbe Zahl sind. Das heißt, die beiden Formen stimmten am 16. noch in sechs von acht Zellen überein und wichen in zweien ab: CRM bei 56 und Lohnabrechnung bei 28.
| Zellen, in denen die beiden Formen vollständig übereinstimmten | |
|---|---|
| 15. August | 8 von 8 |
| 16. August | 6 von 8 |
Der Befund, mit dem dieser Artikel beginnt, dass die Form innerhalb eines Tages meist nichts kostet, wurde also selbst an einem Tag gemessen, und am nächsten kostete sie in einem Viertel dieser Zellen etwas. Das ist keine Rücknahme: die Schlagzeile des amerikanischen Arms hält am 15. August und die des deutschen am 16. Es ist eine Größe dafür, wie fest man sie halten sollte.
Dieses zweite Ergebnis war nicht vorab registriert. Es kam daher, dass sechs Zahlen exakt übereinstimmten, was man nachträglich findet, und wir kennzeichnen es lieber, als es wie eine eingetroffene Vorhersage lesen zu lassen.
Grenzen
Zwei Oberflächen, ungleichmäßig. Alle 19 Kategorien auf Googles AI Overview und 4 davon auf AI Mode wiederholt. Es sagt nichts über Gemini oder ChatGPT, und unsere eigene Arbeit hat wiederholt gefunden, dass ein auf einer Oberfläche gemessenes Ergebnis nicht auf eine andere reist.
4 Märkte, 4 Sprachen, 2 Tage. Die Vereinigten Staaten auf Englisch am 15. August 2026, und Spanien, Deutschland und Frankreich in ihren eigenen Sprachen am 16. August 2026, dazu 8 amerikanische Zellen, die am 16. erneut gelesen wurden und nur im Abschnitt über den Tag berichtet werden. Jede Zahl oben sagt, zu welchem Markt sie gehört. Die einzigen über Märkte hinweg zusammengefassten Zahlen sind die Vier-Arm-Zählungen im Abschnitt zur Schlagzeile, und sie sind als solche gekennzeichnet.
15 vergleichbare Paare. Das genügt, um festzustellen, dass beide Ausgänge existieren, und nicht, um zu schätzen, wie oft jeder auftritt. Behandeln Sie «11 von 15» als Veranschaulichung einer Aufteilung, nicht als Rate.
Die strenge Latte ist streng. Eine in zwei von drei Durchläufen zitierte Quelle gilt nicht als dauerhaft, ein einziger unglücklicher Durchlauf wirft also eine ganze Domain aus der Menge. Das ist eine bekannte Eigenschaft dieses Maßes und der Grund, warum die Kontrollen mehr zählen als die Überschrift.
Nichts hier ist kausal. Keine Seite wurde geändert und nichts wurde davor und danach gemessen. Dies ist, was die beiden Formen zurückgaben, kein Beleg für das Warum.
Häufige Fragen zur Form der Anfrage
Sind eine Keyword-Suche und ein KI-Prompt wirklich dieselbe Anfrage?
Es sind nicht dieselben Zeichenketten, und diese Studie handelt davon, ob das zählt. In 11 von 15 vergleichbaren Kategorien waren die Quellen dahinter identisch, für die ist der Unterschied also akademisch. In 4 waren sie nahezu disjunkt, für die ist es der Unterschied zwischen dem Messen Ihrer Sichtbarkeit und dem Messen der eines anderen.
Warum zählt ein Unterschied in den Quellen, wenn die Antwort dieselben Produkte nennt?
Weil die Quellen das sind, woran man arbeiten kann. Sie können kaum ändern, welche Produkte ein Assistent empfiehlt, aber Sie können auf einer Seite veröffentlicht, zitiert oder rezensiert werden, aus der er schöpft. Schöpfen zwei Formen derselben Frage aus verschiedenen Seiten, ändert sich mit der Form die Liste der Orte, an denen zu erscheinen sich lohnt.
Welche Kategorien waren identisch und welche nicht?
CRM, KI-Coding-Assistenten, Laufschuhe, Flugbuchung, Grammatikprüfer, Lohnabrechnung, Terminplanung, Passwortmanager, VPN-Dienste, Notiz-Apps und Website-Baukästen lieferten auf beide Arten dieselben dauerhaften Quellen. E-Commerce-Plattformen, E-Mail-Marketing, Webhosting und Geschäftskonten nicht. Wir sehen keine Eigenschaft dieser Kategorien, die die Aufteilung vorhersagt, und das ist der unangenehme Teil.
Wie führe ich diese Prüfung selbst durch?
Nehmen Sie eine Frage, die Sie ohnehin verfolgen. Schreiben Sie die Keyword-Phrase, die ein Käufer für dieselbe Absicht tippen würde. Stellen Sie jede mehrfach auf derselben Oberfläche am selben Tag, behalten Sie nur die Quellen, die jedes Mal erscheinen, und vergleichen Sie die beiden Mengen. Lesen Sie danach dieselbe Form zweimal, denn ohne diese Kontrolle können Sie einen von der Form verursachten Unterschied nicht von einer Kategorie unterscheiden, die sich einfach bewegt.
Heißt das, dass auf Prompts gestützte Werkzeuge falsch liegen?
Nein. Es heißt, dass sie auf eine Weise unvollständig sind, die niemand beziffert hatte, wir eingeschlossen, und dass die Größe der Lücke eine Eigenschaft Ihrer Kategorie ist und nicht des Werkzeugs. Ein Werkzeug, das nur Prompts stellt, hat über Prompts recht.
Was würde Ihre Meinung dazu ändern?
Mehr Kategorien, und inzwischen sind es zwei Erweiterungen. Dieses Stück veröffentlichte zuerst fünf vergleichbare Paare mit drei identischen; sechs weitere brachten es auf neun mit sieben identischen; sechs weitere bringen es auf 15 mit 11 identischen. Der Anteil hat sich über alle drei kaum bewegt, was der unspektakulärste mögliche Ausgang ist und der Grund, warum wir uns weiterhin weigern, es eine Rate zu nennen. Verschieben würde es erneut ein anderer Markt oder eine andere Oberfläche, denn all dies ist die USA auf Englisch auf AI Overview.
Wo Sie das hinstellt
Das Ergebnis ist klein, billig zu reproduzieren und unangenehm für alle, die in dieser Kategorie verkaufen, uns eingeschlossen. 4 von 19 Kategorien beantworten das Keyword eines Käufers mit einer deutlich anderen Menge von Quellen als die entsprechende Frage, und zwei dieser vier tun das, während sie vollkommen stabil sind, wenn man sie zweimal gleich fragt.
Das ist kein Argument dafür, Prompts aufzugeben. Es ist ein Argument dafür, einen Nachmittag darauf zu verwenden herauszufinden, ob Ihre Kategorie eine von denen ist, bei denen es zählt, denn die Prüfung kostet fast nichts und die Alternative ist, eine Antwort anzunehmen, die bei 4 von 19 Kategorien falsch ist.
Fragen Sie eine KI zu diesem Artikel
Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.
- ChatGPT (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Claude (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Perplexity (öffnet in neuem Tab)
- Google AI Mode (öffnet in neuem Tab)
Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.