Die Hälfte dessen, was eine KI zitiert, ist nach sechs Tagen weg. Die andere Hälfte bewegt sich kaum.
Vierzehn Kauffragen, zweimal im August gemessen und sechs Tage später erneut. Die zitierte Menge überschneidet sich zu 50 Prozent, der Kern hält 73 Prozent.
Jedes Tool für KI-Sichtbarkeit will Ihnen eine Kurve Ihrer meistzitierten Quellen über die Zeit verkaufen. Wir haben eine aus echten Messungen gebaut und dann die Frage gestellt, die die Kurve nicht beantworten kann: wenn eine Quelle daraus verschwindet, ist sie wirklich weg?
14 Kauffragen, gestellt am 15. und 16. August und erneut am 22. Dieselbe Oberfläche, derselbe Markt, dieselbe Sprache und jedes Mal dieselbe Anzahl Durchläufe. Die gesamte zitierte Menge überschneidet sich zu 50 Prozent zwischen der Basis und sechs Tagen später. Die Menge der Domains, die in beiden Basislesungen zurückkam, hält 73 Prozent.
Also ist die Hälfte dessen, was ein Assistent zitiert, binnen einer Woche eine andere, und die haltbare Hälfte ist etwas anderes und verhält sich anders. Eine Kurve mit einer einzigen Zahl kann Ihnen nicht sagen, welche Hälfte sich bewegt hat.
Transparenz und Methode: EchoWi verkauft Messung von KI-Sichtbarkeit, also ist eine Studie darüber, ob diese Kurven etwas bedeuten, eine Studie über die eigene Kategorie. Das Design, die entscheidende Kennzahl, beide Vorhersagen und die Rückzugsschwelle wurden vor dem ersten Aufruf aufgeschrieben und committet. Die Fragen, die Oberfläche, der Markt, die Daten und die Zahl beantworteter Durchläufe je Zelle stehen in unserem Messregister, und damit kann das jeder gegen uns nachstellen.
Die kurze Fassung
- Die gesamte zitierte Menge wechselt in sechs Tagen etwa zur Hälfte. Mediane Überschneidung 50 Prozent über 12 vergleichbare Zellen.
- Der Kern hält 73 Prozent. Kern heißt, die Domain kam in beiden Basislesungen zurück, nicht dass sie einmal auftauchte.
- Haltbarkeit ist eine Eigenschaft der Frage, nicht der Methode. 4 Zellen behielten ihren ganzen Kern. 4 behielten genau die Hälfte. Gleiche Oberfläche, gleicher Markt, gleiche Latte, gleiche sechs Tage.
- Drei Zellen, die perfekt stabil aussahen, waren es nicht. Alle drei bekamen Rauschen, sobald ein dritter Punkt existierte.
- Die Frage umzuformulieren kostet fast nichts. 5 von 6 Absichten lieferten am selben Tag aus einer Keyword-Form und einer Frageform eine identische Menge.
Warum ein Anteil die falsche Einheit ist
Vor der Zeitfrage steht eine Messfrage, und sie falsch zu beantworten erfindet die Antwort.
Fragen Sie dasselbe zweimal, und die Zahl der einmal zitierten Quellen bewegt sich stark. Die Zahl der jedes Mal zitierten kaum. Ein Prozentsatz aus haltbar geteilt durch gesamt hat also einen fast konstanten Zähler und einen wandernden Nenner, und das ergibt eine Zahl, die wie eine Messung aussieht und sich wie ein Münzwurf verhält.
Darunter liegt eine zweite Falle, und sie ist mehr wert, als die meisten vermuten würden. Mehr beantwortete Durchläufe sind mehr Gelegenheiten, dass eine Domain überhaupt auftaucht, also hat eine Lesung mit zehn Durchläufen eine größere Menge als eine mit drei. Vergleicht man zehn gegen eine Basis von drei, sieht der Kern aus wie eingebrochen, während in Wahrheit die zweite Lesung mehr Gelegenheiten hatte, Fremde aufzunehmen.
Diesen Störfaktor haben wir direkt über die Zellen unseres Registers mit zwei oder mehr Daten gemessen:
| Zellen | Kern | Rand | Kernanteil |
|---|---|---|---|
| Unterschiedlich viele Durchläufe | 101 | 454 | 18 % |
| Gleich viele Durchläufe | 66 | 85 | 43 % |
Die 18 Prozent maßen die Latte und nicht die Welt. Fünfundzwanzig Punkte Unterschied, aus einer Variablen, die niemand in die Kurve schreibt. Jede Zahl dieser Studie stammt aus Zellen, die an beiden Daten gleich viele Durchläufe beantworteten, und die zwei mit weniger bleiben draußen und werden getrennt gezählt, statt auf niedrigerer Latte verglichen zu werden.
Sechs Tage später
12 Zellen qualifizieren sich. Erhaltung ist der Anteil des Basiskerns, der am 22. August noch zitiert wird.
| Frage | Kern | Weiter zitiert | Erhaltung |
|---|---|---|---|
best grammar checker | 4 | 4 | 100 % |
best note taking app | 2 | 2 | 100 % |
what is the best payroll service for a small business? | 5 | 4 | 80 % |
best crm for small business | 4 | 3 | 75 % |
what is the best AI coding assistant? | 10 | 7 | 70 % |
best vpn service | 3 | 2 | 67 % |
best payroll service for a small business | 10 | 5 | 50 % |
best website to book flights | 2 | 1 | 50 % |
what are the best running shoes for beginners? | 4 | 2 | 50 % |
Median 73 Prozent gegen eine mediane Überschneidung von 50 Prozent für die gesamte zitierte Menge. Der Kern ist die haltbare Hälfte, um 23 Punkte.
Und die Verteilung zählt mehr als der Median. 4 Zellen behielten alles, 4 genau die Hälfte. Dazwischen ist wenig. Ob Ihre Kategorie eine stabile Antwort hat, ist eine Eigenschaft Ihrer Kategorie, und keine Menge Stichproben macht aus einer instabilen eine stabile.
Die perfekt aussehenden Zellen hatten nichts, was schiefgehen konnte
3 Zellen lieferten eine Basis, in der jede zitierte Domain in beiden Lesungen auftauchte. Null Rauschen. Schnell gelesen ist das der Traum: eine feste Menge Quellen, an der man arbeiten kann.
Wir sagten vor der Messung vorher, dass mindestens 2 der 3 mit einem dritten Punkt Rauschen bekommen würden, weil eine Menge, die über zwei Lesungen übereinstimmt, eine sehr niedrige Latte gerissen hat und nicht bewiesen ist.
Alle 3 taten es. Eine ging von zehn Domains ohne Rauschen auf sieben Domains, die fünf mit der Basis teilen. Eine andere von zehn auf elf, die sieben teilen.
Das ist der Teil, den eine Wochenkurve verbirgt. Eine Quelle, die zweimal aufgetaucht ist, ist nicht etabliert, und ein Tool, das Ihnen zwei Punkte und eine Gerade dazwischen zeigt, zeigt Ihnen eine Gerade.
Warum es die wechselnde Hälfte überhaupt gibt
Ein Assistent plant den Abruf bei jeder Anfrage neu. Er liest keinen festen Index vertrauenswürdiger Quellen und zitiert daraus, und die Quellen, die jede Lesung einer Frage überstehen, sehen anders aus als die, die einmal erscheinen. In diesen Zellen wird die haltbare Hälfte von wenigen großen Zielen beherrscht, die in vielen unverbundenen Fragen auftauchen, während die wechselnde Hälfte lang und dünn ist und vor allem aus Seiten besteht, die zu einer Formulierung einer Frage an einem Tag passen.
Deshalb gehören die beiden Hälften getrennt berichtet und nicht summiert. An der haltbaren Hälfte zu arbeiten ist eine andere Aufgabe als an der wechselnden, und nur eine davon lässt sich planen.
Umformulieren kostet fast nichts, und die Ausnahme ist zweimal dieselbe
Sechs der vierzehn Zellen sind dieselbe Kaufabsicht in zwei Formen, ein bloßes Keyword und eine ganze Frage. Am selben Tag und auf derselben Latte:
5 von 6 lieferten eine identische Menge Domains. Nicht ähnlich, identisch.
Die sechste ist die Lohnabrechnung, und sie wich auch in der Basis ab. Zwei Lesungen mit einer Woche dazwischen, und dieselbe Absicht ist beide Male die, die sich teilt, während die anderen fünf halten. Das ist kein Rauschen, das ist eine Eigenschaft dieser Frage.
Für jemanden, der ein Tracking-Tool kauft, ist das die nützliche Hälfte. Die Sorge, dass Ihre Zahlen davon abhängen, wie genau der Prompt formuliert war, ist real, und sie konzentriert sich auf eine Minderheit der Absichten statt gleichmäßig verteilt zu sein. Aber Sie können nicht wissen, welche Ihrer Absichten die instabile ist, ohne sie auf mehr als eine Art zu fragen, und fast nichts am Markt tut das.
Was das heißt, wenn Sie KI-Sichtbarkeitsmessung kaufen
Die Kurve ist nicht nutzlos. Sie berichtet zwei verschiedene Dinge addiert, und das nützliche ist das kleinere.
- Fragen Sie, was die Zahl zählt. Ein Prozentsatz haltbarer Quellen an allen Quellen bewegt sich vor allem mit der Gesamtzahl. Verlangen Sie die Menge.
- Fragen Sie nach der Zahl der Durchläufe und ob sie fest ist. Ein Wochenvergleich, in dem die Zahl beantworteter Durchläufe driftet, misst die Drift. Wir haben das mit fünfundzwanzig Punkten gemessen.
- Fragen Sie, ob das Tool mehr als eine Formulierung je Absicht fährt. 5 von 6 Absichten ist es egal, und die sechste zu finden ist der ganze Wert.
- Und fragen Sie, ob es Kern und Rauschen trennt, denn sechs Tage bewegten die halbe Menge und ließen drei Viertel des Kerns in Ruhe. Das sind zwei verschiedene Geschichten über Ihre Sichtbarkeit, und nur eine lohnt eine Handlung.
Wenn Sie diese Trennung für Ihre eigene Kategorie statt für unsere wollen, genau das macht unser Produkt, und die Methode oben ist die, die es benutzt.
Die Oberfläche ist nicht die größere Achse, und wir hatten es anders vorhergesagt
Das erklärte Limit dieser Studie war eine Oberfläche, also haben wir es geschlossen: dieselben 12 Zellen am selben Tag auf AI Mode gelesen, also liegt die Paarung in der Zelle und nur die Oberfläche wechselt.
Die Vorhersage, vor dem ersten Aufruf aufgeschrieben und committet, war, dass die Oberfläche mehr zählt als eine Woche. Sie tut es nicht.
| Mediane Überschneidung | |
|---|---|
| Gleiche Oberfläche, sechs Tage Abstand | 50 % |
| Beide Oberflächen, gleicher Tag | 50 % |
Das ist die Rückzugsschwelle, die das Design benannte, also wird die Behauptung, das Mischen von Oberflächen bringe mehr Rauschen als ein Monat Drift, hier zurückgezogen statt still fallen gelassen.
Und was der Jaccard verbarg, ist besser als unsere Vorhersage. Eine geringe Überschneidung zwischen einer breiten und einer schmalen Menge kann Enthaltensein statt Widerspruch beschreiben, und hier ist es Enthaltensein: median 94 Prozent der AI-Overview-Menge steckt in der AI-Mode-Menge, die 1,52-mal breiter ist. 6 der 12 Zellen sind vollständig enthalten und nur 2 fallen unter die Hälfte.
Die beiden Google-Oberflächen antworten also nicht mit anderen Quellen. Die eine antwortet mit einer Obermenge der anderen, und der Jaccard bestraft die schmale Seite dafür, schmal zu sein. Wer in AI Overview zitiert wird, wird fast sicher auch in AI Mode zitiert, und umgekehrt ist es ein Münzwurf.
Die zwei Zellen, die das brechen, gehören genannt, weil sie echter Widerspruch sind und keine Breite: beide Formulierungen der Flugfrage teilen nur 3 von 7, wobei AI Mode aus Skyscanner, Frommers und US News antwortet, wo AI Overview aus Kayak, Expedia und Quora antwortete. Gleicher Tag, gleicher Markt, gleiche Frage, zwei verschiedene Reise-Sektionen.
Zwei Google-Oberflächen sind ineinander enthalten. Die dritte nicht.
Enthaltensein ist der Befund oben, und er kam von zwei Oberflächen, die einen Index teilen. Das lässt eine Frage offen, die ein Käufer beantwortet braucht: enthält eine Oberfläche die andere, weil Abruf so funktioniert, oder weil diese zwei derselbe Abruf in zwei Breiten sind?
Gemini auf denselben 12 Zellen am selben Tag trennt das. Es ist nicht enthalten.
| Dieselben 12 Zellen, gleicher Tag | Medianes Enthaltensein |
|---|---|
| AI Overview in AI Mode | 94 % |
| Gemini in AI Mode | 42 % |
| Gemini in AI Overview | 37 % |
Das war die Rückzugsschwelle, die das Design benannte, also wird die Behauptung, eine schmale Menge stecke in einer breiten, auf das Paar begrenzt, an dem sie gemessen wurde, und nicht als Eigenschaft von Oberflächen veröffentlicht.
Und das Zahlenpaar ist der ganze Punkt. Gemini gegen AI Overview hat einen Jaccard von 0,25, AI Overview gegen AI Mode 0,50. Das sieht nach derselben Art Zahl aus, doppelt so viel Übereinstimmung im einen Fall. Es ist überhaupt nicht dieselbe Art Zahl. Das eine ist eine schmale Menge in einer breiten; das andere sind zwei Mengen, die wirklich keine Quellen teilen. Nur die Enthaltenseinszahl trennt sie, und kein Tool am Markt berichtet sie.
Gemini ist zudem etwas schmaler als AI Overview, median 0,87 seiner Größe, also geht es hier nicht um Breite. Es ist ein anderer Abruf mit dem Namen derselben Firma.
Was das heißt, wenn Sie Geld für Messung ausgeben: AI Overview zu beobachten sagt Ihnen fast alles, was Sie aus AI Mode lernen würden, und fast nichts über Gemini. Fünf der acht vergleichbaren Zellen teilen weniger als die Hälfte der Gemini-Quellen mit AI Overview. Wenn Ihr Tool eine Google-Zahl meldet, fragen Sie, von welcher Oberfläche sie kam, denn die andere ist ein anderer Markt.
Und das Ineinanderstecken ist amerikanisch
Wenn eine Google-Oberfläche die andere enthält, weil sie einen Index teilen, muss das in jedem Markt auftauchen. Also dieselben acht Absichten auf Deutsch, in Deutschland, auf beiden Oberflächen, je Paar in einem Aufruf, damit die zwei Lesungen nicht auseinanderlaufen können.
Es taucht schwächer auf.
| Medianes Enthaltensein, AI Overview in AI Mode | |
|---|---|
| Vereinigte Staaten | 94 % |
| Deutschland, alle vergleichbaren Zellen | 50 % |
| Deutschland, die 5 Zellen mit drei Durchläufen | 67 % |
50 Prozent war die Rückzugsschwelle, die das Design benannte, also ist die amerikanische Zahl jetzt eine Aussage über diesen Markt und nicht über Googles Architektur.
Beide deutschen Zahlen sind ehrlich, und sie unterscheiden sich aus einem Grund, den man aussprechen sollte. Enthaltensein ist ein Anteil der AI-Overview-Menge, also werden beide Mengen schmaler, wenn beide Oberflächen weniger Durchläufe beantworten, und der Anteil fällt. Die zwei Zellen mit zwei Durchläufen sind die zwei niedrigsten der Tabelle. Das verzerrt diesen Arm nach unten, das Gegenteil des Gemini-Arms, wo nur eine Seite die Latte bewegte und eine niedrige Latte das Enthaltensein nach oben schob. Eine Durchlaufzahl ist keine neutrale Einstellung: wohin sie eine Zahl biegt, hängt davon ab, welche Seite des Bruchs sie verschmälert.
Und die Kontrolle ist das, was den Arm bedeutsam macht. Hätten die deutschen Antworten dieselben Quellen genutzt wie die amerikanischen, wäre das ein Markt, zweimal gemessen. Sie tun es nicht: Frage für Frage verbunden liegt die mediane Überschneidung zwischen deutscher und amerikanischer Quellenmenge bei 0,11, von 0,03 bis 0,27, und die zwei niedrigsten Zellen teilen eine einzige Domain von gut dreißig. Deutschland ist eine andere Quellenmenge, und darin verhalten sich die zwei Oberflächen anders zueinander.
Eine deutsche Zelle lieferte über drei Durchläufe kein AI Overview. Das ist eine Oberfläche, die nicht erscheint, keine Null, und sie wird ausgeschlossen und benannt statt gezählt.
Was das einen Käufer kostet: die Abkürzung ist lokal. In den Vereinigten Staaten sagt Ihnen AI Overview fast alles über AI Mode. In Deutschland sagt es Ihnen zwischen der Hälfte und zwei Dritteln, und die deutsche AI-Mode-Menge ist 1,67-mal breiter. Wer in mehr als einem Land verkauft, hat dort zwei Messungen und nicht eine.
Was das nicht zeigt
- Drei Google-Oberflächen und zwei Märkte. Erhaltung ist nur AI Overview in den Vereinigten Staaten; die Oberflächenhälften ergänzen AI Mode und Gemini auf denselben Zellen, und die Markthälfte wiederholt die Enthaltenseinsmessung in Deutschland. ChatGPT und Perplexity rufen anders ab, und auf diesem Weg liefert ChatGPT überhaupt keine Quellen, seine Null wäre also das Instrument.
- Zwei Märkte und zwei Sprachen. Alles vor dem Marktabschnitt sind die Vereinigten Staaten auf Englisch; die Enthaltenseinsmessung wird in Deutschland auf Deutsch wiederholt, und die marktübergreifende Kontrolle steht im Register.
- Zwei Punkte und dann ein dritter. Sechs Tage sind ein Intervall und kein Trend, und nichts hier sagt, dass die Wechselrate konstant ist.
- 12 vergleichbare Zellen. Ein Median über 12 ist eine Richtung und keine genaue Zahl, und die zwei wegen niedrigerer Latte ausgeschlossenen Zellen stehen namentlich im Register, statt still zu verschwinden.
- Nichts davon ist kausal. Wir haben gemessen, was sich änderte, nicht warum.
Häufige Fragen
Was ist der Unterschied zwischen Kern und Rest?
Der Kern ist die Menge der Domains, die in jeder Lesung einer Frage zitiert werden, nicht nur in einigen. Der Rest tauchte mindestens einmal auf. Die Unterscheidung zählt, weil sich beide über die Zeit anders verhalten: in dieser Studie hielt der Kern 73 Prozent über sechs Tage, und die gesamte Menge überschnitt sich zu 50 Prozent.
Macht häufigeres Fragen die Zahl stabiler?
Nicht so, wie man erwartet. Mehr Durchläufe erhöhen die Zahl der mindestens einmal gesehenen Quellen, also wird eine strenge Kennzahl jedes Mal zitiert schwerer zu erfüllen, je mehr man misst. Deshalb müssen Vergleiche über die Zeit die Zahl der Durchläufe festhalten, und deshalb haben wir fünfundzwanzig Punkte Unterschied zwischen gemischten und gleichen Latten gemessen.
Ist eine Quelle, die aus der Kurve verschwand, wirklich weg?
Oft nicht. In dieser Studie war die Hälfte der gesamten zitierten Menge nach sechs Tagen anders, während drei Viertel des Kerns blieben. Eine Domain, die aus einer Wochenansicht fällt, war womöglich die ganze Zeit in der wechselnden Hälfte, und deshalb zeigt die nützliche Kurve Kern und Rand getrennt statt einer Linie.
Wie oft sollte ein Tool jede Frage stellen?
Oft genug, um eine stabile Zitation von einem Zufall zu unterscheiden, und jedes Mal gleich oft, wenn es vergleicht. Wichtiger als die genaue Zahl ist, dass sie zwischen den verglichenen Wochen nicht driftet, denn dann misst der Vergleich die Stichprobe und nicht den Markt.
Ändert die Formulierung des Prompts die Antwort?
Für die meisten Absichten nicht. 5 von 6 Absichten lieferten hier am selben Tag aus einer Keyword-Form und einer Frageform eine identische Menge. Die sechste lieferte an beiden Messdaten unterschiedliche Mengen, und deshalb ist es ehrlich, jede Absicht auf mehr als eine Art zu fragen, statt die Formulierung für sicher zu halten.
Fragen Sie eine KI zu diesem Artikel
Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.
- ChatGPT (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Claude (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Perplexity (öffnet in neuem Tab)
- Google AI Mode (öffnet in neuem Tab)
Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.