Zum Inhalt springen
KI-SichtbarkeitGEO
DE

Eine Dauerhaftigkeitszahl ist nicht, wonach sie aussieht. Das hier sagt eine nennbare Antwortmenge tatsächlich vorher.

Sechs Fragen tief gelesen, dann dieselbe Absicht dreimal gestellt. Nur eine Formulierung liefert eine Quellenmenge, die man einem Käufer geben kann.

· Aktualisiert · 49 Min. Lesezeit

Gestern haben wir einen Mechanismus veröffentlicht: Man liest eine Kauffrage achtmal und zwölf Quellen kommen in je sieben Durchläufen zurück, mit einem Durchlauf, der nichts außer Google zitiert, sodass eine strenge Latte alle zwölf auf einmal fallen lässt, sobald die Stichprobe diesen Durchlauf enthält. Wir haben das als Eigenschaft der Oberfläche geschrieben. Heute haben wir vier weitere Fragen mit demselben Satzbau, derselben Oberfläche und demselben Markt gestellt, und die Form erscheint in keiner der 4 Fragen, die wir hinzugefügt haben. CRM liefert neun Domains und alle neun nehmen jeden Durchlauf, zweimal gemessen. Webhosting liefert 41 und keine nimmt ihn. Onlineshops liefern 64 und keine nimmt ihn. Also sind “null dauerhafte Quellen” mindestens drei verschiedene Tatsachen unter einer einzigen Zahl, und wir hatten vom mittleren Fall aus verallgemeinert.

Das Nützliche ist nicht der Widerruf. Es ist, dass die drei Fälle gegensätzliche Reaktionen verlangen und die Zahl sie nicht auseinanderhalten kann.

Transparenz: EchoWi verkauft Messung von KI-Sichtbarkeit, und dieser Text grenzt eine gestern veröffentlichte Aussage und eine Kennzahl ein, die wir in neun Studien verwenden. Jede Frage, mit der Oberfläche und dem Markt, in denen sie gestellt wurde, ihrer Zahl von Durchläufen und jeder Domain mit ihrer Zählung, steht in unserem Messregister, das lässt sich also gegen uns wiederholen. Das Stück ist weit über die eine Oberfläche und den einen Markt hinausgewachsen, mit denen es begann, und der Abschnitt zu den Grenzen am Ende sagt genau, wie weit.


Die kurze Fassung

  1. Der Durchgang: sechs Fragen, ein Satzbau, eine Oberfläche, ein Markt, ein Tag. Nur die Kategorie ändert sich. Alles danach weitet eine dieser Achsen.
  2. CRM liefert neun Domains und alle neun sind in jedem beantworteten Durchlauf zitiert, für diese Zeichenkette. Am selben Tag erneut gelesen, dieselben neun Domains, wieder alle. Einstimmigkeit ist erreichbar, und Punkt 7 sagt, was sie kostet.
  3. Drei Fragen liefern nichts Dauerhaftes, und nicht aus dem Grund von gestern. Passwortmanager, Webhosting und Onlineshops zeigen gewöhnliche Streuung: keine geteilte Zahl, kein einsames Google, nur ein langer Rand.
  4. Die Form von gestern erscheint in 2 von 6 Fragen. Sie ist echt und sie ist nicht die Oberfläche.
  5. Die Kontrolle, auf die es ankommt: CRM und Buchhaltung beantworteten beide fünf Durchläufe. Gleiche Tiefe, gleiche Oberfläche, gleicher Markt, gleicher Satzbau. Neun von neun gegen null von dreizehn.
  6. Tief gelesen überlebt nur eine feste Menge. Diese Form bei drei Durchläufen ist vor allem eine flache Latte, und eine Zelle, die im Vereinigten Königreich fest wirkte, behält bei sieben Durchläufen nichts.
  7. Dieselbe Absicht in drei Formulierungen: 9 zitiert und 9 behalten, dann 80 und keine, dann 100 und keine. Gleicher Markt, gleiche Oberfläche, gleicher Tag. Eine feste Antwortmenge gehört der Oberfläche und der Zeichenkette zusammen, und dieselbe Sache auf der anderen Oberfläche zu stellen zeigt, welcher von beiden.
  8. Was eine nennbare Menge vorhersagt, ist nicht die Zahl der Durchläufe, sondern wie breit die Antwort zitiert. Lesungen, die neun Domains oder weniger zitieren, behalten 56 bis 100 Prozent davon; Lesungen mit dreizehn oder mehr behalten höchstens 40 Prozent.
  9. Und die breiteste Kategorie ist auf der anderen Oberfläche nicht breit. Drei derselben Zeichenketten im AI Overview zitieren je 6 oder 7 Domains, alle dauerhaft. E-Commerce sind 104 im AI Mode und 6 hier, das Rätsel, um das es auf dem Rest dieser Seite geht, gehört also dem AI Mode und nicht den Kategorien.

Was wir getan haben

Die gestrige Lesung nahm zwei Fragen auf AI Mode in den Vereinigten Staaten und forderte je zehn Durchläufe an. Heute haben wir denselben Satzbau genommen, “was ist das beste X für ein kleines Unternehmen”, und vier weitere Kategorien genauso gefahren. Nichts hat sich geändert außer der Kategorie.

Jede Lesung brach vor zehn ab. Das steht hier, weil der Nenner jeder Zählung unten die Durchläufe sind, die stattfanden, und nicht die angeforderten, und diese Nenner unterscheiden sich von Zeile zu Zeile.

Sechs Fragen, drei Formen

KategorieBeantwortete DurchläufeZitierte DomainsIn jedem zitiertHöchste Zahl
CRM5995, von allen neun
Gehaltsabrechnung81307, von zwölf
Buchhaltung51304, von zwölf
Passwortmanager41903, von zwei
Webhosting74105, von drei
Onlineshop-Plattformen46403, von vier

Lesen Sie die letzte Spalte vor der vierten. Vier dieser sechs Zeilen melden null dauerhafte Quellen, und die letzte Spalte sagt, dass sie auf drei verschiedenen Wegen dorthin kamen.

CRM ist einstimmig. Neun Domains, jede davon in allen fünf Durchläufen, und überhaupt kein Rand. Nichts wurde einmal zitiert.

Gehaltsabrechnung und Buchhaltung sind die Form von gestern. Zwölf Domains auf der identischen Zahl, eine unter allen Durchläufen, und eine Domain allein in dem Durchlauf, der ihnen allen fehlt. Ein Durchlauf weicht ab, die anderen sieben oder vier stimmen vollständig überein.

Passwortmanager, Hosting und Onlineshops sind Streuung. Die höchste Zahl erreichen zwei, drei oder vier Domains, und alles andere franst aus. Onlineshops zitieren 64 Domains über vier Durchläufe, davon erscheinen 52 genau einmal.

Diesen dreien fehlt ein entarteter Durchlauf, dem man die Schuld geben könnte. Sie haben einen Abruf, der jedes Mal eine andere Menge wählt.

Die Kontrolle, und warum sie die wichtige Zeile ist

Der naheliegende Einwand gegen CRM ist die Tiefe: Es beantwortete fünf Durchläufe und Gehaltsabrechnung acht, vielleicht wirkt CRM also nur einstimmig, weil es weniger tief gelesen wurde.

Buchhaltung beantwortete ebenfalls fünf Durchläufe. Gleiche Tiefe, gleiche Oberfläche, gleicher Markt, gleicher Satzbau, gleicher Tag. Buchhaltung liefert null dauerhafte Quellen von dreizehn zitierten. CRM liefert neun von neun.

Die Zahl der Durchläufe erklärt den Unterschied also nicht, und die Latte auch nicht. Was sie trennt, ist die Kategorie.

Wir haben die beste Zahl erneut gemessen, gerade weil sie die beste war

Neun von neun ohne Rand ist die Art Ergebnis, die für gewöhnlich ein Artefakt ist. Unsere eigene Regel lautet, die Zahl erneut zu messen, die die Schlussfolgerung am stärksten ändern würde, wenn sie fiele, also wurde CRM am selben Tag noch einmal gefragt.

Drei beantwortete Durchläufe beim zweiten Mal. Dieselben neun Domains, nach Namen geprüft, und alle neun in allen drei Durchläufen zitiert: www.youtube.com, www.reddit.com, www.salesforce.com, slack.com, www.pcmag.com, www.uschamber.com, www.zoho.com, www.hubspot.com und fayedigital.com.

Sie hat überlebt. Das zählt mehr als die erste Lesung, denn es heißt, dass es Kategorien gibt, in denen diese Oberfläche aus einer festen Menge antwortet, und dass man einem Käufer in einer davon genau die neun Seiten nennen kann, welche die Antwort auf diese Frage in dieser Formulierung halten. Zwei Abschnitte weiter nimmt eine Umformulierung die Menge wieder weg.

Und die feste Menge gehört dem Markt, nicht der Kategorie

Das CRM-Ergebnis lädt zu einer naheliegenden Frage ein, also haben wir sie am selben Tag gestellt: Ist eine feste Antwortmenge eine Eigenschaft der Kategorie oder des Marktes, in dem sie gemessen wurde? Dieselbe Frage, übersetzt, auf derselben Oberfläche in Spanien, Frankreich und Deutschland.

MarktBeantwortete DurchläufeZitierte DomainsIn jedem zitiert
Vereinigte Staaten599
Spanien4500
Frankreich6420
Deutschland6631

Eine Kategorie, ein Satzbau, 4 Märkte. Die Vereinigten Staaten zitieren neun Quellen und behalten alle neun. Die anderen drei zitieren zwischen 42 und 63 und behalten höchstens eine.

Eine Kontrolle, bevor diese Tabelle als Geschichte über Märkte gelesen wird. Jede ihrer Zeilen ist AI Mode, und unsere Zählung der Verlagsschicht wurde auf AI Overview gemessen. Am selben Tag auf AI Overview in Frankreich gestellt, zitiert dieselbe Frage 8 Domains und behält 5 davon bei vier beantworteten Durchläufen. Auf AI Mode im selben Markt zitiert sie 42 und behält keine. Dieses Paar ist allerdings nicht auf Durchläufe abgeglichen, und der Unterschied zählt: vier gegen sechs, und mehr Durchläufe sind mehr Gelegenheiten, Neues zu zitieren. Richtig abgeglichen, über die 10 Zellen, in denen beide Oberflächen dreimal gelesen wurden, zitiert AI Mode in 7 mehr und der Median des Verhältnisses liegt bei 1,39, mit einer Spanne von 0,92 bis 6,50. Die Richtung überlebt also und die Größe nicht: die Oberfläche ändert durchaus, wie viele Quellen überhaupt zitiert werden, um etwa die Hälfte mehr in der typischen Zelle statt um das Fünffache, und ein auf einer Oberfläche gemessener Platz sagt weiterhin nichts über die andere.

Spanien liefert 50 Domains über vier beantwortete Durchläufe und keine, die in allen zitiert wird. Erneut gelesen, 34 Domains über fünf Durchläufe mit genau einer, die jedes Mal zitiert wird. Keine der beiden Lesungen sieht aus wie die neun von neun ohne Rand, die die Vereinigten Staaten lieferten.

Die beiden spanischen Lesungen stimmen nicht einmal untereinander überein. Die Domain, die in der ersten am höchsten stand, bei drei von vier Durchläufen, sitzt in der zweiten bei einem von fünf. Die Domain, die die zweite in allen fünf Durchläufen hat, war in der ersten bei zwei von vier.

Und die amerikanische Menge hielt über Nacht, und dann hielt sie der Tiefe stand. Am nächsten Tag mit sechs Durchläufen erneut gefragt, kamen dieselben neun Domains zurück, jede davon in jedem Durchlauf zitiert, und ein viertes Mal mit acht gefragt, wieder dieselben neun. Die Tiefe ist die Achse, die eine feste Menge am stärksten bedroht, denn mehr Durchläufe sind mehr Gelegenheiten, etwas Neues zu zitieren, und hier kaufte sie gar nichts. Das sind 4 Lesungen über 2 Tage und 22 beantwortete Durchläufe, die jedes Mal dieselbe Menge namentlich zurückgeben, ohne Rand an irgendeiner Stelle. Unsere Arbeit über zwei Tage bei anderen Fragen ergab eine Median-Überschneidung der Quellen von 0,63; diese Zelle liegt bei eins.

Und diese hielt, als eine zweite Kategorie gestellt wurde, was heute als Erstes gelingt. Geschäftskonten in den Vereinigten Staaten zitieren 7 Domains und behalten alle 7 bei acht Durchläufen, die sauberste schmale Zelle hier. In Spanien auf Spanisch und auf derselben Oberfläche gestellt, zitiert sie 14 und behält 2. Gleiche Kategorie, gleiche Oberfläche, anderer Markt, und die Form kippt genau wie bei CRM.

Fünf beantwortete Durchläufe gegen acht, und beide Hälften sprechen für den Befund statt gegen ihn: weniger Durchläufe können nur weniger Domains zitieren, und weniger Durchläufe machen Einstimmigkeit leichter.

Drei Aussagen dieses Artikels wurden heute innerhalb weniger Stunden nach ihrer Veröffentlichung eingegrenzt, jede von der nächsten gemessenen Zelle. Diese wurde genauso geprüft und bewegte sich nicht, auf sie kann man sich also stützen: eine feste Antwortmenge gehört einer Kategorie in einem Markt, und der Markt leistet mehr Arbeit als die Kategorie.

Der Satz oben braucht also einen Markt daneben. Es gibt Kategorien in einem Markt, in denen diese Oberfläche aus einer festen Menge antwortet. Dieselbe Kategorie eine Grenze weiter wird jedes Mal frisch zusammengesetzt, und einem Käufer dort kann man die Seiten, welche die Antwort halten, nicht nennen, weil es keine solche Menge zu nennen gibt.

Und sie gehört der Formulierung und der Oberfläche, nicht nur dem Markt

Danach blieb eine Frage, und sie entscheidet, ob das alles brauchbar ist. Die neun Domains hielten über 4 Lesungen, 22 Durchläufe und 2 Tage, sind also kein Zufall einer Sitzung. Aber alle vier Lesungen stellten dieselbe Zeichenkette. Also stellten wir dieselbe Absicht, im selben Markt, auf derselben Oberfläche und am selben Tag, mit anderen Worten: welches CRM sollte ein kleines Unternehmen wählen?

Sieben beantwortete Durchläufe. 80 zitierte Domains und keine in allen Durchläufen, der höchste Wert 5 von 7, und 59 Domains genau einmal zitiert. Das ist die breiteste Lesung des Registers, und sie kommt aus der Zelle, die wir gerade den einzigen Ort genannt hatten, an dem man einem Käufer eine Liste geben kann.

Die neun sind nicht verschwunden, und das ist der Teil zum zweimal Lesen. Acht stehen in dieser Lesung, bei 1 bis 3 von 7 Durchläufen: slack.com bei 3, www.hubspot.com bei 2, sowie www.youtube.com, www.reddit.com, www.salesforce.com, www.pcmag.com, www.zoho.com und fayedigital.com bei je 1. Nur www.uschamber.com fehlt. Die Quellen sind weiterhin da. Was sich ändert, ist, ob die Antwort jedes Mal aus ihnen gebaut wird oder aus einem langen Schwanz, der sie enthält.

Beide bisherigen Umformulierungen nutzten denselben Rahmen, also stellten wir eine dritte, die das nicht tut. «Welches CRM sollte ein kleines Unternehmen wählen» ist weiterhin eine Frage mit einem Modalverb darin, und die Verbreiterung hätte dieser Konstruktion gehören können statt dem Umformulieren. Also stellten wir einen Imperativ ganz ohne Frage: empfiehl ein CRM für ein kleines Unternehmen. Acht Durchläufe angefordert und acht beantwortet, die tiefste Lesung des Registers. Sie zitiert 100 Domains und behält keine, der höchste Wert 5 von 8, und 66 Domains genau einmal zitiert. Vier der festen neun fehlen, und der beste der übrigen steht bei 3 von 8.

Dieselbe Absicht, dreimal gestelltDurchläufeZitiertIn allen
Was ist das beste CRM für ein kleines Unternehmen?599
Welches CRM sollte ein kleines Unternehmen wählen?7800
Empfiehl ein CRM für ein kleines Unternehmen.81000

Zwei strukturell verschiedene Umformulierungen verbreitern beide, es ist also keine Konstruktion, die sich danebenbenimmt.

Aber es ist eine Oberfläche, die sich danebenbenimmt, und das ist die Grenze, die diesem Ergebnis fehlte. Der Imperativ wurde am selben Tag, im selben Markt und mit derselben Zeichenkette erneut gestellt, auf AI Overview statt AI Mode. Er zitiert 12 Domains und behält 3, gegen 100 und keine. Acht der festen neun stehen darin, drei davon in jedem beantworteten Durchlauf.

Der Einbruch gehört also AI Mode und nicht dem Umformulieren an sich. Auf AI Overview lässt dieselbe Umformulierung, die die AI-Mode-Menge zertrümmerte, eine schmale stehen. Die ehrliche Lesart der drei Tabellen oben ist, dass die Oberfläche festlegt, wie breit eine Antwort werden kann, und die Formulierung einen Punkt in dieser Spanne wählt.

Und diese Lesart ist bereits zu stark, denn die zweite Absicht wiederholt sie nicht. Die Frage zur KI-Sichtbarkeit wurde am selben Tag mit derselben Zeichenkette auf beiden Oberflächen gestellt, und beide Lesungen beantworteten fünf Durchläufe, es gibt also keine Tiefe zu diskutieren. AI Mode zitiert 29 gegen 21 bei AI Overview, und beide behalten 2.

Dieses Verhältnis ist 1,38, und dieses Register hat bereits einen Median von 1,39 über zehn nach Durchläufen gepaarte Zellen veröffentlicht. Das frische Paar landet auf unserem eigenen Median, was das CRM-Paar mit 100 gegen 12 zum Ausreißer macht und nicht zur Regel.

Keine einzelne Achse dominiert also. Oberfläche, Zeichenkette und Markt bewegen alle die Breite einer Zelle, die Kategorie nicht, und das CRM-Ergebnis ist die Stelle, an der sich alle drei zugleich ausrichteten. Wer eine Zahl aus diesem Artikel mitnimmt, sollte den Median mitnehmen und nicht den Extremwert.

Die Durchläufe sind fünf gegen acht, und die beiden Hälften davon wirken in entgegengesetzte Richtungen, also werden beide genannt. Weniger Durchläufe können nur weniger Domains zitieren, der Breitenunterschied ist also konservativ und würde mehr Durchläufe überstehen. Weniger Durchläufe machen Einstimmigkeit auch leichter, die 3 ist also die großzügige Richtung, und wir stützen uns nicht darauf. Und diese Tabelle liest man von oben nach unten und nicht in die Breite: die schmale Zeile ist eine Formulierung von dreien, und sie ist die flachste der drei. Eine feste Antwortmenge ist kein Ort, den man finden und dann besetzen kann. Sie ist eine Zeichenkette unter den vielen, die ein Käufer tippen könnte.

Eine feste Antwortmenge gehört also der Oberfläche und der Zeichenkette zusammen, dann dem Markt, und der Kategorie gar nicht.

Außerhalb des Englischen tut dieselbe Umformulierung etwas anderes, und das ist die nützlichere Hälfte. Das französische CRM auf AI Overview, zweimal gelesen, behält 5 von 9 zitierten und 5 von 8. Mit demselben imperativen Rahmen gefragt, recommandez un CRM pour une petite entreprise, zitiert es 18 und behält 4. Die dauerhafte Zahl bewegte sich kaum. Ihre Namen schon: nur www.shine.fr und foxeet.fr stehen in beiden, 2 der 7 verschiedenen Domains, die beide Lesungen zusammen behalten.

Das englische Ergebnis, bei dem die Umformulierung die dauerhafte Zahl auf null bringt, ist also nicht die allgemeine Form. Im Französischen überlebt die Zahl die Umformulierung und die Namen darunter werden ausgetauscht, was dieselbe Asymmetrie ist, die dieses Register auf anderen Achsen schon gemessen hat, und die gefährlichere von beiden: eine Zahl, die stillsteht, liest sich wie eine Menge, die stillsteht.

Was ein Tracking mit einem einzigen Prompt wirklich sieht

Die drei CRM-Formulierungen sind dieselbe Absicht, derselbe Markt, dieselbe Oberfläche und derselbe Tag, ihre Quellen lassen sich also zusammenlegen. Zusammen zitieren sie 131 verschiedene Domains, und so viel hätte Ihnen jede einzelne davon gezeigt.

FormulierungZitierte DomainsAnteil an den 131
Was ist das beste CRM für ein kleines Unternehmen?97%
Welches CRM sollte ein kleines Unternehmen wählen?8061%
Empfiehl ein CRM für ein kleines Unternehmen.10076%

Fünf Domains erscheinen in allen dreien: www.youtube.com, www.reddit.com, www.salesforce.com, slack.com und www.hubspot.com. 78 der 131, also 60%, erscheinen in genau einer der drei.

Rechnen Sie selbst nach: Legen Sie die Domainlisten der drei Lesungen in unserem Messregister zusammen, zählen Sie die verschiedenen Einträge und teilen Sie den Wert jeder Lesung durch diese Summe.

Das ist die praktische Fassung von allem oben. Ein Werkzeug, das einen Prompt je Absicht verfolgt, so wie diese Kategorie verkauft wird und wie unser eigenes Panel heute arbeitet, zeigt Ihnen zwischen 7 und 76 Prozent der Quellen, die die Antworten auf diese Absicht bauen, und Sie können nicht erkennen, an welchem Ende Sie stehen, ohne dieselbe Frage anders zu stellen. Was eine einzelne Formulierung erreicht, ist nicht der größte Teil, und was alle drei überlebt, sind fünf Domains, davon zwei Plattformen statt Verlage.

Die zweite Absicht begrenzt diese Spanne und schärft den Befund, statt ihn abzuschwächen. Die Frage zur KI-Sichtbarkeit wurde ebenfalls dreimal gestellt, und ihre drei Lesungen beantworteten alle fünf Durchläufe, diese Kurve trägt also nirgends einen Tiefenunterschied. Sie ergeben zusammen 44 verschiedene Domains, und jede Lesung sieht 41 bis 52 Prozent davon, weit über dem Boden von 7 Prozent der CRM-Menge. Die breite Spanne oben gehört also jener Absicht, und genauer dem Umstand, dass eine ungewöhnlich schmale Formulierung darin steckt.

Was über beide Absichten hält, ist die andere Zahl. 32 der 44 Domains, also 73 Prozent, erscheinen in genau einer der drei Formulierungen, gegen 60 Prozent bei CRM. Und die Kurve wiederholt sich: eine Formulierung erreicht im Median 48 Prozent dessen, was die drei finden, zwei erreichen 75, gegen 61 und 79 bei CRM. Wie viel eine einzelne Formulierung erreicht, schwankt stark zwischen Absichten. Wie viel nur über eine einzige Formulierung erreichbar ist, nicht, und es ist in beiden die Mehrheit.

Was kauft also eine zweite Formulierung? Nimmt man die drei CRM-Lesungen in jeder möglichen Reihenfolge, damit die Antwort nicht davon abhängt, mit welcher Formulierung man zufällig angefangen hat: eine Formulierung erreicht im Median 61 Prozent dessen, was die drei zusammen finden, zwei erreichen im Median 79 Prozent.

Der Median ist nicht das Interessante. Der Boden ist es. Eine Formulierung reicht von 7 bis 76 Prozent, je nachdem, welche man genommen hat. Zwei reichen von 62 bis 99. Die zweite Formulierung kauft an einem guten Tag sehr wenig und rettet einen an einem schlechten ganz, was die Form einer Versicherungsprämie hat und nicht die einer besseren Abdeckung.

Und die dritte zeigt 100 Prozent durch Konstruktion, nicht durch Messung. Der Nenner ist die Vereinigung der Formulierungen, die wir gelaufen sind, also schließt die letzte ihn immer. Diese Zahl ist Arithmetik und kein Beleg, und wer Ihnen eine Abdeckungskurve aus einer Stichprobe von Prompts zeigt, schuldet Ihnen denselben Vorbehalt. Wir können sagen, was eine Formulierung gegenüber dreien verfehlt; wir können nicht sagen, was die drei verfehlen.

Und in der Kategorie, um die es hier geht, funktioniert keine Formulierung

Alles oben ist in fremden Kategorien gemessen, und das mit Absicht: sie sind umkämpft, kommerziell und haben nichts mit uns zu tun. Wer das hier liest, sucht aber meist ein Werkzeug für KI-Sichtbarkeit, also haben wir dasselbe Design auf diese Frage angewandt, auf AI Overview in den Vereinigten Staaten.

Beide Lesungen beantworteten fünf Durchläufe, womit dies das einzige Formulierungspaar des Registers ohne jeden Tiefenunterschied zwischen seinen Seiten ist.

KI-Sichtbarkeitswerkzeuge, Vereinigte StaatenDurchläufeZitiertIn allen
Was ist das beste Werkzeug zur Verfolgung von KI-Sichtbarkeit für eine Marke?5212
Empfiehl ein Werkzeug zur Verfolgung von KI-Sichtbarkeit für eine Marke.5183

Keine der beiden Formulierungen liefert eine Menge, die man einem Käufer geben könnte, auch nicht der Rahmen «was ist das beste», der bei CRM die festen neun lieferte. Die beiden zitierten Mengen teilen 7 Domains von 32 verschiedenen, eine Überschneidung von 0,22, und von den fünf dauerhaften Plätzen beider Lesungen hält genau eine Domain in beiden: www.youtube.com.

Dabei lohnt es sich zu verweilen, wenn man in dieser Kategorie verkauft, und für niemanden darin ist es ein bequemer Befund. Wer einen Assistenten fragt, welches Werkzeug er nehmen soll, bekommt keine stabile Auswahlliste, bekommt je nach Formulierung eine andere, und die einzige Quelle, die die Umformulierung überlebt, ist eine Videoplattform und kein Anbieter, keine Bewertungsseite und kein Vergleich.

Und es hat sich in einer anderen Kategorie auf der anderen Oberfläche wiederholt. Geschäftskonten in den Vereinigten Staaten zitierten 7 Domains und behielten alle 7 bei acht Durchläufen, die sauberste schmale Zelle des Registers. Gefragt als welches Konto sollte ein kleines Unternehmen eröffnen, zitiert sie 25 und behält 3. Sechs der ursprünglichen sieben sind weiterhin da, bei 1 bis 5 von 5 Durchläufen, und www.nerdwallet.com wird weiterhin jedes Mal zitiert.

Die Durchlaufzahlen unterscheiden sich, fünf gegen acht, und das spricht für den Befund statt gegen ihn. Weniger Durchläufe können nur weniger Domains zitieren, und diese zitierte dreieinhalbmal so viele. Weniger Durchläufe machen Einstimmigkeit auch leichter, und der dauerhafte Anteil fiel trotzdem von allen Domains auf drei von fünfundzwanzig. Die Version mit strenger Latte kannten wir schon aus vier Formulierungen einer Hotelfrage, bei der keine Domain alle vier überlebte. Dies ist die starke Form: nicht dass die dauerhafte Menge beim Umformulieren schrumpft, sondern dass eine Zelle von neun von neun ohne Schwanz auf achtzig zitierte und nichts Dauerhaftes fällt, eine Umformulierung entfernt.

Und eine feste Menge bei drei Durchläufen ist meistens keine

Die Form, die CRM besonders wirken ließ, jede zitierte Domain nimmt jeden Durchlauf, ist bei drei Durchläufen nicht selten. Unsere Studie über abgeglichene Kategorien hat solche Zellen in mehreren Märkten, also nahmen wir die stärkste außerhalb der Vereinigten Staaten und lasen sie tief auf ihrer eigenen Oberfläche.

Gehaltsabrechnung im Vereinigten Königreich zitierte bei drei Durchläufen 8 Domains, und alle 8 nahmen ihn. Siebenmal auf dieselbe Weise gelesen, zitiert sie 19 und 0 nehmen ihn, mit der höchsten Zahl bei 6 von 7.

Die Drei-Durchlauf-Fassung dieser Form ist also vor allem eine flache Latte. Sie sagt, dass eine Kategorie wenige offensichtliche Quellen hat, nicht dass sie eine feste Menge hat, und beides sieht identisch aus, bis jemand tiefer liest. Von allen Zellen, die wir inzwischen tief gelesen haben, ist die amerikanische CRM-Zelle die einzige feste Menge, die überlebt hat.

Das ist auch eine Warnung zu unseren eigenen veröffentlichten Tabellen. Jede Dauerhaftigkeitszahl der Studie über abgeglichene Kategorien steht bei drei Durchläufen, was sie zu einer fairen Grundlage macht, um Zellen miteinander zu vergleichen, und zu einer schlechten, um einem Käufer zu sagen, welche Seiten eine Antwort halten.

Wir haben eine Frage sechsmal hintereinander gelesen, und der Zählwert bewegte sich jedes Mal

Alles davor liest eine Frage einmal in die Tiefe oder liest sie an einem anderen Tag erneut. Keines von beiden beantwortet die schlichtere Frage, die ein Käufer zuerst stellt: Wenn ich das morgen und übermorgen laufen lasse, sehe ich dann dieselbe Zahl?

Also haben wir eine Frage sechsmal hintereinander gelesen, auf einer Oberfläche, drei Durchläufe je Lesung, und das Ganze mit einer zweiten Frage in einem anderen Markt und einer anderen Sprache wiederholt. Das sind 13 Aufrufe und 38 beantwortete Durchläufe, alle am 14. August 2026. Das Design wurde vor dem ersten Aufruf aufgeschrieben, einschließlich dessen, was es widerlegen würde, denn das Register trug diese Frage bereits offen und wir wollten sie nicht dadurch beantworten, dass wir hinterher die Auswertung wählen.

Diese offene Frage war, ob wiederholtes Messen die beobachtete Menge schrumpfen lässt. Fünf Lesungen eines Prompts am 10. August ergaben 18, 14, 11, 13 und 9 zitierte Domains, sie wurden der Reihe nach genommen, und eine fallende Folge in dieser Reihenfolge lässt sich nicht von Rauschen unterscheiden. Wäre sie echt, ginge sie alle etwas an, denn sie hieße, dass das Beobachten das Beobachtete verschlechtert.

Sie ist nicht echt. Sechs Lesungen der spanischen Frage ergaben 7, 6, 7, 9, 8 und 10 Domains, und die höchste der sechs ist die letzte. Die amerikanische Frage wurde ebenfalls sechsmal gelesen, davon schlossen fünf drei Durchläufe ab und eine brach bei zwei ab; die fünf ergaben 7, 15, 7, 7 und 7. Nichts schrumpft.

Die Sitzung erklärt es ebenso wenig, und das zu zeigen kostete eine weitere Zelle. An Position sechs des ersten Arms haben wir eine Frage eingeschoben, die in dieser Sitzung nie gestellt worden war, gleicher Markt, gleiche Absicht, und bewusst keine der zuvor gelesenen Formulierungen. Wäre der Rückgang eine Sache des späten Zeitpunkts in einer Sitzung gewesen, wäre die neue Frage klein zurückgekommen. Sie lieferte 8 Domains, was innerhalb der Spanne der bereits fünfmal gelesenen Frage liegt. Die Folge vom 10. August war also Rauschen, das der Reihe nach fiel, und das steht jetzt als Rauschen geschrieben, statt offen zu bleiben.

Was sich bewegt hat

Der Zählwert der dauerhaften Domains. Sechs Lesungen einer Frage meldeten zwischen 2 und 5 dauerhafte Domains, bei gleichem Prompt, gleicher Oberfläche und denselben drei Durchläufen, eine direkt nach der anderen gelesen.

Über die 18 Durchläufe zusammengefasst verfehlten 3 der 16 gesehenen Domains höchstens einen Durchlauf. Zwei weitere liegen bei 12 von 18, und genau diese beiden sind der Grund, warum die einzelnen Lesungen auseinandergehen: eine Lesung beförderte beide zu dauerhaft, eine andere stufte eine der drei herab, die fast nie fehlen. Eine Lesung mit drei Durchläufen ist keine verrauschte Schätzung der dauerhaften Menge. Sie ist eine Ziehung, die jedes Mal auf einer anderen Menge landet, und sie trägt kein Signal darüber, welche ihrer Mitglieder die verlässlichen sind.

Die eine feste Menge und ihr Schweif

Die amerikanische Frage ist die Zelle, die dieses Korpus bereits als einzige feste Menge benannt hat, die eine Tiefenlesung überstanden hat. Sie übersteht auch das hier, und überzeugender als zuvor. Vier der fünf Lesungen mit drei Durchläufen lieferten genau diese 7 Domains und nichts sonst, und die sieben sind dieselben sieben, Name für Name, die eine lange Lesung derselben Zelle am selben Tag lieferte.

Die fünfte Lesung lieferte diese sieben plus 8 Domains, die nie wieder auftauchten. Die feste Menge beschreibt also den Kern, nicht die Menge. Lies diese Zelle zweimal und du hast eine reelle Chance, jene eine Lesung von sechs zu ziehen, die eine feste Kategorie wie eine wechselnde aussehen lässt.

Die Regel, die wir nicht behalten konnten

Die elegante Erklärung lautet, dass die Variation zwischen den Aufrufen lebt und nicht in ihnen: Ein Bündel von Durchläufen teilt, was ein Bündel eben teilt, also kaufen mehr Durchläufe in einem Aufruf weniger als dieselbe Zahl über mehrere verteilt. Zu diesem Arm passt das perfekt. Die lange Lesung sah gar keinen Schweif, und der Schweif tauchte erst beim erneuten Fragen auf.

Sie stirbt an unseren eigenen früheren Zeilen. In derselben Kategorie in Spanien, Frankreich und Deutschland lieferten einzelne Aufrufe 50, 42 und 63 Domains, davon 39, 28 und 36 genau einmal gesehen, alles innerhalb eines Aufrufs. Schweife treten sehr wohl innerhalb eines Aufrufs auf. Was stimmt, ist enger und bleibt stehen: In dieser amerikanischen Zelle lieferten alle 6 Aufrufe den Kern und 1 davon brachte noch etwas anderes.

Wir schreiben die tote Fassung auf, weil sie diejenige ist, die der oder die Nächste beim Blick auf diese Daten vorschlagen wird, und das waren wir.

Und dann die billige Variante, über fünf Fragen auf einmal

Der Abschnitt oben liest zwei Fragen viele Male. Niemand, der ein Werkzeug kauft, wird das tun. Er liest eine Frage, schaut auf die Zahl und liest sie nächste Woche erneut. Also haben wir das gemacht, über fünf Kategorien, die das Register bereits abdeckt, AI Overview, drei Durchläufe je Lesung, je zwei vergleichbare Lesungen.

Zwei aufeinanderfolgende Lesungen nannten dieselben dauerhaften Quellen in 2 der 5 Fragen und andere in 3. Die mittlere Überschneidung zwischen den beiden Lesungen einer Frage liegt bei 0,67.

Die schlechteste Zelle ist den Platz wert. Buchhaltungssoftware zitierte 9 Domains und 0 davon schafften jeden Durchlauf. Minuten später erneut gelesen, zitierte dieselbe Frage 8 und alle 8 schafften es. Ein drittes Mal, wieder dieselben 8. Die Quellen hatten sich überhaupt nicht geändert: Die acht waren schon in der ersten Lesung da, bei zwei von drei Durchläufen, weil ein Durchlauf jener ersten Lesung nichts als Google zitierte. Ein Durchlauf von dreien entschied, ob diese Kategorie keine dauerhafte Quelle hatte oder acht.

Das ist der Mechanismus, mit dem dieser Artikel beginnt, vom anderen Ende gesehen. Dort erklärte er, warum eine Tiefenlesung null liefert. Hier kippt er eine Kategorie zwischen zwei Lesungen, die ein Käufer im Abstand einer Woche nähme und als Trend läse.

Die, die unbemerkt bliebe

Webhosting meldete 5 dauerhafte Domains in beiden Lesungen, und es sind nicht dieselben fünf. Zwei der fünf wechselten den Platz, während die Zahl stillstand. Alles, was eine Zahl statt einer Liste meldet, hätte gar keine Veränderung gezeigt, was schlimmer ist als eine falsche Zahl zu zeigen, denn es gibt nichts zu bemerken.

Deshalb hält das Register beide Zahlen je Zelle, und deshalb druckt die Tabelle Domains statt Summen.

Woraus die Übereinstimmungen bestehen, und das ist der unangenehme Teil

Beide perfekten Übereinstimmungen sind Zellen, in denen jede zitierte Domain in beiden Lesungen die Hürde nahm, 2 von 5. Unser Design sagte vorab, dass diese Form die zu niedrige Hürde ist und keine feste Menge, und dieser Artikel hat bereits veröffentlicht, dass eine feste Menge bei drei Durchläufen meistens keine ist. Die ehrliche Lesart ist also nicht, dass zwei von fünf Fragen stabil sind. Sie ist, dass die zwei Fragen, die übereinstimmten, die zwei sind, bei denen die Statistik nichts falsch machen konnte.

Was das nicht klärt

Fünf Fragen, eine Oberfläche, ein Tag, und Kategorien, die gewählt wurden, weil wir bereits Zeilen zu ihnen hatten. Die beiden Lesungen liegen Minuten auseinander, das misst also Übereinstimmung innerhalb einer Sitzung und sagt nichts über eine Woche. Und zwei Lesungen brachen früh bei zwei Durchläufen ab; sie stehen im Register mit ihrer echten Zahl und außerhalb jeder gepaarten Zahl, denn eine Hürde, die Einstimmigkeit verlangt, ist bei zwei Durchläufen schwächer als bei drei.

Und eine Null hat zwei Formen, die sich jetzt zählen lassen

Der Vorspann dieses Artikels sagt, dass eine strenge Hürde zwölf Quellen auf einmal fallen lässt, wenn ein Durchlauf nichts als Google zitiert. Das war ein Mechanismus, gesehen in einer Lesung. Er hinterlässt eine Form, und diese Form lässt sich zählen, ohne irgendetwas Neues zu messen: google.com genau einmal zitiert, und jede andere Domain genau einen Durchlauf unter der Hürde.

Zählt man jede Lesung in unserem Register mit drei oder mehr beantworteten Durchläufen, und lässt die Wiederholungen unten weg, weil sie danach ausgewählt wurden, null zu sein, und den Anteil bauartbedingt anheben würden: 80 Lesungen, davon liefern 18 null dauerhafte Quellen. 8 dieser 18 haben die knappe Form und 10 sind gewöhnliche Streuung, bei der die beste Domain weit unter der Hürde liegt statt einen Durchlauf darunter. Die Form ist nicht bloß das Auftauchen von Google, denn 14 Lesungen zitieren es und nur 8 davon passen.

Diese beiden Nullen verlangen entgegengesetzte Antworten. Eine knappe Null sagt, die Quellen sind wahrscheinlich da und die Hürde hat einen schlechten Durchlauf erwischt. Streuung sagt, es gibt nichts zu benennen. Die gemeldete Zahl ist dieselbe.

Ob die knappe Null sich erholt, mit Kontrolle geprüft

Wir haben je zwei Zellen beider Formen mit drei Durchläufen erneut gelesen. Hier zählt die Kontrolle mehr als der Test, denn dieses Register hat bereits gemessen, dass erneutes Lesen allein die Statistik stark bewegt: Eine Erholung bedeutet also nichts, wenn nicht etwas, das sich nicht erholen sollte, es auch nicht tut.

ZelleFormdauerhafter Anteil bei erneuter Lesung
Passwortmanager, Vereinigte Staatenknapp47 Prozent
CRM, Deutschlandknapp3 Prozent
Onlinehandel, Vereinigte Staatengestreut3 Prozent
Webhosting, Spaniengestreut0 Prozent

Der beste Fall ist sauber: Passwortmanager zitierten beide Male 19 Domains und gingen von keiner, die jeden Durchlauf schaffte, auf neun. An den Quellen änderte sich nichts; die Hürde änderte sich. Auf AI Overview am Vortag tat eine Buchhaltungszelle dasselbe und ging dahin, dass jede zitierte Domain es schaffte.

Wir haben jeden Arm auf 5 Zellen gebracht, und die Arme überlappen unten weiterhin. Die Anteile der Beinahe-Zellen sind 2, 3, 47, 100 und 100 Prozent, Median 47. Die der gestreuten sind 0, 0, 0, 3 und 6, Median 0. Die niedrigste Beinahe-Zelle liegt weiterhin unter der höchsten gestreuten, eine Regel nach dem Muster “Beinahe heißt, die Quellen sind da” irrt sich also zweimal von fünf.

Getrennt hat die andere Richtung. Keine gestreute Zelle kam über 6 Prozent, und 3 der 5 Beinahe-Zellen kehrten mit 47 Prozent oder mehr zurück. Die Information läuft nur in eine Richtung: Eine gestreute Null sagte jedes Mal eine weitere Beinahe-Null voraus, und eine Beinahe-Null sagte nichts voraus. Das ist schwächer als die symmetrische Behauptung, die uns lieber gewesen wäre, und es ist das, was zehn Lesungen tragen.

Ein Vorbehalt gehört an die Decke dieses Arms und nicht unter ihn. 2 der 10 Wiederholungen gaben jede von ihnen zitierte Domain als dauerhaft zurück, beide Beinahe-Zellen bei 100 Prozent, und dieses Korpus nennt das bereits eine niedrige Schwelle und keine feste Menge. Ein Teil dieser Erholung ist eine engere Antwort und keine zurückkehrenden Quellen.

Die praktische Form ist ohnehin billig genug. Wenn Ihre Null die knappe Form hat, lesen Sie sie noch einmal, bevor Sie danach handeln. Eine weitere Lesung kostet fast nichts und ist der Unterschied zwischen «keine Quelle hält diese Kategorie» und «neun tun es».

Drei Durchläufe sind eine schwächere Hürde als die vier bis neun der ursprünglichen Lesungen, erneutes Lesen begünstigt also die Erholung in beiden Armen. Deshalb ist das Einzige, was oben zitiert wird, der Kontrast, und deshalb wird der Kontrast als nicht trennend gemeldet.

Was eine nennbare Antwortmenge tatsächlich vorhersagt

Liest man alle tiefen Messungen des Registers zusammen, ist es nicht die Zahl der Durchläufe, die eine Zelle mit fester Menge von einer ohne trennt. Die Mediane nach Durchlaufzahl lauten 78, 0, 3, 2, 0, 0, 100 und 20 Prozent, was überhaupt kein Muster ist.

Was sie trennt, ist, wie viele Domains die Antwort überhaupt zitiert. Von 59 tiefen Lesungen zitieren 14 neun Domains oder weniger, 40 zitieren dreizehn oder mehr, und fünf liegen dazwischen: die schmalen behalten zwischen 56 und 100 Prozent dessen, was sie zitieren, die breiten höchstens 40 Prozent. Die Tiefe erklärt es auch nicht, denn die tiefste schmale Lesung hat 9 Durchläufe und die tiefste breite 10.

Und der Prädiktor hält still, was darüber entscheidet, ob er brauchbar ist. Ein Prädiktor, der zwischen Tagen wandert, ist keiner, also wurde die breiteste Zelle des Durchgangs einen Tag später erneut gelesen, mit demselben Prompt, Markt, derselben Oberfläche und Durchlaufzahl. Sie zitierte 64 Domains an einem Tag und 63 am nächsten, und behielt beide Male keine.

Die Quellen darunter hielten überhaupt nicht still: 24 Domains von 103 verschiedenen stehen in beiden Lesungen, eine Überschneidung von 0,23. Die Zahl wiederholt sich also, während fast die gesamte Zusammensetzung wechselt.

Diese Asymmetrie zieht sich durch dieses Register, und überall sonst war die stabile Zahl die irreführende: ein Anteil, der hielt, während seine Quellen komplett wechselten, eine Stabilitätsquote, die fünfzig Punkte durchlief über einem Zähler, der nie sieben verließ. Dies ist die einzige Stelle, an der es andersherum wirkt. Die Breite ist das Behauptete, und sie gehört der Zelle und nicht den Seiten, die an jenem Tag zurückkamen.

Also haben wir vorhergesagt, bevor wir gemessen haben, was das Einzige ist, das dies zu mehr als einer Beschreibung macht. Geschäftskonten in den Vereinigten Staaten zitierten bei drei Durchläufen vier Domains. Das Muster sagt, eine Zelle, die wenig zitiert, behält es, also wurde sie achtmal gelesen: sie zitiert 7 und behält alle 7, ohne Rand. Das ist eine vierte Zelle auf der schmalen Seite, in einer Kombination aus Markt, Kategorie und Oberfläche, die vorher nicht dabei war.

Zwei Dinge, die das nicht ist. Die schmale Seite umfasst 10 verschiedene Zellen gegen 29 auf der breiten, die Seite, welche die Aussage trägt, ist also die dünne. Und eine Drei-Durchlauf-Zählung sagt die tiefe nicht vorher: Gehaltsabrechnung im Vereinigten Königreich zitierte bei drei Durchläufen acht und bei sieben neunzehn, was sie auf die breite Seite brachte. Welche Art Zelle man hat, lernt man, indem man sie tief liest, nicht indem man eine flache Lesung zählt.

Der naheliegende Störfaktor ist die Oberfläche, und er überlebt den Test nicht. AI Overview zitiert weniger Domains als AI Mode, “schmal” könnte also eine Oberfläche unter anderem Namen sein. Nach Oberfläche getrennt hält der Abstand innerhalb jeder: auf AI Overview behalten die schmalen Lesungen 56 bis 100 Prozent und die breiten höchstens 40, auf AI Mode behalten die schmalen 100 und die breiten höchstens 25. Dieser Test zeigt auch, wo es dünn ist, und das gehört in denselben Satz: die schmale Seite von AI Mode ist 1 Zelle und die breite Seite von AI Overview sind 8.

Dann zielte die Vorhersage auf den Fall, der sie brechen sollte. CRM im Vereinigten Königreich ist bei drei Durchläufen schmal, sieben Domains, und keine davon dauerhaft. Das Breitenmuster sagt, eine schmale Zelle behält, was sie zitiert; die Drei-Durchlauf-Lesung sagt, sie behält nichts. Achtmal gelesen zitiert sie 6 und behält alle 6. Die flache Zählung war dort nicht nur flach, sie war umgekehrt: dieselbe Zelle liest sich bei drei Durchläufen als nichts Stabiles und bei acht als sechs Quellen jedes Mal.

Und die Umkehrung hat sich in einer Kategorie wiederholt, die wir nie gelesen hatten. VPN in den Vereinigten Staaten war derselbe Aufbau, sechs zitierte Domains bei drei Durchläufen und keine dauerhaft. Achtmal gelesen zitiert es sechs und behält alle sechs. Zwei unabhängige Zellen, beide bei drei Durchläufen ohne etwas Stabiles, beide mit einer vollständigen festen Menge, sobald sie tief gelesen werden.

Was das mit der gestrigen Aussage macht

Der gestrige Text sagte, die Quellen flackern nicht und einer von fünf bis acht Durchläufen antwortet anders. Beide Hälften stimmen weiterhin für die beiden Fragen, die er gemessen hat, und seine Wahrscheinlichkeitsrechnung ändert sich für sie nicht.

Was er nicht hätte nahelegen dürfen, und was ein Leser vernünftigerweise mitnimmt, ist, dass dies AI Mode beschreibt. Es beschreibt 2 von 6 Fragen, die wir inzwischen auf AI Mode in den Vereinigten Staaten tief gelesen haben. Die anderen vier teilen sich auf zwei Weisen auf, und eine von ihnen hat gar keinen abweichenden Durchlauf.

Es ist das zweite Mal in zwei Tagen, dass ein Befund von uns eingegrenzt werden muss, sobald mehr Fragen ankommen, und die Form des Fehlers ist beide Male dieselbe: ein sauberer Mechanismus, der den Stapel erklärt, der ihn nahegelegt hat, veröffentlicht bevor er gegen einen Stapel geprüft wurde, der ihn nicht zeigt.

Was statt einer Dauerhaftigkeitszahl zu berichten ist

Eine Dauerhaftigkeitszahl von null ist für sich kein Befund. Was die drei Fälle trennt, ist die Verteilung der Zählungen, und das ist eine Zeile Arithmetik:

  • Jede zitierte Domain am Maximum, wie bei CRM, heißt eine feste Antwortmenge. Man arbeitet an diesen Seiten.
  • Fast jede Domain eine unter dem Maximum, eine Domain allein darunter, wie bei der Gehaltsabrechnung, heißt ein einzelner abweichender Durchlauf. Die dauerhafte Menge ist echt und Ihre Stichprobe hat sie verfehlt. Lesen Sie erneut, bevor Sie schließen.
  • Zählungen, die mit einem großen Ein-Durchlauf-Rand ausfransen, wie bei Onlineshops, heißt eine Antwort, die jedes Mal frisch zusammengesetzt wird. Es gibt keine stabile Menge, an der man arbeiten kann, und null zu melden ist richtig und nutzlos ohne die Form daneben.

Jedes Produkt, das für den zweiten und den dritten Fall “dauerhafte Quellen: 0” meldet, gibt einem Beinahetreffer und einer Abwesenheit dieselbe Zahl.

Wo der Unterschied nicht liegt: die rankende Seite

Die naheliegende Erklärung dafür, dass CRM aus einer festen Menge antwortet und E-Commerce nicht, lautet, dass sich ihre Suchergebnisse unterscheiden, die einen gesetzt, die anderen überfüllt. Das mit dem Instrument zu prüfen, das das Rätsel erzeugt hat, wäre ein Zirkelschluss, also braucht es ein zweites Instrument, das vom ersten nichts weiß: Googles eigene organische Ergebnisse für dieselbe Zeichenkette, am selben Tag gelesen.

Sechs Kategorien, dieselbe Zeichenkette an beide Schichten gestellt, Vereinigte Staaten auf Englisch.

KategorieDurchläufe im AI ModeZitierte DomainsAuch in den organischen Top 20Zitiert außerhalb der rankenden Seite
CRM8981
Lohnabrechnung813103
Buchhaltungssoftware51367
Passwortmanager419712
Webhosting741833
E-Commerce-Plattformen9104797

Die Zahl der zitierten Domains, die auch ranken, liegt in allen sechs zwischen 6 und 10. Was von 1 bis 97 läuft, ist die Spalte daneben.

Die Prozentfassung davon, ein Anteil, der von 89 Prozent auf 7 fällt, ist kein zweiter Befund und sollte nicht als einer gelesen werden. Bei nahezu konstantem Zähler fällt der Anteil aus Arithmetik. Die Beobachtung ist der nahezu konstante Zähler.

Es gibt außerdem einen Vergleich, den diese Tabelle nicht anstellt. Die Zahl der eigenen distinkten Domains der organischen Seite liegt in allen sechs zwischen 13 und 16, was nach einem flachen Ergebnis aussieht und keines ist: eine Seite mit zwanzig Positionen ist konstruktionsbedingt bei zwanzig begrenzt, diese Flachheit gehört also dem Instrument. Gelesen wird hier nur die Überschneidung.

Die Kontrolle, die den Vergleich der Kategorien erlaubt

Die Zeilen sind unterschiedlich tief gelesen, von vier beantworteten Durchläufen bis neun, und die Breite wächst mit den Durchläufen. Wüchse die Überschneidung mit ihnen ebenfalls, würde die Tabelle Tiefe messen. Die breiteste Zelle wurde genau deshalb zweimal gelesen: 64 zitierte Domains bei vier beantworteten Durchläufen und 104 bei neun. Die Überschneidung mit der rankenden Seite betrug beide Male 7, und es waren dieselben sieben Domains namentlich. Alle 40 neuen Domains kamen von außerhalb der Seite.

Dieselbe Lücke vom anderen Ende gelesen

Umgedreht sagt die Tabelle etwas, wofür ein Anbieter direkt bezahlt. Zwischen 6 und 9 der rankenden Domains werden überhaupt nie zitiert, in jeder Kategorie. Im E-Commerce gehören dazu vier der Plattformen selbst: Shopify, Wix, BigCommerce und Sellfy ranken alle in den Top zwanzig für genau diese Zeichenkette, und keine der vier wird in neun Durchläufen zitiert.

Zitiert ist nicht genannt. Dieses Register hält diese beiden Ergebnisse überall auseinander, und die Unterscheidung wiegt hier schwer: eine Antwort kann ein Produkt ausführlich empfehlen und dabei die Seite eines anderen darüber zitieren. Gemessen wird, wessen Seite zitiert wurde.

Eine Position auf Seite eins kauft also einen Platz am Antworttisch, dessen Größe sich je nach Kategorie kaum bewegt, und was sich bewegt, ist die Größe des restlichen Tisches. Im CRM sind das 8 von 9 Quellen. Im E-Commerce 7 von 104. Dasselbe Ranking ist zwei sehr verschiedene Dinge wert, und in welchem der beiden man steckt, lässt sich messen, bevor man etwas dafür ausgibt.

Was das weiterhin nicht beantwortet, ist das Warum. Es sagt, wo der Unterschied nicht liegt. Er liegt nicht auf der rankenden Seite, denn die rankende Seite steuert überall ungefähr dasselbe bei. Was eine Kategorie aus einer festen Menge antworten lässt, geschieht in dem, wonach die Oberfläche darüber hinaus greift, und diese Messung reicht auch dorthin nicht.

Und eine Kontrolle von außerhalb der Kauffragen. Jede Zelle oben fragt nach dem besten Produkt einer Kategorie. Fragt man stattdessen, wie man in AI Overviews rankt, eine andere Absicht in einer anderen Branche, zitierte AI Mode über 6 Durchläufe 36 Domains, von denen 8 in den organischen Top 20 standen. Das sind 53 Prozent der rankenden Seite, der Median der zwölf. Sieben rankende Domains blieben in sechs Durchläufen unzitiert, darunter Ahrefs auf Position fünf.

Und eine Kontrolle auf der anderen Oberfläche, die all das eingrenzt. Jede Zelle oben ist AI Mode. Drei derselben Zeichenketten, am selben Tag im selben Markt an AI Overview gestellt, zitieren je 6 oder 7 Domains, jede davon in jedem beantworteten Durchlauf, und nehmen 21 bis 33 Prozent ihrer rankenden Seite. E-Commerce ist der schärfste Fall: 104 zitierte Domains im AI Mode und 6 im AI Overview, bei identischer Frage. Die Kategorienbreite, um die es in diesem ganzen Abschnitt geht, ist also eine Eigenschaft des AI Mode, und im AI Overview ist die breite Kategorie so fest wie die schmale.

Derselbe Aufbau in einem zweiten Markt

Alles oben ist ein Markt, und die Regel dieses Registers lautet, dass ein in einem Markt gemessenes Ergebnis ein in einem Markt gemessenes Ergebnis ist. Also wurden die sechs Kategorien am 14. August 2026 erneut in Spanien gefahren, auf Spanisch, gegen Spaniens eigene rankende Seite für dieselbe spanische Zeichenkette.

Spanien antwortet überall breiter. Seine schmalste Kategorie zitiert 25 Domains, wo die schmalste in den Vereinigten Staaten 9 zitiert, also sieht nichts in Spanien wie die feste Menge von neun aus.

KategorieZitierte DomainsAuch in den organischen Top 20Anteil der rankenden Seite
Lohnabrechnung25667 Prozent
Passwortmanager27640 Prozent
Buchhaltungssoftware39850 Prozent
Webhosting50450 Prozent
CRM771275 Prozent
E-Commerce-Plattformen114956 Prozent

Über alle 18 Zellen der 3 Märkte reicht die zitierte Menge von 9 bis 114, und die Zahl der zitierten Domains, die auch ranken, reicht von 4 bis 12.

Die letzte Spalte ist das, woran die drei Märkte gemessen werden sollten, und sie ist der Grund, warum es sie gibt. Eine rohe Überschneidungszahl ist dadurch begrenzt, wie viele Domains die rankende Seite überhaupt hat, und zwei der spanischen Seiten lieferten neun und acht organische Domains statt fünfzehn. Ein Anteil an der Seite, die jede Zelle tatsächlich hatte, ist so nicht begrenzt. In den Vereinigten Staaten reicht dieser Anteil von 44 bis 63 Prozent, in Spanien von 40 bis 75 und in Deutschland von 27 bis 63. Die ersten beiden Märkte liegen knapp über der Hälfte. Deutschland liegt bei 44 und ist der erste Markt darunter, und genau dafür nimmt man einen dritten Markt dazu.

Also wird ungefähr die halbe erste Seite zitiert, in allen drei Märkten, ob sich die Antwort auf neun Quellen stützt oder auf hundertvierzehn.

Zwei Dinge macht dieser Durchgang besser als der erste. Jede spanische Zelle beantwortete genau sechs Durchläufe, die Vergleiche zwischen Kategorien sind also nach Durchläufen gepaart, während die amerikanischen Zeilen von vier bis neun beantworteten Durchläufen reichten und die Tiefenkontrolle zu ihrer Verteidigung brauchten. Und der Befund ruht nicht mehr auf einem Markt, was dieses Register von einer Aussage verlangt, bevor sie allgemein formuliert wird.

Was achtzehn Zellen nicht klären können, ist, ob sich dieser Anteil mit der Breite dessen bewegt, was eine Zelle zitiert. Was sie zeigen, sind die beiden Spannen: eine zitierte Menge von 9 bis 114 und ein Anteil der ersten Seite von 27 bis 75 Prozent.

Und ein dritter Markt, flacher gelesen

Alles oben sind zwei Märkte, gelesen mit sechs Durchläufen und mehr. Dieselben sechs Kategorien liefen am 14. August 2026 noch einmal in Deutschland, auf Deutsch, mit demselben Aufbau und derselben Zeichenkette an beide Schichten. Alle sechs antworteten drei von drei Durchläufen.

KategorieZitierte DomainsAuch in den organischen Top 20Anteil der rankenden Seite
Buchhaltungssoftware11744 Prozent
CRM12529 Prozent
Lohnabrechnung131063 Prozent
Passwort-Manager16427 Prozent
Webhosting45960 Prozent
E-Commerce-Plattformen45444 Prozent

Zu lesen ist die mittlere Spalte, nicht die linke. Das sind Lesungen mit drei Durchläufen, wo Spanien sechs hatte, und dieses Stück hat bereits gezeigt, dass eine Drei-Durchlauf-Zählung die tiefe nicht vorhersagt: Gehaltsabrechnung im Vereinigten Königreich zitierte bei drei Durchläufen acht und bei sieben neunzehn. Eine zitierte Spanne von 11 bis 45 ist also nicht mit der spanischen vergleichbar, und die Enge links ist zum Teil Tiefe.

Vergleichbar ist die Spalte, die der eigene Tiefenkontrollwert dieser Studie stützt. Die breiteste amerikanische Zelle mit vier und noch einmal mit neun Durchläufen zu lesen, brachte ihre zitierte Menge von 64 auf 104 und ließ die Zahl, die auch rankt, beide Male bei 7: das Zitierte bewegt sich mit der Tiefe, die Überschneidung nicht. In Deutschland reicht diese Überschneidung von 4 bis 10, innerhalb der 4 bis 12, die die ersten beiden Märkte bereits gesetzt hatten. Eine dritte Sprache bewegte keines der beiden Enden.

Was Deutschland bewegt, ist der Anteil der rankenden Seite, nach unten. Sein Boden liegt bei 27 Prozent gegen 40 in Spanien, und sein Median ist 44, der erste der drei Märkte unter der Hälfte.

Und die andere Oberfläche zeigt hier in die andere Richtung, was der amerikanische Kontrollwert nicht erwarten ließ.

Drei dieser deutschen Zeichenketten gingen am selben Tag an AI Overview, dieselben drei Kategorien, die in den Vereinigten Staaten bereits kontrolliert sind. Dort stützt sich AI Overview weniger auf die rankende Seite als AI Mode, 21 bis 33 Prozent gegen 44 bis 63. In Deutschland stützt es sich stärker, in allen dreien: 59 gegen 29, 50 gegen 44 und 89 gegen 44.

Drei so saubere Zellen liegen meistens an der Formulierung und nicht am Markt, also wurden dieselben drei auf Deutsch anders gefragt, auf beiden Oberflächen. AI Overview kam mit 53, 59 und 47 zurück, gegen 35, 53 und 47 bei AI Mode. Über die beiden Formulierungen sind das 6 Paare, 5 mit AI Overview darüber, 1 exaktes Unentschieden und 0 andersherum.

Die Richtung ist also nicht die Formulierung. Die Größe schon: E-Commerce ging von 45 Punkten Abstand auf gar keinen. Was diese Paare tragen, ist, dass in Deutschland AI Overview nie die Oberfläche war, die sich weniger auf Seite eins stützt, und kein bestimmter Abstand.

Zwei Grenzen, weil das die Art Kontrast ist, die zu einer größeren Aussage einlädt, als sie tragen kann. Die amerikanische Seite sind drei Zellen mit einer Formulierung, also ist die nicht wiederholte Hälfte des Vergleichs genau die, auf der der Kontrast ruht. Und die amerikanischen Zeichenketten sind englisch, wo die deutschen deutsch sind, sodass diese Hälfte Land und Sprache weiter gemeinsam bewegt, was genau der Störfaktor ist, den die neue deutsche Formulierung nur auf der deutschen Seite entfernt hat.

Was das nicht zeigt

Unsere AI-Mode-Zahlen sind Untergrenzen, keine Zählungen. Über 5 Fragen in 3 Märkten druckt eine AI-Mode-Antwort nummerierte Zitationsmarker in ihrem Körper, und die strukturierte Liste trägt zwischen 21 Prozent davon und allen, während die von AI Overview in jeder Zelle alle trug. Wir haben das zuerst an zwei Zellen gemessen, es als konstante Hälfte gelesen, und ein dritter Markt lieferte eine AI-Mode-Antwort, die jeden von ihr gedruckten Marker trug. Jede Breitenzahl zu AI Mode hier ist also mindestens das, was sie sagt, um einen Betrag, der je Zelle schwankt und den wir nicht eingrenzen können. Das ist zufällig die sichere Richtung für diesen Artikel: Wo wir berichten, dass AI Mode weit breiter zitiert als AI Overview, macht ein untererfasstes AI Mode die echte Lücke größer statt kleiner. Ausgeschlossen ist damit, eine dieser Zahlen mit einem festen Faktor nach oben zu korrigieren, wozu die Zwei-Zellen-Fassung einlud.

Es ist über seine eigene erste Grenze hinausgewachsen, und dies ist die aktuelle. Das begann als AI Mode in den Vereinigten Staaten auf Englisch an einem einzigen Tag, und dieser Satz stand hier noch, nachdem er aufgehört hatte zu stimmen. Die Lesungen umfassen inzwischen 2 Oberflächen, 5 Märkte, 4 Sprachen und 4 Tage. Jeder Abschnitt sagt, welche er verwendet hat, und keine Zahl hier reicht weiter als der Abschnitt, in dem sie steht.

Die Kategorien sind keine Stichprobe von irgendetwas. Sie wurden gewählt, weil unsere frühere Arbeit sie bereits abdeckt, es sind also die Kategorien, gegen die wir vergleichen können, und keine Zufallsziehung aus der Wirtschaft.

Die beantworteten Durchläufe reichen von vier bis acht und wir steuern das nicht. Das Werkzeug bricht früh ab und meldet, wie viele geantwortet haben. Eine Latte, die Einstimmigkeit verlangt, ist bei acht Durchläufen härter als bei vier, die Zeilen sind also nicht austauschbar, und der Vergleich mit Gewicht ist der, in dem die Tiefen übereinstimmen.

Warum CRM fest ist und Onlineshops nicht, können wir weiterhin nicht sagen. Der Abschnitt oben schließt eine Antwort aus und nur eine: Es liegt nicht daran, dass sich die rankende Seite unterscheidet, denn die rankende Seite steuert je nach Kategorie sechs bis zehn Quellen bei. Damit bleibt der Mechanismus dort, wohin die Messung nicht reicht, in dem, was die Oberfläche jenseits der ersten Seite abruft, und eine plausible Erzählung über kleine Fundusse und überfüllte Kategorien bleibt eine Hypothese für eine größere Studie und kein Befund.

Nichts hier ist kausal und nichts sagt etwas voraus. Das sind Lesungen, kein Eingriff mit Kontrolle.

Häufige Fragen zu dauerhaften Zitiermengen

Heißt null dauerhafte Quellen, dass die Maschine instabil ist?

Für sich genommen nicht. In unseren sechs Lesungen kam die Null auf zwei Wegen zustande: einmal stimmten zwölf von dreizehn Quellen überein und ein einzelner Durchlauf wich ab, einmal erschienen Dutzende Quellen je einmal. Das erste ist ein Beinahetreffer und das zweite eine Abwesenheit, und die Dauerhaftigkeitszahl ist für beide identisch.

Kann eine KI-Antwort jedes Mal dieselben Quellen liefern?

Ja, in manchen Kategorien. Die Frage nach dem besten CRM für ein kleines Unternehmen auf AI Mode lieferte neun Domains, jede in jedem beantworteten Durchlauf zitiert, und eine zweite Lesung am selben Tag lieferte dieselben neun nach Namen. Das ist eine Zelle, in der man einem Käufer genau zeigen kann, welche Seiten die Antwort auf diese Frage in dieser Formulierung halten. Dieselbe Absicht mit anderen Worten, am selben Tag auf derselben Oberfläche und im selben Markt, zitierte 80 Domains und keine dauerhaft, die Liste gehört also der Formulierung, bevor sie der Kategorie gehört.

Bringt ein Ranking auf Seite eins eine Zitierung in einer KI-Antwort?

Teilweise, und in einem Umfang, der sich je nach Kategorie kaum ändert. Stellt man dieselbe Zeichenkette am selben Tag an Googles organische Ergebnisse und an den AI Mode, über sechs Kategorien hinweg, so lag die Zahl der zitierten Domains, die auch in den organischen Top 20 ranken, jedes Mal zwischen 6 und 10, während die zitierte Menge selbst von 9 bis 104 reichte. Eine Position auf Seite eins steuert also eine ungefähr feste Zahl von Quellen bei, und ob das fast die ganze Antwort ist oder ein Bruchteil, entscheidet sich daran, wie viel die Oberfläche außerhalb der rankenden Seite zitiert. In der schmalsten Kategorie waren es 8 von 9 Quellen, in der breitesten 7 von 104.

Gilt das auch im AI Overview?

Nein, und das ist die wichtigste Grenze dieser Seite. Drei derselben Zeichenketten, am selben Tag an AI Overview gestellt, zitieren je 6 oder 7 Domains, jede davon in jedem beantworteten Durchlauf, und nehmen 21 bis 33 Prozent ihrer rankenden Seite. Der klarste Fall ist E-Commerce: 104 zitierte Domains im AI Mode und 6 im AI Overview bei identischer Frage. Die Aufteilung in breit und schmal, auf der diese Seite aufbaut, ist eine Eigenschaft des AI Mode, eine auf einer Oberfläche gemessene Zahl sagt also nichts über die andere.

Warum sagte Ihr früherer Artikel, ein Durchlauf von acht antworte anders?

Weil seine beiden Fragen genau das taten, und das stimmt für sie weiterhin. Vier weitere Fragen mit demselben Satzbau und derselben Oberfläche zeigen es nicht, der Mechanismus gehört also diesen Fragen und nicht der Oberfläche. Dieser Text ist diese Korrektur, veröffentlicht statt still angewandt.

Wie viele Durchläufe sollte eine Stabilitätszahl verwenden?

Mehr als drei, und die Zahl muss neben dem Wert gedruckt stehen. Eine Latte, die eine Quelle in jedem Durchlauf verlangt, wird härter, je mehr Durchläufe hinzukommen, dieselbe Frage ehrlich gemessen bei drei und bei zehn liefert also verschiedene Zählungen. In unserem Register gibt eine Frage dreizehn dauerhafte Domains bei drei Durchläufen und vier bei zehn.

Was sollte ich einen Anbieter dazu fragen?

Jetzt drei Dinge. Ob seine Durchläufe den Cache überspringen, wie viele Formulierungen er je Absicht verfolgt, und was seine Stabilitätszahl tut, wenn die Zahl der Durchläufe steigt. Und ein viertes, wenn er eine Null meldet: ob sie von einem abweichenden Durchlauf kam oder von hundert Quellen, die je einmal erschienen, denn ohne die Verteilung der Zählungen kann er das nicht beantworten.

Wie wiederhole ich das?

Nehmen Sie eine Kauffrage, stellen Sie sie vier- bis zehnmal auf einer Oberfläche in einem Markt, und schreiben Sie auf, wie viele Durchläufe jede Domain zitierten, statt ob jede Domain jeden Durchlauf genommen hat. Dann machen Sie dasselbe mit einer zweiten Kategorie in derselben Sitzung. Haben die beiden Verteilungen verschiedene Formen, haben Sie das hier reproduziert, und die Dauerhaftigkeitszahl allein hätte es verborgen. Stellen Sie dann die erste Frage mit anderen Worten erneut, auf derselben Oberfläche am selben Tag, und legen Sie die beiden Domainlisten zusammen: das ist der Schritt, auf dem dieser Artikel beruht, und der, den die Methode oben allein nicht erreicht.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)