Zum Inhalt springen
AI VisibilityResearch
DE

Eine Kategorie zitierte jedes Mal dieselben 13 Quellen. Eine andere zitierte 49 und wiederholte fast keine.

42 AI-Overview-Messungen über sechs Kategorien: die Stabilität reichte von jede Quelle wiederholt sich bis keine. Einen Tag später kippte eine Kategorie.

· 13 Min. Lesezeit

Fragen Sie Googles AI Overview dreimal nach dem besten KI-Coding-Assistenten, und es zitiert dreizehn Quellen, jedes Mal dieselben dreizehn. Fragen Sie dreimal, welche Firma man für ausgelagerte CFO-Arbeit beauftragen soll, und es zitiert achtzehn, von denen zwölf genau einmal auftauchen.

Gleiche Oberfläche. Gleicher Markt. Gleicher Tag. Gleiche Zahl von Durchläufen. Der Unterschied liegt vollständig in der Kategorie, nach der gefragt wird.

Das zählt, weil jedes Produkt für KI-Sichtbarkeit am Markt, unseres eingeschlossen, Ihnen eine Zahl von Durchläufen verkauft. Wenn die richtige Zahl in einer Kategorie drei und in einer anderen dreißig ist, dann ist eine einheitliche Abtastrate für die meisten Kunden falsch, und niemand in diesem Markt veröffentlicht die Zahl, die Ihnen sagen würde, in welchem Fall Sie stecken.

Wie das gemessen wurde: Googles AI Overview, über ein Live-Auslesen der Oberfläche statt über eine Modell-API, mit Land und Sprache bei jedem Aufruf ausdrücklich gesetzt. Cache umgangen, jeder Durchlauf eine frische Anfrage, seriell ausgeführt. Zehn Messungen, 42 Durchläufe insgesamt, vom 5. bis 7. August 2026. Wir zählen zitierte Domains, nicht Markennennungen: das sind verschiedene Ergebnisse, und sie zu vermischen ist der häufigste Fehler dieser Kategorie. Jeder Prompt, Markt, jedes Datum und jede Durchlaufzahl steht wörtlich in unserem Messregister.


Das Ergebnis

KategorieMarktDurchläufeZitierte DomainsIn jedem DurchlaufGenau einmal
KI-Coding-AssistentenUSA313130
FlugbuchungUSA3660
Noise-Cancelling-KopfhörerUSA2440
CRM für kleine UnternehmenUSA41134
KI-SichtbarkeitswerkzeugeSpanien31154
KI-SichtbarkeitswerkzeugeFrankreich31337
KI-SichtbarkeitswerkzeugeSpanien317311
Ausgelagerte CFO-DiensteUSA318312
KI-SichtbarkeitswerkzeugeUSA423314
GEO-AgenturenSpanien1449039
KI-Coding-Assistenten, USA100% (13 von 13)Flugbuchung, USA100% (6 von 6)Noise-Cancelling-Kopfhörer, USA100% (4 von 4)KI-Sichtbarkeitswerkzeuge, Spanien45% (5 von 11)CRM für kleine Unternehmen, USA27% (3 von 11)KI-Sichtbarkeitswerkzeuge, Frankreich23% (3 von 13)KI-Sichtbarkeitswerkzeuge, Spanien18% (3 von 17)Ausgelagerte CFO-Dienste, USA17% (3 von 18)KI-Sichtbarkeitswerkzeuge, USA13% (3 von 23)GEO-Agenturen, Spanien0% (0 von 49)
Stabilität, gelesen als Anteil der zitierten Domains, die jeden Durchlauf überstanden. Ganz oben nutzte die Antwort jede Quelle, die sie nutzte, jedes Mal. Ganz unten neunundvierzig Domains über vierzehn Durchläufe und keine davon in allen. Das sind einzelne Sitzungen an benannten Tagen: die CRM-Zeile wurde einen Tag später erneut gemessen und kam mit sieben von sieben zurück.
Anteil der zitierten Domains, die in jedem Durchlauf erschienen, nach Kategorie
value
KI-Coding-Assistenten, USA100%
Flugbuchung, USA100%
Noise-Cancelling-Kopfhörer, USA100%
KI-Sichtbarkeitswerkzeuge, Spanien45%
CRM für kleine Unternehmen, USA27%
KI-Sichtbarkeitswerkzeuge, Frankreich23%
KI-Sichtbarkeitswerkzeuge, Spanien18%
Ausgelagerte CFO-Dienste, USA17%
KI-Sichtbarkeitswerkzeuge, USA13%
GEO-Agenturen, Spanien0%

Lesen Sie die letzten beiden Spalten zusammen. Ganz oben nutzte die Antwort jede Quelle, die sie nutzte, jedes Mal. Ganz unten wurden neunundvierzig Domains über vierzehn Durchläufe zitiert und keine einzige erschien in allen.

Der Vergleich, bei dem es keine Ausreden gibt

Unterschiedliche Durchlaufzahlen machen die Mitte dieser Tabelle schwer vergleichbar, hier also das Paar, an dem es nichts wegzuerklären gibt.

KI-Coding-Assistenten und ausgelagerte CFO-Dienste. Beide Vereinigte Staaten, beide Englisch, beide Googles AI Overview, beide drei Durchläufe, beide am 7. August 2026 gemessen.

KI-Coding-AssistentenAusgelagerte CFO-Dienste
Zitierte Domains1318
In allen drei Durchläufen zitiert133
Genau einmal zitiert012

Eine davon ist bei drei Durchläufen vollständig reproduzierbar. Die andere sagt Ihnen zum gleichen Preis und am selben Nachmittag bei drei Durchläufen fast nichts: zwei Drittel dessen, was Sie gesehen hätten, war einmalig.

Verkauften Sie beiden Unternehmen denselben Monatsbericht, bekäme eines eine Messung und das andere Rauschen mit einem Diagramm darauf.

Was es tatsächlich vorhersagt und was nicht

Die naheliegende Vermutung ist das Alter der Kategorie. Sie ist in beide Richtungen falsch.

KI-Coding-Assistenten sind etwa drei Jahre alt und vollkommen stabil. CRM-Software ist dreißig Jahre alt und lieferte drei stabile Domains von elf. Neuheit verursacht keine Instabilität.

Die zweite Vermutung ist Größe oder Geld der Kategorie. Ebenfalls falsch: Flugbuchung gehört zu den kommerziell umkämpftesten Anfragen des Internets und lieferte sechs Domains, alle sechs stabil.

Was die instabilen Zeilen gemeinsam haben, ist subtiler, und wir benennen es als Hypothese und nicht als Ergebnis, weil zehn Messungen es nicht belegen können:

Instabilität folgt der Zahl weitgehend austauschbarer Seiten, die um die Antwort konkurrieren. Ausgelagerte CFO-Firmen, GEO-Agenturen und Anbieter von KI-Sichtbarkeit haben alle einen großen Bestand nahezu identischer kommerzieller Seiten hervorgebracht, jede mit ähnlichem Anspruch und ähnlicher Autorität. Es gibt keine offensichtlich zu bevorzugende Quelle, also stellt die Suche jedes Mal eine andere plausible Teilmenge zusammen. Wo eine Kategorie eine kleine Zahl klar primärer Quellen hat, ob das Gartner und GitHub für Coding-Werkzeuge sind oder eine Handvoll Metasuchmaschinen für Flüge, findet die Suche dieselben und hört auf.

Wenn das stimmt, ist die kontraintuitive Folge, dass mehr Inhalt in einer Kategorie Zitate weniger stabil macht, nicht stabiler. Das gehört ordentlich geprüft, und das haben wir vor.

Die zwei Dinge, die das an der Messung ändert

Erstens: Ihre Stichprobengröße ist eine Eigenschaft Ihrer Kategorie, nicht Ihres Budgets.

Das Standardprodukt dieses Marktes ist eine feste Zahl von Durchläufen je Prompt und Monat, für alle gleich verkauft. Unser geprüfter Preiskatalog zeigt die Spanne: Nightwatch gibt dreißig Antworten je Prompt und Monat in jedem Tarif, Rank Prompt verkauft ein Guthaben, das Sie selbst verteilen, und mehrere Anbieter veröffentlichen die Zahl gar nicht.

Keines davon ist falsch. Falsch ist, zwischen ihnen zu wählen, ohne zu wissen, in welcher Hälfte dieser Tabelle Sie stehen. Dreißig Antworten im Monat sind in einer Kategorie wie Coding-Werkzeugen großzügig und in einer wie professionellen Dienstleistungen dünn.

Zweitens: ein einzelner Bericht kann Abwesenheit nicht von Rauschen unterscheiden.

In den instabilen Kategorien erschienen die meisten zitierten Domains einmal. Ist Ihre Marke eine davon, beschreibt ein Monatsbericht mit «zitiert» und der nächste mit «nicht zitiert» überhaupt keine Veränderung in der Welt. Sie bräuchten viel mehr Beobachtungen, bevor der Unterschied zwischen diesen beiden Monaten etwas bedeutete, und die Arithmetik dazu ist bei kleinen Stichproben unerbittlich.

Das ist dieselbe Form, die wir fanden, als wir eine Studie über drei Märkte zwei Tage später wiederholten: die Summe reproduzierte sich fast exakt, während die einzelnen Namen fast vollständig wechselten. Stabile Gesamtzahlen, instabile Zusammensetzung.

Der Test, den Sie selbst durchführen können

Sie brauchen unsere Daten nicht. Sie brauchen Ihre, und das ist das ganze Verfahren:

  1. Nehmen Sie den Prompt, der Sie wirklich interessiert.
  2. Lassen Sie ihn dreimal laufen, mit ausdrücklich gesetztem Land und ausdrücklich gesetzter Sprache, Cache umgangen.
  3. Listen Sie die in jedem Durchlauf zitierten Domains auf.
  4. Zählen Sie, wie viele in allen dreien vorkommen.

Kommen die meisten vor, sind drei Durchläufe in Ihrer Kategorie eine echte Messung, und den Rest des Budgets können Sie in Breite stecken: mehr Prompts, mehr Märkte, mehr Oberflächen.

Kommen wenige vor, sind drei Durchläufe eine Ziehung und keine Rate. Investieren Sie stattdessen in Wiederholung, und behandeln Sie jede einzelne Monatszahl, von welchem Anbieter auch immer, als vorläufig, bis Sie genug Durchläufe für ein Intervall darum haben.

Machen Sie das einmal je Kategorie, nicht einmal je Prompt. Es ist eine Eigenschaft des Fragenraums, in den Sie verkaufen, und ändert sich nicht von Woche zu Woche.

Das Ergebnis, nach dem wir nicht gesucht haben

Die CRM-Messung wurde dreimal angefordert, und Google lieferte nur einmal ein AI Overview. Kein Fehler, kein Ausfall: zwei der drei Anfragen ergaben schlicht eine Seite ohne KI-Antwort. Wir wiederholten sie mit vier Anfragen und bekamen vier.

Das ist ein dritter Zustand, und die meiste Berichterstattung dieser Kategorie wirft ihn mit dem zweiten zusammen:

  • Sie erscheinen in der Antwort.
  • Es gibt eine Antwort und Sie sind nicht darin.
  • Es gibt keine Antwort.

Ein Werkzeug, das für den Monat «0 Nennungen» meldet, hat Ihnen nichts darüber gesagt, in welchem der letzten beiden Fälle Sie sind, und die verlangen entgegengesetzte Reaktionen. Erzeugt eine Frage oft gar kein AI Overview, besteht Ihre Arbeit nicht darin, eine bessere Seite dafür zu schreiben. Sie besteht darin, eine andere Frage zu wählen oder hinzunehmen, dass diese Oberfläche nicht der Ort ist, an dem dieser Käufer bedient wird.

Wir haben eine Zeile am nächsten Tag erneut gemessen, und sie kippte

Die Tabelle oben zeigt zehn Sitzungen an benannten Tagen. Am 8. August 2026, einen Tag nach der Messung, ließen wir die CRM-Zeile erneut laufen: dieselbe Prompt-Zeichenkette, dieselbe Oberfläche, derselbe Markt und dieselbe Zahl von Durchläufen.

CRM-Software für kleine Unternehmen, USA, Googles AI Overview7. August8. August
Durchläufe44
Zitierte Domains117
In jedem Durchlauf zitiert37
Genau einmal zitiert40

Die Kategorie, die das Beispiel für Instabilität dieses Artikels lieferte, kam vollkommen stabil zurück. Siebenundzwanzig Prozent wurden über Nacht hundert, ohne dass sich bei uns etwas geändert hätte und ohne dass etwas übrig bliebe, um es wegzuerklären: identischer Prompt, identische Durchlaufzahl, ein Tag Abstand.

Eine Anmerkung dazu, wie knapp das schiefging, denn es ist genau die Falle, um die es in diesem Artikel geht. Die erste Wiederholung benutzte «what is the best CRM for a small business?» und ließ damit ein Wort des registrierten Prompts weg, und lieferte sieben von sieben bei fünf Durchläufen. Das sah nach demselben Ergebnis aus und war nicht derselbe Test. Der Vergleich oben verwendet die exakte Zeichenkette aus dem Register, denn ein Prompt, der sich um ein Wort unterscheidet, ist ein anderer Prompt, und diese Regel haben wir anderswo veröffentlicht.

Drei Dinge folgen daraus, und die ersten beiden haben uns etwas gekostet.

Die Stabilitätsrangfolge in der Tabelle oben ist eine Momentaufnahme von Sitzungen, keine Eigenschaft von Kategorien. Wir schrieben, dieser Artikel sei eine Fotografie und keine Reihe. Das ist es, was dieser Satz bedeutet, wenn man ihn einlöst: eine Kategorie kann an einem Tag von der instabilen Hälfte an die Spitze der Tabelle wandern. Wer unsere Tabelle nutzt, um zu entscheiden, wie oft er seine eigene Kategorie messen soll, sollte die Zeile als eine Beobachtung behandeln, was jede Zeile hier immer schon war.

Der von uns vermutete Mechanismus wird dadurch nicht gestützt. Wir haben vorgeschlagen, dass Instabilität der Zahl weitgehend austauschbarer Seiten folgt, die um die Antwort konkurrieren. Der Bestand an CRM-Seiten im Internet hat sich zwischen einem Freitag und einem Samstag nicht wesentlich verändert. Was sich bewegte, lag auf der Abrufseite und nicht im Korpus, eine stabile Zahl konkurrierender Seiten kann also nicht die ganze Geschichte sein.

Und der praktische Rat übersteht es unversehrt, aus einem Grund, der gesagt gehört. Nichts hier legt nahe, dass einmal messen sicher ist. Es legt das Gegenteil nahe: wenn eine einzelne Sitzung 27 % melden kann und die nächste 100 %, dann ist eine einzelne Sitzung genau das, worauf Sie sich nicht verlassen können. Die Abhilfe bleibt dieselbe und ist jetzt besser belegt: wiederholen, auf nicht gecachten Durchläufen, und die Durchlaufzahl neben jede Zahl schreiben.

Wir haben außerdem eine Kategorie ergänzt, die der ursprüngliche Satz nicht abdeckte, am selben Tag gemessen:

KategorieMarktDurchläufeZitierte DomainsIn jedem DurchlaufGenau einmal
Projektmanagement-SoftwareUSA31848

Achtzehn Domains bei drei Durchläufen, von denen vier alle drei überstehen, was sie zur instabilen Hälfte stellt und nicht zu Flügen und Coding-Assistenten.

Was das nicht zeigt

  • Eine Oberfläche, die Engine war hier also nie eine Variable. Nur Googles AI Overview. Jede Zahl dieses Artikels liegt innerhalb einer Oberfläche, was bedeutet, dass nichts darin Stabilität der Kategorie statt der Engine zuschreiben kann: wir haben die Engine nie variiert. Wir haben seither vier Oberflächen dieselbe Frage gestellt und gefunden, dass keine einzige zitierte Quelle auf allen vier erschien, einschließlich der Kategorie an der Spitze dieser Tabelle, deren Stabilität innerhalb der Oberfläche perfekt war.
  • Zehn Messungen. Genug, um festzustellen, dass die Spanne zwischen Kategorien groß und real ist. Nicht genug, um Kategorien genau zu ordnen, und ganz sicher nicht genug, um den oben vermuteten Mechanismus zu belegen.
  • Die Durchlaufzahlen unterscheiden sich. Eine Domain muss bei drei Durchläufen 3 von 3 treffen und bei vierzehn 14 von 14, das Maß wird also strenger, je mehr Durchläufe es gibt. Deshalb ruht das Argument auf den Paaren mit gleicher Durchlaufzahl und nicht auf der ganzen Tabelle. Es erklärt keine Lücke zwischen 0 % und 67 % Einmaligen bei identischer Durchlaufzahl.
  • Nichts Kausales. Das ist Beobachtung. Wir haben nichts geändert und gemessen, was zurückkam.
  • Nichts über Qualität. Zitiert zu werden heißt nicht, gut zu sein. Es sagt, was die Abrufschicht gefunden hat, nicht, was zu kaufen sich lohnt.
  • Eine Fotografie, keine Reihe. Das sind einzelne Sitzungen an benannten Tagen, und unsere eigenen Wiederholungen zeigen Sitzungen, die einander widersprechen. Behandeln Sie jede Zeile als eine Beobachtung.

Warum wir das veröffentlichen

Es spricht gegen die einfachste Version unseres eigenen Produkts. Ein Anbieter, der Messung von KI-Sichtbarkeit verkauft, hat einen offensichtlichen Anreiz zu sagen, dass Messung unkompliziert ist, dass eine Monatszahl bedeutet, wonach sie aussieht, und dass dasselbe Paket für alle passt.

Die Daten sagen in mehr als der Hälfte der geprüften Kategorien etwas anderes, unserer eigenen eingeschlossen. Uns ist lieber, die Zahl zu veröffentlichen, die den Verkauf verkompliziert, als eine einfachere zu verteidigen, die ein Kunde mit drei Durchläufen und einem Cent widerlegen kann.

Häufige Fragen zur Stabilität von KI-Antworten

Wie oft sollte ich einen Prompt laufen lassen, um KI-Sichtbarkeit zu messen?

Das hängt von der Kategorie ab, und Sie können es selbst herausfinden. Lassen Sie den Prompt dreimal mit ausdrücklich gesetztem Land und ausdrücklich gesetzter Sprache laufen und zählen Sie dann, wie viele zitierte Domains in allen dreien vorkommen. In unseren Messungen reichte diese Zahl von allen bis keiner. Wo sich die meisten Quellen wiederholen, sind drei Durchläufe eine echte Messung. Wo es wenige tun, brauchen Sie erheblich mehr, bevor eine Monatszahl etwas bedeutet.

Ändern sich KI-Antworten zwischen identischen Anfragen?

In manchen Kategorien fast gar nicht. Dreimal nach dem besten KI-Coding-Assistenten gefragt, zitierte Googles AI Overview dreizehn Domains, jedes Mal dieselben dreizehn. In anderen stark: vierzehn Durchläufe zu spanischen GEO-Agenturen zitierten neunundvierzig Domains, und keine davon erschien in jedem Durchlauf.

Welche Kategorien liefern die stabilsten KI-Zitate?

In unserer Stichprobe etablierte Verbraucher- und Produktkategorien: Flugbuchung, Noise-Cancelling-Kopfhörer und KI-Coding-Assistenten lieferten alle jede zitierte Domain in jedem Durchlauf. Am wenigsten stabil waren professionelle Dienstleistungen und aufkommende B2B-Software, wo die meisten zitierten Domains genau einmal erschienen.

Warum sollte eine neuere Kategorie stabiler sein als eine ältere?

Das Alter scheint nicht der Treiber zu sein. KI-Coding-Assistenten sind eine junge Kategorie und waren vollkommen stabil; CRM-Software ist Jahrzehnte alt und war es nicht. Unsere Hypothese ist, dass Stabilität davon abhängt, wie viele weitgehend austauschbare Seiten um die Antwort konkurrieren, sodass eine Kategorie mit wenigen klar primären Quellen diese beständig liefert, während eine überfüllte jedes Mal eine andere plausible Teilmenge liefert. Das ist eine Hypothese, kein Ergebnis.

Was bedeutet es, wenn meine Marke in einem Monat erscheint und im nächsten nicht?

In einer instabilen Kategorie durchaus möglicherweise nichts. Die meisten zitierten Domains erschienen dort in genau einem von drei oder vier Durchläufen, eine Änderung zwischen zwei einzelnen Beobachtungen liegt also klar im Rauschen. Bevor Sie das als echte Bewegung behandeln, prüfen Sie, wie viele Durchläufe hinter jeder Zahl stehen.

Zeigt Google immer ein AI Overview?

Nein, und das zählt für die Messung. Eine unserer Anfragen lieferte nur bei einer von drei Anfragen ein AI Overview, ohne Fehler bei den anderen beiden. Ein Bericht mit null Nennungen kann «es gab eine Antwort und Sie waren nicht darin» nicht von «es gab keine Antwort» unterscheiden, und die verlangen unterschiedliche Reaktionen.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)