Zum Inhalt springen
KI-SichtbarkeitForschung
DE

Wir haben neunzehnmal nach der besten Agentur gefragt, in vier Märkten. Das meiste Zitierte war im nächsten Durchlauf weg.

Neunzehn Kauffragen, vier Märkte, drei KI-Oberflächen, 46 Durchläufe. Von 408 zitierten Quellen erschienen 58% genau einmal.

· Aktualisiert · 19 Min. Lesezeit

Wir haben neunzehn Fragen der Form „welche ist die beste Agentur für X“ an drei KI-Oberflächen in vier Märkten gestellt. Zusammen zitierten sie 408 Quellen. Zweihundertachtunddreißig davon, 58%, erschienen in genau einem Durchlauf und waren im nächsten weg.

Das ist die Zahl, die eine Agentur kennen muss, bevor sie einen KI-Sichtbarkeitswert in einen Kundenbericht schreibt, denn sie entscheidet, was dieser Wert bedeutet. Eine einmal zitierte Quelle ist keine Position in der Antwort. Sie ist eine Münze, die richtig gefallen ist. Und der Anteil, der hält, den alle als Stabilitätswert verkaufen, trägt von der anderen Seite denselben Fehler: über alle unsere Messungen zusammengelegt sagt er vor allem, wie viele Quellen die Antwort zitiert hat.

Offenlegung: EchoWi verkauft Messung von KI-Sichtbarkeit und tritt in dieser Kategorie an. Das ist ein Interessenkonflikt, und die Antwort auf einen Konflikt ist eine prüfbare Methode und kein Versprechen von Neutralität. Alles, was man braucht, um das hier zu wiederholen, auch gegen uns, steht unten: die Fragen, die Oberflächen, die Märkte, die Zahl der Durchläufe und die Daten.


Die kurze Fassung

  1. Von 408 zitierten Quellen erschienen 238 genau einmal. Das sind 58%. Es waren auch 58%, als diese Studie vier Fragen kleiner war und zwei Märkte weniger hatte, was das Beruhigendste daran ist.
  2. Ein gutes Drittel hielt über alle Durchläufe. 129 von 408, also 32%. Dieses Drittel ist der einzige Teil einer KI-Antwort, auf dem sich eine Strategie bauen lässt.
  3. Die Zahl bewegt sich um 10 Punkte allein durch die Zahl der Durchläufe. Zweimal gestellte Fragen zeigen 37% stabile Quellen, dreimal gestellte 27%. Gleiche Methode, gleiche Oberflächen, gleiche Woche.
  4. Der Markt verändert die Antwort, aber nicht verlässlich. Von vier nach Branche und Durchlaufzahl gepaarten Vergleichen unterscheiden sich zwei um 15 und 35 Punkte und zwei um 3 und 2.
  5. Man bekommt nicht die Durchläufe, die man anfordert. Zehn der neunzehn Fragen ruhen auf zwei Durchläufen oder einem, weil die Messung vorher abbrach und es sagte. Zu notieren, was lief, statt was angefordert wurde, ist der Unterschied zwischen einem Nenner und einem Wunsch.

Was wir gemessen haben

Fragen19, alle der Form „welche ist die beste Marketingagentur für [Branche]“, in der Sprache des jeweiligen Marktes. 18 tragen einen Stabilitätswert; eine lieferte nur einen Durchlauf und bleibt aus allen Prozentzahlen heraus
BranchenHotels, Anwaltskanzleien, Kliniken, E-Commerce, Gesundheit, B2B-SaaS, White-Label-SEO und Hochschulen
OberflächenGoogle AI Overview, Google AI Mode und Gemini, je Frage zusammengefasst
MärkteUSA und Englisch, Spanien und Spanisch, Frankreich und Französisch, Deutschland und Deutsch, jeweils explizit gesetzt
Durchläufe46 insgesamt, 45 in der Auswertung, 1 bis 3 je Frage, je Frage notiert und nicht angenommen
CacheUmgangen. Jeder Durchlauf ist ein frischer Aufruf
Daten9. und 10. August 2026

Drei Dinge in dieser Tabelle entscheiden, ob irgendetwas davon etwas bedeutet.

Der Markt wird bei jedem Durchlauf explizit gesetzt. Die Messung startet standardmäßig auf den USA und Englisch. Eine deutsche Frage im Standard wird vom amerikanischen Markt beantwortet, und nichts in der Ausgabe sagt es, was vier verdächtig ähnliche Ergebnisse und eine völlig falsche Schlussfolgerung ergeben hätte.

Die Zahl der Durchläufe ist die, die tatsächlich lief. Zehn Fragen lieferten weniger Durchläufe als angefordert, und das Werkzeug sagte es. Dort drei zu schreiben hätte ein Drittel eines Nenners erfunden, und Nenner zu erfinden ist genau der Fehler, gegen den dieses Register existiert. Jede Frage unten ist eine Zeile im Messregister mit der Zahl, die zurückkam, nicht der angeforderten. Es heißt auch, dass Fragen mit zwei und mit drei Durchläufen nicht direkt vergleichbar sind, und das erwies sich als das Nützlichste der Studie.

ChatGPT fehlt. Es ist die Oberfläche, nach der am meisten gefragt wird, und die, deren Messung auf diesem Weg am wenigsten zu verteidigen ist, weil die genutzte Route keine Quellenliste dafür zurückgibt. Eine Null vom Instrument ist von einer echten Null nicht zu unterscheiden, also bleibt sie draußen, statt als Abwesenheit veröffentlicht zu werden.


Wie viel einer KI-Antwort still hält

Fasst man die drei Oberflächen je Frage zusammen, ergibt sich eine Menge zitierter Domains. Teilt man sie in die in jedem Durchlauf vorhandenen, die genau einmal vorhandenen und die dazwischen:

QuellenVon 408
In jedem Durchlauf zitiert12932%
Mehr als einmal, nicht immer4110%
Genau einmal zitiert23858%
in jedem Durchlauf zitiertunterschiedliche Quellen zitiertUSA · Kanzleien, 2 Durchl.13 → 20Spanien · Hotels, 2 Durchl.9 → 16Frankreich · Kliniken, 2 Durchl.8 → 16USA · B2B-SaaS, 2 Durchl.7 → 19USA · Hotels, 3 Durchl.6 → 17Spanien · E-Commerce, 3 Durchl.9 → 28USA · White-Label-SEO, 2 Durchl.8 → 25Frankreich · Kanzleien, 3 Durchl.7 → 22Frankreich · E-Commerce, 2 Durchl.9 → 29USA · Gesundheit, 2 Durchl.6 → 20USA · E-Commerce, 3 Durchl.7 → 24Deutschland · Kanzleien, 2 Durchl.7 → 25Frankreich · Hotels, 3 Durchl.7 → 26USA · Hochschulen, 3 Durchl.6 → 23Spanien · Kliniken, 3 Durchl.5 → 22Deutschland · Hotels, 2 Durchl.5 → 24Deutschland · Kliniken, 3 Durchl.6 → 29Spanien · Kanzleien, 3 Durchl.4 → 23
Jede Zeile ist eine Kauffrage. Der linke Punkt ist, was über alle Durchläufe hielt, der rechte alles überhaupt Zitierte, und der Abstand dazwischen ist der Teil, der beim nächsten Mal nicht mehr da ist. Google AI Overview, AI Mode und Gemini zusammengefasst, Cache umgangen, 9. und 10. August 2026.
In jedem Durchlauf zitierte Quellen gegen alle unterschiedlich zitierten Quellen, für die achtzehn Agentur-Kauffragen
in jedem Durchlauf zitiertunterschiedliche Quellen zitiert
USA · Kanzleien, 2 Durchl.1320
Spanien · Hotels, 2 Durchl.916
Frankreich · Kliniken, 2 Durchl.816
USA · B2B-SaaS, 2 Durchl.719
USA · Hotels, 3 Durchl.617
Spanien · E-Commerce, 3 Durchl.928
USA · White-Label-SEO, 2 Durchl.825
Frankreich · Kanzleien, 3 Durchl.722
Frankreich · E-Commerce, 2 Durchl.929
USA · Gesundheit, 2 Durchl.620
USA · E-Commerce, 3 Durchl.724
Deutschland · Kanzleien, 2 Durchl.725
Frankreich · Hotels, 3 Durchl.726
USA · Hochschulen, 3 Durchl.623
Spanien · Kliniken, 3 Durchl.522
Deutschland · Hotels, 2 Durchl.524
Deutschland · Kliniken, 3 Durchl.629
Spanien · Kanzleien, 3 Durchl.423

Keine der achtzehn Fragen hat eine stabile Mehrheit. Die beste ist eine US-Frage zu Anwaltskanzleien, 13 von 20, und die lief zweimal. Sie fiel am nächsten Tag auf 7 von 24, was weiter unten einen eigenen Abschnitt hat. Die schlechteste ist eine spanische Kanzleifrage, 4 von 23, über drei Durchläufe.


Die Zahl der Durchläufe verschiebt den Wert, und zwar um so viel

„In jedem Durchlauf zitiert“ ist bei zwei Durchläufen eine leichtere Hürde als bei drei. Das ist Arithmetik, kein Befund. Der Befund ist, dass sich die Größe aus einer einzigen Studie heraus beziffern lässt, weil beide Gruppen in derselben Woche mit derselben Methode gemessen wurden:

FragenStabiler AnteilGenau einmal zitiert
Zwei Durchläufe937%63%
Drei Durchläufe927%54%
Fragen mit zwei Durchläufen37%Fragen mit drei Durchläufen27%
Gleiche Methode, gleiche Oberflächen, gleiche Woche. Der einzige Unterschied ist, wie oft die Frage gestellt wurde. Zehn Punkte eines scheinbaren Stabilitätswerts sind die Zahl der Durchläufe und nichts sonst.
Anteil der in jedem Durchlauf zitierten Quellen, bei zweimal gegen dreimal gestellten Fragen
value
Fragen mit zwei Durchläufen37%
Fragen mit drei Durchläufen27%

Zehn Punkte. Auf einer Folie erzählen 37% und 27% zwei verschiedene Geschichten über die Position eines Kunden, und was sie hier trennt, ist weder der Kunde noch der Markt noch die Branche noch die Woche. Es ist, wie oft jemand auf den Knopf gedrückt hat.

Das ist die praktische Folge, und sie gehört unverblümt gesagt. Ein Sichtbarkeitswert ohne seine Durchlaufzahl ist keine Messung, sondern eine Überschrift. Wenn ein Werkzeug meldet, eine Marke erscheine in einem bestimmten Anteil der KI-Antworten, ist die erste Frage: in wie vielen Antworten, und die zweite: kamen diese Durchläufe aus einer Sitzung oder aus mehreren Tagen. Unsere kamen aus einzelnen Sitzungen, und genau deshalb behaupten wir nicht, diese Prozentzahlen beschrieben den August: sie beschreiben diese Durchläufe.

Die Variante von einem Tag auf den anderen haben wir getrennt gemessen, und sie ist schlimmer: dieselbe Frage zwei Tage später zu wiederholen reproduzierte die Zahlen fast genau und tauschte fast alle Namen aus. Und über sechs Kategorien statt einer lief die Zahl der Durchläufe, die eine Kategorie überhaupt zur Beschreibung braucht, von etwa drei bis etwa dreißig, weshalb ein einheitlicher Hausstandard den Kontakt mit einer zweiten Branche nicht überlebt.


Man bekommt nicht die angeforderten Durchläufe, und das ist keine Fußnote

Jede Frage dieser Studie forderte drei Durchläufe an. Zehn der neunzehn kamen mit zwei oder einem zurück, und die Messung sagte es jedes Mal, statt die Summe aufzufüllen. Als wir am 10. August vier weitere Fragen in Frankreich und Deutschland ergänzten, brachen drei der vier vorher ab und eine lieferte nur einen Durchlauf, weshalb diese eine in diesem Artikel nirgends einen Prozentwert trägt.

Das allein ist eine Veröffentlichung wert. Ein Stabilitätswert ist ein Bruch, und der Nenner ist nichts, was man wählt, sondern etwas, das einem gegeben wird. Wenn ein Werkzeug zehn Durchläufe anfordert, sechs bekommt und „in 60% der Durchläufe zitiert“ gegen einen Nenner von zehn meldet, ist die Zahl in einer Richtung falsch, die niemandem im Besonderen nützt und allen schadet.

Die Prüfung ist einfach und niemand bietet sie an: fragen Sie Ihren Anbieter, was passiert, wenn ein Durchlauf fehlschlägt. Lautet die Antwort, dass die angeforderte Zahl gemeldet wird, steckt in den Prozentwerten ein erfundener Nenner, und seine Größe ist von außen nicht sichtbar. Unsere steht als Spalte im Register: die Durchlaufzahl ist das, was zurückkam.


Wir haben zwei davon einen Tag später wiederholt, und die beste zerfiel

Alles oben ist innerhalb einzelner Sitzungen gemessen, was die Grenzen am Ende dieses Artikels von Anfang an als Schwäche benennen. Am 10. August haben wir daher zwei der Fragen vom 9. erneut gestellt, gleicher Markt, gleiche Oberflächen, gleiche Methode.

Frage9. August10. August
Kanzleien, USA13 von 20 stabil, 65%, 2 Durchläufe7 von 24 stabil, 29%, 2 Durchläufe
E-Commerce, USA7 von 24 stabil, 29%, 3 Durchläufe7 von 23 stabil, 30%, 2 Durchläufe

Die stabilste Frage der ganzen Studie war die am wenigsten reproduzierbare. Die Kanzleien fielen an einem Tag von 65% auf 29%, mit derselben Durchlaufzahl an beiden Tagen, es ist also nicht der oben beschriebene arithmetische Effekt. Es ist dieselbe Frage, die eine andere Antwort bekommt.

E-Commerce, ein gewöhnliches Ergebnis aus der Mitte, kam mit fast derselben Zahl zurück. Dort unterscheiden sich die Durchlaufzahlen, zwei gegen drei, es ist also kein sauberer Vergleich und wird auch nicht als solcher behandelt. Sagen lässt sich: die unauffällige Zahl reproduzierte sich, die auffällige nicht.

Das kehrt den Instinkt um. Ein einzelner hoher Stabilitätswert sieht aus wie der stärkste Beleg auf der Seite und ist der, dem am wenigsten zu trauen ist, weil es viel mehr Wege gibt, instabil zu sein als stabil, und ein Ausreißer weiter zu fallen hat. Wenn Sie vor dem Versand eines Kundenberichts eine einzige Zahl nachprüfen, prüfen Sie die beste.

Und manchmal hält sie, und genau deshalb lautet der Rat prüfen und nicht zweifeln. Eine Reisebuchungs-Frage, in derselben Woche auf denselben drei Oberflächen und mit denselben zwei Durchläufen gemessen, kam mit 24 von 25 stabilen Quellen zurück und dann mit 24 von 26 in einer zweiten Sitzung, beide Male mit denselben vierundzwanzig Domains. Eine hohe Zahl ist nicht verdächtig, weil sie hoch ist. Nachmessen trennt einen echten Kern von einer glücklichen Sitzung, und nur eines von beiden verdient ein Content-Briefing.

Eines können wir nicht sagen, und das ist unsere Schuld und nicht die der Methode. Die Zeilen vom 9. August notierten, wie viele Quellen stabil waren, nicht welche, also lassen sich die beiden Tage in der Größe vergleichen und nicht in der Identität.

Eine dritte Sitzung am selben Tag beantwortet den fehlenden Teil. Wir haben die Kanzleifrage am 10. August noch einmal gestellt, in einer frischen Sitzung. Sie brach nach einem Durchlauf ab, liefert also keine Stabilitätsrate und wir leiten keine ab. Ein Durchlauf kann trotzdem etwas anderes beantworten: welche Quellen wiederkamen.

Alle sieben stabilen Quellen der zweiten Sitzung kamen wieder: reddit.com, answeringlegal.com, natlawreview.com, exults.com, rebuttalpr.com, mycase.com und lawyerist.com. Zehn der siebzehn Einmal-Quellen jener Sitzung kamen ebenfalls wieder, drei Domains waren neu, und die beiden zitierten Mengen überlappen sich bei 0,63 nach Jaccard.

Der Prozentwert ist also schwankender als die Quellen, die er beschreibt. Eine Zahl, die sich um 36 Punkte bewegte, sitzt auf einem Kern, der sich überhaupt nicht bewegte. Das gehört in einem Kundenbericht getrennt: „Ihr Stabilitätswert ist gefallen“ und „die Seiten, die die Antwort tragen, haben sich geändert“ sind zwei verschiedene Sätze, und diese Woche war nur der erste wahr.

Der Grund ist mechanisch, nicht rätselhaft. „In jedem Durchlauf zitiert“ ist bei zwei oder drei Durchläufen ein Kriterium fast ohne Toleranz: eine Quelle, die in einem Durchlauf fehlt, verlässt den Zähler ganz, und bei einstelligem Zähler wird aus einer kleinen Änderung der Antwort ein großer Ausschlag im Prozentwert. Der Kern überlebt; die Statistik, die ihn beschreibt, nicht.

Die naheliegende Korrektur funktioniert nicht, und das ist einen Absatz wert. Wenn „in jedem Durchlauf zitiert“ zu spröde ist, ist der natürliche Ersatz die mittlere Zitierrate, die verzeiht, dass eine Quelle einen Durchlauf verpasst, statt sie zu verwerfen. Auf diese beiden Sitzungen angewandt wirkt sie deutlich gutmütiger: 0,825 fällt auf 0,646, ein relativer Rückgang von 22% gegen 55% beim stabilen Anteil.

Diese Verbesserung ist eine Täuschung, und die Algebra sagt es. Bei zwei Durchläufen wird eine Quelle einmal oder zweimal zitiert, ihre Rate ist also 0,5 oder 1, und der Mittelwert ist exakt 0,5 + 0,5 × (stabiler Anteil). Dieselbe Zahl auf einer halb so breiten Skala. Sie kann in keiner sinnvollen Weise weniger schwanken und trägt kein Bit, das die erste Zahl nicht schon trug.

Bei drei Durchläufen gibt es drei Stufen, ein Drittel, zwei Drittel und eins, und der Mittelwert hört auf, eine lineare Umformung des stabilen Anteils zu sein. Toleranz kauft man also mit Durchläufen, nicht mit Formeln. Eine cleverere Statistik über zwei Durchläufe ist Schminke, und wir hätten diese fast als Befund veröffentlicht.


Gleiche Branche, anderer Markt: die vier sauberen Vergleiche

Die meisten Marktvergleiche in diesen Daten sind durch die Durchlaufzahl verunreinigt. Vier sind es nicht, weil Branche und Durchlaufzahl übereinstimmen:

BrancheDurchläufeAbstand
Hotels2Spanien 56% (9 von 16)Deutschland 21% (5 von 24)35 Punkte
Kanzleien3Frankreich 32% (7 von 22)Spanien 17% (4 von 23)15 Punkte
E-Commerce3Spanien 32% (9 von 28)USA 29% (7 von 24)3 Punkte
Kliniken3Spanien 23% (5 von 22)Deutschland 21% (6 von 29)2 Punkte

Die Klinikzeile ist die, für die wir zurückgegangen sind. Die erste Fassung dieser Studie hatte drei dieser Vergleiche, zwei davon widersprachen einander, was nicht reicht, um ein Muster von einem Zufall zu trennen, also haben wir E-Commerce und Kliniken in Frankreich und Deutschland gemessen, eigens um saubere Paare zu gewinnen. Es brachte eines: die deutsche Klinikfrage ist die einzige der vier, die ihre drei Durchläufe lieferte.

Zwei der vier unterscheiden sich stark und zwei kaum. Das ist die ehrliche Zusammenfassung und nützlicher, als eine saubere Regel gewesen wäre. Der Markt ist kein Faktor, den man auf eine Zahl anwendet. Eine spätere Messung fand bei einer anderen Frage doch einen, indem sie dieselbe Zeichenkette erneut stellte statt innerhalb einer Lesung zu zählen, und die beiden Zahlen widersprechen sich nicht, weil sie Verschiedenes messen. Spanische Hotels liefern die zweitstabilste Antwort der ganzen Studie und spanische Kanzleien die instabilste, im selben Markt, in derselben Sprache, am selben Tag.

Wenn darin ein Muster steckt, sieht diese Studie es nicht. Sagen kann sie, dass eine Agentur, die dieselbe Messung für zwei Kunden in zwei Ländern fährt, mit unterschiedlicher Verlässlichkeit der beiden Berichte rechnen muss und den Unterschied nicht dem Kunden anlasten sollte.


Die zitierte Menge bewegt sich weniger als das Zitierte, und Deutschland ist die Ausnahme

MarktFragenDurchschnittlich unterschiedliche Quellen je Frage
USA721,1
Spanien422,3
Frankreich423,3
Deutschland326,0

Fünf Quellen zwischen dem breitesten und dem schmalsten, bei drei bis sieben Fragen je Markt. Kein Markt baut seine Antwort aus deutlich weniger Material, und der größte Markt benutzt am wenigsten davon.

Das zählt für alle, die einen Markteintritt planen und annehmen, ein kleinerer Markt sei eine leichter zu besetzende Antwort. Nach dieser Evidenz ist er nicht dünner, sondern etwas breiter und weniger stabil: Deutschland zitiert die meisten Quellen je Frage und behält davon die wenigsten über die Durchläufe. Deutschland ist auch auf der Ergebnisseite eine eigene Form: dort ranken lokale Agenturen die Tools anderer Unternehmen, während internationale Anbieter sich selbst ranken, was weder die amerikanische noch die spanische Seite so zeigt.


Was Sie damit tun, wenn Sie Kunden berichten

Schreiben Sie die Zahl der Durchläufe neben jeden Prozentwert. Es ist die einzige Änderung, die einen KI-Sichtbarkeitsbericht verteidigbar macht, und fast niemand in dieser Kategorie tut es. Unsere eigenen Zahlen bewegen sich allein dadurch um zehn Punkte.

Berichten Sie den stabilen Kern getrennt von der langen Schwanzverteilung. Ein Kunde, der zwanzig zitierte Quellen sieht und hört, er stehe in keiner davon, reagiert anders als einer, dem man sagt, die Antwort habe einen Kern von sechs und einen Schwanz von vierzehn, der sich jedes Mal ändert. Das Zweite stimmt, das Erste ist ein Schrecken.

Bauen Sie keinen Content-Plan gegen ein einmaliges Zitat. 58% dessen, wogegen Sie planen würden, ist beim Nachsehen nicht mehr da. Das Drittel, das hält, ist die Stelle, an der sich ein Briefing lohnt, und es ist klein genug, um es Seite für Seite zu benennen.

Fragen Sie Ihren Anbieter, ob seine wiederholten Durchläufe den Cache umgehen. Tun sie es nicht, ist eine tägliche Trendlinie konstruktionsbedingt flach, und ein darauf gebauter Stabilitätswert misst seine Infrastruktur und nicht Ihre Sichtbarkeit. Die Frage hat eine richtige Antwort und kostet nichts.

Und messen Sie den Markt, in dem Sie verkaufen, nicht den, den Ihr Werkzeug voreinstellt. Jeder Durchlauf hier hatte Land und Sprache explizit gesetzt, was nirgends die Voreinstellung ist, und das ist der Unterschied zwischen vier Ergebnissen und einem viermal kopierten.


Was diese Studie nicht zeigt

  • Neunzehn Fragen sind wenig. Vier Märkte, acht Branchen, und nur vier Branchen kommen in mehr als einem Markt vor. Jeder Prozentwert hier hat einen Nenner im Zehnerbereich, nicht im Tausenderbereich.
  • Eine Frage bleibt aus allen Prozentwerten heraus. Die deutsche E-Commerce-Frage lieferte nur einen Durchlauf, und in dieser Größe ist jede Quelle trivialerweise stabil und trivialerweise einmalig. Sie steht im Register, weil das Register festhält, was geschah, und außerhalb der Auswertung, weil sie deren Frage nicht beantworten kann.
  • Zwei und drei Durchläufe sind nicht dasselbe Experiment, weshalb sie getrennt berichtet werden statt in einer Überschrift zusammengefasst. Die 32% mischen beide und lesen sich als Mittelwert, nicht als Rate. Sie überstanden das Wachstum der Studie von fünfzehn auf neunzehn Fragen und von zwei auf vier Märkte, was ein Beleg für einen stabilen Mittelwert ist, kein Beweis.
  • Zwei Fragen haben einen zweiten Tag, siebzehn nicht. Durchläufe innerhalb einer Sitzung sprechen über diese Sitzung, und die beiden wiederholten sind sich uneinig, wie sehr das zählt.
  • Drei Oberflächen, nicht vier. ChatGPT bleibt draußen, weil die genutzte Route keine Quellenliste dafür zurückgibt, und das als Null zu veröffentlichen hieße, unser Instrument zu veröffentlichen.
  • Eine Formulierung je Frage. Eine spanische Studie derselben Fragenklasse nutzte vier Formulierungen und fand 49 zitierte Quellen, von denen keine in allen vier auftauchte, diese Mengen gehören also zu diesen Formulierungen und nicht zur Absicht dahinter.
  • Zitiert heißt nicht empfohlen, und Abwesenheit ist kein Urteil. Eine zitierte Quelle hat die Frage gut beantwortet. Eine fehlende kann ausgezeichnet sein und schlicht unbeschrieben.
  • Nichts hiervon ist kausal. Wir haben nichts verändert und festgehalten, was zurückkam.
  • Die deutsche Hotelfrage ist uneben. AI Overview antwortete einmal, wo die beiden anderen Oberflächen zweimal antworteten, und sie steht mit zwei Durchläufen da statt geglättet.

Häufige Fragen zu dieser Studie

Wie stabil sind KI-Antworten bei Agentur-Kauffragen?

Ein gutes Drittel der zitierten Quellen hielt über alle Durchläufe, und 58% erschienen genau einmal. Über neunzehn Fragen und vier Märkte hat keine Frage eine stabile Mehrheit: die beste liegt bei 13 von 20 Quellen über zwei Durchläufe, die schlechteste bei 4 von 23 über drei. Eine einzelne KI-Antwort auf eine Kauffrage besteht überwiegend aus Quellen, die in der nächsten nicht mehr vorkommen.

Warum verändert die Zahl der Durchläufe einen KI-Sichtbarkeitswert?

Weil „in jedem Durchlauf zitiert“ bei zwei Durchläufen eine leichtere Hürde ist als bei drei. In dieser Studie zeigten zweimal gestellte Fragen 37% stabile Quellen und dreimal gestellte 27%, gemessen in derselben Woche mit derselben Methode. Zehn Punkte eines scheinbaren Stabilitätswerts sind die Zahl der Durchläufe und nichts sonst, und deshalb lässt sich ein ohne seinen Nenner veröffentlichter Prozentwert mit nichts vergleichen.

Unterscheiden sich KI-Antworten zwischen Ländern bei derselben Frage?

Manchmal stark und manchmal gar nicht. Vergleicht man nur Fragen gleicher Branche und gleicher Durchlaufzahl, unterscheiden sich spanische und deutsche Hotelantworten um 35 Stabilitätspunkte, französische und spanische Kanzleiantworten um 15, spanische und amerikanische E-Commerce-Antworten um 3 und spanische und deutsche Klinikantworten um 2. Zwei große und zwei kleine Abstände aus vier Vergleichen ergeben keine Regel über Märkte.

Sollte eine Agentur ihren Kunden KI-Sichtbarkeit berichten?

Ja, mit zwei Dingen daneben: der Zahl der Durchläufe hinter jedem Prozentwert und einer Trennung zwischen den Quellen, die jedes Mal erscheinen, und denen, die einmal erscheinen. Ohne die Durchlaufzahl lässt sich der Wert nicht mit dem nächsten Bericht vergleichen. Ohne die Trennung liest ein Kunde eine lange Kette von Zufällen als Wettbewerbsposition.

Welche KI-Oberflächen wurden gemessen?

Google AI Overview, Google AI Mode und Gemini, je Frage zusammengefasst, mit umgangenem Cache, damit jeder Durchlauf ein frischer Aufruf ist. ChatGPT fehlt bewusst: die hier genutzte Route gibt keine Quellenliste dafür zurück, und eine vom Instrument erzeugte Null ist von einer echten Null nicht zu unterscheiden.

Wie wiederhole ich diese Messung?

Stellen Sie dieselbe Frage mit explizit gesetztem Land und explizit gesetzter Sprache, mindestens dreimal, auf jeder Oberfläche einzeln, mit abgeschaltetem Cache, und notieren Sie, was tatsächlich lief, statt was Sie angefordert hatten. Dieser letzte Teil ist keine Pedanterie: zehn unserer neunzehn Fragen kamen mit weniger Durchläufen zurück als angefordert. Zählen Sie dann drei Dinge: unterschiedliche Quellen, in jedem Durchlauf vorhandene Quellen und genau einmal vorhandene Quellen. Diese drei Zahlen sind die ganze Studie, und die dritte veröffentlicht niemand.


Wo Sie das hinstellt

Was wir nicht erwartet hatten, ist, wie wenig eine KI-Antwort trägt. Neunzehn Fragen, vier Märkte, drei Oberflächen, und 58% von allem Zitierten war ein Einmaliges. Diese Zahl bewegte sich nicht, als die Studie um vier Fragen und zwei Märkte wuchs, was das Nächste an einer Replikation ist, das sie hat.

Woran gearbeitet wird, ist das Drittel, das hält, und es ist klein genug, um benannt zu werden: sechs oder sieben Quellen je Frage. Das ist ein Content-Briefing, kein Dashboard, und es ist dieselbe Schlussfolgerung wie beim Messen dessen, was die KI zitiert, wenn man sie nach Universitäten fragt, wo der stabile Kern aus Studentenwohnheimen und Nachhilfe bestand statt aus den Hochschulen selbst.

Wenn Sie Sichtbarkeitsberichte für Kunden fahren, ist die billigste verfügbare Verbesserung kein besseres Werkzeug. Es ist, die Durchlaufzahl neben den Prozentwert zu drucken und den Kern vom Schwanz zu trennen. Beides ist gratis, und beides ist der Unterschied zwischen einem Bericht, auf den ein Kunde handeln kann, und einer Zahl, die er Ihnen vorhält, wenn sie sich bewegt.

Wenn Sie diese Messung für Ihre eigenen Kunden wollen, wir machen das mit Agenturen.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)