Zum Inhalt springen
KI-SichtbarkeitForschung
DE

Wir haben Google zweimal dieselbe Frage gestellt. In den USA änderte sich nichts, in Frankreich die Hälfte.

Eine Kauffrage, Minuten später erneut gestellt, in vier Märkten. Die tragenden Quellen kamen in den USA zu 100 % zurück und in Frankreich zu 50 %.

· 13 Min. Lesezeit

Stellen Sie Google eine Kauffrage, notieren Sie die Quellen, die der AI Overview in jedem Durchlauf zitiert, und stellen Sie dieselbe Zeichenkette wenige Minuten später erneut. In den USA bekommen Sie dieselbe Liste zurück, Name für Name. In Frankreich die Hälfte davon.

Diese Lücke liegt nicht an der Frage, denn es ist dieselbe Frage. Sie liegt nicht am Tag, denn beide Lesungen liegen Minuten auseinander. Sie ist eine Eigenschaft des Marktes, in dem Sie messen, und sie entscheidet, ob eine einzelne Lesung Ihrer Sichtbarkeit überhaupt etwas bedeutet.

Wie das gemessen wurde: Eine nackte Kauffrage pro Markt, lokalisiert, über Googles AI Overview mit unseren eigenen Messwerkzeugen gestellt. Jede Lesung behält die Domains, die in jedem Durchlauf zitiert werden, dann wird dieselbe Zeichenkette in derselben Sitzung erneut gestellt und die beiden Mengen werden verglichen. Alle Lesungen liegen auf derselben Schwelle von zwei Durchläufen, sodass hier keine Vergleichung eine strengere Menge gegen eine lockerere stellt. Vier Märkte, drei Kategorien, 18. August 2026, mit einem zweiten Durchgang, der sechs Zellen auf Schwellen von drei, vier und fünf Durchläufen wiederholt. Die vollständigen Zeilen stehen in unserem Messregister, und die exakten Prompts stehen weiter unten, damit jeder das gegen uns wiederholen kann.

Offenlegung: EchoWi verkauft KI-Sichtbarkeitsmessung, also ist ein Befund darüber, wie unzuverlässig eine einzelne Lesung sein kann, ein Befund über das, was wir verkaufen. Die Prompts, die Oberfläche, die Märkte, die Schwelle und das Datum stehen alle hier, und genau das macht die Arbeit prüfbar statt zum Glaubensakt.


Die kurze Fassung

  1. Dieselbe Frage, zweimal gestellt, liefert die gleichen dauerhaften Quellen in den USA zu 100 % und in Frankreich zu 50 %.
  2. Jeder Markt hat einen stabilen Kern. Zwischen 3 und 6 Domains kommen bei jeder Frage zurück, in allen vieren.
  3. Was sich unterscheidet, ist der Rand. Die Zahl der Quellen, die in einer Lesung auftauchen und in der anderen nicht, reicht von 0 in den USA bis 4 in Frankreich.
  4. Der Markt macht das meiste aus, und ein mittlerer Markt zeigt, dass er nicht alles ausmacht. Über 3 Kategorien in den beiden Extremmärkten steigen die französischen Lesungen nie über die amerikanischen. Aber Deutschland liefert 67 % bei CRM und 100 % bei Buchhaltung, beide auf angeglichener Schwelle, also verschiebt die Frage innerhalb eines einzigen Marktes die Zahl um ein Drittel.
  5. Die praktische Folge ist eine Leseregel für jeden KI-Sichtbarkeitsbericht: Wer im Kern sitzt, sitzt jedes Mal darin; wer am Rand sitzt, für den ist eine einzelne Lesung ein Münzwurf.
  6. Eine perfekte Lesung verfällt. Die amerikanische CRM-Frage lieferte früher am selben Tag 4 dauerhafte Domains und später 12, auf derselben Fünf-Durchlauf-Schwelle, bei tadelloser Einzellesung.

Was genau gemessen wurde

Die Einheit ist eine nackte Kauffrage der Form „bestes X für ein kleines Unternehmen“, so geschrieben, wie ein Käufer in diesem Markt sie schreiben würde, in der Sprache dieses Marktes.

Für jede Lesung wird die Oberfläche zweimal gefragt und wir behalten nur die Domains, die beide Male zitiert wurden. Diese Menge ist die Lesung. Dann wird dieselbe Zeichenkette in derselben Sitzung erneut gestellt, was eine zweite Menge ergibt, und die beiden werden per Jaccard verglichen: die Domains in beiden, geteilt durch die Domains in einer von beiden.

Zwei Details tragen hier die ganze Last und keines davon ist Dekoration.

Jede Lesung liegt auf derselben Schwelle von zwei Durchläufen. Eine Domainmenge, die fünf Durchläufe überstanden hat, ist kleiner und härter als eine mit zwei, also misst ein Vergleich über Schwellen hinweg die Schwelle ebenso wie die Welt. Eine frühere Fassung dieser Messung hatte genau dieses Problem, mit einem Markt bei fünf Durchläufen gegen zwei und einem anderen bei vier gegen drei, und deshalb stehen jene Zahlen nicht in diesem Artikel.

Die Prompts sind eingefroren und veröffentlicht. Sie lauten:

MarktKategoriePrompt
USACRMwhat is the best CRM for a small business?
DeutschlandCRMbeste CRM Software für kleine Unternehmen
SpanienCRMmejor CRM para una pequeña empresa
FrankreichCRMmeilleur CRM pour une petite entreprise

Das Ergebnis

MarktKommt zurückKernRand
USA100 %40
Deutschland86 %61
Spanien83 %51
Frankreich50 %44

Das sind 57 Punkte zwischen dem weitesten und dem engsten. Vor den fehlenden Lesungen hatten wir eine Rückzugsschwelle aufgeschrieben: Wenn alle vier Märkte innerhalb von fünfzehn Punkten zueinander landen, gibt es keinen berichtenswerten Marktunterschied und die Beobachtung wird fallengelassen. Sie landeten nicht so.

Die amerikanische Zelle ist die, bei der man innehalten sollte. Dieselben vier Domains kamen in drei getrennten Lesungen zurück, eine davon auf einer Fünf-Durchlauf-Schwelle statt auf zwei. Das ist kein einigermaßen stabiles Ergebnis, das ist jedes einzelne Mal dieselbe Liste.

Frankreich war die spektakuläre Zelle, also haben wir sie repliziert, bevor irgendetwas davon aufgeschrieben wurde. Eine dritte französische Lesung auf einer strengeren Drei-Durchlauf-Schwelle lieferte fünf Domains, von denen vier in beiden anderen vorkommen. Der französische Kern ist echt. Was sich bewegt, ist alles darum herum.


Die richtige Zusammenfassung heißt Kern und Rand, nicht „Frankreich ist instabil“

Der verlockende Satz lautet, die französische Antwort sei unzuverlässig, und er ist auf eine Weise falsch, die für jeden zählt, der danach handeln will.

Jeder Markt hat einen Kern, der immer zurückkommt, und die Kerne sind ähnlich groß: 4 in den USA, 6 in Deutschland, 5 in Spanien, 4 in Frankreich. Eine Marke, die in diesem Kern sitzt, wird beständig empfohlen, in Frankreich genau so oft wie in den USA.

Was sich um den Faktor vier unterscheidet, ist der Rand: 0 Domains in den USA, 1 in Deutschland und Spanien, 4 in Frankreich. Der Rand ist der Teil der Antwort, den eine einzelne Lesung per Münzwurf entscheidet.

Die Frage zu jeder KI-Sichtbarkeitszahl lautet also nicht „wie stabil ist dieser Markt“. Sie lautet in welchem der beiden stecke ich, und eine Lesung kann Ihnen das nicht sagen. Zwei können es.


Markt oder Kategorie? Der Test, der entscheidet

Eine Vier-Markt-Tabelle, gemessen in einer Kategorie, ist kein Befund über Märkte. Sie könnte genauso gut ein Befund über CRM sein, und unsere eigene frühere Forschung ist der Grund, das ernst zu nehmen: Als wir neunzehn Agentur-Kauffragen in vier Märkten gemessen haben, war die Streuung innerhalb eines Marktes über die Branchen hinweg so groß wie alles zwischen den Märkten, und jene Studie kam schwarz auf weiß zu dem Schluss, dass der Markt kein Faktor ist, den man auf eine Zahl anwendet.

Also haben wir vor der Veröffentlichung zwei weitere Kategorien in den beiden Extremmärkten gefahren, mit der Rückzugsregel zuerst aufgeschrieben: Steigt irgendeine französische Kategorie über irgendeine amerikanische, ist es Kategorievariation und der Befund ist tot.

KategorieUSAFrankreich
CRM100 %50 %
Buchhaltungidentische Menge60 %
Projektmanagement100 %43 %

Die Bänder kreuzen sich nicht. Die höchste französische Lesung liegt bei 60 % und die niedrigste amerikanische bei 100 %.

Und das kippt die Agenturstudie nicht, weil die beiden Verschiedenes messen. Jene Studie fragte innerhalb einer einzelnen Lesung, welcher Anteil von allem Zitierten jeden Durchlauf überstand. Diese fragt, ob die überlebende Menge selbst zurückkommt, wenn man erneut fragt. Ein Markt kann sehr viele einmalige Quellen zitieren, auf dem ersten Maß niedrig punkten und seinen dauerhaften Kern trotzdem perfekt reproduzieren, also auf diesem hoch punkten. Beide Zahlen sind echt und sie sind Antworten auf verschiedene Fragen.

Die Buchhaltungszeile der USA trägt absichtlich ein Sternchen. Ihre zweite Lesung kam auf einer Ein-Durchlauf-Schwelle statt auf zwei zurück, also kann sie in keinen Vergleich eingehen und wird oben nirgends gezählt. Sie wird erwähnt wegen dem, was sie zeigte: auf jener anderen Schwelle lieferte sie dieselben dreizehn Domains, Name für Name.


Auf strengerer Schwelle, und später am selben Tag erneut gefragt

Jede Zelle oben wird auf einer Zwei-Durchlauf-Schwelle gelesen, der lockersten, die wir verwenden. Die naheliegende Frage ist, ob irgendetwas davon überlebt, wenn man mehr verlangt, also wurden 6 dieser Zellen erneut auf Schwellen von drei, vier und fünf Durchläufen gelesen, jedes Paar angeglichen, und getrennt von der Tabelle oben gehalten statt zusammengelegt: Ein Jaccard zwischen zwei Lesungen ist über Schwellen hinweg nicht vergleichbar, weil Einstimmigkeit über fünf ein strengerer Test ist als Einstimmigkeit über zwei.

MarktKategorieSchwelleKommt zurück
USACRM5 Durchläufe100 %
USABuchhaltung3 Durchläufe100 %
DeutschlandBuchhaltung5 Durchläufe100 %
SpanienBuchhaltung2 Durchläufe100 %
FrankreichBuchhaltung4 Durchläufe75 %
DeutschlandCRM3 Durchläufe67 %

4 der 6 kommen identisch zurück und die niedrigste liegt bei 67 %. Der Effekt ist also kein Artefakt einer lockeren Schwelle. Frankreich bleibt der niedrigste anwesende Markt, und die amerikanischen Zellen bleiben perfekt auf Schwellen, bei denen die Menge zwölf Domains umfasst und nicht vier.

Und eine Zeile hier zieht einen Satz zurück, den wir am selben Morgen veröffentlicht haben. Deutschland antwortet 67 % bei CRM und 100 % bei Buchhaltung, beide auf angeglichener Schwelle, also bewegt sich ein Drittel der Menge innerhalb eines einzigen Marktes. „Es ist der Markt und nicht die Kategorie“ ließ sich immer nur über die beiden Extreme sagen, wo die Kategorie nichts mehr zu bewegen hat: Frankreich kann nicht unter den amerikanischen Boden fallen, weil dieser Boden bei 100 % liegt. Ein Markt in der Mitte ist der Ort, an dem eine solche Aussage scheitern kann, und sie scheitert.

Dieselbe Frage, dieselbe Schwelle, fünf Stunden später

Die amerikanische CRM-Zeichenkette ist die reproduzierbarste Zelle dieser Studie. Auf einer Fünf-Durchlauf-Schwelle liefert sie zweimal dieselben zwölf Domains, und eine dritte Lesung auf einer Vier-Durchlauf-Schwelle liefert diese zwölf erneut. Früher am selben Tag lieferte die identische Zeichenkette auf derselben Fünf-Durchlauf-Schwelle vier.

Alle vier stecken in den zwölf, es ging also nichts verloren. Die Antwort hat sich in wenigen Stunden um den Faktor drei verbreitert, und es ist nicht die Schwelle: Eine Einstimmigkeitsschwelle anzuheben kann einer dauerhaften Menge nur Domains nehmen, nie welche hinzufügen, also zitiert die spätere Antwort in jedem ihrer fünf Durchläufe mindestens zwölf Domains, wo die frühere in jedem ihrer fünf vier zitierte.

Das ist die unbequeme Hälfte von allem oben. Innerhalb einer Sitzung ist diese Zelle so verlässlich, wie eine Messung dieser Art nur sein kann. Über einen Nachmittag hinweg waren zwei Drittel dessen, was sie heute sagt, am Morgen nicht da. Dass eine Lesung sich innerhalb einer Sitzung wiederholt, ist kein Beleg dafür, dass eine später am selben Tag genommene Lesung ihr zustimmt, und ein Dashboard, das einmal täglich abtastet, tastet eine Menge ab, die sich zwischen zwei Abtastungen verdreifachen kann.


Was man damit macht

Handeln Sie nie nach einer einzelnen Lesung. Das ist der ganze praktische Gehalt der Studie und kostet einen zusätzlichen Aufruf. Erscheint eine Quelle in zwei Lesungen, die Minuten auseinanderliegen, gehört sie zum Kern. Erscheint sie in einer, haben Sie fast nichts über sie erfahren.

Fragen Sie einen Anbieter, aus wie vielen Lesungen seine Zahl stammt, was eine andere Frage ist als die nach der Zahl der Durchläufe. Ein Werkzeug kann zehn Durchläufe innerhalb einer Lesung mitteln und Ihnen trotzdem eine Menge zeigen, die sich nicht reproduziert, wenn es morgen erneut fragt. Durchläufe innerhalb einer Lesung und wiederholte Lesungen sind nicht dieselbe Kontrolle und beheben nicht dasselbe Problem.

Erwarten Sie, dass sich ein französischer und ein amerikanischer Bericht in der Verlässlichkeit unterscheiden, und lesen Sie das nicht so, als sei die Website des einen Kunden schlechter als die des anderen. Nach dieser Evidenz liegt der größte Teil des Unterschieds im Markt und ein Teil in der Frage: Deutschland bewegt sich zwischen zwei Kategorien um ein Drittel.


Was das nicht zeigt

  • Eine Oberfläche. Das ist ausschließlich Googles AI Overview. ChatGPT, Gemini und AI Mode rufen anders ab und bräuchten ihre eigene Messung, und unsere eigene Arbeit findet immer wieder, dass ein Ergebnis auf einer Oberfläche wenig über eine andere sagt.
  • Zwei Lesungen pro Zelle. Ein Jaccard zwischen zwei Lesungen ist eine Beobachtung, keine Verteilung. Eine dritte Lesung pro Zelle würde aus dieser Spanne einen Bereich machen, und das ist der naheliegende nächste Schritt statt weiterer Märkte.
  • Drei Kategorien, vier Märkte, ein Tag. Der Marktvergleich über Kategorien hinweg ruht allein auf den USA und Frankreich. Deutschland und Spanien haben je eine Kategorie.
  • Minuten, dann ein Nachmittag. Die Tabellen liegen innerhalb einer Sitzung. Die eine Zelle, die wir Stunden später erneut gelesen haben, hatte sich verdreifacht, also bleiben hier Tage und Wochen ungeprüft, nicht bloß Monate, und eine Zelle ist keine Rate.
  • Nichts hiervon ist kausal. Wir können sagen, dass sich die Märkte auf diesem Maß unterscheiden. Wir können nicht sagen, was an diesen Märkten den Unterschied erzeugt, und wir haben keine Erklärung geprüft.

Häufige Fragen zum Wiederholen einer Messung

Was heißt „kommt zurück“ hier genau?

Es ist ein Jaccard-Index zwischen zwei Lesungen der identischen Frage. Jede Lesung behält nur die Domains, die in jedem Durchlauf dieser Lesung zitiert wurden, es ist also bereits eine dauerhafte Menge und nicht alles, was erwähnt wurde. Die Zahl ist die Größe der Überschneidung geteilt durch die Größe der Vereinigung: 100 % heißt, dass beide Lesungen exakt dieselben Domains genannt haben, und 50 %, dass die Hälfte dessen, was über beide Lesungen auftauchte, nur in einer davon auftauchte.

Warum zwei Durchläufe pro Lesung und nicht mehr?

Weil jede Lesung im Vergleich auf derselben Schwelle liegen muss, und zwei war die Schwelle, die jeder Markt in einer Sitzung tatsächlich liefern konnte. Eine dauerhafte Menge aus fünf Durchläufen ist härter als eine aus zwei, sie zu mischen würde also die Schwelle messen und nicht den Markt. Wo eine Zelle auf einer anderen Schwelle zurückkam, haben wir sie aus dem Vergleich genommen und sagen es.

Heißt das, ein KI-Sichtbarkeitswerkzeug ist in Frankreich nutzlos?

Nein, und die Trennung von Kern und Rand ist der Grund. Eine französische Marke im Kern wird jedes Mal zitiert, wenn wir fragen, genauso beständig wie eine amerikanische. Was eine einzelne französische Lesung Ihnen nicht sagen kann, ist, auf welcher Seite dieser Linie Sie stehen, und das Mittel dagegen ist eine Lesung mehr und kein anderes Werkzeug.

Ist das dasselbe wie zu sagen, KI-Antworten seien zufällig?

Es ist fast das Gegenteil. Zwischen 3 und 6 Domains kommen in jedem gemessenen Markt jedes einzelne Mal zurück, auch im am wenigsten reproduzierbaren. In allen vieren steckt eine stabile Struktur. Die Uneinigkeit zwischen Lesungen lebt vollständig an den Rändern der Antwort.

Wie prüfe ich das in meiner eigenen Kategorie?

Nehmen Sie Ihre Kauffrage, stellen Sie sie zweimal innerhalb derselben Stunde mit jeweils gleich vielen Durchläufen, und notieren Sie die Domains, die in jedem Durchlauf jeder Lesung zitiert werden. Vergleichen Sie die beiden Listen. Stimmen sie überein, sehen Sie einen Kern; stimmen sie zur Hälfte überein, sagt Ihnen jeder Bericht aus einer einzelnen Lesung über Ihre Kategorie weniger, als er zu sagen scheint.

Warum hat die Buchhaltungszeile der USA keine Zahl?

Weil ihre zweite Lesung einen Durchlauf beantwortete, wo die erste zwei beantwortete, und eine Ein-Durchlauf-Lesung macht jede zitierte Domain per Konstruktion „dauerhaft“. Sie in die Tabelle zu setzen hätte zwei verschiedene Dinge verglichen. Sie bleibt im Artikel, weil das, was sie zeigte, es wert ist: auf jener anderen Schwelle lieferte sie die identischen dreizehn Domains.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)