Zum Inhalt springen
AI VisibilityResearch
DE

Wir haben dieselbe Hotelbuchung auf vier Arten gefragt. In Spanien bewegte sich die Zahl kaum und keine einzige Quelle überlebte.

Eine Absicht, vier Formulierungen, zwei Märkte. In Spanien hielt der stabile Anteil zwischen 30 % und 48 %, während null Domains alle vier überstanden.

· Aktualisiert · 11 Min. Lesezeit

Wir haben eine Frage genommen, wie man ein Hotel bucht, und sie in den Vereinigten Staaten auf vier Arten gestellt und in Spanien auf vier Arten. In Spanien kam der stabile Anteil mit 42 %, 41 %, 48 % und 30 % zurück, was wie eine verlässliche Messung einer Kategorie aussieht. Über diese vier Formulierungen hinweg war die Zahl der Quellen, die alle vier überstanden, null.

Das ist der Befund, und er ist schlimmer als Instabilität. Eine Kennzahl, die sich bewegt, sagt Ihnen, dass man ihr nicht trauen kann. Diese hier steht still, während das, was darunter liegt, vollständig ausgetauscht wird.

Disclosure: EchoWi verkauft Messung von KI-Sichtbarkeit, und diese Studie widerspricht etwas, das wir fünf Tage zuvor veröffentlicht haben. Die Antwort auf einen Interessenkonflikt ist eine prüfbare Methode, also stehen die vier Formulierungen, die zwei Märkte, die drei Oberflächen, die Durchgangszahlen und das Datum alle unten, und jede Zeile steht in unserem öffentlichen Messregister.


Die kurze Fassung

  1. In Spanien hielt die Rate und die Quellen nicht. Vier Formulierungen ergaben 42 %, 41 %, 48 % und 30 % stabil. Über alle vier hinweg erschienen null Domains in jedem Durchgang jeder Formulierung.
  2. In den Vereinigten Staaten verschob eine Umformulierung die Rate um 57 Punkte, von 92 % auf 35 %, ohne dass sich außer den Worten etwas geändert hätte.
  3. Unser eigenes bestes veröffentlichtes Ergebnis überlebt das nicht. Die Reisestudie fand 24 Domains, die über die Durchgänge hielten, und nannte das einen Kern, auf dem man aufbauen kann. Fragt man dasselbe auf vier Arten, ist der Kern drei Domains: reddit.com, youtube.com und frommers.com.
  4. Die Empfindlichkeit gegenüber der Formulierung ist selbst eine Eigenschaft des Marktes. Die amerikanische Frage schwankte über die Formulierungen um 57 Punkte. Die spanische um 18.
  5. Eine Formulierung konnte in keiner von zwei Sitzungen verlässlich überhaupt ein AI Overview erzeugen, was eine Tatsache über diesen Satz ist und nicht über die Oberfläche.

Was wir gemessen haben

AbsichtEin Hotel buchen, festgehalten
Formulierungen4 je Markt, in der Sprache des Marktes, jede eine Art, wie ein Mensch tatsächlich fragt
MärkteVereinigte Staaten auf Englisch, Spanien auf Spanisch, beides ausdrücklich gesetzt
OberflächenGoogle AI Overview, Google AI Mode und Gemini, je Formulierung zusammengefasst
Durchgänge2 je Formulierung, je Formulierung erfasst statt angenommen
CacheUmgangen. Jeder Durchgang ist ein frischer Aufruf
Datum10. August 2026

Die vier englischen Formulierungen waren “what is the best website to book hotels”, “where should I book a hotel online”, “which hotel booking site is most reliable” und “best site for cheap hotel deals”. Die vier spanischen spiegeln sie. Jede der acht steht im Register mit ihrem Prompt genau so, wie er gesendet wurde.

Zwei Zeilen tragen eine Notiz statt einer sauberen Lesung, und beide stehen im Register. Die zweite englische Formulierung wurde zweimal gemessen, weil ihre erste Sitzung kaputt aussah; sie war es nicht, und beide Sitzungen werden berichtet. Die dritte spanische Formulierung brach beim ersten Versuch nach einem einzigen Durchgang ab, was jede Quelle trivial stabil macht, also ist dieser Versuch aus jeder Zahl hier ausgeschlossen und bleibt im Register, weil er stattgefunden hat.

Dieses Design hat einen Zweck: unsere eigene stärkste veröffentlichte Aussage anzugreifen. Vor fünf Tagen berichteten wir, eine amerikanische Hotelfrage halte 24 von 25 Quellen über die Durchgänge, dann 24 von 26 in einer zweiten Sitzung, dieselben vierundzwanzig Domains beim Namen, und wir schrieben, sechs oder sieben stabile Quellen seien ein Content-Briefing und vierundzwanzig eine Landkarte. Diese Studie fragt, wovon diese Landkarte eine Karte ist.


Die acht Zellen

MarktFormulierungStabiler AnteilZitiertGehalten
Vereinigte Staaten„what is the best website to book hotels“92 %2422
Vereinigte Staaten„which hotel booking site is most reliable“83 %1815
Vereinigte Staaten„best site for cheap hotel deals“58 %3118
Vereinigte Staaten„where should I book a hotel online“35 %207
Spanien„¿qué web de reservas de hotel es más fiable?“48 %2512
Spanien„¿cuál es la mejor web para reservar hoteles?“42 %3113
Spanien„¿dónde reservo un hotel por internet?“41 %2711
Spanien„mejor web para ofertas de hotel baratas“30 %206

Lesen Sie die zwei Blöcke unterschiedlich, denn sie versagen auf zwei verschiedene Arten. Der amerikanische Block ist ein Absturz von 57 Punkten, den jedes Dashboard als Problem zeigen würde. Der spanische Block sind vier Zahlen innerhalb eines Bandes von 18 Punkten, was jedes Dashboard als eine sich gleichmäßig verhaltende Kategorie zeigen würde.


Der spanische Block ist der gefährliche

Vier Formulierungen, 42 %, 41 %, 48 %, 30 %. Würden Sie eine davon wöchentlich messen, berichteten Sie eine stabile Zahl um die 40 % und niemand würde nachfragen.

Zählen Sie jetzt die Quellen statt des Prozentsatzes.

Domains, die hieltenGeteilt mit der Formulierung darüber
„¿cuál es la mejor web para reservar hoteles?“13
„¿dónde reservo un hotel por internet?“114
„¿qué web de reservas de hotel es más fiable?“124
„mejor web para ofertas de hotel baratas“62

Über alle vier spanischen Formulierungen hinweg ist die Zahl der Domains, die in jedem Durchgang jeder Formulierung hielten, null. Einundsechzig verschiedene Domains erschienen irgendwo in den acht spanischen Durchgängen. Keine einzige war für alle vier Arten zu fragen verlässlich da.

Die paarweisen Überschneidungen sagen dasselbe genauer. Als Schnittmenge über Vereinigungsmenge gemessen teilen die vier spanischen Formulierungen zwischen 0,06 und 0,32 ihrer stabilen Mengen. Die zwei ähnlichsten, bei 0,32, sind sich über zwei Drittel dessen, was sie zitieren, immer noch uneinig.

Die ehrliche Beschreibung des spanischen Ergebnisses lautet also: die Rate ist eine Eigenschaft der Kategorie und die Quellen sind eine Eigenschaft des Satzes. Das sind zwei verschiedene Tatsachen, und nur die zweite sagt Ihnen, welche Seite Sie schreiben sollen.


Der amerikanische Block, und was er uns kostet

Die amerikanischen Formulierungen fallen von 92 % auf 35 %, und die verlockende Lesart ist, dass manche Formulierungen einfach schlechter sind. Das sagen die Quellen auch nicht.

Über die vier amerikanischen Formulierungen erschienen 53 verschiedene Domains. Drei davon hielten in jedem Durchgang jeder Formulierung: reddit.com, youtube.com und frommers.com. Paarweise teilen die stabilen Mengen zwischen 0,16 und 0,38.

Vor fünf Tagen veröffentlichten wir, dass die amerikanische Hotelfrage in zwei getrennten Sitzungen dieselben vierundzwanzig Domains zurückgab und dass vierundzwanzig stabile Quellen eine Landkarte sind, auf der man bauen kann. Diese Messung war richtig und wir würden sie wieder durchführen. Was diese Studie zeigt, ist, dass die Landkarte die Karte eines Satzes ist. Ändern Sie den Satz in einen anderen, den ein Kunde plausibel tippen würde, und einundzwanzig dieser vierundzwanzig hören auf, verlässlich zu sein.

Wir ziehen die frühere Zahl nicht zurück. Wir grenzen sie ein, was ein Anbieter dieser Kategorie mit seiner eigenen besten Zahl fast nie tut.


Auch die Formulierungsempfindlichkeit ist keine Konstante

Die zwei Märkte unterscheiden sich nicht nur im Niveau, sie unterscheiden sich darin, wie sehr die Formulierung überhaupt zählt.

Spanne über vier Formulierungen
Vereinigte Staaten57 Punkte, von 92 % auf 35 %
Spanien18 Punkte, von 48 % auf 30 %

Das ist dieselbe Form, die die Reisestudie fand, als sie statt der Worte den Markt variierte: zwei Fragen, die in Deutschland drei Punkte auseinanderliegen und in den Vereinigten Staaten 53. Beide Studien landen aus entgegengesetzten Richtungen am selben Ort. Weder der Markt noch die Branche noch die Frage noch die Formulierung ist ein Koeffizient, den man anwenden kann. Jede Kombination ist ihre eigene Messung, und der einzige Weg, eine Zelle zu kennen, ist, diese Zelle zu messen.

Es gibt außerdem ein praktisches Detail, das mehr wert ist, als es aussieht. Die Formulierung “where should I book a hotel online” erzeugte in beiden Sitzungen, die wir liefen, nur in einem von zwei Durchgängen ein AI Overview. Manche Arten zu fragen lösen diese Oberfläche gar nicht verlässlich aus, und ein Bericht, der Oberflächen zusammenwirft, zeigt das als geringe Sichtbarkeit statt als fehlenden Bestand.


Was diese Studie nicht zeigt

  • Eine Absicht, zwei Märkte, acht vergleichbare Zellen. Jeder Prozentsatz hat einen Nenner in den Zwanzigern oder Dreißigern.
  • Zwei Durchgänge, nicht drei. “In jedem Durchgang zitiert” ist über zwei Durchgänge eine leichtere Schwelle, diese Zahlen sind also nicht mit Drei-Durchgangs-Messungen anderswo vergleichbar, auch nicht mit Teilen unserer Agenturstudie, die diesen Effekt auf etwa zehn Punkte bezifferte.
  • Vier Formulierungen sind nicht der Raum der Formulierungen. Wir haben vier gewählt, die ein Käufer wiedererkennen würde. Vier andere ergäben andere Zahlen, und genau das ist der Punkt und kein Mangel. Erwähnenswert ist auch, dass ein wachsender Anteil der Sätze, die eine Website erreichen, gar nicht von einem Käufer getippt, sondern von Software zusammengesetzt wird.
  • Drei Oberflächen, nicht vier. ChatGPT ist ausgeschlossen, weil die von uns genutzte Route dafür keine Quellenliste zurückgibt, und das als Null zu berichten hieße, unser Instrument zu berichten.
  • Eine Sitzung je Zelle, außer zweien. Die zweite englische Formulierung hat zwei Sitzungen und die dritte spanische einen verworfenen ersten Versuch. Beide sind oben benannt und beide stehen im Register.
  • Wir haben nicht geprüft, ob die Formulierungen gleich häufig sind. Das Suchvolumen sagte Ihnen, für welchen Satz Sie optimieren sollten; diese Studie sagt Ihnen nur, dass die Wahl zählt.
  • Nichts hier ist kausal. Wir haben die Worte geändert und aufgezeichnet, was zurückkam, ohne Eingriff an irgendeiner Seite.

Häufige Fragen zu dieser Studie

Ändert das Umformulieren einer Frage, welche Quellen eine KI zitiert?

Ja, und um mehr, als es das Land tut. Dieselbe Hotelbuchungsfrage in den Vereinigten Staaten auf vier Arten zu stellen verschob den Anteil der in jedem Durchgang zitierten Quellen von 92 % auf 35 %, und nur 3 Domains von 53 hielten über alle vier Formulierungen. In Spanien hielten 0 Domains von 61 über alle vier.

Wenn der Prozentsatz gleich bleibt, ist meine KI-Sichtbarkeit dann stabil?

Nicht unbedingt, und das ist die Falle, für die diese Studie gebaut wurde. Vier spanische Formulierungen ergaben 42 %, 41 %, 48 % und 30 %, ein Band eng genug, um wie eine verlässliche Messung auszusehen, und teilten dabei über alle vier hinweg keine einzige Domain. Eine stillstehende Rate ist kein Beleg dafür, dass die Quellen, die sie halten, dieselben Quellen sind.

Wie viele Prompts sollte ich je Frage verfolgen?

Mehr als eine Formulierung, und die Zahl hängt vom Markt ab. Bei derselben Absicht spannten die amerikanischen Formulierungen 57 Punkte und die spanischen 18, ein einzelner Prompt ist in den Vereinigten Staaten also ein viel schlechterer Stellvertreter als in Spanien. Es gibt keine allgemeingültige Zahl, weshalb wir die Zellen statt einer Regel veröffentlichen.

Widerspricht das Ihrer früheren Reisestudie?

Es grenzt sie ein. Jene Studie berichtete, eine amerikanische Hotelfrage halte 24 von 25 Quellen und wiederhole das bei 24 von 26 mit denselben Domains, und diese Messung steht. Diese hier zeigt, dass jene vierundzwanzig eine Eigenschaft genau dieses Satzes sind: formuliert man um, überleben drei. Beide Ergebnisse stehen im Register und die frühere Zahl wurde nicht geändert.

Welche KI-Oberflächen wurden gemessen?

Google AI Overview, Google AI Mode und Gemini, je Formulierung zusammengefasst, mit umgangenem Cache, sodass jeder Durchgang ein frischer Aufruf ist. ChatGPT fehlt bewusst: die hier genutzte Route gibt dafür keine Quellenliste zurück, und eine von einem Instrument erzeugte Null ist von einer echten Null nicht zu unterscheiden.

Wo kann ich die Rohzeilen sehen?

In unserem Messregister, das alle zehn Zeilen dieser Studie führt, mit jedem Prompt genau so, wie er gesendet wurde, seinem Markt, seinen Oberflächen, seiner Durchgangszahl und seinem Datum, einschließlich der zwei ausgeschlossenen oder markierten Zeilen und dem Grund für jede.


Wo Sie das hinführt

Wenn Sie irgendjemandem KI-Sichtbarkeit berichten, ist die Anweisung aus dieser Studie kurz. Verfolgen Sie den Satz, nicht das Thema, und verfolgen Sie mehr als einen Satz je Thema. Ein einzelner Prompt gibt Ihnen eine Zahl, die für diesen Prompt echt ist und Ihnen über den nächsten sehr wenig sagt, selbst wenn der nächste für eine menschliche Leserin dasselbe bedeutet.

Und wenn ein Werkzeug Ihnen Woche für Woche einen stabilen Prozentsatz zeigt, fragen Sie es, aus welchen Domains dieser Prozentsatz besteht. In unserem spanischen Block hätte der Prozentsatz einen Monat lang gut ausgesehen. Darunter teilten vier verschiedene Arten, eine Frage zu stellen, nicht eine einzige verlässliche Quelle miteinander.

Wir haben das Ergebnis mit den vierundzwanzig Domains vor fünf Tagen veröffentlicht und wir glauben es weiterhin. Das ist, was es wert ist, gemessen am einzigen Test, der zählte: dieselbe Sache in Worten zu fragen, die wir nicht benutzt hatten.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)