Zum Inhalt springen
KI-SichtbarkeitForschung
DE

Zwei Reisefragen, vier Märkte. In Deutschland nicht zu trennen, in den USA 53 Punkte auseinander.

Hotels und Flüge, gefragt in vier Märkten auf drei KI-Oberflächen. Der Abstand zwischen beiden Fragen reicht von 3 Punkten in Deutschland bis 53 in den USA.

· Aktualisiert · 11 Min. Lesezeit

Wir haben zwei Fragen zur Reisebuchung gestellt, Hotels und Flüge, in vier Märkten auf drei KI-Oberflächen. In Deutschland konnten wir die beiden Fragen nicht trennen, 39% und 42%. In den USA liegen 53 Punkte dazwischen. Gleiche Branche, gleiche Woche, gleiche Methode.

Das ist die Zahl, die in ein Kundengespräch über KI-Sichtbarkeit gehört: wie stabil Ihre Antworten sind, ist keine Eigenschaft Ihrer Branche. Es ist eine Eigenschaft der genauen Frage im genauen Markt, und beide verbinden sich nicht auf eine Weise, die sich aus einem von beiden vorhersagen ließe.

Offenlegung: EchoWi verkauft Messung der KI-Sichtbarkeit. Das ist ein Interessenkonflikt, und die Antwort auf einen Interessenkonflikt ist eine überprüfbare Methode und kein Versprechen, neutral zu sein. Fragen, Oberflächen, Märkte, Durchlaufzahlen und Daten stehen unten, und jede Zeile steht in unserem öffentlichen Messregister.


Aktualisiert am 10. August 2026. Nach der Veröffentlichung haben wir eine Frage an einem Tag fünfmal gelesen und ihren stabilen Anteil von 39% auf 89% wandern sehen, während die Zahl der dauerhaften Quellen bei sieben bis acht blieb. Das berührt weder die 53 Punkte in den USA noch die 45 in Spanien, die beide weit außerhalb dieser Spanne liegen und von denen einer in einer zweiten Sitzung repliziert wurde. Es zieht aber eine Aussage zurück: ein Abstand von drei Punkten ist kein Befund. Die deutsche Zeile steht hier als zwei Fragen, die dieses Instrument nicht trennen kann, was sie immer war, und die fünf Lesungen stehen in der Folgestudie.

Die kurze Fassung

  1. Der Abstand zwischen zwei Fragen in einem Markt reicht von ununterscheidbar bis 53 Punkten. Deutschlands Hotels und Flüge kommen auf 39% und 42%. Die der USA auf 96% und 43%.
  2. Eine Frage ist echt und wiederholbar stabil. Die US-Hotelfrage hielt 24 von 25 Quellen über zwei Durchläufe, danach 24 von 26 in einer zweiten Sitzung, und die vierundzwanzig sind dieselben vierundzwanzig Domains.
  3. Nichts an „Reisen“ erklärt irgendetwas davon. Über die sieben vergleichbaren Fragen reicht der stabile Anteil von 14% bis 96%.
  4. Reisen ist insgesamt stabiler als der Agenturkauf, und das verbirgt mehr, als es sagt. 47% der zitierten Quellen hielten hier, gegen 32% in unserer Agenturstudie mit neunzehn Fragen, und die Spanne innerhalb von Reisen ist weit größer als der Unterschied zwischen beiden Branchen.
  5. Das instabile Ende ist schlimmer als alles, was wir bisher veröffentlicht haben. Die spanische Flugfrage lieferte 35 Quellen, von denen 5 hielten und 30 genau einmal auftauchten.

Was wir gemessen haben

Fragen2 Absichten, „was ist die beste Website, um Hotels zu buchen“ und „…um Flüge zu buchen“, jeweils in der Sprache des Marktes
MärkteUSA und Englisch, Spanien und Spanisch, Frankreich und Französisch, Deutschland und Deutsch, jeweils explizit gesetzt
OberflächenGoogle AI Overview, Google AI Mode und Gemini, je Frage zusammengefasst
Durchläufe2 je Frage, je Frage protokolliert statt angenommen
CacheUmgangen. Jeder Durchlauf ist ein frischer Aufruf
Datum10. August 2026

Sieben Fragen tragen eine Stabilitätszahl. Drei weitere wurden gemessen und sind ausgeschlossen, jede mit genanntem Grund: die französische Flugfrage lieferte einen einzigen Durchlauf, und bei dieser Größe ist jede Quelle trivialerweise stabil und trivialerweise einmalig; und ein früherer Versuch der spanischen Hotelfrage lief auf zwei statt drei Oberflächen durch, schöpft also aus einem kleineren Vorrat und kann nicht neben den übrigen stehen. Beide stehen im Register, weil das Register festhält, was passiert ist.

Was aus solchen Messungen für die eigene Seite folgt, steht getrennt: was in unseren Messungen tatsächlich zitiert wird.

Die Methode entspricht der Agenturstudie mit Absicht, damit sich beide vergleichen lassen, ohne über Instrumente zu streiten.


Die zwei Fragen, Markt für Markt

MarktHotelsFlügeAbstand
USA96% (24 von 25)43% (9 von 21)53 Punkte
Spanien59% (13 von 22)14% (5 von 35)45 Punkte
Deutschland39% (7 von 18)42% (11 von 26)3 Punkte
Frankreich50% (10 von 20)ein Durchlauf, keine Quote
in jedem Durchlauf zitiertverschiedene zitierte QuellenUSA · Hotels24 → 25Spanien · Hotels13 → 22Frankreich · Hotels10 → 20Deutschland · Flüge11 → 26USA · Flüge9 → 21Deutschland · Hotels7 → 18Spanien · Flüge5 → 35
Jede Zeile ist eine Frage in einem Markt. Der linke Punkt ist, was über beide Durchläufe hielt, der rechte alles überhaupt Zitierte. Google AI Overview, AI Mode und Gemini zusammengefasst, Cache umgangen, 10. August 2026.
Stabile Quellen gegen alle zitierten Quellen für die Hotel- und die Flugfrage in vier Märkten
in jedem Durchlauf zitiertverschiedene zitierte Quellen
USA · Hotels2425
Spanien · Hotels1322
Frankreich · Hotels1020
Deutschland · Flüge1126
USA · Flüge921
Deutschland · Hotels718
Spanien · Flüge535

Lesen Sie die deutsche und die amerikanische Zeile zusammen, denn darin liegt der Befund. In Deutschland liefern die Frage nach Hotels und die Frage nach Flügen Antworten drei Punkte auseinander, was dieses Instrument nicht trennen kann. Das ist nicht dasselbe wie zu sagen, sie verhielten sich gleich: es heißt, eine Lesung unterscheidet sie nicht, und keine beschreibt die andere. In den USA liegen dieselben zwei Fragen 53 Punkte auseinander, und wer eine gemessen und auf die andere geschlossen hätte, läge um mehr als die halbe Skala daneben.

Spanien liegt in der Form dazwischen und im Niveau ganz unten: 45 Punkte Abstand, und die Flugfrage liefert die instabilste Antwort in allem, was wir veröffentlicht haben.


Der Ausreißer hielt, und das war beim letzten Mal anders

Die US-Hotelfrage kam mit 24 von 25 in beiden Durchläufen zitierten Quellen zurück. Das liegt weit über allem in unserer Agenturstudie, deren bestes Ergebnis über neunzehn Fragen 13 von 20 war, also bekam sie die Behandlung, die uns jene Studie beigebracht hat: noch einmal messen.

Zitierte QuellenStabilAnteil
Erste Sitzung252496%
Zweite Sitzung262492%

Und die vierundzwanzig sind dieselben vierundzwanzig Domains, nach Namen geprüft und nicht nach Anzahl: booking.com, kayak.com, expedia.com, reddit.com, youtube.com, google.com, forbes.com und siebzehn weitere, in beiden Sitzungen.

Das ist das Gegenteil dessen, was der stabilsten Frage der Agenturstudie widerfuhr, die über Nacht von 65% auf 29% fiel. Beide Ergebnisse zählen, und sie sagen zwei Hälften derselben Regel. Eine hohe Zahl ist nicht verdächtig, weil sie hoch ist; sie ist die billigstmögliche Gegenprobe wert, und manchmal bestätigt die Gegenprobe einen Kern, gegen den sich wirklich arbeiten lässt. Sechs oder sieben stabile Quellen je Frage sind ein Content-Briefing. Vierundzwanzig sind eine Landkarte.


Warum das deutsche Ergebnis das nützliche ist

Die Versuchung bei einer solchen Tabelle ist, mit 96% aufzumachen. Die deutsche Zeile ist mehr wert, weil sie diejenige ist, die Ihnen die Form des Problems verrät.

Wenn Frage und Markt auf einfache Weise zusammenwirkten, zeigte Deutschland denselben Abstand wie die USA, kleiner oder größer, aber vorhanden. Es zeigt drei Punkte, also gar keinen auflösbaren Abstand. Was auch immer die amerikanische Hotelfrage so viel stabiler macht als die amerikanische Flugfrage, es ist keine Eigenschaft von Hotels, denn es reist nicht nach Deutschland mit.

Was es ist, können wir aus diesen Daten nicht sagen, und diese Studie wird nicht so tun als ob. Was sie sagen kann, ist, was eine Agentur damit tun sollte: messen Sie die Frage, für die Sie bezahlt werden, in dem Markt, für den Sie bezahlt werden. Eine Stabilitätszahl aus einer Nachbarfrage derselben Branche ist kein Beleg über Ihre, und in einem unserer drei Märkte wäre sie um 53 Punkte falsch gewesen.


Gegen die Agenturstudie, die dasselbe Instrument benutzte

Agentur-KauffragenReisebuchungsfragen
Fragen197
Stabiler Anteil32%47%
Genau einmal zitiert58%53%
Spanne über die Fragen17% bis 65%14% bis 96%

Reisen sieht stabiler aus, und der Gesamtwert ist die uninteressanteste Zeile der Tabelle. Die Spanne ist der Punkt. Der stabile Anteil bei Reisen umspannt 82 Punkte über sieben Fragen; der Agentursatz umspannt 48 über neunzehn. Ein Branchendurchschnitt hätte sowohl die 96% als auch die 14% verdeckt, und das sind genau die beiden Zeilen, über die ein Käufer Bescheid wissen will.

Das ist derselbe Schluss, den die Agenturstudie von der anderen Seite zog: dort unterschieden sich zwei von vier sauberen Marktvergleichen um 15 und 35 Punkte und zwei um 3 und 2. Weder Markt noch Branche ist ein Faktor, den man anlegen kann.


Was diese Studie nicht zeigt

  • Sieben vergleichbare Fragen sind wenig. Zwei Absichten, vier Märkte, und nur drei Märkte tragen beide Absichten. Jeder Prozentwert hat einen zweistelligen Nenner.
  • Zwei Durchläufe, nicht drei. „In jedem Durchlauf zitiert“ ist über zwei Durchläufe die leichtere Hürde, diese Zahlen sind also nicht mit Messungen über drei Durchläufe vergleichbar, auch nicht mit Teilen unserer eigenen Agenturstudie. Jene Studie bezifferte diesen Effekt auf etwa zehn Punkte.
  • Eine Sitzung je Frage, mit einer Ausnahme. Nur die US-Hotelfrage hat eine zweite Sitzung. Der Rest beschreibt die Sitzung, in der er gemessen wurde, und genau diese Einschränkung wurde beim letzten Test zum Befund.
  • Drei Oberflächen, nicht vier. ChatGPT ist ausgeschlossen, weil der von uns genutzte Weg dafür keine Quellenliste zurückgibt, und das als Null zu melden hieße, unser Instrument zu melden.
  • Die spanische Flugzeile ist unsauber. AI Overview antwortete einmal, wo die anderen beiden Oberflächen zweimal antworteten. Sie ist als zwei Durchläufe erfasst und markiert statt geglättet, und sie ist die unzuverlässigste Zeile der Tabelle.
  • Eine Formulierung je Frage. Eine spanische Studie einer anderen Kategorie benutzte vier Formulierungen und fand 49 Quellen, von denen keine in allen vieren auftauchte, diese Mengen gehören also zu diesen Formulierungen.
  • Nichts hiervon ist kausal. Wir haben nichts verändert und festgehalten, was zurückkam.

Häufige Fragen zu dieser Studie

Wie stabil sind KI-Antworten bei Fragen zur Reisebuchung?

Das hängt vollständig davon ab, welche Frage und welcher Markt. Über sieben vergleichbare Fragen reichte der Anteil der in jedem Durchlauf zitierten Quellen von 14% bis 96%. Die US-Hotelfrage hielt 24 von 25 Quellen und wiederholte das in einer zweiten Sitzung; die spanische Flugfrage hielt 5 von 35. Es gibt keinen einzelnen Wert für Reisen, und wer als Anbieter einen nennt, mittelt über eine Spanne, die fast die ganze Skala umfasst.

Verhält sich dieselbe Frage in verschiedenen Ländern gleich?

Nein, nicht einmal näherungsweise. Die Frage nach der Hotelbuchung lieferte 96% stabile Quellen in den USA, 59% in Spanien, 50% in Frankreich und 39% in Deutschland. Das sind 57 Punkte Spanne bei einer Frage, mit dem Markt als einziger Variablen, gemessen am selben Tag auf denselben Oberflächen. In welchem Markt Sie sind, ist kein Detail derselben Antwort, es ändert, welche Quellen überhaupt existieren: wir haben dieselben Marken ihre KI-Sichtbarkeit verlieren sehen, je weiter ihr Markt von den Vereinigten Staaten entfernt liegt.

Ist Reisen in der KI-Suche stabiler als andere Kategorien?

Im Gesamtwert leicht: 47% der zitierten Quellen hielten hier gegen 32% in unserer Agenturstudie mit neunzehn Fragen. Der Gesamtwert führt in die Irre. Die Spanne bei Reisen reicht von 14% bis 96% und die der Agenturstudie von 17% bis 65%, die Streuung innerhalb von Reisen ist also größer als der Unterschied zwischen beiden Kategorien.

Soll ich einem hohen KI-Sichtbarkeitswert trauen?

Genug, um ihn einmal zu prüfen, und das ist billig. Das beste Ergebnis unserer Agenturstudie fiel am nächsten Tag von 65% auf 29%. Das beste unserer Reisestudie hielt bei 96% und dann 92%, beide Male mit denselben vierundzwanzig Domains. Die Gegenprobe ist, was die beiden trennt, und sie ist das Einzige, was das tut.

Welche KI-Oberflächen wurden gemessen?

Google AI Overview, Google AI Mode und Gemini, je Frage zusammengefasst, mit umgangenem Cache, sodass jeder Durchlauf ein frischer Aufruf ist. ChatGPT fehlt mit Absicht: der hier genutzte Weg gibt dafür keine Quellenliste zurück, und eine von einem Instrument erzeugte Null ist von einer echten Null nicht zu unterscheiden.

Wo kann ich die Rohzeilen sehen?

In unserem Messregister, das jede Frage dieser Studie mit ihrem Prompt in der gestellten Form trägt, dazu Markt, Oberflächen, Durchlaufzahl und Datum, einschließlich der drei aus der Auswertung ausgeschlossenen Zeilen und des Grundes für jede.


Wo Sie das hinführt

Die Ausgangsfrage war, ob eine Branche ein Stabilitätsprofil hat. Sie hat keines. Zwei Fragen innerhalb einer Branche können in einem Land ununterscheidbar sein und in einem anderen 53 Punkte auseinanderliegen, und kein Mittelwert über „Reisen“ hätte Ihnen verraten, in welchem Land Sie gerade sind.

Für alle, die KI-Sichtbarkeit berichten, fällt das auf eine Anweisung zusammen: messen Sie die Frage, an der Ihr Kunde tatsächlich gemessen wird, in dem Markt, in dem er tatsächlich verkauft, und mehr als einmal. Alles andere auf dieser Seite ist der Beleg dafür, warum die billige Fassung davon nicht funktioniert.

Und wenn Sie eine Zahl so hoch wie 96% finden, prüfen Sie sie noch einmal, bevor Sie feiern. Unsere hat gehalten. Die beste Zahl unserer Agenturstudie nicht, und der Unterschied zwischen diesen beiden Ausgängen war eine einzige Wiederholungsmessung.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)