Zum Inhalt springen
AI VisibilityResearch
DE

Wir haben vier KI-Oberflächen dieselbe Frage gestellt. 51 Quellen kamen zurück und keine erschien auf allen vier.

Gleiche Frage, gleicher Markt, gleicher Moment, vier Oberflächen. 41 von 51 zitierten Quellen erschienen auf genau einer. Googles drei überschneiden sich kaum.

· 10 Min. Lesezeit

Jede Studie, die wir veröffentlicht haben, trug dieselbe Einschränkung: eine Oberfläche, Googles AI Overview. Diese prüft, was diese Einschränkung kostet.

Wir haben zwei Fragen im selben Moment an vier Oberflächen gestellt: AI Overview, Google AI Mode, Gemini und ChatGPT. Zusammen zitierten sie 51 verschiedene Domains. Keine erschien auf allen vier. 41 erschienen auf genau einer.

Der für Google unangenehme Teil ist, dass drei dieser vier Oberflächen ihm gehören, und AI Overview und Gemini teilten sich bei keiner der beiden Fragen eine einzige Quelle.

Wie das gemessen wurde: zwei Prompts, Vereinigte Staaten, Englisch, 7. August 2026, ein Durchlauf je Oberfläche, alle vier Oberflächen im selben Aufruf abgefragt. Ein Durchlauf ist eine Ziehung und keine Rate, weshalb dieser Artikel die Überschneidung zwischen Oberflächen zählt statt der Häufigkeit innerhalb einer. Nur zitierte Domains, nie Markennennungen. Beide Durchläufe stehen in unserem Messregister mit den Zahlen je Oberfläche.


Frage eins: Laufschuhe

OberflächeZitierte Domains
ChatGPT11
AI Overview5
AI Mode4
Gemini3

20 verschiedene Domains. Eine erschien auf drei Oberflächen (runrepeat.com), eine auf zwei und 18 auf genau einer.

Frage zwei: E-Mail-Plattformen für E-Commerce

OberflächeZitierte Domains
ChatGPT16
AI Mode11
AI Overview8
Gemini5

31 verschiedene Domains. Eine erschien auf drei (drip.com), sieben auf zwei und 23 auf genau einer.

Die beiden Fragen zusammen

Domains, die erschienen auf…AnzahlAnteil
allen vier Oberflächen00%
drei Oberflächen24%
zwei Oberflächen816%
genau einer Oberfläche4180%

Vier Fünftel des zitierten Webs sind für diese Fragen genau einem der vier Orte sichtbar, an denen ein Käufer fragen könnte.

Alle vier Oberflächen0 (0%)Drei Oberflächen2 (4%)Zwei Oberflächen8 (16%)Genau eine Oberfläche41 (80%)
51 verschiedene Domains über zwei Kauffragen. Keine erschien auf allen vier Oberflächen, und vier Fünftel erschienen auf genau einer. USA auf Englisch, AI Overview, AI Mode, ChatGPT und Gemini, ein Durchlauf je Oberfläche, was eine Ziehung ist und keine Rate.
Wie viele der 51 zitierten Domains auf einer, zwei, drei oder allen vier KI-Oberflächen erschienen
value
Alle vier Oberflächen0
Drei Oberflächen2
Zwei Oberflächen8
Genau eine Oberfläche41

Warum das schlimmer ist als «Engines unterscheiden sich»

Jeder in dieser Kategorie wird Ihnen sagen, dass Engines sich unterscheiden. Was die Zahlen hinzufügen, ist wie sehr, und ein bestimmtes Ergebnis, mit dem niemand wirbt.

AI Overview und Gemini zitierten nichts Gemeinsames. Bei keiner der beiden Fragen. Beide gehören Google. Fragen Sie Googles Such-KI und Googles Assistenten in derselben Minute dasselbe, und die Belege unter den beiden Antworten sind disjunkt.

AI Mode, ebenfalls Google, teilt bei der ersten Frage eine Domain mit AI Overview und bei der zweiten vier. Besser, und immer noch überwiegend getrennt.

Wenn Sie eine Google-Oberfläche messen und das «Google» nennen, messen Sie eine Google-Oberfläche.

Das Ergebnis, neben dem das steht

Hier ist, was den Befund scharf macht statt bloß interessant.

Laufschuhe ist die stabilste Kategorie, die wir je gemessen haben. In unserer Stabilitätsstudie gaben drei Durchläufe genau dieser Frage auf AI Overview fünf Domains zurück, und alle fünf erschienen in jedem einzelnen Durchlauf. Perfekte Reproduzierbarkeit innerhalb der Oberfläche.

Dieselbe Frage, an vier Oberflächen gestellt, ergab zwanzig Domains, von denen achtzehn auf genau einer erschienen.

Reproduzierbarkeit innerhalb einer Oberfläche sagt nichts über Übereinstimmung zwischen Oberflächen. Ein Anbieter kann ehrlich berichten, dass Ihre Messung grundsolide ist, sie den ganzen Monat wiederholen und dabei ein Viertel des Bildes beschreiben. Das sind zwei verschiedene Eigenschaften, und dieser Markt verkauft routinemäßig die erste und suggeriert die zweite.

ChatGPT zitiert am meisten, Gemini am wenigsten

ChatGPT lieferte bei beiden Fragen die längste Quellenliste, 11 und 16. Gemini die kürzeste, 3 und 5. AI Overview und AI Mode lagen dazwischen.

Wir werden Ihnen nicht sagen, was das über die Antwortqualität bedeutet, weil wir keine Qualität gemessen haben. Praktisch bedeutet es, dass die gemessene Oberfläche nicht nur ändert, welche Quellen Sie sehen, sondern auch wie viele, und ein Share-of-Voice-Prozentsatz, der gegen einen Nenner von drei Domains gerechnet ist, lässt sich nicht mit einem gegen sechzehn vergleichen.

Das ist ein schlichtes Rechenproblem, das in vielen Dashboards steckt.

Was das am Kaufen ändert

Ein Preis je Engine ist ein Preis je Bild. Unser geprüfter Katalog zeigt Einstiegstarife mit einer Engine (Surfer und unser eigener 29-Euro-Tarif), drei (Siftly, Writesonic), vier (Nightwatch) und sechs (Promptmonitor für 29 $, Rank Prompt). Nach dieser Evidenz ist der Unterschied zwischen einer Engine und vieren keine Verfeinerung. Er ist der größte Teil der Daten.

Mitteln Sie nicht über Engines. Wenn 80 % der Quellen auf einer einzigen Oberfläche erscheinen, mischt ein zusammengefasster Sichtbarkeitswert vier weitgehend disjunkte Grundgesamtheiten zu einer Zahl, die keine von ihnen beschreibt. Lesen Sie sie getrennt oder lesen Sie sie nicht.

Prüfen Sie, welche Oberfläche Ihre Käufer tatsächlich nutzen, bevor Sie für die optimieren, die Ihr Werkzeug zufällig abdeckt. Das ist eine Frage über Ihren Markt, nicht über KI.

Und denken Sie an die andere Achse. Wie viele Durchläufe eine Kategorie braucht reicht von etwa drei bis etwa dreißig, und dieser Artikel legt eine zweite Dimension darüber. Abdeckung und Wiederholung sind getrennte Anschaffungen, und die meisten Anbieter verkaufen Ihnen eine feste Menge von beidem.

Am 7. August 2026 fünfmal repliziert

Dieser Artikel maß zwei Verbraucherfragen. Seit er geschrieben wurde, haben wir dasselbe Instrument fünfmal weiter laufen lassen, auf Fragen, die mit Laufschuhen nichts gemein haben. Die Überschrift hielt bei vieren und brach bei der fünften.

FrageMarktZitierte DomainsAuf zwei OberflächenAuf drei oder vier
Beste GEO-AgenturVereinigte Staaten2050
Beste GEO-AgenturFrankreich1940
Beste GEO-AgenturSpanien1640
Welches KI-SichtbarkeitswerkzeugVereinigte Staaten2110
Beste GEO-AgenturDeutschland, ergänzt am 7. Aug. 20261822

Andere Kategorie, vier Sprachen, und einer der Durchläufe ist Unternehmenssoftware statt einer Dienstleistung. In den ersten vier Replikationen wurde keine einzige Quelle von drei der vier Oberflächen zitiert. Deutschland, zuletzt gelaufen, brach das. Dort erreichten zwei Domains drei Oberflächen, und beide sind Agenturwebsites: eine gehört Aufgesang und eine Suchhelden. Vier Durchläufe ließen es wie eine Regel aussehen, und der fünfte sagt, dass es keine ist, was der ganze Grund ist, weiter zu replizieren. Bei der Werkzeugfrage gab Google AI Overview einen Serverfehler zurück, diese Zeile hat also drei Oberflächen statt vier, und das ist unser Instrument, das versagt, nicht Google, das verstummt.

Zählt man die beiden Fragen dieses Artikels dazu, sind das sieben Fragensätze über zwei Kategorien und vier Sprachen. Nicht einer brachte eine Quelle hervor, die von allen vier Oberflächen zitiert wurde, und das ist der Teil, der jedes Mal gehalten hat. Bei drei Oberflächen ist das Bild dünner, aber nicht leer: die beiden Verbraucherfragen hier schafften genau je eine Quelle, vier der fünf neueren Durchläufe keine und Deutschland zwei. Wir nennen nichts davon ein Gesetz, denn jeder Einzelne davon ist ein einzelner Durchgang, und wir wissen, was ein einzelner Durchgang wert ist. Sagen lässt sich, dass die Spalte «alle vier» in sieben Versuchen nie von null abgewichen ist und dass die Spalte «drei Oberflächen» sich danach bewegt, ob in diesem Markt jemand eine Seite veröffentlicht hat, über die es sich einig zu sein lohnt.

Was das nicht zeigt

Eine der vier Oberflächen gibt weniger zurück, als sie zitiert, und das reicht bis in die Überschrift. Gemessen am 15. August 2026: Eine AI-Mode-Antwort druckt nummerierte Zitationsmarker in ihren Text, und die strukturierte Liste, die wir lesen, trägt etwa die Hälfte davon, während die von AI Overview alle trägt. «Keine erschien auf allen vier» ist also teilweise eine Aussage über die Erfassung von AI Mode: Eine auf jeder Oberfläche vorhandene Domain könnte in der AI-Mode-Spalte fehlen und die Serie brechen, ohne je in der Antwort gefehlt zu haben.

Was unberührt bleibt, ist die schärfere Hälfte. AI Overview und Gemini zitierten bei beiden Fragen null gemeinsame Domains, und beide Listen tragen jeden Marker, den ihre Antworten drucken, dieses Paar ist also auf beiden Seiten mit einem Instrument gemessen. Die Erfassung von ChatGPT können wir überhaupt nicht prüfen, weil dieser Aufruf auf diesem Weg in einen Timeout läuft.

  • Ein Durchlauf je Oberfläche. Zwei Fragen, acht Oberflächenantworten. Das misst, wie wenig sich die vier Quellenmengen in einem Moment überschneiden. Es misst nicht, wie oft eine bestimmte Domain erscheint, und kann es nicht: dafür braucht es Wiederholung, was ein anderer und teurerer Aufbau ist.
  • Zwei Fragen, ein Markt, eine Sprache, ein Tag. Beide Fragen sind Verbraucher- oder KMU-Software in den Vereinigten Staaten auf Englisch.
  • Überschneidung ist nicht Qualität. Dass vier Oberflächen sich uneins sind, macht keine von ihnen falsch. Verschiedene Belege können dieselbe Empfehlung stützen, und tatsächlich nannten alle vier überlappende Produkte, während sie verschiedene Quellen zitierten.
  • Wir haben Domains gezählt, nicht Prominenz. Eine einmal zitierte Domain und eine, auf die sich die Antwort stützte, zählen gleich.
  • Nichts Kausales und nichts über Markennennungen. Dies sind ausschließlich Zitationsdaten.
  • Oberflächen bewegen sich. Das sind vier Produkte in aktiver Entwicklung, an einem Nachmittag gemessen.

Häufige Fragen zu Unterschieden zwischen KI-Engines

Zitieren ChatGPT, Gemini und Google AI Overview dieselben Quellen?

Kaum. Über zwei Fragen, die vier Oberflächen im selben Moment gestellt wurden, wurden 51 verschiedene Domains zitiert und keine erschien auf allen vier. 41 der 51, etwa 80 %, erschienen auf genau einer Oberfläche.

Stimmen Googles eigene KI-Oberflächen untereinander überein?

Nach unserer Evidenz nicht. AI Overview und Gemini zitierten bei beiden Fragen null gemeinsame Domains. AI Mode, ebenfalls Google, teilte bei der ersten Frage eine Domain mit AI Overview und bei der zweiten vier. Eine Google-Oberfläche zu messen sagt nichts über die anderen.

Welche KI-Engine zitiert die meisten Quellen?

ChatGPT, bei beiden getesteten Fragen, mit 11 und 16 verschiedenen Domains. Gemini zitierte die wenigsten, mit 3 und 5. Das zählt für jeden Prozentsatz: eine Share-of-Voice-Zahl, gegen fünf Quellen gerechnet, ist nicht mit einer gegen sechzehn vergleichbar.

Lohnt sich ein Werkzeug, das mehr Engines abdeckt?

Nach dieser Evidenz ist der Abdeckungsunterschied der größte Teil der Daten und keine Verfeinerung, da vier Fünftel der zitierten Quellen nur auf einer Oberfläche erschienen. Einstiegstarife in unserem geprüften Katalog reichen von einer Engine bis sechs zu ähnlichen Preisen, der Vergleich lohnt sich also bewusst.

Wenn meine Messung stabil ist, sehe ich dann das ganze Bild?

Nein, und das ist die Falle. Die Frage dieser Studie mit perfekter Stabilität innerhalb der Oberfläche, fünf Domains in jedem von drei Durchläufen zitiert, ergab achtzehn Domains auf nur einer Oberfläche von zwanzig, als wir vier Oberflächen fragten. Reproduzierbarkeit und Abdeckung sind verschiedene Eigenschaften, und ein Werkzeug kann bei der ersten hervorragend und zur zweiten stumm sein.

Kann ich das reproduzieren?

Ja. Zwei Prompts, Vereinigte Staaten, Englisch, vier Oberflächen, je ein Durchlauf, am 7. August 2026, mit beiden oben vollständig zitierten Prompts und den Zahlen je Oberfläche in unserem Register. Stellen Sie dieselbe Frage in derselben Sitzung an vier Oberflächen und listen Sie die Domains auf, die jede zitiert.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)