Wir haben vier KI-Oberflächen dieselbe Frage gestellt. 51 Quellen kamen zurück und keine erschien auf allen vier.
Gleiche Frage, gleicher Markt, gleicher Moment, vier Oberflächen. 41 von 51 zitierten Quellen erschienen auf genau einer. Googles drei überschneiden sich kaum.
Jede Studie, die wir veröffentlicht haben, trug dieselbe Einschränkung: eine Oberfläche, Googles AI Overview. Diese prüft, was diese Einschränkung kostet.
Wir haben zwei Fragen im selben Moment an vier Oberflächen gestellt: AI Overview, Google AI Mode, Gemini und ChatGPT. Zusammen zitierten sie 51 verschiedene Domains. Keine erschien auf allen vier. 41 erschienen auf genau einer.
Der für Google unangenehme Teil ist, dass drei dieser vier Oberflächen ihm gehören, und AI Overview und Gemini teilten sich bei keiner der beiden Fragen eine einzige Quelle.
Wie das gemessen wurde: zwei Prompts, Vereinigte Staaten, Englisch, 7. August 2026, ein Durchlauf je Oberfläche, alle vier Oberflächen im selben Aufruf abgefragt. Ein Durchlauf ist eine Ziehung und keine Rate, weshalb dieser Artikel die Überschneidung zwischen Oberflächen zählt statt der Häufigkeit innerhalb einer. Nur zitierte Domains, nie Markennennungen. Beide Durchläufe stehen in unserem Messregister mit den Zahlen je Oberfläche.
Frage eins: Laufschuhe
| Oberfläche | Zitierte Domains |
|---|---|
| ChatGPT | 11 |
| AI Overview | 5 |
| AI Mode | 4 |
| Gemini | 3 |
20 verschiedene Domains. Eine erschien auf drei Oberflächen (runrepeat.com), eine auf zwei und 18 auf genau einer.
Frage zwei: E-Mail-Plattformen für E-Commerce
| Oberfläche | Zitierte Domains |
|---|---|
| ChatGPT | 16 |
| AI Mode | 11 |
| AI Overview | 8 |
| Gemini | 5 |
31 verschiedene Domains. Eine erschien auf drei (drip.com), sieben auf zwei und 23 auf genau einer.
Die beiden Fragen zusammen
| Domains, die erschienen auf… | Anzahl | Anteil |
|---|---|---|
| allen vier Oberflächen | 0 | 0% |
| drei Oberflächen | 2 | 4% |
| zwei Oberflächen | 8 | 16% |
| genau einer Oberfläche | 41 | 80% |
Vier Fünftel des zitierten Webs sind für diese Fragen genau einem der vier Orte sichtbar, an denen ein Käufer fragen könnte.
| value | |
|---|---|
| Alle vier Oberflächen | 0 |
| Drei Oberflächen | 2 |
| Zwei Oberflächen | 8 |
| Genau eine Oberfläche | 41 |
Warum das schlimmer ist als «Engines unterscheiden sich»
Jeder in dieser Kategorie wird Ihnen sagen, dass Engines sich unterscheiden. Was die Zahlen hinzufügen, ist wie sehr, und ein bestimmtes Ergebnis, mit dem niemand wirbt.
AI Overview und Gemini zitierten nichts Gemeinsames. Bei keiner der beiden Fragen. Beide gehören Google. Fragen Sie Googles Such-KI und Googles Assistenten in derselben Minute dasselbe, und die Belege unter den beiden Antworten sind disjunkt.
AI Mode, ebenfalls Google, teilt bei der ersten Frage eine Domain mit AI Overview und bei der zweiten vier. Besser, und immer noch überwiegend getrennt.
Wenn Sie eine Google-Oberfläche messen und das «Google» nennen, messen Sie eine Google-Oberfläche.
Das Ergebnis, neben dem das steht
Hier ist, was den Befund scharf macht statt bloß interessant.
Laufschuhe ist die stabilste Kategorie, die wir je gemessen haben. In unserer Stabilitätsstudie gaben drei Durchläufe genau dieser Frage auf AI Overview fünf Domains zurück, und alle fünf erschienen in jedem einzelnen Durchlauf. Perfekte Reproduzierbarkeit innerhalb der Oberfläche.
Dieselbe Frage, an vier Oberflächen gestellt, ergab zwanzig Domains, von denen achtzehn auf genau einer erschienen.
Reproduzierbarkeit innerhalb einer Oberfläche sagt nichts über Übereinstimmung zwischen Oberflächen. Ein Anbieter kann ehrlich berichten, dass Ihre Messung grundsolide ist, sie den ganzen Monat wiederholen und dabei ein Viertel des Bildes beschreiben. Das sind zwei verschiedene Eigenschaften, und dieser Markt verkauft routinemäßig die erste und suggeriert die zweite.
ChatGPT zitiert am meisten, Gemini am wenigsten
ChatGPT lieferte bei beiden Fragen die längste Quellenliste, 11 und 16. Gemini die kürzeste, 3 und 5. AI Overview und AI Mode lagen dazwischen.
Wir werden Ihnen nicht sagen, was das über die Antwortqualität bedeutet, weil wir keine Qualität gemessen haben. Praktisch bedeutet es, dass die gemessene Oberfläche nicht nur ändert, welche Quellen Sie sehen, sondern auch wie viele, und ein Share-of-Voice-Prozentsatz, der gegen einen Nenner von drei Domains gerechnet ist, lässt sich nicht mit einem gegen sechzehn vergleichen.
Das ist ein schlichtes Rechenproblem, das in vielen Dashboards steckt.
Was das am Kaufen ändert
Ein Preis je Engine ist ein Preis je Bild. Unser geprüfter Katalog zeigt Einstiegstarife mit einer Engine (Surfer und unser eigener 29-Euro-Tarif), drei (Siftly, Writesonic), vier (Nightwatch) und sechs (Promptmonitor für 29 $, Rank Prompt). Nach dieser Evidenz ist der Unterschied zwischen einer Engine und vieren keine Verfeinerung. Er ist der größte Teil der Daten.
Mitteln Sie nicht über Engines. Wenn 80 % der Quellen auf einer einzigen Oberfläche erscheinen, mischt ein zusammengefasster Sichtbarkeitswert vier weitgehend disjunkte Grundgesamtheiten zu einer Zahl, die keine von ihnen beschreibt. Lesen Sie sie getrennt oder lesen Sie sie nicht.
Prüfen Sie, welche Oberfläche Ihre Käufer tatsächlich nutzen, bevor Sie für die optimieren, die Ihr Werkzeug zufällig abdeckt. Das ist eine Frage über Ihren Markt, nicht über KI.
Und denken Sie an die andere Achse. Wie viele Durchläufe eine Kategorie braucht reicht von etwa drei bis etwa dreißig, und dieser Artikel legt eine zweite Dimension darüber. Abdeckung und Wiederholung sind getrennte Anschaffungen, und die meisten Anbieter verkaufen Ihnen eine feste Menge von beidem.
Am 7. August 2026 fünfmal repliziert
Dieser Artikel maß zwei Verbraucherfragen. Seit er geschrieben wurde, haben wir dasselbe Instrument fünfmal weiter laufen lassen, auf Fragen, die mit Laufschuhen nichts gemein haben. Die Überschrift hielt bei vieren und brach bei der fünften.
| Frage | Markt | Zitierte Domains | Auf zwei Oberflächen | Auf drei oder vier |
|---|---|---|---|---|
| Beste GEO-Agentur | Vereinigte Staaten | 20 | 5 | 0 |
| Beste GEO-Agentur | Frankreich | 19 | 4 | 0 |
| Beste GEO-Agentur | Spanien | 16 | 4 | 0 |
| Welches KI-Sichtbarkeitswerkzeug | Vereinigte Staaten | 21 | 1 | 0 |
| Beste GEO-Agentur | Deutschland, ergänzt am 7. Aug. 2026 | 18 | 2 | 2 |
Andere Kategorie, vier Sprachen, und einer der Durchläufe ist Unternehmenssoftware statt einer Dienstleistung. In den ersten vier Replikationen wurde keine einzige Quelle von drei der vier Oberflächen zitiert. Deutschland, zuletzt gelaufen, brach das. Dort erreichten zwei Domains drei Oberflächen, und beide sind Agenturwebsites: eine gehört Aufgesang und eine Suchhelden. Vier Durchläufe ließen es wie eine Regel aussehen, und der fünfte sagt, dass es keine ist, was der ganze Grund ist, weiter zu replizieren. Bei der Werkzeugfrage gab Google AI Overview einen Serverfehler zurück, diese Zeile hat also drei Oberflächen statt vier, und das ist unser Instrument, das versagt, nicht Google, das verstummt.
Zählt man die beiden Fragen dieses Artikels dazu, sind das sieben Fragensätze über zwei Kategorien und vier Sprachen. Nicht einer brachte eine Quelle hervor, die von allen vier Oberflächen zitiert wurde, und das ist der Teil, der jedes Mal gehalten hat. Bei drei Oberflächen ist das Bild dünner, aber nicht leer: die beiden Verbraucherfragen hier schafften genau je eine Quelle, vier der fünf neueren Durchläufe keine und Deutschland zwei. Wir nennen nichts davon ein Gesetz, denn jeder Einzelne davon ist ein einzelner Durchgang, und wir wissen, was ein einzelner Durchgang wert ist. Sagen lässt sich, dass die Spalte «alle vier» in sieben Versuchen nie von null abgewichen ist und dass die Spalte «drei Oberflächen» sich danach bewegt, ob in diesem Markt jemand eine Seite veröffentlicht hat, über die es sich einig zu sein lohnt.
Was das nicht zeigt
Eine der vier Oberflächen gibt weniger zurück, als sie zitiert, und das reicht bis in die Überschrift. Gemessen am 15. August 2026: Eine AI-Mode-Antwort druckt nummerierte Zitationsmarker in ihren Text, und die strukturierte Liste, die wir lesen, trägt etwa die Hälfte davon, während die von AI Overview alle trägt. «Keine erschien auf allen vier» ist also teilweise eine Aussage über die Erfassung von AI Mode: Eine auf jeder Oberfläche vorhandene Domain könnte in der AI-Mode-Spalte fehlen und die Serie brechen, ohne je in der Antwort gefehlt zu haben.
Was unberührt bleibt, ist die schärfere Hälfte. AI Overview und Gemini zitierten bei beiden Fragen null gemeinsame Domains, und beide Listen tragen jeden Marker, den ihre Antworten drucken, dieses Paar ist also auf beiden Seiten mit einem Instrument gemessen. Die Erfassung von ChatGPT können wir überhaupt nicht prüfen, weil dieser Aufruf auf diesem Weg in einen Timeout läuft.
- Ein Durchlauf je Oberfläche. Zwei Fragen, acht Oberflächenantworten. Das misst, wie wenig sich die vier Quellenmengen in einem Moment überschneiden. Es misst nicht, wie oft eine bestimmte Domain erscheint, und kann es nicht: dafür braucht es Wiederholung, was ein anderer und teurerer Aufbau ist.
- Zwei Fragen, ein Markt, eine Sprache, ein Tag. Beide Fragen sind Verbraucher- oder KMU-Software in den Vereinigten Staaten auf Englisch.
- Überschneidung ist nicht Qualität. Dass vier Oberflächen sich uneins sind, macht keine von ihnen falsch. Verschiedene Belege können dieselbe Empfehlung stützen, und tatsächlich nannten alle vier überlappende Produkte, während sie verschiedene Quellen zitierten.
- Wir haben Domains gezählt, nicht Prominenz. Eine einmal zitierte Domain und eine, auf die sich die Antwort stützte, zählen gleich.
- Nichts Kausales und nichts über Markennennungen. Dies sind ausschließlich Zitationsdaten.
- Oberflächen bewegen sich. Das sind vier Produkte in aktiver Entwicklung, an einem Nachmittag gemessen.
Häufige Fragen zu Unterschieden zwischen KI-Engines
Zitieren ChatGPT, Gemini und Google AI Overview dieselben Quellen?
Kaum. Über zwei Fragen, die vier Oberflächen im selben Moment gestellt wurden, wurden 51 verschiedene Domains zitiert und keine erschien auf allen vier. 41 der 51, etwa 80 %, erschienen auf genau einer Oberfläche.
Stimmen Googles eigene KI-Oberflächen untereinander überein?
Nach unserer Evidenz nicht. AI Overview und Gemini zitierten bei beiden Fragen null gemeinsame Domains. AI Mode, ebenfalls Google, teilte bei der ersten Frage eine Domain mit AI Overview und bei der zweiten vier. Eine Google-Oberfläche zu messen sagt nichts über die anderen.
Welche KI-Engine zitiert die meisten Quellen?
ChatGPT, bei beiden getesteten Fragen, mit 11 und 16 verschiedenen Domains. Gemini zitierte die wenigsten, mit 3 und 5. Das zählt für jeden Prozentsatz: eine Share-of-Voice-Zahl, gegen fünf Quellen gerechnet, ist nicht mit einer gegen sechzehn vergleichbar.
Lohnt sich ein Werkzeug, das mehr Engines abdeckt?
Nach dieser Evidenz ist der Abdeckungsunterschied der größte Teil der Daten und keine Verfeinerung, da vier Fünftel der zitierten Quellen nur auf einer Oberfläche erschienen. Einstiegstarife in unserem geprüften Katalog reichen von einer Engine bis sechs zu ähnlichen Preisen, der Vergleich lohnt sich also bewusst.
Wenn meine Messung stabil ist, sehe ich dann das ganze Bild?
Nein, und das ist die Falle. Die Frage dieser Studie mit perfekter Stabilität innerhalb der Oberfläche, fünf Domains in jedem von drei Durchläufen zitiert, ergab achtzehn Domains auf nur einer Oberfläche von zwanzig, als wir vier Oberflächen fragten. Reproduzierbarkeit und Abdeckung sind verschiedene Eigenschaften, und ein Werkzeug kann bei der ersten hervorragend und zur zweiten stumm sein.
Kann ich das reproduzieren?
Ja. Zwei Prompts, Vereinigte Staaten, Englisch, vier Oberflächen, je ein Durchlauf, am 7. August 2026, mit beiden oben vollständig zitierten Prompts und den Zahlen je Oberfläche in unserem Register. Stellen Sie dieselbe Frage in derselben Sitzung an vier Oberflächen und listen Sie die Domains auf, die jede zitiert.
Fragen Sie eine KI zu diesem Artikel
Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.
- ChatGPT (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Claude (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Perplexity (öffnet in neuem Tab)
- Google AI Mode (öffnet in neuem Tab)
Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.