Zum Inhalt springen
AI VisibilityResearch
DE

Wir haben dieselbe Kategorie zweimal gefragt. Die Kauffrage zitierte acht Quellen, die Definitionsfrage keine

Gleiche Kategorie, gleicher Markt, gleicher Tag. Nach der besten Plattform gefragt, zitierte ChatGPT acht Domains. Nach der Definition gefragt, null.

· Aktualisiert · 23 Min. Lesezeit

Am 8. August 2026 haben wir ChatGPT und Gemini im Abstand von Minuten zwei Fragen zum E-Mail-Marketing gestellt, im selben Markt und in derselben Sprache. „Welches ist die beste E-Mail-Marketing-Plattform für E-Commerce?“ kam mit acht zitierten Domains von ChatGPT zurück und mit fünf von Gemini. „Was ist E-Mail-Marketing-Automatisierung?“ kam bei beiden mit null zurück. Gleiche Kategorie. Gleicher Tag. Dieselben zwei Oberflächen. Geändert hat sich nur, ob die Frage nach dem Kauf oder nach der Bedeutung eines Wortes fragte.

Das ist der Befund, und er hat eine unbequeme Folge: der Erklärtext zu „Was ist X“, das meistempfohlene Format in jedem Leitfaden zur generativen Suchmaschinenoptimierung, unsere eigenen eingeschlossen, ist ein Format, für das zwei der vier von uns gemessenen Oberflächen oft niemanden zitieren.

Wie das gemessen wurde: sechs Definitionsfragen und eine Kauffrage, am 8. August 2026 über die echten Oberflächen von ChatGPT, Gemini, Google AI Overview und Google AI Mode gestellt, mit bei jedem Aufruf explizit gesetztem Land und explizit gesetzter Sprache, mit unserem eigenen Messwerkzeug. Wir zählen nur zitierte Domains, nie die Ergebnisse, die eine Oberfläche gesucht und dann ignoriert hat, denn diese beiden zu vermischen ist ein Fehler, den wir öffentlich gemacht und korrigiert haben. Jeder Durchlauf steht mit Datum und Zahl der Oberflächen in unserem Messregister.

Am selben Tag um wiederholte Durchläufe ohne Cache ergänzt. Dieser Artikel erschien zuerst mit einem Durchlauf je Oberfläche und Frage, und die faire Kritik daran lautet, dass ein einzelner Durchlauf eine Ziehung ist und keine Rate. Wir haben das kontrollierte Paar seither auf einem Weg wiederholt, der den Cache umgeht. Der Befund hielt. Der Abschnitt zur Wiederholung nennt die Zahlen und erklärt, was nützlicher ist, warum der naheliegende Weg, eine Messung in dieser Kategorie zu wiederholen, einen erfundenen Nenner erzeugt. Das Paar wurde seither in zwei fremden Kategorien repliziert, CRM und Projektmanagement.


Die Kurzfassung

  1. Das kontrollierte Paar ist die ganze Studie. Gleiche Kategorie, gleicher Markt, gleicher Tag, dieselben zwei Oberflächen: Kauffrage, ChatGPT 8 Domains und Gemini 5. Definitionsfrage, beide null.
  2. Über sechs Definitionsfragen in vier Sprachen zitierte ChatGPT in genau einer Quellen. Über neun Kauffragen zitierte es in allen neun.
  3. Googles zwei Oberflächen zitieren so oder so. AI Overview und AI Mode lieferten für jede Frage beider Arten Quellen. Die Spaltung ist ein Verhalten von Chat-Assistenten, kein Verhalten der KI-Suche.
  4. Die eine Ausnahme ist lehrreich und ließ sich nicht reproduzieren. Die deutsche Frage nach LLMO ist die einzige Definitionsfrage, bei der ChatGPT überhaupt etwas zitierte, und die einzige, bei der es überhaupt gesucht hat.
  5. Es repliziert in Kategorien, mit denen wir nichts zu tun haben. Neun Durchläufe ohne Cache über Definitionsfragen in E-Mail-Marketing, CRM und Projektmanagement lieferten null zitierte Quellen. Die Kauffrage derselben drei Kategorien zitierte zwölf bis fünfzehn Domains.
  6. Es überlebte die Wiederholung, und der naheliegende Weg zu wiederholen ist kaputt. Drei Durchläufe ohne Cache je Chat-Oberfläche hielten die Definitionsnull. Wiederholt man über eine normale Anfrage mit Cache, kommt selbst bei umformulierter Frage byteweise identischer Text zurück, also sind „zehn Durchläufe“ auf diesem Weg eine Beobachtung im Kostüm.
  7. Und zehn Tage später hörte die eine zitierbare Definition auf, zitierbar zu sein. Am 18. August 2026 erneut gestellt, ging die deutsche LLMO-Frage von 3 zitierten Domains und einer protokollierten Suche auf 0 und gar keine Suche, während die Minuten später gestellte Kauffrage 4 Domains zitierte und 4 abgeleitete Suchanfragen protokollierte.
  8. Das korrigiert einen unserer eigenen Artikel. Unser deutscher LLMO-Artikel schloss, die Definitionsebene sei der stabilere Ort zum Konkurrieren. Die Messung darunter erfasste nur die zwei Oberflächen, die immer zitieren. Weiter unten korrigiert.

Das kontrollierte Paar

Alles andere hier ist Breite. Das hier ist der Teil, der wirklich kontrolliert ist.

Frage, USA, Englisch, 8. August 2026ChatGPTGemini
what is the best email marketing platform for ecommerce?85
What is email marketing automation?00

Beide Fragen drehen sich um E-Mail-Marketing. Beide wurden in den Vereinigten Staaten auf Englisch gestellt. Beide liefen am selben Tag über dieselben zwei Oberflächen. Die eine fragt, welches Produkt man wählen soll, die andere, was ein Begriff bedeutet.

Bei der Kauffrage zitierte ChatGPT emailtooltester.com, einen bei Contentful gehosteten BigCommerce-Leitfaden und die Startseiten von Klaviyo, Omnisend, ActiveCampaign, Mailchimp, Shopify und Brevo. Es durchsuchte außerdem elf weitere Domains, die es nicht zitierte, und genau deshalb veröffentlichen wir Zitationen und keine Suchlisten. Gemini zitierte klaviyo.com, maropost.com, emailtooltester.com, insiderone.com und emailvendorselection.com. Zwei Domains, emailtooltester.com und klaviyo.com, wurden von beiden zitiert.

Bei der Definitionsfrage lieferten beide Oberflächen lange, kompetente, gut gegliederte Antworten. Die von ChatGPT umfasste rund fünfhundert Wörter mit einem durchgerechneten Beispiel, einem Diagramm einer Willkommensstrecke und einer Liste von sechs namentlich genannten Plattformen. Die von Gemini hatte Überschriften, eine dreiteilige Aufschlüsselung von Auslösern, Workflows und Inhalten sowie vier durchgerechnete Beispiele. Keine von beiden zitierte eine einzige Quelle.

Die Antworten waren nicht schlechter. Sie waren nicht zuschreibbar. Es gab kein Literaturverzeichnis, in dem ein Verlag hätte stehen können.

Dieselbe Spaltung in vier Sprachen

Wir haben die Definitionsform in vier Sprachen gestellt, um zu sehen, ob das Paar oben ein Zufall eines einzigen Themas war.

DefinitionsfrageMarktChatGPTGeminiAI OverviewAI Mode
What is generative engine optimization?USA, Englisch04810
What is generative engine optimization and how does it differ from SEO?USA, Englisch05nicht gestelltnicht gestellt
What is email marketing automation?USA, Englisch00823
¿Qué es la optimización para motores generativos (GEO)?Spanien, Spanisch00910
Qu’est-ce que l’optimisation pour les moteurs génératifs (GEO) ?Frankreich, Französisch00814
Was ist LLMO und wie unterscheidet es sich von GEO?Deutschland, Deutsch371211
ChatGPTGoogle AI ModeE-Mail-Automatisierung, USA0 auf 23GEO, Frankreich, Französisch0 auf 14LLMO, Deutschland, Deutsch3 auf 11GEO, USA, Englisch0 auf 10GEO, Spanien, Spanisch0 auf 10
Dieselbe Definitionsfrage, einem Chat-Assistenten und einer Google-Oberfläche gestellt. ChatGPT zitierte bei vier dieser fünf überhaupt nichts, während AI Mode für die identische Frage zwischen zehn und dreiundzwanzig Domains zitierte. Gemessen am 8. August 2026, Land und Sprache explizit gesetzt, Durchläufe ohne Cache.
Verschiedene für Definitionsfragen zitierte Domains, ChatGPT gegen Google AI Mode
ChatGPTGoogle AI Mode
E-Mail-Automatisierung, USA023
GEO, Frankreich, Französisch014
LLMO, Deutschland, Deutsch311
GEO, USA, Englisch010
GEO, Spanien, Spanisch010

Lies die ChatGPT-Spalte von oben nach unten. Fünf Nullen und eine Drei.

Lies nun dieselbe Spalte für die Kauffragen, die wir gemessen haben, allesamt bereits veröffentlicht und registriert: elf für Laufschuhe, sechzehn für E-Mail-Plattformen, vier für die amerikanische Frage nach der GEO-Agentur, eine für die französische, drei für die deutsche, eine für die zweite deutsche Formulierung, eine für die spanische, sechs für die amerikanische Frage nach dem Werkzeug für KI-Sichtbarkeit und acht für die E-Mail-Plattform-Frage von oben. Neun Kauffragen, neun Werte über null, im Bereich von eins bis sechzehn.

Sechs Definitionsfragen, ein Wert über null.

Eine Einschränkung, die wir am selben Tag ergänzt haben, weil sie gegen die aufgeräumte Fassung spricht. Eine zehnte Kauffrage, „what is the best accounting software for freelancers?“, wurde danach ohne Cache auf ChatGPT gemessen. Ihr erster Durchlauf zitierte überhaupt nichts, und ein zweiter Aufruf über zwei Durchläufe zitierte zwölf Domains, von denen jede in genau einem der beiden auftauchte. Eine Kauffrage kann also null liefern, und dieselbe Kauffrage kann zwischen Durchläufen von null auf zwölf springen. Der Satz oben sagt, neun Kauffragen ergaben neun Werte über null, was für diese neun stimmt und nicht als „Kauffragen zitieren“ gelesen werden sollte.

Die Asymmetrie überlebt das und ist es wert, präzise statt bequem wiederholt zu werden. Auf der Definitionsseite hielt die Null über neun Durchläufe ohne Cache in drei fremden Kategorien, ohne dass ein einziger Durchlauf eine Zitation erzeugte. Auf der Kaufseite reicht die Zahl von null bis sechzehn, manchmal bei derselben Frage. Nie zitieren und manchmal nicht zitieren sind verschiedene Behauptungen, und nur die erste ist unsere.

Gemini spaltet sich genauso, aber weniger scharf: es zitierte bei acht von neun Kauffragen und bei drei von sechs Definitionsfragen.

Die zwei Google-Oberflächen spalten sich überhaupt nicht. AI Overview und AI Mode lieferten bei jeder beantworteten Frage beider Arten zitierte Quellen, mit einer Ausnahme, die kein Schweigen ist: bei der amerikanischen Frage nach dem Werkzeug für KI-Sichtbarkeit lieferte AI Overview statt einer Antwort einen vorgelagerten Fehler, und diese Zeile ist als drei Oberflächen registriert und nicht als Null gezählt. Überall sonst zitierten beide. Wenn deine Definitionsseite irgendwo zitiert werden soll, dann dort.

Wir haben es wiederholt, weil ein Durchlauf eine faire Kritik ist

Der häufigste Einwand gegen eine Arbeit wie diese, und der richtige, lautet, dass ein einzelner Durchlauf je Oberfläche eine Ziehung ist und keine Rate. Eine Null bekommt jeder einmal. Also haben wir das kontrollierte Paar wiederholt. Das richtig zu machen war am Ende interessanter als das Ergebnis.

Die naheliegende Methode ist wertlos. Wir haben „What is email marketing automation?“ zuerst fünfmal hintereinander gestellt. Alle fünf kamen mit null Zitationen zurück, was nach Bestätigung aussieht, bis man den Text liest: alle fünf waren identisch, Byte für Byte, sowohl bei ChatGPT als auch bei Gemini. Dann haben wir die Zeichenkette geändert. „What is email marketing automation“ ohne Fragezeichen lieferte denselben Text erneut. „Can you explain what email marketing automation is?“, was eine anders formulierte Frage ist, lieferte denselben Text ein siebtes Mal, bis hin zum selben handgezeichneten ASCII-Diagramm einer Willkommensstrecke.

Drei verschiedene Eingaben, eine identische Ausgabe. Das ist ein Cache, und er hängt nicht an der exakten Zeichenkette, denn die drei Zeichenketten unterscheiden sich. „Null Zitationen in zehn Durchläufen“ darauf zu stützen wäre ein erfundener Nenner gewesen: es ist eine Beobachtung, siebenmal ausgeliefert.

Also haben wir das Paar auf einem Weg wiederholt, der den Cache umgeht und die Recherche bei jeder Anfrage neu plant. Das ist die Messung unten.

Frage, USA, Englisch, 8. August 2026OberflächeDurchläufe ohne CacheVerschiedene zitierte Domains
What is email marketing automation?ChatGPT30
What is email marketing automation?Gemini30
what is the best email marketing platform for ecommerce?ChatGPT215
what is the best email marketing platform for ecommerce?Gemini39

Die Definitionsnull überlebt die Wiederholung. Drei Durchläufe ohne Cache auf jeder Chat-Oberfläche, in keinem eine Zitation.

Die Kaufseite lieferte die überraschendere Zahl. Über die zwei Durchläufe ohne Cache bei ChatGPT wurden fünfzehn verschiedene Domains zitiert, und jede einzelne davon tauchte in genau einem der beiden Durchläufe auf. Die zwei Durchläufe teilten sich keine einzige zitierte Domain. Gemini war ruhiger, aber nicht ruhig: von neun Domains erschienen drei in allen drei Durchläufen (drip.com, maropost.com und emailtooltester.com) und sechs in nur einem.

Diese Asymmetrie ist die praktische Lehre, und sie trifft unseren eigenen ersten Entwurf so hart wie jeden anderen. Bei einer Definitionsfrage genügt ein einzelner Durchlauf, weil null keine Varianz hat und eine Wiederholung nichts Neues verrät. Bei einer Kauffrage ist ein einzelner Durchlauf nahezu wertlos, weil die Zitationsmenge zwischen Durchläufen erheblich neu gemischt wird. Jeder Anbieter, der deine „KI-Sichtbarkeit“ für eine kommerzielle Anfrage aus einem täglichen Durchlauf meldet, meldet einen Münzwurf, und jeder Anbieter, der eine Anfrage über einen Cache wiederholt, zeichnet dir konstruktionsbedingt eine flache Linie. Nach beidem lohnt es sich vor dem Kauf zu fragen.

Drei Kategorien, drei Paare, neun Durchläufe ohne Cache, keine Zitationen

Der zweite faire Einwand, nach dem zur Zahl der Durchläufe, lautet, dass es hier nur um generative Suchmaschinenoptimierung und E-Mail-Marketing geht und wir generative Suchmaschinenoptimierung verkaufen. Ein Befund, der nur in der eigenen Branche auftaucht, ist ein Befund über die eigene Branche.

Also haben wir dasselbe kontrollierte Paar in zwei Kategorien gestellt, mit denen wir nichts zu tun haben, ohne Cache, auf ChatGPT.

KategorieDefinitionsfrageDomainsKauffrageDomains
E-Mail-MarketingWhat is email marketing automation?0 in 3 Durchläufenbest email marketing platform for ecommerce?15 in 2 Durchläufen
CRMWhat is a CRM?0 in 3 Durchläufenbest CRM for a small business?12 in 1 Durchlauf
ProjektmanagementWhat is project management software?0 in 3 Durchläufenbest project management software for a remote team?13 in 1 Durchlauf

Neun Durchläufe ohne Cache über drei Definitionsfragen in drei fremden Kategorien, und nicht eine zitierte Quelle. Drei Kauffragen in denselben drei Kategorien, alle zitiert, je zwölf bis fünfzehn Domains.

Die Zahlen der Durchläufe sind ungleich, und es lohnt sich deutlich zu sagen, in welche Richtung das wirkt. Die Definitionshälfte hat je drei Durchläufe ohne Cache, weil eine Null nur dann etwas wert ist, wenn man sie wiederholt hat. Die Kaufhälfte hat einen oder zwei, weil ChatGPT langsam genug ist, dass das Werkzeug vorzeitig anhielt, und weil diese Hälfte nur belegen muss, dass Zitationen überhaupt vorkommen, was ein Durchlauf mit dreizehn Domains bequem tut. Wenn die Asymmetrie unserer Behauptung nützte, würden wir sie nicht veröffentlichen. Sie wirkt andersherum: die Hälfte, die wir am härtesten wiederholt haben, ist die, die nichts lieferte.

Ein Detail aus den Kaufdurchläufen ist mehr wert als die Zahlen. Bei der CRM-Frage sind drei der zwölf zitierten Domains Fachmedien, die man erwartet, technologyadvice.com, forbes.com und techradar.com. Die anderen neun umfassen konabayev.com, softabase.com, themona.global, b2bbrief.com und americanbusinesscenter.org, also keine Namen, die im CRM-Markt jemand wiedererkennen würde. Bei der Projektmanagement-Frage sind sechs der dreizehn die Anbieter selbst, monday.com, asana.com und clickup.com sowie drei ihrer Support-Subdomains.

Die Kaufebene ist also erreichbar, und erreichbar für kleine Seiten. Genau das macht den Definitionsbefund handlungsrelevant: es ist nicht so, dass Zitationen schwer zu gewinnen wären, es gibt bei diesen Fragen schlicht keine zu gewinnen.

Die Ausnahme, die wir nicht wegerklären konnten

Die deutsche LLMO-Frage ist die einzige Definitionsfrage, bei der ChatGPT überhaupt etwas zitierte, und die naheliegende Erklärung ist falsch.

Unser erster Verdacht war die Formulierung. Diese Frage verlangt einen Vergleich, „was ist LLMO und wie unterscheidet es sich von GEO“, statt eines schlichten „Was ist X“, und ein Vergleich braucht plausibel den Abgleich zweier Quellen. Also haben wir es geprüft: wir haben „What is generative engine optimization and how does it differ from SEO?“ in den Vereinigten Staaten auf Englisch gestellt, am selben Tag, über dieselben zwei Oberflächen.

ChatGPT zitierte null. Die vergleichende Form änderte nichts. Gemini ging von vier zitierten Domains auf fünf, was bei dieser Stichprobengröße Rauschen ist.

Die vergleichende Struktur war es also nicht. Was im deutschen Durchlauf sichtbar ist und in jedem englischen fehlt, ist, dass ChatGPT tatsächlich gesucht hat. Seine eigene abgeleitete Suchanfrage ist protokolliert: „LLMO definition GEO generative engine optimization difference“. Es durchsuchte neun Domains und zitierte drei davon, und seine Antwort sagt ausdrücklich, die beiden Begriffe würden „teilweise synonym“ verwendet. Bei den englischen Fragen gibt es keine abgeleitete Suchanfrage und überhaupt keine Suche.

Die Lesart, die passt, lautet: der Assistent sucht, wenn er einen Begriff als ungeklärt behandelt, und antwortet aus seinen Gewichten, wenn er ihn als geklärt behandelt. LLMO ist ein junges Label mit echter Uneinigkeit darüber, ob es sich von GEO unterscheidet. E-Mail-Marketing-Automatisierung ist unstrittig. Generative engine optimization hat auf Englisch einen Wikipedia-Artikel und gilt offenbar als geklärt.

Das ist eine Beobachtung, und wir kennzeichnen sie als eine. Es ist eine Hypothese mit einem sichtbaren Mechanismus, kein Ergebnis. Ohne Absicherung sagen lässt sich das Negative: die vergleichende Formulierung reproduzierte den Effekt nicht, also sollte jeder, der ChatGPT-Zitationen gewinnen will, indem er „Was ist X“ zu „Was ist X und wie unterscheidet es sich von Y“ umschreibt, das selbst messen, bevor er es glaubt.

Zehn Tage später hörte der beobachtete Begriff auf, zitierbar zu sein

Als dieser Artikel erschien, sagten wir, die Prompts seien eingefroren und würden erneut gestellt, und wir nannten die Zahl, auf die zu achten ist: ob die englische GEO-Definition wieder eine Suche auslöst oder ob die deutsche damit aufhört.

Am 18. August 2026 haben wir sie erneut gestellt. Die deutsche hörte auf.

Was ist LLMO und wie unterscheidet es sich von GEO?8. August18. August
ChatGPT, zitierte Domains30
ChatGPT, Suche durchgeführtjanein
Gemini, zitierte Domains74

Am 8. August war dies die einzige der sechs Definitionsfragen, bei der ChatGPT überhaupt etwas zitierte, und die einzige, bei der eine abgeleitete Suchanfrage protokolliert wurde. Zehn Tage später gibt es keine abgeleitete Suchanfrage und keine Zitation. Die Antwort ist weiterhin kompetent, sagt weiterhin, die beiden Begriffe würden „teilweise synonym“ verwendet, und entsteht nun, ohne irgendetwas nachzuschlagen.

Die Kontrolle ist das, was das lesbar macht. Eine Definitionsnull bedeutet nichts an einem Tag, an dem das Werkzeug überhaupt nicht recherchiert, also haben wir am selben Tag im Abstand von Minuten die Kauffrage gestellt: 4 zitierte Domains und 4 protokollierte abgeleitete Suchanfragen, gegen 45 Suchergebnisse. Die Recherche funktionierte. Sie wurde bei der Definition nur nicht genutzt.

Das ist die Richtung, die dieser Artikel vorhergesagt hat, und es lohnt sich genau zu sein, was es ist und was nicht. Es sind zwei Zeitpunkte, keine Zeitreihe. Es ist ein Durchlauf je Zelle, und die erneute Lesung kam byteweise identisch zurück, was der Cache ist, den dieser Artikel bereits dokumentiert, und keine zweite Beobachtung. Und eine beobachtete Richtung ist keine gezeigte Ursache: nichts hier zeigt, dass das Absetzen des Begriffs das Fenster geschlossen hat, nur dass sich das Fenster in den zehn Tagen geschlossen hat, nachdem wir sagten, man solle darauf achten.

Die englische GEO-Definition, die andere Hälfte des von uns genannten Paars, lief auf der Chat-Oberfläche zweimal in eine Zeitüberschreitung und ist hier nicht gemessen. Sie war am 8. August null, die interessante Hälfte war also nie sie.

Was das einen Plan kostet, falls es hält. Das Fenster, für die Definition einer Kategorie zitiert zu werden, steht nicht unbegrenzt offen und misst sich womöglich in Wochen. LLMO war am 8. August ein Begriff, der jung genug war, dass der Assistent nachsah; zehn Tage, in denen das Web darüber schrieb, reichten offenbar, damit er damit aufhört. Wer eine Definition besetzen will, sollte davon ausgehen, dass die zitierbare Phase die frühe ist.

Was das einen Content-Plan kostet

Jeder Leitfaden zu dieser Disziplin, unsere eingeschlossen, sagt dir, du sollst den eigenständigen Definitionsabsatz schreiben. Dieser Rat ist nicht falsch, und das GEO-bench-Experiment aus Princeton über zehntausend Anfragen ist weiterhin der beste Beleg für das Format: Zitate erhöhten den Anteil einer Quelle an der Antwort um 41%, Statistiken um 30% und zitierte Quellen um 27%, während Keyword-Stuffing schlechter abschnitt als gar nichts zu tun.

Format-Rat zahlt sich aber nur dort aus, wo es ein Literaturverzeichnis gibt. Bei fünf der sechs Definitionsfragen oben erzeugte ChatGPT für niemanden ein Literaturverzeichnis. Der zitierbarste Definitionsabsatz, der je geschrieben wurde, wäre in diesen Antworten null Mal zitiert worden, weil keine Seite es wurde.

Die ehrliche Fassung des Rats hat also eine Bedingung:

  • Eine Definitionsseite ist eine Wette auf Googles KI-Oberflächen, nicht auf die Chat-Assistenten. AI Overview und AI Mode zitierten bei jeder von uns gestellten Definitionsfrage, jeweils zwischen 8 und 23 Domains. Das ist eine echte und gewinnbare Oberfläche.
  • Bei einem geklärten Begriff antworten die Chat-Assistenten aus dem Training, nicht aus der Recherche. Nichts, was du dieses Quartal veröffentlichst, erreicht eine Antwort, die nie eine Suche durchführt. Der Hebel dort ist, im nächsten Trainingskorpus zu stehen und überall konsistent beschrieben zu werden, was ein Zwölfmonatszug ist und keiner für den Redaktionskalender.
  • Die Kauffrage ist der Ort, an dem Recherche stattfindet. Neun von neun. Wenn du diesen Monat eine Zitation von einem Chat-Assistenten willst, muss die Seite eine Frage beantworten, an deren Ende ein Kauf steht.
  • Miss die Frage, nicht das Thema. Zwei Fragen zum E-Mail-Marketing, einen Tag auseinander im selben Markt, erzeugten dreizehn Zitationsplätze und null Zitationsplätze. Wer „KI-Sichtbarkeit für E-Mail-Marketing“ als eine einzige Zahl meldet, mittelt über diese Lücke hinweg.

Die Korrektur an einem eigenen Artikel

Am 8. August 2026 haben wir einen deutschen Artikel über LLMO veröffentlicht, der schloss, Definitionsfragen erzeugten weit mehr Übereinstimmung zwischen Oberflächen als Kauffragen, und die Definitionsebene sei deshalb der stabilere Ort für eine Marke zum Konkurrieren. Er berichtete siebzehn zitierte Domains, von denen sechs auf beiden gemessenen Oberflächen auftauchten, also mehr als ein Drittel, gegen nahezu keine Übereinstimmung bei den Kauffragen.

Die Arithmetik stimmte und der Vergleich war nicht belastbar, aus einem Grund, den wir in jenem Artikel als Einschränkung markiert und dann trotzdem weggeredet haben. Jener Durchlauf maß zwei Oberflächen, AI Overview und AI Mode. Die Kaufdurchläufe, gegen die er verglichen wurde, maßen vier. Genau diese zwei Google-Oberflächen sind die zwei, die bei jeder Frage zitieren, also selektiert eine Beschränkung auf sie für Übereinstimmung. Wir haben eine Messung über zwei Google-Oberflächen gegen Messungen über vier Oberflächen gestellt und den Unterschied als Eigenschaft der Frage gelesen.

Mit vier weiteren gemessenen Definitionsfragen läuft die Übereinstimmung zwischen genau diesen zwei Google-Oberflächen so: 29% für die englische GEO-Definition, 19% für die spanische, 11% für die Definition der E-Mail-Automatisierung, 10% für die französische und die deutsche 35%. Der deutsche Wert ist die Spitze der Spanne, kein typischer Wert.

Der deutsche Artikel wurde entsprechend korrigiert. Sein praktischer Rat, einen extrahierbaren Absatz zu schreiben, hält, denn der ruht auf der Arbeit aus Princeton und darauf, welche Seiten die Google-Oberflächen tatsächlich zitieren. Seine Behauptung, die Definitionsebene sei der stabilere Ort zum Konkurrieren, hält nicht, und der Ersatzbefund ist der aus diesem Artikel: bei Definitionsfragen zitieren die Chat-Assistenten oft niemanden, was ein härteres Problem ist als geringe Übereinstimmung.

Wir haben außerdem die Lücke geschlossen, die jener Artikel selbst benannte. Er sagte, ChatGPT und Gemini seien seine Frage nie gestellt worden, weil der Aufruf über vier Oberflächen in eine Zeitüberschreitung lief. Sie sind ihnen inzwischen gestellt worden, am selben Tag, und die Antwort lautet drei zitierte Domains und sieben.

Was wir nicht gemessen haben

  • Wiederholung über das kontrollierte Paar hinaus. Das Paar wurde auf dem Weg ohne Cache wiederholt, drei Durchläufe je Chat-Oberfläche. Die anderen fünf Definitionsfragen und die Zeilen über vier Oberflächen sind weiterhin je ein Durchlauf, und das Register hält die Zahl der Durchläufe in jeder Zeile genau deshalb fest. Wo eine Zeile einen Durchlauf sagt, ist einer gemeint.
  • Perplexity und Claude. Unsere Messung liest ChatGPT, Gemini, Google AI Overview und Google AI Mode über deren echte Oberflächen. Diese zwei sind nicht dabei, und wir behaupten nichts über sie.
  • Ob die nicht zitierten Antworten richtig waren. Wir haben gezählt, wer zitiert wird, nicht ob das Gesagte stimmt. Die nicht zitierten Definitionsantworten wirkten auf uns korrekt, und genau das macht sie schwer angreifbar.
  • Ob das hält, während Begriffe altern. Der Mechanismus, den wir gesehen zu haben glauben, sagt voraus, dass ein Begriff mit dem Absetzen unzitierbar wird. Das ist eine Behauptung über Veränderung in der Zeit, und wir haben zwei Zeitpunkte, es ist also eine Frage für weitere Wiederholungen gegen dieselben eingefrorenen Prompts und keine Schlussfolgerung.
  • Angemeldetes oder personalisiertes Verhalten. Das sind saubere Sitzungen. Wer eine Historie hat, bekommt womöglich andere Rechercheentscheidungen.

Wie es weitergeht

Die Prompts oben sind eingefroren, und die erste Wiederholung gegen dieselbe Menge hat zehn Tage später stattgefunden: sie ist der Abschnitt weiter oben. Die interessante Zahl ist nicht die heutige Spaltung, sondern ob die englische GEO-Definition je wieder eine Suche auslöst oder ob die deutsche damit aufhört. Wenn die Lesart von geklärt gegen ungeklärt stimmt, sollte ein Begriff mit dem Reifen weniger zitierbar werden, was hieße, dass sich das Fenster, für die Definition einer Kategorie zitiert zu werden, schließt statt öffnet.

Wenn du dieselbe Messung für deine eigene Kategorie willst, ist das genau das, was unser Produkt für KI-Sichtbarkeit macht: dieselben Prompts, dieselben Oberflächen, Land und Sprache explizit gesetzt, wiederholt, damit du eine Rate bekommst statt einer Ziehung. Die vollständige Studie über Oberflächen hinweg, die diese hier erweitert, ist vier Oberflächen, eine Frage, und die frühere und kleinere Beobachtung, die das zuerst aufwarf, ist answers with no sources.

Häufige Fragen zu nicht zitierten Definitionen

Zitiert ChatGPT bei einer „Was ist“-Frage jemals Quellen?

Ja, in unserer Messung aber selten. Über sechs Definitionsfragen in vier Sprachen am 8. August 2026 zitierte es in einer Quellen, der deutschen Frage nach LLMO, wo drei Domains zitiert wurden. In den anderen fünf erzeugte es vollständige Antworten ganz ohne Quellen. Über neun am 7. und 8. August 2026 gemessene Kauffragen zitierte es in allen neun Quellen. Eine zehnte, später am selben Tag gemessen, zitierte in ihrem ersten Durchlauf ohne Cache nichts und über zwei weitere zwölf Domains, Kauffragen zitieren also auch nicht garantiert. Was sie trennt, ist, dass die Definitionsnull in jedem von neun Durchläufen ohne Cache hielt, während die Kaufzahl von null bis sechzehn reicht.

Warum sollte eine KI eine Definition beantworten, ohne etwas zu zitieren?

Weil sie nicht sucht. In den Durchläufen, in denen ChatGPT nichts zitierte, ist keine abgeleitete Suchanfrage protokolliert, es wurde also keine Recherche durchgeführt und die Antwort kam aus dem Training des Modells. In dem einen deutschen Durchlauf, in dem es zitierte, ist eine Suchanfrage protokolliert. Ein Modell, das einen Begriff für geklärt hält, hat keinen Grund nachzuschlagen.

Heißt das, Definitionsinhalte sind für KI-Sichtbarkeit wertlos?

Nein, es heißt, dass die Oberfläche zählt. Google AI Overview und Google AI Mode zitierten bei jeder von uns gestellten Definitionsfrage Quellen, jeweils zwischen 8 und 23 Domains. Eine Definitionsseite ist eine Wette auf diese Oberflächen. Was sie nicht ist, ist ein verlässlicher Weg, bei einem Begriff, den das Modell für geklärt hält, von einem Chat-Assistenten zitiert zu werden.

Ist das dasselbe wie Suche ohne Klick?

Nein. Suche ohne Klick beschreibt, dass ein Nutzer eine Antwort bekommt, ohne eine Seite zu besuchen, aber die Quellen werden weiterhin gezeigt und zugeschrieben. Das hier ist stärker: es gibt überhaupt keine Zuschreibung, also gibt es keinen Link, den jemand nicht anklicken kann, und keinen genannten Verlag. Eine Marke kann in einer Antwort, die niemanden nennt, nicht auftauchen.

Auf wie vielen Durchläufen beruht das?

Das kontrollierte Paar wurde je Chat-Oberfläche dreimal auf einem Weg wiederholt, der den Cache umgeht, und die Definitionsnull hielt in jedem Durchlauf. Die anderen fünf Definitionsfragen und die Zeilen über vier Oberflächen sind je ein Durchlauf, und das Register hält die Zahl in jeder Zeile fest. Eine Warnung für alle, die das wiederholen: dieselbe Frage über eine normale Anfrage mit Cache erneut zu stellen liefert identischen Text, zehn solcher „Durchläufe“ sind also eine Beobachtung und nicht zehn. Wir sind darauf gestoßen und sagen es oben, statt den aufgeblähten Nenner zu veröffentlichen, den es erzeugt hätte.

Gilt das nur in eurer eigenen Branche?

Nein. Das kontrollierte Paar wurde in CRM und Projektmanagement wiederholt, Kategorien, mit denen wir nichts zu tun haben. „What is a CRM?“ und „What is project management software?“ lieferten je null zitierte Domains über drei Durchläufe ohne Cache bei ChatGPT, während „what is the best CRM for a small business?“ und „what is the best project management software for a remote team?“ zwölf und dreizehn Domains zitierten. Neun Definitionsdurchläufe ohne Cache über drei fremde Kategorien, in keinem eine Zitation.

Ändert das Wiederholen der Frage die Antwort?

Das hängt ganz von der Art der Frage ab, und das ist der nützliche Teil. Bei der Definitionsfrage erzeugten drei Durchläufe ohne Cache je Oberfläche jedes Mal null Zitationen. Bei der Kauffrage zitierten zwei Durchläufe ohne Cache bei ChatGPT zusammen fünfzehn Domains und teilten sich keine: jede Domain tauchte in genau einem der beiden auf. Gemini zitierte neun über drei Durchläufe, davon drei jedes Mal. Ein einzelner Durchlauf genügt also für eine Definitionsfrage und ist für eine kommerzielle nahezu bedeutungslos.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)