Zum Inhalt springen
KI-SichtbarkeitGEO
DE

Wir haben eine Frage achtmal gelesen. Die Quellen bewegten sich nicht, die Antwort schon, und das bricht die Kennzahl, die alle benutzen.

Zwölf Domains in sieben von acht Durchläufen zitiert, einer in einem. In jedem Durchlauf zitiert misst nicht Stabilität, sondern Ihr Stichprobenglück.

· 11 Min. Lesezeit

Jede Stabilitätszahl auf dieser Seite ruht auf derselben Latte: eine Quelle zählt, wenn sie in jedem beantworteten Durchlauf zitiert wurde, drei Durchläufe pro Frage. Gestern kippte diese Latte eine Zelle zwischen zwei Lesungen im Abstand einer Stunde von null dauerhaften Quellen auf zwölf. Also haben wir aufgehört, Zellen hinzuzufügen, und stattdessen eine einzige Frage tief gelesen. Acht beantwortete Durchläufe. Zwölf Domains in sieben davon zitiert, und eine Domain, google.com, in einem. Eine zweite Frage ergab bei fünf Durchläufen dieselbe Form: zwölf bei vier, google.com bei einem. Die Quellen flackern nicht. Einer von fünf bis acht Durchläufen liefert eine andere Antwort, und die strenge Latte lässt alle zwölf auf einmal fallen, sobald Ihre Stichprobe ihn enthält.

Damit misst “in jedem Durchlauf zitiert” Ihr Stichprobenglück statt irgendetwas über die Quellen, und wir haben es veröffentlicht.

Am selben Tag eingegrenzt. Vier weitere Fragen mit diesem Satzbau und dieser Oberfläche zeigen den Mechanismus unten nicht, er gehört also diesen beiden Fragen und nicht AI Mode: eine Dauerhaftigkeitszahl von null erweist sich als drei verschiedene Tatsachen, und eine Kategorie liefert dieselben neun Quellen in jedem Durchlauf. Die Arithmetik hier ändert sich für die beiden Fragen nicht, an denen sie gemessen wurde.

Transparenz: EchoWi verkauft Messung von KI-Sichtbarkeit, und dieser Text zieht eine Kennzahl zurück, die wir in neun veröffentlichten Studien verwenden und die Produkte dieser Kategorie als Schlagzeilenzahl ausweisen. Die beiden Fragen, die Oberfläche, der Markt und die Zahl der Durchläufe stehen in unserem Messregister, die Rechnung unten lässt sich also prüfen und gegen uns wiederholen.


Die kurze Fassung

  1. Zwölf Domains, eine einzige Zahl. Achtmal gelesen, wurde jede der zwölf Quellen in genau sieben Durchläufen zitiert. Unabhängiges Flackern streut die Zahlen; dass zwölf auf derselben Zahl landen, ist ein einziger gemeinsam fehlender Durchlauf.
  2. Der abweichende Durchlauf zitiert Google und sonst nichts. google.com ist in beiden Fragen die einzige Domain, die in genau dem Durchlauf auftaucht, in dem die anderen zwölf fehlen.
  3. Also ist die Latte alles oder nichts. Ziehen Sie drei Durchläufe ohne den abweichenden, bekommen Sie zwölf dauerhafte Quellen. Ziehen Sie drei mit ihm, bekommen Sie null. An den Quellen hat sich nichts geändert.
  4. Die Chance, ihn bei drei Durchläufen zu erwischen, liegt bei diesen beiden Fragen zwischen 33 und 49 %. Das ist keine Fehlermarge, das ist ein Münzwurf, der zwischen einer leeren und einer vollen Antwort entscheidet.
  5. Zu berichten ist stattdessen die Häufigkeit, sieben von acht, kein Bestehen oder Durchfallen an einer Latte, die ein einziger Durchlauf kippen kann.

Was wir tatsächlich getan haben

Die gestrige Studie über Oberflächen hinweg veröffentlichte, dass vier Zellen auf AI Mode keine dauerhafte Quelle lieferten. Eine Stunde später erneut gefragt, lieferten alle vier eine, und Gehaltsabrechnung in den Vereinigten Staaten ging von null auf zwölf, wobei die zwölf genau die Domains waren, die beim ersten Mal in zwei von drei Durchläufen gestanden hatten. Wir haben die Aussage am selben Tag zurückgezogen, und die naheliegende nächste Frage war, ob sich die Latte bewegt oder die Quellen.

Also statt einer weiteren Zelle eine Frage so tief gelesen, wie das Werkzeug reicht. Wir haben zehn Durchläufe angefordert und acht bekommen, was hier steht, weil der Nenner jeder Zahl unten die Durchläufe sind, die stattfanden, und nicht die, die angefordert wurden.

Zwei Fragen, eine Form

FrageBeantwortete DurchläufeDomains bei einem unter allenDomain des abweichenden Durchlaufs
Bester Gehaltsabrechnungsdienst812google.com bei 1
Beste Buchhaltungssoftware512google.com bei 1

Die wichtige Spalte ist die dritte. Zwölf Quellen, denen jeweils genau ein Durchlauf fehlt, in beiden Fragen, ohne eine einzige Quelle bei sechs von acht und keine bei acht von acht.

Wäre jede Quelle für sich unzuverlässig, würden die Zahlen streuen: einige bei acht, einige bei sechs, einige bei fünf. Sie streuen überhaupt nicht. Dass zwölf Domains sich eine einzige Zahl teilen, ist, wie ein fehlender Durchlauf von außen aussieht, und deshalb lohnt sich das Aggregat zu lesen statt es zu überfliegen.

Die Kontrolle: dieselben zwei Fragen auf AI Overview

Wenn einer von fünf bis acht Durchläufen anders antwortet, ist die naheliegende Frage, ob das AI Mode ist oder die Messung. Also wurden beide Fragen auf dieselbe Weise auf AI Overview gelesen.

LesungBeantwortete DurchläufeIn jedem Durchlauf zitiertEinmal zitiertGemeinsam fehlender Durchlauf
AI Mode, Gehaltsabrechnung801ja
AI Mode, Buchhaltung501ja
AI Overview, Gehaltsabrechnung96 von 60nein
AI Overview, Buchhaltung104 von 2012nein

Keine der beiden AI-Overview-Lesungen hat diese Form. Keine Domain sitzt allein bei einem Durchlauf, während alles andere einen unter dem Gesamtwert sitzt, der entartete Durchlauf ist in diesen vier Lesungen also eine Eigenschaft von AI Mode und nicht des Werkzeugs, das beide misst.

Aber AI Overview ist auch nicht deterministisch, und die erste Lesung hätte uns fast überzeugt. Gehaltsabrechnung lieferte 6 Domains, alle sechs in allen 9 beantworteten Durchläufen zitiert, ohne jeden Rand. Stabiler wird eine Abrufschicht nicht, und es war verlockend zu schreiben, AI Overview bewege sich schlicht nicht. Die Buchhaltungslesung hat das erledigt: 4 Domains in allen 10 Durchläufen, eine in neun, zwei in acht, eine in zwei und 12 Domains genau einmal zitiert.

Die beiden Oberflächen brechen dieselbe Kennzahl also auf zwei verschiedene Arten. Auf AI Mode kann ein einziger Durchlauf die dauerhafte Menge leeren. Auf AI Overview erodiert die dauerhafte Menge, während Durchläufe hinzukommen, weil die Latte Einstimmigkeit verlangt und jeder weitere Durchlauf eine weitere Gelegenheit ist, sie zu verlieren.

Was das für unsere eigenen veröffentlichten Zahlen bedeutet

Das ist der unangenehme Teil. Unser Register enthält eine Zeile für Buchhaltung in den Vereinigten Staaten auf AI Overview mit dreizehn dauerhaften Domains bei drei Durchläufen. Zehnmal gelesen hat dieselbe Frage auf derselben Oberfläche vier.

Beide sind richtig und sie beantworten verschiedene Fragen. Dreizehn ist, wie viele Quellen in allen drei Durchläufen jener Lesung zurückkamen. Vier ist, wie viele in allen zehn dieser Lesung zurückkamen. Die Latte ist eine Funktion der Zahl der Durchläufe, und das war sie immer.

Das entwertet die darauf gebauten Vergleiche nicht, weil jede Zelle der Studie über abgeglichene Kategorien bei drei Durchläufen gemessen wurde und gegen andere Zellen bei drei Durchläufen verglichen wird. Zurückgezogen wird eine Lesart dieser Zahlen, die wir nie hingeschrieben haben und die jeder machen würde: die Größe einer dauerhaften Menge ist keine Schätzung dafür, wie viele Quellen stabil sind. Sie ist eine Zählung dessen, was eine bestimmte Zahl von Durchläufen überlebt hat, und sie gehört neben diese Zahl.

Die Rechnung, die daraus ein Problem macht

Wenn einer von n Durchläufen die abweichende Antwort liefert, ist die Chance, dass eine Stichprobe von k Durchläufen ihn enthält, 1 - (1 - 1/n)^k.

Gezogene DurchläufeGehaltsabrechnung, abweichend 1 von 8Buchhaltung, abweichend 1 von 5
333 Prozent49 Prozent
549 Prozent67 Prozent
1074 Prozent89 Prozent

Lesen Sie diese Tabelle richtig herum, denn sie ist kontraintuitiv. Mehr Durchläufe machen es wahrscheinlicher, dass die strenge Latte null liefert, nicht unwahrscheinlicher. Die Latte verlangt Einstimmigkeit, und Einstimmigkeit wird schwerer, je größer die Stichprobe wird. Ein Produkt, das Ihre Prompts täglich laufen lässt und berichtet, wie viele Quellen jedes einzelne Mal zitiert wurden, betreibt einen Test, den seine eigene Sorgfalt zum Scheitern verurteilt.

Das ist das Gegenteil davon, wie sich eine Stabilitätskennzahl verhalten sollte, und darauf haben unsere eigenen Drei-Durchlauf-Zahlen gesessen.

Warum die Null und die Zwölf beide wahr waren

Gehaltsabrechnung in den Vereinigten Staaten auf AI Mode, erste Lesung: drei Durchläufe, einer davon der abweichende, null Quellen in allen dreien zitiert. Zweite Lesung eine Stunde später: drei Durchläufe, keiner davon der abweichende, zwölf Quellen in allen dreien zitiert.

Beide Lesungen sind richtig. Keine beschreibt die Quellen. Bei 1 von 8 landet eine Drei-Durchlauf-Lesung etwa in einem Drittel der Fälle auf null, und die erste tat es.

Das erklärt auch einen Fall, den wir vier Tage vorher veröffentlicht und damals nicht erklären konnten. In unserer Arbeit über zwei Tage lieferte eine Frage zu E-Mail-Marketing an einem Nachmittag nichts Dauerhaftes und eine Stunde später sieben Domains, und diese sieben waren genau die Quellen, die in zwei von drei Durchläufen gestanden hatten. Wir schrieben damals, eine strenge Latte und ein sich verschiebender Abruf erzeugten eine leere Menge, ohne dass irgendetwas kaputt sei. Das war richtig und vage. Der Mechanismus ist ein einziger entarteter Durchlauf, und er wird sichtbar, sobald man tief genug liest.

Was wir ändern

Wir löschen die Zahlen der dauerhaften Mengen nicht. Sie sind weiterhin die ehrliche Antwort auf “welche Quellen kamen in jedem Durchlauf dieser Lesung zurück”, und jede einzelne ist mit ihrer Zahl von Durchläufen daneben veröffentlicht. Was sie nicht sind, ist eine Eigenschaft der Frage, und unsere Studien, die eine Änderung dieser Zahl als Änderung der Welt behandeln, brauchen den Vorbehalt, den dieser Text liefert.

Die Zahl, mit der wir führen werden, ist die Häufigkeit. Sieben von acht ist eine Tatsache über die Quelle. Null von drei, wenn die drei den abweichenden Durchlauf enthielten, ist eine Tatsache über die Stichprobe.

Und die zweite Frage an einen Anbieter hat jetzt eine Begleitfrage. Nach “überspringen Ihre Durchläufe den Cache” fragen Sie, was ihre Stabilitätszahl tut, wenn die Zahl der Durchläufe steigt. Sinkt sie, berichten sie Einstimmigkeit, und Einstimmigkeit ist keine Stabilität.

Was das nicht zeigt

Zwei Fragen, eine Oberfläche, ein Markt, ein Tag. Das ist AI Mode in den Vereinigten Staaten auf Englisch am 12. August 2026. Die beiden AI-Overview-Lesungen oben sind eine Kontrolle am selben Tag im selben Markt, keine allgemeine Aussage über diese Oberfläche, und nichts davon sagt, wie oft etwas davon über Wochen passiert.

Der gemeinsame Durchlauf ist ein Schluss aus Zahlen, keine Beobachtung von Durchläufen. Das Werkzeug liefert, wie viele Durchläufe jede Domain zitierten, nicht welche. Was diese Lesart über eine Vermutung hebt, ist, dass alle zwölf Zahlen in beiden Fragen identisch sind und dass eine getrennte Drei-Durchlauf-Lesung alle zwölf bei drei von drei zurückgab, was unmöglich ist, wenn ihre fehlenden Durchläufe verteilt wären.

Beide Lesungen brachen früh ab. Wir haben zehn Durchläufe angefordert und acht und fünf bekommen. Deshalb sind die beiden Raten, 1 von 8 und 1 von 5, Schätzungen aus je einer Lesung statt Messungen, und deshalb ist die Wahrscheinlichkeitstabelle eine Spanne und keine Konstante.

Und ein entarteter Durchlauf ist nicht zwangsläufig eine Art von Durchlauf. Wir sehen, dass google.com die einzige darin zitierte Domain ist. Wir sehen nicht, ob es eine kürzere Antwort, eine Verweigerung oder ein anderer Abrufpfad war, und diese Messung war nicht dafür gebaut, das zu unterscheiden.

Häufige Fragen zum Messen von Zitierstabilität

Was misst “in jedem Durchlauf zitiert” eigentlich?

Nach dieser Evidenz, ob Ihre Stichprobe den Durchlauf enthielt, der anders antwortet. Eine Frage achtmal gelesen, wurden zwölf Quellen in je sieben Durchläufen zitiert und eine Domain im verbleibenden. Eine Drei-Durchlauf-Stichprobe, die diesen Durchlauf enthält, berichtet null stabile Quellen; eine, die ihn nicht enthält, berichtet zwölf, und die Quellen waren beide Male identisch.

Macht mehr Prompts laufen zu lassen eine Stabilitätsnote verlässlicher?

Diese Art von Note nicht. Eine Latte, die eine Quelle in jedem Durchlauf verlangt, wird schwerer zu nehmen, je mehr Durchläufe hinzukommen, mehr Sorgfalt erzeugt also eine niedrigere Zahl statt einer festeren. Bei unserer Gehaltsabrechnungsfrage steigt die Chance, dass die strenge Latte null liefert, von 33 Prozent bei drei Durchläufen auf 74 Prozent bei zehn.

Was sollte stattdessen berichtet werden?

Die Zitierhäufigkeit jeder Quelle, mit der Zahl der Durchläufe daneben. Sieben von acht ist prüfbar und handelt von der Quelle. Ein Bestehen oder Durchfallen an der Einstimmigkeit lässt sich von einem einzigen Durchlauf kippen und handelt von der Stichprobe.

Warum zitierte ein Durchlauf nur Google?

Wir wissen es nicht, und diese Messung kann es nicht sagen. Sichtbar ist, dass es in beiden Fragen genau einen Durchlauf gibt, in dem die zwölf üblichen Quellen fehlen und google.com da ist. Ob dieser Durchlauf eine kürzere Antwort oder ein anderer Abrufpfad war, ist eine eigene Frage, die Einsicht in jeden einzelnen Durchlauf braucht statt Aggregate.

Heißt das, Ihre früheren Studien sind falsch?

Die Zahlen stimmen und die Deutung musste enger werden, deshalb steht das hier statt still korrigiert zu werden. Eine dauerhafte Menge beschreibt eine Lesung zutreffend. Was nicht überlebt, ist, eine Änderung darin als Änderung dessen zu behandeln, was die Maschine zitiert, und der gestrige Text über Oberflächen hinweg trägt bereits den Widerruf, der das hier ausgelöst hat.

Wie würde ich das gegen Sie wiederholen?

Nehmen Sie eine Kauffrage, stellen Sie sie acht- bis zehnmal auf einer Oberfläche in einem Markt, und schreiben Sie auf, wie viele Durchläufe jede Domain zitierten, statt ob jede Domain jeden Durchlauf genommen hat. Häufen sich die Zahlen auf einer einzigen Zahl, die eins unter dem Gesamtwert liegt, haben Sie dieselbe Form, und die Latte, die alle zitieren, misst Ihre Stichprobe.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)