Zum Inhalt springen
KI-SichtbarkeitGEO
DE

Wir haben den Standard-Crawler-Audit an 66 Anbietern für KI-Sichtbarkeit gefahren. Alle 66 bestanden.

Drei Prüfungen, sechsundsechzig Anbieter, null Durchfaller. Ein glattes Ergebnis sagt wenig über die Kategorie und viel über die Prüfungen.

· Aktualisiert · 10 Min. Lesezeit

Jedes Tool dieses Marktes verkauft eine Prüfung des Crawler-Zugangs, und alle fahren dieselben drei: robots.txt lesen, die Seite abrufen, nach versteckten Pfaden suchen. Wir haben sie an allen sechsundsechzig Anbietern unseres Katalogs gefahren, uns eingeschlossen. Alle sechsundsechzig bestanden alle drei.

Das ist kein Kompliment an die Kategorie. Es ist ein Ergebnis über die Prüfungen, und wir können das mit einiger Autorität sagen, weil unsere eigene Domain alle drei an einem Tag bestand, an dem ein Crawler an unserem CDN abgewiesen wurde.

Offenlegung: EchoWi ist einer der sechsundsechzig und verkauft KI-Sichtbarkeitsmessung, eine Studie also, die zu dem Schluss kommt, dass die kostenlose Prüfung nichts aussagt, ist eine interessierte Studie. Die drei Methoden sind unten vollständig beschrieben, das Datum ist der 11. August 2026, die elf gesuchten Crawler-Namen sind aufgeführt, und die Zählungen stehen in unserem Messregister. Nichts darin fälscht einen User-Agent, aus einem Grund, den der Methodenabschnitt erklärt.


Die Kurzfassung

  1. Null von sechsundsechzig blockieren einen KI-Crawler in robots.txt. Gesucht wurde nach elf Agenten, von GPTBot bis Applebot-Extended.
  2. Sechsundsechzig von sechsundsechzig bedienen einen einfachen HTTP-Client, und das sind die meisten Crawler.
  3. Null verstecken Preise, Vergleiche oder Dokumentation vor Crawlern. Die einzigen verbotenen Pfade, die es gibt, sind Feeds, Verwaltungsrouten und Parameter-Duplikate.
  4. Sechzehn nennen KI-Crawler ausdrücklich, und alle sechzehn erlauben sie, was nichts ändert, denn ein Crawler, den niemand erwähnt, ist bereits erlaubt.
  5. Ein glattes Ergebnis auf allen dreien ist genau das, was unsere eigene Website zeigte, während sie einen Crawler blockierte, und darum geht es in diesem Artikel.
  6. Nirgendwo wurde ein User-Agent gefälscht, denn den Namen eines Crawlers von der eigenen Maschine zu senden beweist nichts, und so werden die meisten dieser Audits gemacht.

Die drei Prüfungen, und was jede wirklich fragt

robots.txt lesen. Das fragt, was die Website erklärt hat. Es ist eine veröffentlichte Anweisung an wohlerzogene Crawler und die einzige der drei, die sich nicht fälschen lässt, weil die Datei der Website gehört.

Die Seite abrufen. Das fragt, ob ein Server Inhalt an einen Client zurückgibt, der kein Browser ist. Wir haben einen User-Agent gesendet, der sagt, was er ist, echowi-accessibility-check, statt uns als GPTBot auszugeben. Diese Unterscheidung ist der ganze Unterschied zwischen einer Messung und einer Vermutung: eine gefälschte Crawler-Zeichenkette von unserer Maschine ist nicht dieser Crawler, und ein CDN, das über Verified-Bot-Status und Ursprungs-IP entscheidet, lässt sie jedes Mal durch. Jeder Audit, der Zugang testet, indem er den Namen eines anderen sendet, testet nichts.

Nach versteckten Pfaden suchen. Das fragt, ob die kommerziell nützlichen Seiten, Preise, Vergleiche und Dokumentation, vom Crawling ausgeschlossen sind.

Diese drei fährt ein kostenloser KI-Sichtbarkeits-Audit. Sie sind alle vernünftig und alle billig, weshalb jedes Tool sie enthält.


Die Ergebnisse

PrüfungBestandene Anbieter
robots.txt blockiert keinen KI-Crawler66 von 66
Bedient einen einfachen HTTP-Client66 von 66
Versteckt weder Preise noch Vergleiche noch Dokumentation66 von 66

Die elf gesuchten Agenten waren GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, anthropic-ai, PerplexityBot, Perplexity-User, Google-Extended, Bytespider, CCBot und Applebot-Extended.

Auch in die andere Richtung lehnt niemand etwas ab: gefragt, was sie erklären statt was sie blockieren, haben fünf der sechsundsechzig eine Content-Signals-Direktive, und alle fünf erlauben. Drei Tage später über einen größeren Katalog neu gemessen, und zwar mit allen Direktivenzeilen statt nur der ersten, deklarieren sieben Content Signals und einer lehnt das Training ab, wo auch der Instrumentfehler hinter der früheren Zählung beschrieben ist. Die verbotenen Pfade, die es gibt, sind Hausarbeit. Surfer schließt einen Blog-Paginierungsparameter aus, Semrush Varianten mit Tracking-Parametern und die Suche seines Blogs, MaxAEO Kommentar-Feeds, Rankability WordPress-Verwaltungsverzeichnisse, Ahrefs Archivabfragen, Alhena Tag-Seiten, SE Ranking ein statisches Tool-Verzeichnis und Ceyo Integrationsdokumentation einiger Partner. Nicht einer der sechsundsechzig schließt eine Seite aus, die ein Käufer sehen wollte.


Die sechzehn, die wirkungslose Regeln geschrieben haben

Sechzehn Anbieter nennen KI-Crawler ausdrücklich in robots.txt: Airefs, Cloudflare AEO, EchoWi, KIME, MaxAEO, Omnibound, Qwairy, Rank Prompt, Rankability, Rankscale, SE Ranking, ScalePost, Siftly, Superlines, Surfeo und Wellows.

Alle sechzehn erlauben sie. Und eine ausdrückliche Erlaubnis für einen Crawler, den niemand blockiert hat, ändert überhaupt kein Verhalten, denn der Standardzustand eines nicht erwähnten Crawlers ist bereits „erlaubt“. User-agent: GPTBot gefolgt von Allow: / erzeugt denselben Zugang wie gar nichts zu schreiben.

Der einzige messbare Unterschied zwischen diesen sechzehn und den anderen fünfzig ist also, dass sechzehn sich die Mühe gemacht haben, eine Absicht zu erklären. Das ist vernünftig, denn eine künftige Platzhalterregel würde die genannten Crawler dann nicht mit einsammeln. Es ist kein Zugang, und eine Checkliste, die es als Punkt wertet, wertet einen Kommentar.

Wir sind unter den sechzehn. Dieser Absatz gilt uns.


Warum ein glattes Ergebnis die falsche Art von Beruhigung ist

Hier ist der Fall, der die drei Prüfungen dünn aussehen lässt, und es ist unserer.

Unsere robots.txt erlaubt jeden KI-Crawler namentlich. Unsere Seiten sind statisch und werden jedem Client geliefert, der fragt. Nichts ist versteckt. Auf allen drei Prüfungen oben erreicht unsere Domain die volle Punktzahl, und sie erreichte sie an dem Tag, an dem wir feststellten, dass ein großer KI-Crawler bei fast jeder Anfrage an uns abgewehrt wurde.

Die Ursache lag nicht in robots.txt und konnte dort nicht liegen. Cloudflares Bot Fight Mode fordert jeden Bot heraus, der nicht auf seiner Verified-Liste steht, er läuft außerhalb der Ruleset Engine, sodass keine WAF-Regel etwas davon ausnehmen kann, und er entscheidet über Verified-Bot-Status und Ursprungs-IP statt über die Zeichenkette, die ein Client sendet. Keine der drei Prüfungen sieht irgendetwas davon. Das Einzige, was es sehen konnte, waren die Logs des CDN selbst, die nicht öffentlich sind, und deshalb hätte ein Dritter, der uns den Standard-Audit fährt, ein grünes Ergebnis erzeugt und sich geirrt.

Das verallgemeinert sich unbequem. Sechsundsechzig Anbieter, die drei Prüfungen bestehen, sagt Ihnen, dass sechsundsechzig Anbieter keine Anweisung veröffentlicht haben, wegzubleiben. Es sagt Ihnen nichts darüber, was ihre CDNs tun, und die CDN-Konfiguration ist genau dort, wo der Ausfall lag, den wir tatsächlich erlebt haben.


Was man stattdessen fragen sollte

Verlangen Sie das Log, nicht die Prüfung. Die Frage mit einer Antwort lautet, welche Crawler Ihren Ursprung erreicht haben, wie oft und mit welchen Statuscodes. Diese Daten stehen in den Logs Ihres CDN oder Servers und nirgendwo sonst. Sagt Ihnen ein Tool, Ihre Website sei für KI-Crawler zugänglich, ohne diese gelesen zu haben, hat es Ihnen gesagt, was es sehen konnte, und nicht, was Sie gefragt haben.

Gleichen Sie den User-Agent mit dem angefragten Pfad ab. Zuordnung allein über den User-Agent taugt in beide Richtungen nichts. Als wir nachsahen, was der Name eines Crawlers bei uns angefragt hatte, waren unter den Pfaden private Schlüsseldateien und Dateinamen von Zugangsdaten, und das ist ein Schwachstellen-Scanner im Namen eines Crawlers und kein Crawler. Ein legitimer Crawler fragt nach Artikeln.

Teilen Sie das Zeitfenster am Moment der Änderung. Wenn Sie etwas beheben, messen Sie nicht über die Behebung hinweg. Ein Aggregat, das Vorher und Nachher umspannt, beschreibt den Mittelwert zweier Regime und keines von beiden, und so wird aus einer Behebung, die funktioniert hat, eine, die halb funktioniert hat.

Und behandeln Sie ein grünes Ergebnis als die Abwesenheit einer Art von Problem. Diese drei zu bestehen heißt, dass Sie Crawlern nicht gesagt haben, sie sollen gehen. Das ist es wert, bestätigt zu werden, es dauert eine Minute, und dort endet diese Art von Audit, nicht dort, wo sie aufhört nützlich zu sein.


Was das nicht zeigt

Niemand wurde auf echten Zugang geprüft. Keine einzige Messung hier belegt, dass ein Crawler eine dieser sechsundsechzig Websites erreicht, unsere eingeschlossen. Das erforderte die Logs jedes einzelnen Anbieters.

Eine Lesung, ein Tag. robots.txt ändert sich, und ein Anbieter könnte morgen eine Sperrregel hinzufügen. Die elf Agenten sind die, nach denen gesucht wurde; ein Agent außerhalb dieser Liste könnte blockiert sein und würde nicht auftauchen.

Blockieren ist nicht der einzige Fehler. Eine Website kann gecrawlt werden und trotzdem unzitierbar bleiben, und das ist das meiste, was der Rest dieses Blogs misst.

Ein 403 ist nicht immer eine Sperre. Die Preisseite eines Anbieters antwortete unserem einfachen Client mit 403, während seine Startseite 200 lieferte. Das passt zu einer Bot-Management-Regel und ebenso gut zu einem Ratenlimit oder einer pfadbezogenen Regel, und wir haben sie nicht unterschieden, also zählt es in der Tabelle oben nicht als Durchfaller.

Und wir sind in der Stichprobe. EchoWi ist einer der sechsundsechzig und erreicht auf allen dreien dasselbe wie alle anderen, was das ganze Argument ist und keine Einschränkung daran.


Häufige Fragen zum Zugang von KI-Crawlern

Bedeutet eine erlaubende robots.txt, dass KI-Crawler meine Website lesen können?

Nein, und das ist der häufigste Irrtum dieser Kategorie. robots.txt ist eine Anweisung an Crawler, die sich entscheiden, ihr zu folgen. Sie sagt nichts darüber, ob Ihr CDN die Anfrage abwehrt, bevor Ihr Server sie überhaupt sieht, und Bot-Management-Produkte entscheiden über Verified-Bot-Status und Ursprungs-IP statt über die Datei. Unsere eigene Website erlaubt jeden KI-Crawler namentlich und hatte einen davon bei fast jeder Anfrage abgewehrt.

Kann ich Zugang testen, indem ich den User-Agent des Crawlers sende?

Nein, und das erzeugt jedes Mal ein falsches Bestehen. Eine Anfrage von Ihrer Maschine mit PerplexityBot als User-Agent ist nicht PerplexityBot, und jede Bot-Management-Schicht, die ihr Geld wert ist, entscheidet über die Verified-Liste und die Ursprungs-IP. Wir haben diesen Test einmal an zehn Agenten gefahren, zehn 200er bekommen und die Schicht für sauber erklärt. Sie war es nicht. Geklärt haben es allein die Anfrage-Logs des CDN selbst.

Wenn niemand KI-Crawler blockiert, warum überhaupt prüfen?

Weil eine Sperre billig zu verursachen und teuer zu übersehen ist. Eine Deny-by-default-Regel in einem Bot-Produkt, eine Firewall-Vorlage, eine von einer Agentur geerbte Konfiguration, und der Crawler ist weg, ohne dass irgendetwas auf der Seite es zeigt. Die Prüfung ist die Minute wert, die sie kostet. Nicht wert ist es, das grüne Ergebnis als Aussage über Ihre Sichtbarkeit zu behandeln, denn das ist ein anderes Problem mit anderen Ursachen.

Was ist der Unterschied zwischen GPTBot und ChatGPT-User in robots.txt?

Sie leisten Verschiedenes, und sie zu blockieren hat verschiedene Folgen. GPTBot ist der Trainings- und Indexierungs-Crawler, und ChatGPT-User ist der Abruf, der stattfindet, wenn die Frage eines Nutzers dazu führt, dass eine Seite live geholt wird. Den ersten zu blockieren ist eine Entscheidung über Trainingsdaten. Den zweiten zu blockieren nimmt Sie aus Antworten heraus, die gerade geschrieben werden. Sechzehn Anbieter dieser Stichprobe nennen sie getrennt, was nahelegt, dass die Unterscheidung in diesem Markt verstanden wird, selbst wo die Regeln keine Wirkung haben.

Sollte ich ausdrückliche Allow-Regeln für KI-Crawler schreiben?

Es kostet nichts und gewährt nichts. Ein nicht erwähnter Crawler ist bereits erlaubt, eine ausdrückliche Erlaubnis ändert heute also kein Verhalten. Der Grund, sie zu schreiben, ist, dass sie einen genannten Crawler aus jeder künftigen Platzhalterregel heraushält, die Sie oder eine Agentur später hinzufügen könnten, und das ist eine kleine Absicherung und keine Verbesserung. Wir haben sie geschrieben, und dieser Artikel ist der Grund, warum wir uns das nicht anrechnen.

Wie sähe ein wirklich nützlicher Crawler-Audit aus?

Er würde die Logs Ihres CDN oder Servers lesen, statt Anfragen von anderswo zu stellen, nach Crawler und Statuscode berichten, den User-Agent mit den angefragten Pfaden abgleichen, damit Scanner in Crawler-Namen getrennt werden, und jedes Zeitfenster an dem Moment schneiden, an dem sich eine Konfiguration geändert hat. Jeder dieser Punkte braucht Zugriff auf Ihre Infrastruktur, weshalb die kostenlose Version dieser Prüfung stattdessen die drei Dinge oben tut, und weshalb diese drei Dinge sechsundsechzig saubere Ergebnisse liefern.

Fragen Sie eine KI zu diesem Artikel

Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.

Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.

Geschrieben von

Maher El Ouahabi

CTO und Mitgründer von EchoWi

Baut die Software, die Marken zeigt, was KI wirklich über sie sagt, und was zu ändern ist, damit die nächste Antwort besser ausfällt. Zwölf Engines, vorher und nachher gemessen.

LinkedIn Maher El Ouahabi (öffnet in neuem Tab)