Der erste KI-Sichtbarkeitsanbieter, der einen Crawler blockiert, hat die Regel nicht getippt
Ein Durchlauf über 77 KI-Sichtbarkeitsanbieter fand einen, der Crawler verbietet. Die Sperre ist eine verwaltete robots.txt und trifft Training, nicht Abruf.
Am 17. August 2026 haben wir die robots.txt dieser Kategorie durchgesehen: 68 Anbieter lieferten eine aus und 0 verboten auch nur einen der 14 KI-Crawler, die wir verfolgen. Am 21. August haben wir denselben Durchlauf über einen größeren Katalog wiederholt. 77 liefern eine Datei aus und 1 blockiert. Das Interessante ist nicht die Zahl. Es ist, dass der blockierende Anbieter die Regel nicht getippt hat, und dass die Regel Training aussperrt und nicht Abruf, womit sie unsere 14 Crawler in genau 7 gesperrte und 7 erlaubte teilt.
Offenlegung und Methode: EchoWi verkauft Messung von KI-Sichtbarkeit, und jeder Anbieter in diesem Durchlauf ist ein Wettbewerber. Genau deshalb ist die Methode mechanisch und nicht redaktionell: Wir rufen die
robots.txtjedes Anbieters auf seinem eigenen Host ab, werten die Regeln für 14 namentlich genannte Crawler an dem Pfad aus, den jede Datei angibt, und berichten, was die Datei sagt. Kein User-Agent wird gefälscht, denn ein gefälschter Agent beweist nichts über Zugang. 78 Katalogeinträge abgefragt, 77 lieferten eine Datei, 1 hinter einer Bot-Abfrage und in einem eigenen Eimer statt als konform gezählt, 21. August 2026. Die Zahlen stehen in unserem Messregister, und die Datei ist öffentlich, sodass das jeder gegen uns nachprüfen kann.
Die kurze Fassung
- Eine veröffentlichte Null ist weg. Am 17. August 2026 lieferten 68 Anbieter eine Datei aus und 0 verboten irgendeinen KI-Crawler. Am 21. August liefern 77 aus und 1 blockiert.
- Die Regel ist eine verwaltete Voreinstellung, nicht der Satz des Anbieters. Die Datei trägt
# BEGIN Cloudflare Managed content, und jede Sperre steht darin. Nach dem Ende dieses Abschnitts besteht der eigene Beitrag des Anbieters aus einem einzigenDisallowauf einen Pfad. - Sie sperrt Training und lässt Abruf offen. Von unseren 14 Crawlern sind 7 verboten und 7 nicht, und die Grenze zwischen den Hälften verläuft danach, wozu ein Crawler da ist.
- Die Crawler, die Zitierungen bringen, stehen alle in der erlaubten Hälfte, nach dieser Evidenz verliert der Anbieter also Aufnahme in Trainingskorpora und behält Antworten.
- Die verwaltete Liste ist nicht vollständig, und die Lücke wird unten benannt.
- Das ist ein Vorgeschmack auf den 15. September, was der Grund ist, warum es zählt, und im letzten Abschnitt steht.
Welcher Anbieter, und warum wir ihn nennen
Der Anbieter ist Knowatoa, und knowatoa.com/robots.txt sagt das alles öffentlich. Apex und www liefern Byte für Byte identische Dateien von 1.968 Bytes aus, getrennt geprüft, denn ein Host und sein www können sich unterscheiden, und dieses Register ist damit schon einmal hereingefallen.
Wir nennen ihn aus demselben Grund, aus dem wir den genauen Prompt jeder Messung veröffentlichen: Eine Zahl, die man nicht prüfen kann, ist keine Zahl. Jeder kann diese Datei mit einem Befehl abrufen und sehen, ob wir sie richtig gelesen haben.
Und wir werden vorsichtig damit sein, was das bedeutet, denn die naheliegende Schlagzeile ist falsch. «Ein KI-Sichtbarkeitsanbieter sperrt KI-Crawler» ist ein guter Satz und eine schlechte Beschreibung. Die Sperre steht in einem verwalteten Abschnitt, also einer Einstellung und nicht einem Satz, den jemand geschrieben hat, und sie hält die Crawler auf, die Trainingskorpora aufbauen, während sie jeden Crawler in Ruhe lässt, der eine Seite abruft, um eine Frage zu beantworten.
Was in der Datei wirklich steht
Drei Teile, in dieser Reihenfolge.
Eine Präambel. Sechsundzwanzig Zeilen, die das Vokabular der Content Signals definieren und mit der Erklärung enden, dass jede darüber ausgedrückte Einschränkung ein ausdrücklicher Rechtevorbehalt nach Artikel 4 der EU-Urheberrechtsrichtlinie ist. Das ist Standardtext, der mit der verwalteten Datei kommt und nicht vom Anbieter verfasst wurde, leistet aber trotzdem juristische Arbeit.
Der verwaltete Block. Er beginnt mit einer *-Gruppe mit Allow: / und Content-Signal: search=yes,ai-train=no,use=reference und verbietet dann neun Agenten rundheraus: Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, CloudflareBrowserRenderingCrawler, Google-Extended, GPTBot und meta-externalagent.
Die eigene Regel des Anbieters, nach # END Cloudflare Managed Content. Sie ist eine Zeile: eine zweite *-Gruppe mit einem Disallow auf einen einzigen Pfad der Website.
Die eigene Crawler-Politik des Anbieters ist also ein Pfad. Alles, was sich wie eine Haltung zur KI liest, ist eine verwaltete Liste, und die Content-Signal-Zeile sagt dasselbe im anderen Vokabular: Indexieren und Zitieren sind in Ordnung, Training nicht.
Es gibt noch eine strukturelle Feinheit, die man beim Prüfen solcher Dateien kennen sollte. Es gibt zwei *-Gruppen, eine in jedem Abschnitt. Ein Parser, der bei der ersten Übereinstimmung stehen bleibt, sieht Allow: / und meldet die Website als vollständig offen; einer, der die letzte nimmt, sieht nur die Pfadregel. Keiner von beiden ist die ganze Datei. Genau diesen Fehler haben wir schon einmal gemacht, an der Datei eines anderen, und deshalb liest unser Durchlauf jede Gruppe und nicht die erste, die er findet.
Training und Abruf sind verschiedene Erlaubnisse, und nur eine ist gesperrt
Das ist die Unterscheidung, die die Kategorie immer wieder einebnet, und diese Datei zieht sie ungefähr so sauber, wie es geht.
| Gesperrt, von den 14 verfolgten | Erlaubt, von den 14 verfolgten |
|---|---|
| GPTBot | OAI-SearchBot |
| ClaudeBot | ChatGPT-User |
| Google-Extended | Claude-User |
| CCBot | Googlebot |
| Applebot-Extended | PerplexityBot |
| Bytespider | Perplexity-User |
| meta-externalagent | anthropic-ai |
Das sind 7 und 7. Jeder Crawler in der linken Spalte existiert, um Korpora zu sammeln. 6 der 7 in der rechten Spalte existieren, um eine Seite abzurufen, während sie jemandes Frage beantworten. Eine Marke, die die linke Spalte sperrt, verliert Aufnahme ins Training und behält Zitierungen. Eine Marke, die die rechte Spalte sperrt, verschwindet aus den Antworten.
Deshalb würde die nackte Zahl in die Irre führen. Die Hälfte der verfolgten Crawler gesperrt klingt hart. Die Hälfte gesperrt, wobei keiner dieser Hälfte eine Zitierung trägt, ist eine andere Tatsache und zeigt in die andere Richtung.
Die Datei sperrt außerdem Amazonbot und CloudflareBrowserRenderingCrawler, die außerhalb der 14 liegen, die wir verfolgen, und deshalb nicht in der Tabelle stehen. Wir erwähnen sie, weil die Datei ohne sie im Text kleiner wirken würde, als sie ist.
Die Lücke in der verwalteten Liste
anthropic-ai steht in der erlaubten Spalte, und nach der Logik des übrigen Dateiinhalts gehört es dort nicht hin. Es ist der ältere Agentenname, den Anthropic für das Sammeln von Trainingsdaten verwendete. Die verwaltete Liste sperrt ClaudeBot und übersieht ihn.
Das ist keine Kritik am Anbieter, der die Liste nicht geschrieben hat. Es ist das Argument dagegen, eine verwaltete Sperre für eine Politik zu halten: Sie ist eine Momentaufnahme davon, welche Agentennamen ein Anbieter für wichtig hält, sie wird nach dem Kalender eines anderen gepflegt, und ein Name, der außerhalb liegt, ist schlicht nicht abgedeckt. Wenn die Absicht ai-train=no lautet, löst diese Datei sie nicht vollständig ein, und nichts auf der Website des Anbieters würde ihm das sagen.
Hat es sich geändert, oder haben wir es übersehen?
Hier müssen wir vorsichtig damit sein, was sich tatsächlich beweisen lässt.
Der Anbieter kam am 7. August in unseren Katalog, zehn Tage vor dem Durchlauf, der 68 ausliefernde Anbieter und keinen blockierenden fand. Der einzige aus jenem Durchlauf ausgeschlossene Anbieter stand hinter einer Bot-Abfrage und ist ein anderes Unternehmen. Die Schlussfolgerung lautet also, dass sich diese Datei zwischen dem 17. und dem 21. August 2026 geändert hat.
Das ist eine Schlussfolgerung, keine gespeicherte Beobachtung. Jener Durchlauf hielt Summen fest, 68 auslieferend und 0 blockierend, und keine Zeile pro Anbieter. Es gibt keine Zeile in unserem Register, die sagt, dieser Anbieter habe am 17. August alles erlaubt. Was wir haben, ist eine Summe ohne Platz für einen Blockierer und ein Katalog, der diesen Anbieter bereits enthielt. Das ist tragfähig, und es ist schwächer als ein Diff.
Die Behebung ist die naheliegende und inzwischen der Plan: das Ergebnis pro Anbieter speichern statt der Summe, damit eine Änderung beim nächsten Mal ein Diff ist und keine Deduktion. Wir schreiben das öffentlich, weil derselbe Fehler wahrscheinlich in Ihrer eigenen Überwachung steckt. Eine Summe reicht, um zu bemerken, dass sich etwas bewegt hat, und nie, um zu sagen, was.
Warum das am 15. September mehr zählt als jetzt
Cloudflare ändert seine Voreinstellungen für KI-Bots am 15. September 2026. Zwei Punkte daraus betreffen diese Datei.
Der erste ist, dass die Änderung für die verwalteten Regeln gilt, also genau den Abschnitt, der hier alles sperrt. Niemand beim Anbieter muss etwas anfassen, damit sich das Verhalten seiner Website ändert.
Der zweite, und der aufschreibenswerte, ist, dass Crawler, die zugleich Suche und Training betreiben, künftig von jeder Einstellung gesperrt werden, die Training sperrt, einschließlich Einstellungen, die vor der Änderung gewählt wurden.
Für ein Unternehmen, das Sichtbarkeit in KI-Antworten verkauft, ist das die teure Richtung. Eine Trainingssperre ist billig: Man verliert Aufnahme ins Korpus und behält Zitierungen, was ein stimmiger Tausch ist. Eine Trainingssperre, die auch die gemischten Crawler erwischt, ist nicht billig, denn die gemischten sind diejenigen, die eine Seite abrufen, um sie zu zitieren.
Nichts hier sagt, dass das geschehen ist. Die heutige Datei sperrt Training und lässt Abruf offen, was genau das ist, was ein Unternehmen wollen sollte, das zitiert und nicht aufgesogen werden will. Der Punkt ist, dass diese Haltung derzeit von einer Voreinstellung getragen wird, und die Voreinstellungen bewegen sich am 15. September 2026.
Was das nicht zeigt
Ein Anbieter ist kein Trend. Die ehrliche Zusammenfassung lautet, dass aus einer Null eine Eins wurde, bei einer Grundgesamtheit, die außerdem gewachsen ist. Der Inhalt ist der Mechanismus, nicht die Rate, und wir würden dasselbe sagen, wenn die Zahl nächste Woche wieder null wäre.
Eine Erklärung ist kein Verhalten. Eine robots.txt sagt, worum ein Crawler gebeten wird. Sie belegt nicht, dass der Crawler gehorcht hat, dass die Seiten zitiert werden oder dass sich in irgendeiner Antwort etwas geändert hat. Jede unserer Zahlen zum Crawler-Zugang trägt diese Grenze, und diese ist keine Ausnahme.
Wir können nicht beweisen, dass sich die Datei geändert hat, nur dass unsere eigene Summe von vier Tagen zuvor keinen Platz dafür lässt.
Und wir haben den Anbieter nicht gefragt. Das ist die Lektüre einer öffentlichen Datei, kein Bericht über jemandes Absicht. Eine verwaltete Sperre ist eine Einstellung, und eine Einstellung kann aus Gründen aktiv sein, die mit einer Haltung zur KI nichts zu tun haben.
Und die anderen 76 sind der Befund unter diesem Befund. 76 von 77 liefern eine Datei aus, die keinen der 14 von uns verfolgten Crawler verbietet. Worüber diese Kategorie öffentlich auch streitet, ihre eigenen Vordertüren stehen offen.
Häufige Fragen
Ist es für eine Marke ein Fehler, Trainings-Crawler zu sperren?
Nicht für sich genommen, und der Tausch ist gut lesbar. GPTBot, ClaudeBot und Google-Extended zu sperren nimmt Sie aus den Trainingskorpora, während OAI-SearchBot, Claude-User und Googlebot Ihre Seiten weiter abrufen dürfen, wenn ein Assistent eine Frage beantwortet. Wenn Ihre Sorge das Aufgesogenwerden ist und Ihr Ziel das Zitiertwerden, ist das die stimmige Einstellung. Zum Problem wird es, wenn eine für Training gedachte Regel auch die abrufenden Crawler erwischt, und genau das ändert sich am 15. September 2026.
Wie prüfe ich meine eigene Datei darauf?
Rufen Sie ihredomain.de/robots.txt ab und suchen Sie nach # BEGIN Cloudflare Managed content. Steht es dort, gehört die Sperrliste darin nicht Ihnen, und sie bewegt sich, wenn sich die Voreinstellungen des Anbieters bewegen. Lesen Sie jede Gruppe und nicht nur die erste, denn eine verwaltete Datei und Ihre eigenen Regeln können beide auf * zielen. Prüfen Sie Apex und www getrennt, denn sie können verschiedene Dateien ausliefern.
Kann eine verwaltete robots.txt die ersetzen, die ich geschrieben habe?
Ja, und das ist das Risiko, das man kennen sollte. Die verwaltete Datei kann anstelle Ihrer ausgeliefert werden, sodass eine von Ihnen committete Erklärung aufhören kann, ausgeliefert zu werden, ohne dass sich in Ihrem Repository etwas ändert. Wir prüfen unsere eigene Einstellung genau deshalb, denn für ein Unternehmen, das Crawler-Erklärungen veröffentlicht, wäre ihr stilles Ersetztwerden das peinlichste verfügbare Versagen.
Warum eine Crawler-Liste und nicht eine einzige Zahl?
Weil Training und Abruf verschiedene Erlaubnisse sind und eine einzelne Zahl den Unterschied verbirgt. Die Liste deckt für jeden großen Anbieter beide Seiten ab, sodass eine Datei, die eine sperrt und die andere erlaubt, als solche sichtbar wird, statt zu einem Punktwert zusammenzufallen. Diese Datei ist der Beleg: Eine Zahl hätte sich als halbe Liste gesperrt gelesen, während die nützliche Tatsache ist, welche Hälfte.
Bewirkt Content-Signal für sich allein etwas?
Es ist eine Erklärung, keine Durchsetzung, und es ist jung. Es lohnt sich, weil es die Absicht maschinenlesbar festhält und laut der mit diesen Dateien ausgelieferten Präambel als Rechtevorbehalt nach EU-Urheberrecht gerahmt wird. Was es nicht tut, ist einen Crawler aufhalten. Die Disallow-Zeilen sind das, woran sich ein regelkonformer Crawler hält, und keines von beidem bindet einen Crawler, der die Datei ignoriert.
Fragen Sie eine KI zu diesem Artikel
Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.
- ChatGPT (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Claude (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Perplexity (öffnet in neuem Tab)
- Google AI Mode (öffnet in neuem Tab)
Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.