Die meisten Domains, die KI-Zitierungen gewinnen, liefern keine llms.txt aus. Die meisten Anbieter, die das verkaufen, schon.
Wir haben 69 KI-Sichtbarkeitsanbieter und 122 zitierte Domains an einem Tag nach ihrer llms.txt gefragt. Die Anbieter liefern sie weit häufiger aus.
Am 14. August 2026 haben wir zwei Gruppen mit demselben Skript am selben Tag nach ihrer llms.txt gefragt: die 69 Anbieter in unserem Katalog von KI-Sichtbarkeitswerkzeugen und die 122 Domains, die unser Register drei Mal oder öfter als in KI-Antworten zitiert festgehalten hat. Von den erreichbaren Anbietern liefern 44 von 68 eine aus. Von den zitierten Domains 49 von 112. Das war der erste Arm. Er ist seither auf zwei weiteren disjunkten Schichten zitierter Domains wiederholt worden, 2.147 insgesamt, und die Rate hält dreimal. Wer die Konvention verkauft, liefert sie zu rund zwei Dritteln aus. Die Seiten, die die Zitierungen tatsächlich gewinnen, zu weniger als der Hälfte.
Offenlegung: EchoWi verkauft Messung von KI-Sichtbarkeit und liefert selbst eine llms.txt aus, wir stehen also in der Anbieterzeile und haben ein Interesse daran, was diese Datei wert ist. Die Methode ist ein GET auf
/llms.txtbeim Origin jeder Domain, an einem Tag, wobei Bot-Prüfungen und Netzwerkfehler getrennt von fehlenden Dateien gezählt werden. Die Zählungen stehen in unserem Messregister, die Regel für die Grundgesamtheit steht unten, und das Ganze gegen uns zu wiederholen kostet einen Nachmittag.
Die kurze Fassung
- Anbieter liefern eine llms.txt bei 44 von 68 erreichbaren Domains aus. Das ist die Gruppe, deren Produkt darin besteht, Sie für Maschinen lesbar zu machen.
- Die von uns zitiert gesehenen Domains liefern sie bei 49 von 112 aus. Das ist die Gruppe, die die Maschinen tatsächlich zitieren.
- Der Abstand läuft gegen das Verkaufsargument. Wäre die Datei das, was Zitierungen einbringt, müsste die zitierte Gruppe vorn liegen, und sie liegt rund zwanzig Punkte zurück.
- Das ist kein Beleg dafür, dass die Datei schadet oder nichts bewirkt. Zwei Grundgesamtheiten, die sich in einer Konvention unterscheiden, sind kein Mechanismus, und wir tun nicht so.
- Für eine enge Aussage reicht es, und die ist nützlich: Zitierungen zu gewinnen setzt keine llms.txt voraus, denn die meisten Domains, die sie gewinnen, haben keine.
- Sechs Anbieterdateien liegen unter 2 KB, also vorhanden und zu klein, um irgendetwas zu indexieren.
- Eine dritte Schicht aus 1.221 einmal zitierten Domains entscheidet, welche Hälfte der Crawler-Kreuztabelle sich repliziert. Nennen ja, z 5,47. Sperren nein, z 1,87.
Was eine llms.txt zu sein beansprucht
llms.txt ist eine vorgeschlagene Konvention: eine Markdown-Datei im Wurzelverzeichnis, die einem Sprachmodell eine kuratierte Karte dessen gibt, was zählt, in der Reihenfolge, die ein Mensch empfehlen würde. Das Argument ist einfach und nicht unvernünftig. Ein Crawler, der auf einer großen Seite landet, muss die Struktur aus Navigation und internen Links erschließen; eine Datei, die sagt „dies sind die zwölf Seiten, auf die es ankommt, und das tut jede davon”, nimmt ihm dieses Raten ab.
Sie hat keine Spezifikation hinter sich in dem Sinn, in dem Content Signals eine hat, kein Register, und keine veröffentlichte Aussage irgendeiner großen Maschine, dass sie gelesen wird. Dieser letzte Punkt zählt, und wir kommen darauf zurück, denn eine Konvention, deren Konsum niemand nachgewiesen hat, ist etwas anderes als eine, deren Konsument bekannt ist.
Was sie hat, ist Verbreitung in einer bestimmten Branche: den Werkzeugen, die KI-Sichtbarkeit verkaufen. Mit dieser Beobachtung fängt dieses Stück an.
Zwei Grundgesamtheiten, ein Tag, ein Instrument, und später eine dritte Schicht
Der Vergleich bedeutet nur etwas, wenn beide Hälften gleich und gleichzeitig gemessen wurden, also wurde es so gemacht.
Die Anbieter-Grundgesamtheit sind die 69 Werkzeuge in unserem geprüften Katalog von Software für KI-Sichtbarkeit und Answer Engine Optimisation. Sie schließt uns ein.
Die zitierte Grundgesamtheit ist jede Domain, die unser Messregister in drei oder mehr getrennten Sondenzeilen festgehalten hat: 122 der 1.019 verschiedenen Domains, die es gesehen hat. Die Schwelle ist willkürlich, und wir deklarieren sie, statt sie zu vergraben. Drei oder mehr heißt, dass eine Domain über mehrere Fragen hinweg aufgetaucht ist und nicht ein einziges Mal, was der Unterschied ist zwischen einer Seite, nach der die Antwortschicht greift, und einer, die zufällig da war. Senkt man die Latte auf zwei, sind es 286; hebt man sie auf fünf, sind es 44.
Das Instrument ist ein GET auf /llms.txt beim Origin jeder Domain, Weiterleitungen folgend. Drei seiner Entscheidungen entscheiden das Ergebnis:
GET, nie HEAD. Ein Server ist nicht verpflichtet, auf eine HEAD-Anfrage zu antworten. Ein früherer Link-Prüfer in diesem Projekt meldete zwei völlig lebendige Seiten aus genau diesem Grund als tot, deshalb fragt dieses Instrument nach dem, was es lesen will.
Eine Prüfung ist keine fehlende Datei. Die Status 401, 403, 429 und 999 heißen, dass eine Bot-Kontrolle im Weg stand, was ein Beleg über die Edge ist und nicht darüber, ob eine Datei existiert. Sieben zitierte Domains und ein Anbieter landen dort. Sie in „keine llms.txt” zu falten hätte eine Zahl in Richtung unserer eigenen Überschrift hergestellt, und genau dann ist Vorsicht am nötigsten.
Eine 200 ist keine Datei. Manche Hoster beantworten jeden Pfad mit ihrer Marketingseite. Ein Rumpf, der ein HTML-Dokument eröffnet, ist keine llms.txt, was auch immer die Statuszeile sagte, und neun zitierte Domains antworteten so.
Deshalb trägt die Tabelle unten zwei Nenner. Gefragt ist die ganze Grundgesamtheit. Erreichbar ist gefragt minus Prüfungen und Netzwerkfehler. Beide werden veröffentlicht, weil ein Leser prüfen können muss, ob die Wahl des Nenners die Arbeit macht.
Die Zahlen
| Anbieter | Von uns zitiert gesehene Domains | |
|---|---|---|
| Gefragt | 69 | 122 |
| Erreichbar | 68 | 112 |
| Liefern eine llms.txt | 44 | 49 |
| Anteil der Erreichbaren | 65 Prozent | 44 Prozent |
| Unter 2 KB | 6 | 3 |
| Median-Größe | 9.535 Bytes | 15.378 Bytes |
Zwei Dinge sind aus dieser Tabelle abzulesen, bevor jemand ein Argument darauf baut.
Das erste ist der Abstand selbst: 65 Prozent gegen 44. Wäre das Ausliefern dieser Datei das, was Zitierungen einbringt, müsste die zitierte Gruppe die Gruppe sein, die sie ausliefert, und das Verhältnis ist umgekehrt.
Das zweite ist die Median-Größe, die gegen die einfachste Abfertigung der Datei spricht. Unter den zitierten Domains, die eine ausliefern, liegt der Median über 15 KB: das sind keine symbolischen Gesten. Und sechs Anbieterdateien liegen unter 2 KB, vorhanden und zu klein, um Index von irgendetwas zu sein, die Anbieterzahl ist also etwas großzügig gegenüber den Anbietern.
Auf viereinhalbmal so vielen Domains erneut gefragt, und sie hält
Die Zahl oben zählt zitierte Domains, also ist das die Achse, die man verbreitert statt sie zu wiederholen. Dieselbe Regel, die am 14. August 122 Domains ergab, ergibt heute 547, weil das Register gewachsen ist, und es gibt eine zweite Schicht von 379 genau zweimal zitierten, die keinen Eintrag mit ihr teilt. Beide wurden am 25. August 2026 gefragt, mit vorab notiertem Design und drei Schwellen.
| Dreimal oder öfter zitiert | Genau zweimal zitiert | |
|---|---|---|
| Gefragte Domains | 547 | 379 |
| Haben gesagt, ob die Datei existiert | 503 | 349 |
| Liefern eine | 209 | 153 |
| Anteil der Antwortenden | 41,6 Prozent | 43,8 Prozent |
43,8 ist die veröffentlichte Zahl auf die Nachkommastelle. Der erste Arm kommt auf 41,6, und das Intervall um das Original reichte von 34,9 bis 53,0, beide liegen also darin. Eine an 112 Domains gemessene Zahl hielt an 503 und erneut an 349 disjunkten.
Gekreuzt mit den Crawler-Regeln derselben Sites
Das ist der Teil, den die frühere Untersuchung nicht leisten konnte. Dieselben Domains wurden tags zuvor auf ihre robots.txt gelesen, also lassen sich eine llms.txt zu veröffentlichen und einen KI-Crawler zu sperren auf einer Site kreuzen statt als zwei Summen vergleichen.
Die vor der Anfrage aufgeschriebene Vorhersage lautete, Veröffentlicher würden weniger sperren, denn die Datei existiert, um einem Modell Inhalt zu liefern. Über beide Schichten zusammengefasst:
| Von den Domains, die auf beides geantwortet haben | Veröffentlichen llms.txt | Nicht |
|---|---|---|
| Domains | 360 | 479 |
| Nennen eine KI-Crawler-Regel | 34 Prozent | 24 Prozent |
| Verbieten mindestens einen KI-Crawler | 9 Prozent | 16 Prozent |
Veröffentlicher schreiben häufiger KI-Regeln, und ihre Regeln sagen seltener nein. Beide Richtungen halten zusammengefasst, z von 3,37 beim Nennen und 3,14 beim Sperren. Die Datei ist also keine Dekoration: Sie reist mit einer Haltung.
Und die Arme sind sich uneins, welche der beiden Hälften echt ist, was mehr wert ist als die zusammengefasste Zahl. In der häufig zitierten Schicht beträgt der Sperr-Abstand 10 Punkte und ist sauber, z von 3,18, während der Nenn-Abstand nichts ist. In der zweimal zitierten Schicht ist es umgekehrt: Nennen trennt stark, z von 4,02, und Sperren fällt auf 3 Punkte, was das eingefrorene Design als nichts unterscheiden bezeichnet.
Die Vorhersage ist damit in einem Arm bestätigt und im anderen nicht, und so wird sie veröffentlicht. Eine dritte, größere Schicht wurde danach gelaufen und entscheidet das: Nennen repliziert sich, Sperren nicht, und der Abschnitt unten hat die sechs Zellen. Nichts aus diesem Absatz wird zurückgezogen, aber hören Sie hier nicht auf zu lesen. Die Richtung ist in beiden dieselbe. Die Größe nicht, und dieses Design kann nicht sagen, warum.
Und das entscheidet eine Frage, die eine Schwesterstudie offengelassen hatte. Kreuzt man llms.txt bei Anbietern gegen Markdown, dann sagt die eine zu tun nichts darüber, ob jemand die andere tut: 62 % gegen 57 %, ein Abstand kleiner als ein einzelner Anbieter. Der Unterschied zwischen den beiden Ergebnissen ist nicht die Konvention, sondern die Art dessen, was gekreuzt wird. Eine Datei zu veröffentlichen und Markdown auszuliefern sind zwei Pflichtaufgaben, deren Übernahme dem Aufwand folgt. Was eine robots.txt über einen KI-Crawler sagt, ist eine Haltung. Zwei Pflichtaufgaben zu kreuzen trennt nichts, eine Pflichtaufgabe gegen eine Haltung schon.
Das Ergebnis zum Nennen war überhaupt nicht vorhergesagt. Es steht als Beobachtung da, denn ein Befund, der nach den Daten kommt, ist eine Hypothese für den nächsten Arm und kein Ergebnis dieses einen.
Eine dritte Schicht, und sie sagt, welche Hälfte sich repliziert
Die beiden Arme oben waren sich uneins, also war der ehrliche Schritt, den Arm zu laufen, der die Trennschärfe hat, das zu entscheiden. Es gibt 1.221 registrierbare Domains, die unser Register genau einmal zitiert gesehen hat, disjunkt von beiden Schichten oben und größer als die beiden zusammen. Das Design, die entscheidende Kennzahl und vier Schwellen wurden vor der ersten Anfrage eingefroren und committet.
| Veröffentlicher gegen Nicht-Veröffentlicher | 3+ zitiert | Zweimal zitiert | Einmal zitiert |
|---|---|---|---|
| Gekreuzte Domains | 495 | 344 | 1.102 |
| Nennen eine KI-Regel | 34 gegen 29 | 34 gegen 16 | 35 gegen 20 |
| z beim Nennen | 1,24 | 4,02 | 5,47 |
| Sperren mindestens einen | 9 gegen 20 | 9 gegen 11 | 7 gegen 10 |
| z beim Sperren | 3,18 | 0,89 | 1,87 |
Nennen repliziert sich, Sperren nicht. Die eingefrorene Regel sagte, dass die Kennzahl, die als einzige die größte Schicht überlebt, der Effekt ist und die andere zu der Schicht gehörte, aus der sie kam. Nennen trennt in zwei von drei Armen, mit den beiden größten z-Werten. Sperren trennt in einem, dem kleinsten und am häufigsten zitierten.
Aber die Richtung ist in allen sechs Zellen dieselbe, und das wiegt schwerer als die Schwellen. Veröffentlicher nennen in allen drei Armen häufiger, um 5, 18 und 15 Punkte. Veröffentlicher sperren in allen drei seltener, um 11, 2 und 3. Was sich nicht repliziert, ist nicht das Vorzeichen, sondern die Größe, und in beiden Zeilen ist es die stark zitierte Schicht, die von den anderen beiden abweicht.
Die zusammengefasste Zahl oben wird also nicht zurückgezogen, und sie genügt allein nicht. Ein zusammengefasstes z über Schichten, die um den Faktor fünf auseinanderliegen, ist Arithmetik und kein Beleg für einen stabilen Effekt, und dies ist der Absatz, der das über unsere eigene Zahl sagt.
Über alle drei Schichten zusammengefasst liegt das Nennen bei 35 gegen 22 %, z von 6,32. Wir zitieren diese und nicht ihr Sperr-Gegenstück, und der Grund ist der Absatz oben und nicht das Ergebnis: Nennen repliziert sich über die Schichten, also bedeutet das Zusammenfassen etwas, und Sperren nicht, also würde es nur die Zahl eines Arms in einen größeren Nenner waschen.
Die Vorhersage, die sich auszahlte, betraf die Veröffentlicher
Vor der Messung schrieben wir, dass die Veröffentlicher, wenn sie eine stabile Population sind, nahe bei 34 % beim Nennen und 9 % beim Sperren zurückkommen würden, mit Bändern von 27 bis 41 und von 4 bis 15. Sie kamen bei 35 und 7 zurück.
Über drei disjunkte Schichten von einer Zitation bis zu mehr als drei geben die Veröffentlicher 34, 34 und 35 % beim Nennen und 9, 9 und 7 beim Sperren. Das ist dreimal dieselbe Population. Es sind die Nicht-Veröffentlicher, die sich bewegen, 29, 16 und 20 beim Nennen, und deshalb scheiterte die Vorhersage, dass sie mit der Zitationshäufigkeit monoton fallen würden: Es gibt keinen Trend, der mittlere Arm ist schlicht der Ausreißer.
Was die Sites tatsächlich schreiben
Die Kennzahl verdeckt etwas Einfacheres, das die Schicht am Ende sichtbar macht.
Von den 1.132 Domains, die eine robots.txt auslieferten, nennen 306 einen
KI-Crawler und nur 104 sperren einen. Also haben 204 die Regel geschrieben
und ja gesagt. Zwei sperren, ohne jemanden zu nennen, erfasst von einem
pauschalen User-agent: *.
Das rückt das ganze Kreuztabellenergebnis zurecht. Der Unterschied zwischen Veröffentlichern und Nicht-Veröffentlichern ist nicht, dass die einen häufiger ablehnen. Er ist, dass sie überhaupt eine geschriebene Meinung haben, und zwei von drei Malen ist diese Meinung eine Erlaubnis.
Und 29 der 104 Sperrenden sind eine verwaltete Voreinstellung, eine Sperre, die ein CDN geschrieben hat und nicht die Site. Wir trennen sie, weil eine Erklärung kein Autor ist, und weil eine Zählung des Webs, das KI-Training abschaltet, zum Teil eine Zählung der Produktentscheidung eines Anbieters ist.
Die llms.txt-Quote selbst bewegte sich nicht: 41,6, 43,8 und 44,0 % über die drei Schichten. Die Datei zu veröffentlichen ist keine Eigenschaft davon, wie oft man zitiert wird.
Was das nicht zeigt
Dies ist der wichtigste Abschnitt, denn die Überschrift ist von der Sorte, die ohne ihn zitiert wird.
Es zeigt nicht, dass llms.txt nichts bewirkt. Zwei Grundgesamtheiten, die sich in einer Konvention unterscheiden, sind kein Mechanismus. Wir haben keine Intervention gefahren, es gibt kein Vorher und Nachher, und nichts hier isoliert die Datei von allem anderen an diesen Seiten.
Die beiden Grundgesamtheiten sind sich nicht ähnlich, aber die Zusammensetzung ist nicht die Erklärung. Die zitierte Menge enthält youtube.com, reddit.com, forbes.com und pcmag.com, große Publisher mit eigenen Publikationsstandards und eigener Rechtsprüfung, und die erste Fassung dieses Abschnitts sagte, ein unbekannter Teil des Abstands komme daher. Das stimmt nicht. Teilt man die zitierte Grundgesamtheit danach auf, wie oft wir sie zitiert gesehen haben, liefert die meistzitierte Schicht die Datei bei 8 von 17 erreichbaren aus und alles darunter bei 41 von 95, also derselben Rate, und beide weit unter den Anbietern. Der Abstand sind nicht die großen Namen.
Selektion läuft mitten hindurch. Die zitierte Grundgesamtheit definieren unsere eigenen Sonden, in unseren Märkten, mit unseren Fragen. Ein anderer Fragensatz ergäbe andere 122.
Eine Konvention ohne nachgewiesenen Konsumenten ist schwer zu prüfen. Keine große Maschine hat veröffentlicht, dass sie llms.txt liest. Wir haben keinen Abruf unserer eigenen durch einen benannten KI-Crawler beobachtet, den wir der Datei statt dem normalen Crawling zuschreiben könnten, und wir werden auch keinen behaupten.
Wir haben nicht gemessen, ob das Ausliefern für irgendjemanden etwas geändert hat. Das bräuchte dieselben Seiten vorher und nachher, mit Kontrolle, und das ist eine andere und viel langsamere Studie.
Was die Frage wirklich beantworten würde
Da wir sie nicht beantworten, gehört dazu zu sagen, was es täte.
Die saubere Fassung ist eine Intervention: eine Menge vergleichbarer Seiten nehmen, die die Datei nicht ausliefern, sie der Hälfte hinzufügen, die andere Hälfte festhalten und die Zitierraten über einen eingefrorenen Promptsatz beobachten, lange genug, um das Rauschen zu überdauern, das dieses Register in KI-Antworten bereits gemessen hat. Dieses Rauschen ist groß, der Zeitraum also lang und die Stichprobe nicht klein.
Die billige Fassung, die offenbar niemand veröffentlicht hat, liegt auf der Serverseite: schauen Sie in Ihre eigenen Logs und prüfen Sie, ob ein benannter KI-Crawler /llms.txt überhaupt anfragt, und in welchem Verhältnis zu /robots.txt. Das ist eine Abfrage gegen Zugriffslogs und würde die Konsumentenfrage für eine Seite klären. Uns wären zehn Seiten, die das veröffentlichen, lieber als eine weitere Verbreitungszählung, unsere eingeschlossen.
Häufige Fragen zu llms.txt
Was ist eine llms.txt-Datei?
llms.txt ist eine vorgeschlagene Konvention: eine Markdown-Datei im Wurzelverzeichnis einer Domain, die einem Sprachmodell einen kuratierten Führer durch die Seite gibt und die Seiten auflistet, auf die es ankommt, samt Zweck. Sie ist keine Spezifikation mit einem Register dahinter, und keine große Maschine hat veröffentlicht, dass sie die Datei liest.
Wie viele KI-Sichtbarkeitsanbieter liefern eine llms.txt aus?
44 der 68 Anbieter, die wir erreichen konnten, von 69 gefragten, gemessen am 14. August 2026. Einer schickte eine Bot-Prüfung zurück, die wir getrennt von einer fehlenden Datei zählen, weil eine Prüfung ein Beleg über die Edge ist und nicht darüber, ob die Datei existiert. Sechs der vorhandenen Dateien liegen unter 2 KB und sind zu klein, um eine Seite jeder Größe zu indexieren.
Liefern die Seiten, die in KI-Antworten zitiert werden, eine llms.txt aus?
Seltener als die Anbieter. Von 122 Domains, die unser Register drei Mal oder öfter zitiert festgehalten hat, waren 112 erreichbar und 49 liefern eine aus, das sind 44 Prozent gegen die 65 der Anbieter. Das ist ein Vergleich zweier Grundgesamtheiten und kein Mechanismus, und die beiden sind sich nicht ähnlich, es zeigt also nicht, dass die Datei nutzlos ist. Es zeigt, dass Zitierungen sie nicht voraussetzen.
Hilft llms.txt der Sichtbarkeit in KI-Antworten?
Niemand hat Belege in die eine oder andere Richtung veröffentlicht, die wir finden konnten, und diese Studie klärt es nicht. Was sie ausschließt, ist die stärkste Fassung der Behauptung: die Datei kann für Zitierung nicht notwendig sein, denn die meisten Domains, die Zitierungen gewinnen, haben keine. Ob sie am Rand hilft, bräuchte eine Intervention mit Kontrolle und keine Verbreitungszählung.
Sollte ich meiner Seite eine llms.txt hinzufügen?
Sie ist billig, sie schadet nicht, und wenn Ihre Seite groß und schlecht strukturiert ist, ist es vernünftig, einem Crawler so etwas in die Hand zu geben. Was wir nicht täten, wäre sie als Sichtbarkeitsprodukt zu kaufen oder sie die Arbeit an dem verdrängen zu lassen, was dieses Register tatsächlich mit Zitierung variieren sah, nämlich was eine Seite sagt und ob es sonst jemand auch sagt. Schauen Sie zuerst in Ihre eigenen Zugriffslogs: hat nie ein KI-Crawler nach der Datei gefragt, haben Sie in einer Abfrage mehr gelernt als jede Verbreitungszählung Ihnen sagen kann.
Wie prüfe ich, was eine Domain ausliefert?
Fordern Sie /llms.txt beim Origin der Domain mit einem GET an, nicht mit einem HEAD, und lesen Sie den Rumpf, bevor Sie dem Statuscode glauben. Öffnet er ein HTML-Dokument, hat man Ihnen eine Marketingseite gegeben und keine Datei. Ist die Antwort 401, 403, 429 oder 999, sind Sie auf eine Bot-Prüfung gestoßen und haben nichts darüber erfahren, ob eine Datei da ist.
Fragen Sie eine KI zu diesem Artikel
Öffnet Ihren Assistenten mit dieser Seite bereits geladen, damit Sie die Zahlen prüfen, die Methode hinterfragen oder fragen können, was das für Sie bedeutet.
- ChatGPT (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Claude (öffnet in neuem Tab. die Frage steht schon da, mit Enter abschicken)
- Perplexity (öffnet in neuem Tab)
- Google AI Mode (öffnet in neuem Tab)
Perplexity und Google antworten sofort. ChatGPT und Claude füllen das Feld und warten auf Ihr Enter, das ist ihr Verhalten und nichts, was wir einstellen können.