La mayoría de dominios que se llevan citas de IA no publica un llms.txt. La mayoría de proveedores que venden la idea, sí.
Pedimos el llms.txt a 69 proveedores de visibilidad en IA y a 122 dominios que hemos visto citados, el mismo día. Los proveedores lo publican mucho más.
El 14 de agosto de 2026 pedimos su llms.txt a dos grupos con el mismo script y el mismo día: los 69 proveedores de nuestro catálogo de herramientas de visibilidad en IA, y los 122 dominios que nuestro registro tiene anotados como citados tres veces o más en respuestas de IA. De los proveedores que pudimos alcanzar, 44 de 68 lo publican. De los dominios citados, 49 de 112. Ése fue el primer brazo. Desde entonces se ha repetido en dos estratos disjuntos más de dominios citados, 2.147 en total, y la tasa aguanta tres veces. Quien vende la convención la publica en torno a dos tercios. Los sitios que de verdad se llevan las citas la publican en menos de la mitad.
Aviso: EchoWi vende medición de visibilidad en IA y publica un llms.txt, así que estamos dentro de la fila de proveedores y tenemos interés en lo que vale este fichero. El método es un GET a
/llms.txten el origen de cada dominio, un solo día, contando los retos de bot y los fallos de red aparte de los ficheros ausentes. Los recuentos están en nuestro registro de mediciones, la regla de población está escrita abajo, y repetirlo contra nosotros cuesta una tarde.
La versión corta
- Los proveedores publican un llms.txt en 44 de 68 dominios alcanzables. Ese es el grupo cuyo producto es hacerte legible para las máquinas.
- Los dominios que hemos visto citados lo publican en 49 de 112. Ese es el grupo al que las máquinas citan de verdad.
- La diferencia va en la dirección contraria al argumento de venta. Si el fichero fuera lo que gana citas, esperarías que el grupo citado fuera por delante, y va por detrás unos veinte puntos.
- Esto no es evidencia de que el fichero perjudique, ni de que no haga nada. Dos poblaciones que difieren en una convención no son un mecanismo, y no vamos a fingir lo contrario.
- Sí basta para una afirmación estrecha, y esa afirmación es útil: llevarse citas no exige un llms.txt, porque la mayoría de los dominios que se las llevan no lo tiene.
- Seis ficheros de proveedor están por debajo de 2 KB, o sea presentes y demasiado pequeños para indexar nada.
- Un tercer estrato de 1.221 dominios citados una sola vez zanja qué mitad del cruce de rastreo se replica. Nombrar sí, con z 5,47. Bloquear no, con z 1,87.
Qué dice ser un llms.txt
llms.txt es una convención propuesta: un fichero markdown en la raíz de un sitio que le da a un modelo de lenguaje un mapa curado de lo que importa, en el orden en que se lo recomendaría un humano. El argumento es sencillo y no es irrazonable. Un rastreador que aterriza en un sitio grande tiene que inferir la estructura desde la navegación y los enlaces internos; un fichero que dice «estas son las doce páginas que importan y esto hace cada una» le quita ese trabajo de adivinar.
No tiene detrás una especificación en el sentido en que sí la tiene Content Signals, ni registro, ni una declaración publicada por ningún motor grande de que lo lea. Ese último punto importa y volveremos a él, porque una convención de la que nadie ha demostrado que se consuma es otra cosa distinta de una cuyo consumidor se conoce.
Lo que sí tiene es adopción dentro de una industria concreta: las herramientas que venden visibilidad en IA. Esa es la observación con la que empieza esta pieza.
Dos poblaciones, un día, un instrumento, y después un tercer estrato
La comparación solo significa algo si las dos mitades se midieron igual y a la vez, así que así se hizo.
La población de proveedores son las 69 herramientas de nuestro catálogo verificado de software de visibilidad en IA y optimización para motores de respuesta. Nos incluye.
La población citada es cada dominio que nuestro registro de mediciones tiene anotado como aparecido en tres o más filas de sonda distintas: 122 de los 1.019 dominios distintos que ha visto. El umbral es arbitrario y lo declaramos en vez de enterrarlo. Tres o más significa que un dominio ha salido en varias preguntas y no en una, que es la diferencia entre un sitio al que la capa de respuesta acude y un sitio que estaba por ahí. Bajando el listón a dos, la población son 286; subiéndolo a cinco, son 44.
El instrumento es un GET a /llms.txt en el origen de cada dominio, siguiendo redirecciones. Tres de sus decisiones deciden el resultado:
GET, nunca HEAD. Un servidor no está obligado a responder a una petición HEAD. Un comprobador de enlaces anterior de este proyecto reportó dos páginas perfectamente vivas como muertas por ese mismo motivo, así que este pide la cosa que quiere leer.
Un reto no es un fichero ausente. Los estados 401, 403, 429 y 999 significan que una comprobación de bots se puso en medio, que es evidencia sobre el borde y no sobre si existe un fichero. Siete dominios citados y un proveedor caen ahí. Meterlos en «no tiene llms.txt» habría fabricado un número en la dirección de nuestro propio titular, que es justo cuando hay que tener más cuidado.
Un 200 no es un fichero. Algunos alojamientos responden cualquier ruta con su página de marketing. Un cuerpo que abre un documento HTML no es un llms.txt diga lo que diga la línea de estado, y nueve dominios citados respondieron así.
Por eso la tabla de abajo lleva dos denominadores. Preguntados es la población entera. Alcanzables es preguntados menos retos y fallos de red. Los dos se publican porque el lector tiene derecho a comprobar si la elección de denominador está haciendo el trabajo.
Los números
| Proveedores | Dominios que hemos visto citados | |
|---|---|---|
| Preguntados | 69 | 122 |
| Alcanzables | 68 | 112 |
| Publican un llms.txt | 44 | 49 |
| Cuota de alcanzables | 65 por ciento | 44 por ciento |
| Menos de 2 KB | 6 | 3 |
| Tamaño mediano | 9.535 bytes | 15.378 bytes |
Dos cosas hay que leer en esa tabla antes de construir ningún argumento sobre ella.
La primera es la diferencia: 65 por ciento contra 44. Si publicar este fichero fuera lo que gana citas, el grupo citado debería ser el grupo que lo publica, y la relación va al revés.
La segunda es el tamaño mediano, que va en contra del descarte más fácil del fichero. Entre los dominios citados que sí lo publican, la mediana pasa de 15 KB: no son gestos simbólicos. Y seis ficheros de proveedor están por debajo de 2 KB, presentes y demasiado pequeños para ser el índice de nada, así que la cifra de proveedores es algo generosa con los proveedores.
Vuelto a preguntar sobre cuatro veces y media los dominios, y aguanta
La cifra de arriba cuenta dominios citados, así que ése es el eje que hay que doblar en vez de repetir. La misma regla que dio 122 dominios el 14 de agosto da hoy 547, porque el registro ha crecido, y hay un segundo estrato de 379 citados exactamente dos veces que no comparte ni un miembro con él. A los dos se les preguntó el 25 de agosto de 2026, con el diseño y tres umbrales escritos antes.
| Citados 3+ veces | Citados exactamente dos | |
|---|---|---|
| Dominios preguntados | 547 | 379 |
| Contestaron si el fichero existe | 503 | 349 |
| Sirven uno | 209 | 153 |
| Cuota de los que contestaron | 41,6 por ciento | 43,8 por ciento |
43,8 es la cifra publicada al decimal. El primer brazo sale a 41,6, y el intervalo alrededor del original iba del 34,9 al 53,0, así que los dos caen dentro. Un número medido sobre 112 dominios aguantó sobre 503 y otra vez sobre 349 disjuntos.
Cruzado con las reglas de rastreo de esos mismos sitios
Esta es la parte que el estudio anterior no podía hacer. A los mismos dominios se les leyó el robots.txt el día antes, así que publicar un llms.txt y bloquear a un rastreador de IA se pueden cruzar en un mismo sitio en vez de compararse como dos totales.
La predicción, escrita antes de la petición, era que los publicadores bloquearían menos, porque el fichero existe para servirle contenido a un modelo. Agregando los dos estratos:
| De los dominios que contestaron a las dos | Publican llms.txt | No |
|---|---|---|
| Dominios | 360 | 479 |
| Nombran alguna regla de rastreador de IA | 34 por ciento | 24 por ciento |
| Prohíben al menos a un rastreador de IA | 9 por ciento | 16 por ciento |
Los publicadores escriben reglas de IA más a menudo y sus reglas dicen que no menos a menudo. Las dos direcciones aguantan en el agregado, z de 3,37 en nombrar y 3,14 en bloquear. Así que el fichero no es decoración: viaja con una postura.
Y los brazos no se ponen de acuerdo sobre cuál de las dos mitades es real, lo cual vale más que la cifra agregada. En el estrato muy citado la diferencia de bloqueo son 10 puntos y sale limpia, z de 3,18, mientras que la de nombrar no es nada. En el estrato citado dos veces es al revés: nombrar separa con fuerza, z de 4,02, y bloquear cae a 3 puntos, que el diseño congelado llama no distinguir nada.
La predicción queda por tanto confirmada en un brazo y no en el otro, y así se publica. Después se corrió un tercer estrato más grande y lo zanja: nombrar se replica, bloquear no, y la sección de abajo tiene las seis celdas. Nada de este párrafo se retira, pero no dejes de leer aquí. La dirección es la misma en los dos. El tamaño no, y este diseño no puede decir por qué.
Y esto cierra una pregunta que un estudio hermano tuvo que dejar abierta. Cruzando llms.txt contra markdown a nivel de proveedor, hacer una no predice hacer la otra: 62 % contra 57 %, una diferencia menor que un solo proveedor. La diferencia entre los dos resultados no es la convención, es la clase de cosa que se cruza. Publicar un fichero y servir markdown son dos tareas, y su adopción sigue al coste. Lo que dice un robots.txt de un rastreador de IA es una postura. Cruzar dos tareas no separa nada; cruzar una tarea con una postura sí.
El resultado de nombrar no estaba predicho en absoluto. Va como observación, porque un hallazgo que llega después del dato es una hipótesis para el brazo siguiente y no un resultado de éste.
Un tercer estrato, y dice qué mitad se replica
Los dos brazos de arriba no coincidían, así que lo honesto era correr el brazo con potencia para zanjarlo. Hay 1.221 dominios registrables que nuestro registro ha visto citados exactamente una vez, disjuntos de los dos estratos anteriores y más grandes que los dos juntos. El diseño, el estadístico decisivo y cuatro umbrales se congelaron y se commitearon antes de la primera petición.
| Publicadores contra no publicadores | Citados 3+ | Citados dos veces | Citados una vez |
|---|---|---|---|
| Dominios cruzados | 495 | 344 | 1.102 |
| Nombran una regla de IA | 34 contra 29 | 34 contra 16 | 35 contra 20 |
| z al nombrar | 1,24 | 4,02 | 5,47 |
| Prohíben al menos uno | 9 contra 20 | 9 contra 11 | 7 contra 10 |
| z al bloquear | 3,18 | 0,89 | 1,87 |
Nombrar se replica y bloquear no. La regla congelada decía que si sólo una de las dos diferencias sobrevivía al estrato mayor, esa es el efecto y la otra pertenecía al estrato del que salió. Nombrar separa en dos brazos de tres, con las dos z más grandes. Bloquear separa en uno, el más pequeño y el más citado.
Pero la dirección es la misma en las seis celdas, y eso importa más que los umbrales. Los publicadores nombran más en los tres brazos, por 5, 18 y 15 puntos. Los publicadores bloquean menos en los tres, por 11, 2 y 3. Lo que no se replica no es el signo, es el tamaño, y en las dos filas el estrato muy citado es el que discrepa de los otros dos.
Así que la cifra agrupada de arriba no se retira y no basta por sí sola. Una z agrupada sobre estratos que discrepan por un factor de cinco es aritmética y no evidencia de un efecto estable, y este es el párrafo que lo dice sobre nuestro propio número.
Agrupando los tres estratos, nombrar da 35 contra 22 %, con z de 6,32. Citamos esa y no su gemela de bloqueo, y el motivo es el párrafo de arriba y no el resultado: nombrar se replica entre estratos, así que agruparlo significa algo, y bloquear no, así que agruparlo sólo lavaría la cifra de un brazo dentro de un denominador más grande.
La predicción que pagó era sobre los publicadores
Antes de medir escribimos que si los publicadores eran una población estable volverían cerca del 34 % nombrando y del 9 % bloqueando, con bandas de 27 a 41 y de 4 a 15. Volvieron en 35 y 7.
Sobre tres estratos disjuntos que van de una citación a más de tres, los publicadores dan 34, 34 y 35 % al nombrar y 9, 9 y 7 al bloquear. Es la misma población tres veces. Los que se mueven son los no publicadores, 29, 16 y 20 al nombrar, y por eso falló la predicción de que caerían de forma monótona con la citación: no hay tendencia, el brazo de en medio es simplemente el que se sale.
Lo que los sitios están escribiendo de verdad
El estadístico esconde algo más simple que el estrato de la cola deja a la vista.
De los 1.132 dominios que sirvieron un robots.txt, 306 nombran algún rastreador
de IA y sólo 104 prohíben a alguno. O sea que 204 escribieron la regla y
dijeron que sí. Dos bloquean sin nombrar a nadie, cazados por un User-agent: * general.
Eso reencuadra el cruce entero. La diferencia entre publicadores y no publicadores no es que los primeros rechacen más. Es que tienen una opinión escrita, y dos de cada tres veces esa opinión es un permiso.
Y 29 de los 104 bloqueadores son un valor por defecto gestionado, un bloqueo escrito por una CDN y no por el sitio. Los separamos porque una declaración no es un autor, y un recuento de la web apagando el entrenamiento de IA es en parte un recuento de la decisión de producto de un proveedor.
La cuota de llms.txt en sí no se movió: 41,6, 43,8 y 44,0 % en los tres estratos. Publicar el fichero no es una propiedad de cuánto te citan.
Qué no enseña esto
Esta es la sección que más importa, porque el titular es de los que se citan sin ella.
No enseña que el llms.txt no haga nada. Dos poblaciones que difieren en una convención no son un mecanismo. No hemos corrido una intervención, no hay antes y después, y aquí nada aísla el fichero de todo lo demás que tienen estos sitios.
Las dos poblaciones no se parecen, aunque la composición resulta no ser la explicación. El conjunto citado contiene youtube.com, reddit.com, forbes.com y pcmag.com, editores grandes con sus estándares de publicación y su revisión legal, y la primera versión de esta sección decía que una parte desconocida de la diferencia era eso. No lo es. Partiendo la población citada por lo a menudo que la hemos visto citada, el tramo más citado publica el fichero en 8 de 17 alcanzables y todo lo de debajo en 41 de 95, que es la misma tasa y las dos muy por debajo de los proveedores. La diferencia no son los nombres grandes.
La selección pasa por el medio. La población citada la definen nuestras propias sondas, en nuestros mercados, con nuestras preguntas. Otro conjunto de preguntas daría otros 122.
Una convención sin consumidor demostrado es difícil de probar. Ningún motor grande ha publicado que lea el llms.txt. No hemos observado una petición del nuestro por parte de un rastreador de IA nombrado que podamos atribuir al fichero y no al rastreo normal, y no vamos a afirmar una.
No hemos medido si publicarlo cambió algo para nadie. Eso necesitaría los mismos sitios antes y después, con control, que es otro estudio y mucho más lento.
Qué contestaría de verdad la pregunta
Ya que nos negamos a contestarla, es justo decir qué lo haría.
La versión limpia es una intervención: coger un conjunto de sitios comparables que no publiquen el fichero, añadírselo a la mitad, dejar la otra mitad fija, y mirar las tasas de citación sobre un conjunto de prompts congelado durante un periodo lo bastante largo para sobrevivir al ruido que este registro ya ha medido en las respuestas de IA. Ese ruido es grande, así que el periodo es largo y la muestra no es pequeña.
La versión barata, que no parece haber publicado nadie, es del lado del servidor: mira tus propios logs y comprueba si algún rastreador de IA nombrado pide /llms.txt siquiera, y a qué ritmo comparado con /robots.txt. Eso es una consulta contra los logs de acceso y zanjaría la pregunta del consumidor para un sitio. Preferiríamos ver diez sitios publicando eso que ver otro recuento de adopción, el nuestro incluido.
Preguntas frecuentes sobre llms.txt
¿Qué es un fichero llms.txt?
llms.txt es una convención propuesta: un fichero markdown en la raíz de un dominio que le da a un modelo de lenguaje una guía curada del sitio, listando las páginas que importan y para qué es cada una. No es una especificación con un registro detrás, y ningún motor grande ha publicado una declaración de que lea el fichero.
¿Cuántos proveedores de visibilidad en IA publican un llms.txt?
44 de los 68 proveedores que pudimos alcanzar, de 69 preguntados, medido el 14 de agosto de 2026. Uno devolvió un reto de bot, que contamos aparte de un fichero ausente porque un reto es evidencia sobre el borde y no sobre si el fichero existe. Seis de los ficheros que existen están por debajo de 2 KB, demasiado pequeños para indexar un sitio de cualquier tamaño.
¿Los sitios que se llevan citas en respuestas de IA publican un llms.txt?
Menos que los proveedores. De 122 dominios que nuestro registro tiene anotados como citados tres veces o más, 112 eran alcanzables y 49 lo publican, que es el 44 por ciento contra el 65 de los proveedores. Es una comparación de dos poblaciones y no un mecanismo, y las dos no se parecen, así que no enseña que el fichero sea inútil. Sí enseña que llevarse citas no lo exige.
¿Ayuda el llms.txt a la visibilidad en IA?
Nadie ha publicado evidencia en un sentido ni en otro que hayamos podido encontrar, y este estudio no lo zanja. Lo que sí descarta es la versión fuerte de la afirmación: el fichero no puede ser necesario para la citación, porque la mayoría de los dominios que se llevan citas no lo tiene. Si ayuda en el margen necesitaría una intervención con control, no un recuento de adopción.
¿Debería añadir un llms.txt a mi sitio?
Es barato, no hace daño, y si tu sitio es grande y está mal estructurado es razonable dárselo a un rastreador. Lo que no haríamos es comprarlo como producto de visibilidad, ni dejar que desplace el trabajo sobre las cosas que este registro sí ha medido variando con la citación, que son qué dice una página y si alguien más lo dice también. Mira antes tus propios logs de acceso: si ningún rastreador de IA ha pedido nunca el fichero, has aprendido más en una consulta que con cualquier recuento de adopción.
¿Cómo compruebo qué publica un dominio?
Pide /llms.txt al origen del propio dominio con un GET y no con un HEAD, y lee el cuerpo antes de creerte el código de estado. Si abre con un documento HTML te han dado una página de marketing y no un fichero. Si la respuesta es 401, 403, 429 o 999 has topado con un reto de bot y no has aprendido nada sobre si el fichero está.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.