Comprobamos 26 anfitriones de publicación contra 14 rastreadores de IA. Once dejan entrar a Google y cierran la puerta a la IA.
Publicar en un dominio que no es tuyo se vende como táctica de visibilidad en IA. Leímos el robots.txt de cada anfitrión que ese consejo nombra.
El consejo está por todas partes: publica tu página en un dominio grande que no es tuyo y rankeará en horas en vez de en meses. La versión más nueva usa artefactos publicados de Claude y se vende explícitamente como una táctica de la era de la IA. Leímos el robots.txt de 26 anfitriones contra 14 rastreadores, y después doblamos la lista y volvimos a leerla. Once de ellos admiten a Googlebot y rechazan al menos a un rastreador de IA, y las dos empresas de IA que te dejan publicar una página se bloquean entre sí. Y de los 68 proveedores que venden visibilidad en IA, 0 bloquean a ninguno de los 14.
Transparencia: EchoWi vende medición de visibilidad en IA, así que un estudio que concluye que una táctica gratuita no da visibilidad en IA es un estudio con interés en su propio resultado. La respuesta a un conflicto es un método que puedes repetir: cada anfitrión, la ruta exacta, los 14 nombres de rastreador, la fecha y el grupo de user-agent que decidió cada veredicto están abajo y en nuestro registro de mediciones. El lado de los proveedores es nuestro catálogo público, así que las dos poblaciones son listas que puedes reconstruir. Todos son ficheros públicos que puedes pedir tú mismo en un segundo.
Actualización del 21 de agosto de 2026. La mitad de proveedores de este estudio se volvió a medir después de que el catálogo creciera, y el cero de arriba no sobrevivió: 77 proveedores sirven un fichero y 1 prohíbe ya a 7 de los 14 rastreadores. El 68 y el 0 se quedan tal cual están escritos, porque es lo que encontró el barrido del 17 de agosto y una cifra congelada no debe seguir a una medición posterior. Qué cambió, y por qué ese bloqueo es un valor por defecto gestionado y no una regla que escribiera el proveedor, está en la continuación.
La versión corta
- 26 anfitriones sirvieron un robots.txt. Dos no, y se reportan aparte: uno contestó un reto de bot y el otro no sirve fichero. Bloqueado no es ausente, y ausente no es permiso.
- Once anfitriones admiten a Googlebot y prohíben al menos a un rastreador de IA. Ese es el hueco que un comprador no puede ver desde fuera, porque la página rankea y no se puede leer.
- Las empresas de IA se bloquean entre ellas. Cuatro de estos anfitriones dejan publicar una página. Dos de los cuatro prohíben a los rastreadores de sus competidores y permiten el suyo.
- Bloquean más el entrenamiento que la búsqueda. A GPTBot lo rechazan 6 y a OAI-SearchBot 4. A ClaudeBot 8 y a Claude-User 4.
- Googlebot entra en 25 de 26. La única excepción prohíbe a todos, Google incluido.
- Y hay un segundo mecanismo que no tiene nada que ver con robots.txt. Para la táctica que originó esto, el contenido de la página no está en el HTML.
- Los proveedores que venden visibilidad en IA no bloquean nada. De los 68 que sirvieron un fichero, 0 prohíben a ninguno de los rastreadores. De los anfitriones que nombra este consejo, lo hacen 12 de 26.
- Doblamos la lista y la proporción aguantó. 9 de los siguientes 25 admiten a Googlebot y rechazan a un rastreador de IA, frente a 11 de 26 en el primer barrido.
Por qué lo comprobamos en vez de discutirlo
La táctica es vieja y el marco es nuevo. Publicar en un dominio con más autoridad que el tuyo lleva dos décadas siendo una táctica de buscadores. Lo que ha cambiado es que ahora se recomienda para visibilidad en respuestas de IA, que es una afirmación distinta sobre un conjunto distinto de máquinas, y nadie parecía haber comprobado si esas máquinas tienen permiso para entrar.
Esa comprobación cuesta una petición HTTP por anfitrión. Parecía razonable hacerla antes de escribir nada sobre si la táctica funciona.
Qué medimos y qué no
Un robots.txt por anfitrión, pedido dos veces el 17 de agosto de 2026, analizado por grupos y juzgado en la ruta que usa de verdad la táctica. Así que claude.ai se juzga en /public/artifacts/, chatgpt.com en /share/, linkedin.com en /pulse/ y el resto en la raíz.
El análisis es toda la dificultad y es donde una respuesta rápida se equivoca. Un robots.txt es una lista de grupos. Un grupo son una o más líneas User-agent: consecutivas que comparten las reglas de debajo. Un rastreador obedece al grupo cuyo token sea la coincidencia más larga con su propio nombre, y sólo cae en * cuando ningún grupo con nombre coincide. Así que un fichero cuyo grupo * lo permite todo puede prohibir a GPTBot dos grupos más abajo, y quien se pare en * reporta exactamente lo contrario de la verdad.
Las dos lecturas coincidieron en todos los anfitriones y todos los rastreadores, sin una sola diferencia, que es el control de estabilidad que un barrido así necesita y casi nunca tiene.
Lo que esto no mide, dicho aquí porque es el límite honesto: si los rastreadores obedecen el fichero, si esas páginas se citan en respuestas de IA y si el ranking llega. Una declaración es una declaración. Lo que dice un fichero y lo que hace el borde son capas distintas, y la segunda necesita datos de servidor de un dominio que controles. Esa segunda capa ya la hemos leído en el nuestro, y dice que los agentes se parten en dos grupos que piden páginas completamente distintas bajo una política idéntica. Tampoco convierte en causal la comparación con los proveedores: dos poblaciones leídas igual el mismo día se describen, no se explican.
Los 14 rastreadores son GPTBot, OAI-SearchBot y ChatGPT-User de OpenAI; Google-Extended y Googlebot de Google; ClaudeBot, anthropic-ai y Claude-User de Anthropic; PerplexityBot y Perplexity-User; y CCBot, Applebot-Extended, Bytespider y meta-externalagent. Entrenamiento, búsqueda y recuperación por encargo de un usuario son tres permisos distintos, y separarlos resultó importar.
Las empresas de IA se bloquean entre ellas
Cuatro de los anfitriones de este barrido dejan publicar una página que cualquiera puede leer. Dos de ellos prohíben a los rastreadores de sus rivales.
| Anfitrión | Prohíbe a | Permite a |
|---|---|---|
claude.ai/public/artifacts/ | GPTBot, OAI-SearchBot, ChatGPT-User, Google-Extended | ClaudeBot, PerplexityBot, Googlebot |
chatgpt.com/share/ | Google-Extended, anthropic-ai, PerplexityBot, CCBot, Bytespider | GPTBot, OAI-SearchBot, ClaudeBot, Googlebot |
gemini.google.com/share/ | a ninguno de los 14 | a los 14 |
www.perplexity.ai/page/ | a ninguno de los 14 | a los 14 |
Los dos ficheros que bloquean lo hacen de forma distinta y llegan al mismo sitio. Anthropic apila cuatro nombres de agente sobre un único Disallow: /, que es por lo que un analizador que suponga un agente por grupo lo lee como que bloquea a uno y permite a tres. OpenAI escribe un grupo por competidor. Los dos permiten a su propio rastreador y los dos permiten a Googlebot.
Si publicas una página en cualquiera de esos dos anfitriones para que la lean los asistentes de IA, el asistente con más probabilidad de leerla es el de la empresa en cuyo dominio has publicado.
Googlebot entra casi en todas partes, y la excepción es lo interesante
A Googlebot lo prohíbe exactamente un anfitrión de los 26, y no es ninguna de las empresas de IA. Es Reddit.
El robots.txt entero de Reddit son 538 bytes. Después de un comentario que remite a su política de contenido público, dice User-agent: * y luego Disallow: /. Ese es el fichero completo. Prohíbe a todos los rastreadores de este estudio, Googlebot incluido.
El contenido de Reddit está evidentemente en Google. Está ahí por un acuerdo comercial entre dos empresas, no porque el fichero conceda permiso. Así que quien publique en Reddit para que lo recoja la búsqueda con IA depende de un acuerdo privado del que no es parte, en un dominio cuya instrucción pública a todos los rastreadores es que no entren.
Bloquean más el entrenamiento que la búsqueda
Este es el hallazgo que no esperábamos, y el que dice que el sector es más fino de lo que se le suele reconocer.
| Rastreador | Prohibido por |
|---|---|
| Bytespider | 10 de 26 |
| ClaudeBot | 8 |
| CCBot | 8 |
| anthropic-ai | 7 |
| Applebot-Extended | 7 |
| meta-externalagent | 7 |
| GPTBot | 6 |
| Google-Extended | 6 |
| ChatGPT-User | 5 |
| PerplexityBot | 5 |
| OAI-SearchBot | 4 |
| Claude-User | 4 |
| Perplexity-User | 4 |
| Googlebot | 1 |
Lee los pares. Al rastreador de entrenamiento de OpenAI lo rechazan 6 anfitriones y al de búsqueda 4. Al de Anthropic 8 y a su agente de recuperación 4. El mismo orden se mantiene con Perplexity.
Estos anfitriones no están bloqueando la IA. Están trazando una línea entre ser material de entrenamiento y ser buscables, y dejan pasar la búsqueda más a menudo. Es una posición coherente, está a la vista en un fichero público, y significa que «¿este anfitrión bloquea rastreadores de IA?» es la pregunta equivocada. La correcta es cuál de los tres permisos necesitas.
Para una marca que publica una página para que la encuentren, el permiso que necesitas es el de búsqueda. Es el que más se concede, que es la pequeña buena noticia de este estudio.
Los proveedores que venden esto dejan entrar a la IA
Un barrido más, el mismo día, los mismos 14 rastreadores, el mismo instrumento. Lo apuntamos a las 69 herramientas de nuestro catálogo verificado, las empresas cuyo producto es la visibilidad en IA.
De los 68 que sirvieron un robots.txt, 0 prohíben a ninguno de los 14 rastreadores. Ni uno. Y no son ficheros sin reglas: Semrush lleva 60 líneas Disallow, Ahrefs 26 y HubSpot 356. Tienen reglas de rutas de sobra y ninguna política sobre rastreadores de IA. El sexagésimo noveno contestó un reto de bot y queda excluido en vez de contarse como permiso.
Pon las dos poblaciones una al lado de la otra y se ve la forma del consejo.
| Población | Anfitriones | Bloquean al menos un rastreador de IA |
|---|---|---|
| Proveedores que venden visibilidad en IA | 68 | 0 |
| Anfitriones que nombra este consejo | 26 | 12 |
La categoría que vende esto practica lo que predica. Las plataformas a las que te manda a publicar, no.
Ese contraste hay que decirlo con cuidado, porque es descriptivo y no causal. Son dos poblaciones con propósitos distintos: la web de un proveedor existe para que la encuentren, y una plataforma de publicación tiene usuarios, límites de tasa y acuerdos de licencia en los que pensar. Lo que comparten los dos recuentos es el día, la lista de rastreadores y el instrumento, que es la única razón por la que se pueden comparar.
Y dos de ellos publican una portada que ningún rastreador puede leer
El contraste de arriba es sobre lo que permite un fichero. Hay un segundo permiso
que no escribe nadie: si tus palabras están en la respuesta. Una página cuyo
texto llega solo después de ejecutar JavaScript es ilegible para cualquier
rastreador que no renderice, permita lo que permita el robots.txt.
Apuntamos la misma medida al mismo catálogo, una portada cada uno. 67 se leyeron y 2 contestaron un reto de bot, así que esas dos van como no leídas en vez de contarse en un sentido u otro.
1 de las 67 no sirve nada de su propio texto en ninguna parte. Bluefish AI contesta con 114 bytes: un script que manda el navegador a otro sitio, y nada más. Ni un encabezado, ni una frase, ni un título, ni una descripción, ni datos estructurados, ni siquiera un enlace que un rastreador pueda seguir.
La segunda es otra cosa, y la publicamos como si fuera la misma. GEO-Vantage
contesta con 4.870 bytes cuyo cuerpo no lleva nada, y lo contamos como ilegible.
No lo es. Su cabecera lleva título, descripción y datos estructurados, así que
una capa de recuperación tiene material de sobra; simplemente no usa el cuerpo
para eso. Publicamos 2 de 67 y el recuento correcto es 1, con una segunda página
que lleva su contenido en la cabecera. Ninguna ofrece una alternativa en
noscript, y las dos devolvieron respuestas idénticas byte a byte en dos
lecturas del mismo día.
Para dar escala, la siguiente portada más delgada del catálogo lleva 446 caracteres de cuerpo y la mediana lleva alrededor de diez mil.
Así que el expediente de la categoría depende del eje por el que preguntes. En
robots.txt practica lo que predica. En renderizado, dos empresas que venden
visibilidad en IA publican una puerta de entrada que un rastreador de IA no puede
leer, que es un arreglo de una línea y una sola petición para comprobarlo.
Todas las páginas que citó un motor de IA se podían leer, y un tercio lo guarda en la cabecera
Las dos poblaciones de arriba las elegimos nosotros. Esta no. Nuestro registro tiene 79 URLs que un motor de IA citó de verdad en alguno de nuestros estudios, así que la muestra la eligieron los motores. 64 se pudieron leer, 14 contestaron un reto de bot y 1 no contestó nada.
0 de las 64 eran ilegibles. Ni una sola página citada dejó de llevar su propio contenido en algún sitio de la respuesta.
Pero 18 de las 64 lo llevan sólo en la cabecera, y todas son YouTube o
Facebook. Una página de vídeo de YouTube contesta con alrededor de 1,4 MB cuyo
cuerpo son 217 caracteres de pie de sitio y ni una palabra del vídeo. Su cabecera
lleva el título, la descripción, las palabras clave y un VideoObject completo
en JSON-LD.
Merece pararse aquí, porque YouTube es el dominio más citado de todo este corpus. El cuerpo no es donde vive la citabilidad para el dominio que gana más veces. Lo que necesita una capa de recuperación es la respuesta en algún sitio legible por máquina, y la cabecera cuenta como un sitio.
Lo que esto no puede demostrar, y el motivo es el propio diseño: la muestra está seleccionada por el resultado. «Las páginas citadas se leen» no puede significar que renderizar cause la citación, porque las páginas que acaban citadas pueden ser legibles por razones que además las hacen dignas de cita. Lo que un diseño así sí puede hacer es matar la afirmación contraria. Si una parte grande de las citadas hubiera sido ilegible, servir tu texto no sería un requisito para que te citen. Cero de sesenta y cuatro lo eran.
Doblamos la lista y la proporción aguantó
La cifra de arriba cuenta anfitriones, así que es una afirmación sobre nuestra muestra tanto como sobre la web. Preguntamos a 32 más, otro día, con los mismos 14 rastreadores y el mismo instrumento, y la predicción quedó por escrito antes de la primera petición: el hallazgo aguanta si los nuevos caen entre el 30 y el 55 por ciento.
25 de los 32 sirvieron un fichero. 9 de los 25 admiten a Googlebot y rechazan al menos a un rastreador de IA, frente a 11 de 26 en el primer barrido.
| Barrido | Sirvieron un robots.txt | Admiten a Googlebot y rechazan a un rastreador de IA |
|---|---|---|
| Primero | 26 | 11 |
| Segundo | 25 | 9 |
Juntos son 20 de 51 anfitriones. Dos muestras independientes de las plataformas que nombra este consejo, y el hueco se queda a un lado y otro de cuatro de cada diez las dos veces.
La admisión de Googlebot también aguantó, 24 de 25 frente a 25 de 26 en el primer barrido, y la única excepción es el anfitrión de dos párrafos más abajo.
El segundo barrido añadió dos cosas que el primero no podía.
En 5 de los 32 no hay ningún robots.txt. Ese es el extremo permisivo y no un rechazo: sin fichero no hay nada prohibido a nadie. Va contado aparte de los 2 que contestaron un reto de bot, porque no leído y no restringido son estados distintos y sólo uno de los dos es permiso.
Y un anfitrión cierra sus propias páginas publicadas a todo el mundo.
grok.com nombra a GPTBot, ChatGPT-User, PerplexityBot, ClaudeBot,
Google-Extended y Applebot-Extended en un solo grupo y se los prohíbe en todo el
sitio, que es el patrón de la sección de arriba. Y además /share devuelve 404
y /share-links devuelve 200, así que sus páginas públicas viven en la única
ruta que el grupo * rechaza, y en esa ruta están prohibidos los 14
rastreadores, Googlebot incluido. Es el primer anfitrión de aquí donde una
página que publicas queda cerrada a todo, así que la táctica falla en el paso de
la búsqueda y no sólo en el de la IA. Lo encontramos preguntando en qué ruta
están de verdad las páginas en vez de medir la raíz.
El brazo de IA también se dobló. 5 anfitriones de publicación más sirvieron un fichero y 1 de los 5 deja fuera a un rival, así que el hallazgo de dos secciones más arriba se queda en 3 de 9 entre los dos barridos. Es un tercio en vez de la mitad, que es la dirección en la que se mueve casi siempre una muestra pequeña cuando la agrandas, y la razón para agrandarla.
El segundo mecanismo, que no tiene nada que ver con robots.txt
La táctica que originó todo esto es publicar un artefacto de Claude. Así que pedimos artefactos publicados como un cliente corriente que no ejecuta JavaScript.
Todos los artefactos devuelven lo mismo. Byte a byte lo mismo: 91.774 bytes, en dos identificadores de artefacto distintos, con tres agentes de usuario. Esa carga contiene un título de reserva que dice Claude Artifact, una etiqueta noindex, nofollow y 78 caracteres de texto visible una vez quitados scripts y etiquetas. Ninguno de esos 78 caracteres es del artefacto.
Mandar un agente de Googlebot no cambia nada. El recuento de bytes es idéntico, así que no hay una versión prerrenderizada aparte para los buscadores. Google tiene estas páginas indexadas con sus títulos reales porque Googlebot ejecuta JavaScript y lee la página que construiría un navegador.
Esta es la parte que importa, y es independiente de todo lo anterior. Un rastreador que ignorase el robots.txt por completo seguiría recibiendo 78 caracteres de armazón. La táctica falla para visibilidad en IA por partida doble, por dos mecanismos que no dependen el uno del otro: el fichero dice que no, y la página está vacía para cualquier cosa que no renderice.
Estamos describiendo cómo se comporta una aplicación de una sola página. No es una crítica al producto, que no está construido para ser una plataforma de publicación del marketing de otros. Es una descripción de lo que recibe quien la pide.
Si estabas a punto de hacer esto
La táctica no es falsa. Esas páginas están indexadas, en volumen, en muchos idiomas, y algunas son claramente comerciales. Si tu objetivo es una página que rankee rápido en la búsqueda web de Google para un término poco competido, hace lo que dice.
Se vende como otra cosa. Rankear en la búsqueda web de Google y ser legible por asistentes de IA son dos resultados distintos con dos porteros distintos, y este barrido enseña que se separan en 11 de 26 anfitriones.
Comprueba el fichero antes de publicar, no después. Cuesta una petición. Pide https://elanfitrion.ejemplo/robots.txt, busca el grupo que nombra al rastreador que te importa y lee la regla. Si no hay grupo con nombre, aplica el grupo *. Y si la página que publicas se renderiza en el cliente, pídela con algo que no ejecute JavaScript y mira si tus palabras están en la respuesta.
Y prefiere un dominio que controles. Todo lo de arriba es una decisión que toma otro sobre tu contenido, que puede cambiar sin avisarte y que tiene razones comerciales para cambiar. En tu propio dominio el fichero es tuyo.
Límites
- Una lectura de un fichero por anfitrión, en una fecha. Un
robots.txtes un hecho de un día. Cada fila lleva su recuento de bytes para que un fichero cambiado salga como una fila cambiada la próxima vez. - Declaración, no comportamiento. Nada de esto mide si un rastreador obedece, si la página se cita o si el ranking llega.
- 51 anfitriones en dos barridos, no la web. Se eligieron porque son los que este consejo nombra de verdad. Otra lista daría otras proporciones, así que el recuento va dicho en todas partes donde va una proporción.
- El hallazgo del renderizado es de una plataforma. Pedimos artefactos publicados de Claude. Los demás anfitriones de la lista renderizan de otra forma y no se probaron así.
- 9 anfitriones no dieron veredicto y quedan fuera de todos los recuentos en vez de contarse como permiso.
Preguntas frecuentes sobre publicar en el dominio de otro
¿Publicar en un dominio con autoridad sigue funcionando para Google?
Sí, para lo poco que hace. Esas páginas están indexadas y algunas rankean para términos poco competidos. Lo que mide este estudio es otra pregunta: si las máquinas que contestan preguntas, en vez de la que lista enlaces, tienen permiso para leerlas.
¿De qué rastreador me tengo que preocupar de verdad?
Del que corresponda al resultado que quieres. Los de entrenamiento, como GPTBot y Google-Extended, deciden si tu texto puede informar a un modelo más adelante. Los de búsqueda, como OAI-SearchBot, deciden si se puede recuperar y citar ahora. Los agentes de usuario, como ChatGPT-User y Claude-User, piden una página porque alguien lo ha pedido. Para que te encuentren en una respuesta hoy, el que importa es el de búsqueda, y es el que menos se rechaza.
Si un anfitrión bloquea a un rastreador, ¿ese rastreador se queda fuera seguro?
No, y este estudio no lo afirma. Un robots.txt es una instrucción, no un muro. Lo que establece es la intención, que conviene conocer antes de montar una estrategia sobre un dominio, y aparte de si se respeta.
¿Por qué Reddit prohíbe a Googlebot si Reddit está por todo Google?
Porque el acceso ahí está pactado comercialmente en vez de concedido públicamente. El fichero es el mismo para todos, y la presencia de Google es fruto de un acuerdo. Justo por eso es un mal cimiento para el plan de visibilidad de otro.
¿El hallazgo del artefacto de Claude es un fallo?
No. Es cómo se comporta una aplicación renderizada en el cliente: el servidor manda una aplicación y el navegador construye la página. Google se apaña porque ejecuta JavaScript. Cualquier cosa que sólo pida HTML ve el armazón, y eso vale para muchos rastreadores, no sólo los de IA.
¿Qué debería comprobar en un anfitrión antes de publicar ahí?
Tres cosas, las tres gratis. Pide su robots.txt y busca el grupo del rastreador que quieres. Pide la página publicada con un cliente normal y confirma que tu texto está en la respuesta. Y pregúntate si el anfitrión puede cambiar cualquiera de las dos cosas sin avisarte, porque puede.
Método y fuentes
Cada anfitrión, la ruta juzgada, el recuento de bytes del fichero, los rastreadores prohibidos ahí y el grupo de user-agent que decidió cada veredicto están en nuestro registro de mediciones, junto con las cifras del armazón del artefacto. El registro guarda también los dos anfitriones que no dieron veredicto, en su propio cubo.
Los nombres de los rastreadores salen de la documentación de sus operadores: la lista de OpenAI, la de Google y la de Anthropic. Las reglas de coincidencia por grupo están en la especificación de robots.txt de Google.
Si quieres repetirlo contra tu propia lista de anfitriones, todo el método es una petición por anfitrión y las reglas de análisis de arriba. Vas a tardar más en elegir los anfitriones que en correrlo.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.