Saltar al contenido
Visibilidad en IAGEO
ES

El primer proveedor de visibilidad en IA que bloquea un rastreador no escribió la regla

Barrido de 77 proveedores de visibilidad en IA: uno prohíbe rastreadores, con un robots.txt gestionado que para entrenamiento y no recuperación.

· 12 min de lectura

El 17 de agosto de 2026 barrimos los robots.txt de esta categoría: 68 proveedores servían uno y 0 prohibían a ninguno de los 14 rastreadores de IA que seguimos. Repetimos el mismo barrido el 21 de agosto sobre un catálogo más grande. 77 sirven un fichero y 1 bloquea. Lo interesante no es el recuento. Es que el proveedor que bloquea no escribió la regla, y que lo que la regla deja fuera es entrenamiento y no recuperación, partiendo nuestros 14 rastreadores en exactamente 7 bloqueados y 7 permitidos.

Transparencia y método: EchoWi vende medición de visibilidad en IA y todos los proveedores de este barrido son competencia. Por eso el método es mecánico y no editorial: pedimos el robots.txt de cada proveedor en su propio anfitrión, evaluamos las reglas de 14 rastreadores nombrados en la ruta que declara cada fichero, y contamos lo que dice el fichero. No falsificamos ningún user-agent, porque un agente falsificado no demuestra nada sobre el acceso. 78 entradas del catálogo preguntadas, 77 sirvieron un fichero, 1 tras un reto de bot y puesto en su propio cubo en vez de contado como conforme, 21 de agosto de 2026. Los recuentos están en nuestro registro de mediciones, y el fichero es público, así que cualquiera puede repetir esto en contra nuestra.


La versión corta

  1. Un cero publicado ya no está. El 17 de agosto de 2026, 68 proveedores servían un fichero y 0 prohibían a ningún rastreador de IA. El 21 de agosto, 77 sirven y 1 bloquea.
  2. La regla es un valor por defecto gestionado, no la frase del proveedor. El fichero lleva # BEGIN Cloudflare Managed content y todos los bloqueos están dentro. Cuando esa sección se cierra, la aportación propia del proveedor es un solo Disallow sobre una ruta.
  3. Bloquea entrenamiento y deja abierta la recuperación. De nuestros 14 rastreadores, 7 están prohibidos y 7 no, y la línea entre las dos mitades es para qué sirve cada rastreador.
  4. Los rastreadores que traen citación están todos en la mitad permitida, así que con esta evidencia el proveedor pierde presencia en corpus y conserva las respuestas.
  5. La lista gestionada no es exhaustiva, y el hueco se nombra abajo.
  6. Esto es un anticipo del 15 de septiembre, que es la razón de que importe y está en la última sección.

Qué proveedor, y por qué lo nombramos

El proveedor es Knowatoa, y knowatoa.com/robots.txt dice todo esto en público. El ápice y el www sirven ficheros idénticos byte a byte de 1.968 bytes, comprobados por separado, porque un anfitrión y su www pueden diferir y este registro ya se llevó una vez el susto de suponer que no.

Lo nombramos por la misma razón por la que publicamos el prompt exacto de cada medición: una cifra que no puedes comprobar no es una cifra. Cualquiera puede pedir ese fichero en un comando y ver si lo leímos bien.

Y vamos a tener cuidado con lo que significa, porque el titular obvio es falso. «Un proveedor de visibilidad en IA bloquea rastreadores de IA» es una buena frase y una mala descripción. El bloqueo está dentro de una sección gestionada, que es un ajuste y no una frase que alguien escribiera, y para a los rastreadores que construyen corpus de entrenamiento mientras deja en paz a todos los que piden una página para contestar una pregunta.


Qué contiene el fichero de verdad

Tres partes, en este orden.

Un preámbulo. Veintiséis líneas que definen el vocabulario de Content Signals y terminan declarando que cualquier restricción expresada por esa vía es una reserva expresa de derechos bajo el artículo 4 de la directiva europea de copyright. Es texto que viene con el fichero gestionado y no lo redactó el proveedor, pero hace trabajo legal igualmente.

El bloque gestionado. Abre con un grupo * que lleva Allow: / y Content-Signal: search=yes,ai-train=no,use=reference, y después prohíbe a nueve agentes en seco: Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, CloudflareBrowserRenderingCrawler, Google-Extended, GPTBot y meta-externalagent.

La regla propia del proveedor, después de # END Cloudflare Managed Content. Es una línea: un segundo grupo * con un Disallow sobre una sola ruta del sitio.

O sea que la política de rastreo propia del proveedor es una ruta. Todo lo que se lee como una postura sobre la IA es una lista gestionada, y la línea de Content-Signal dice lo mismo en el otro vocabulario: indexar y citar fragmentos está bien, entrenar no.

Hay un detalle de estructura que conviene saber para auditar ficheros así. Hay dos grupos *, uno en cada sección. Un parser que se pare en la primera coincidencia ve Allow: / y reporta el sitio como completamente abierto; uno que se quede con la última ve solo la regla de ruta. Ninguno de los dos es el fichero. Ese error lo hemos cometido nosotros, sobre el fichero de otro, y es la razón de que nuestro barrido lea todos los grupos y no el primero que encuentra.


Entrenamiento y recuperación son permisos distintos, y solo uno está bloqueado

Esta es la distinción que la categoría no para de aplastar, y este fichero la dibuja casi tan limpia como se puede dibujar.

Bloqueados, de los 14 que seguimosPermitidos, de los 14 que seguimos
GPTBotOAI-SearchBot
ClaudeBotChatGPT-User
Google-ExtendedClaude-User
CCBotGooglebot
Applebot-ExtendedPerplexityBot
BytespiderPerplexity-User
meta-externalagentanthropic-ai

Son 7 y 7. Todos los rastreadores de la columna izquierda existen para reunir corpus. 6 de los 7 de la derecha existen para pedir una página mientras contestan la pregunta de alguien. Una marca que bloquea la izquierda pierde presencia en entrenamiento y conserva citaciones. Una marca que bloquea la derecha desaparece de las respuestas.

Por eso el recuento a secas engañaría. La mitad de los rastreadores seguidos bloqueada suena grave. La mitad bloqueada, cuando ninguno de esa mitad trae una citación, es otro hecho y apunta al revés.

El fichero también bloquea a Amazonbot y a CloudflareBrowserRenderingCrawler, que están fuera de los 14 que seguimos y por eso no salen en esa tabla. Los mencionamos porque dejarlos fuera de la prosa haría parecer el fichero más pequeño de lo que es.

El hueco de la lista gestionada

anthropic-ai está en la columna de permitidos, y no le corresponde estar ahí según la lógica del resto del fichero. Es el nombre de agente antiguo que usaba Anthropic para recogida de entrenamiento. La lista gestionada bloquea a ClaudeBot y se lo salta.

Eso no es una crítica al proveedor, que no escribió la lista. Es el argumento contra tratar un bloqueo gestionado como una política: es una foto de qué nombres de agente le parecen importantes a un proveedor, se mantiene en el calendario de otro, y un nombre que quede fuera simplemente no está cubierto. Si la intención es ai-train=no, este fichero no la cumple del todo, y nada dentro de la web del proveedor se lo diría.


¿Cambió, o se nos pasó?

Aquí hay que tener cuidado con lo que de verdad se puede demostrar.

El proveedor entró en nuestro catálogo el 7 de agosto, diez días antes del barrido que encontró 68 proveedores sirviendo y ninguno bloqueando. El único proveedor excluido de aquel barrido estaba tras un reto de bot y es otra empresa. Así que la inferencia es que este fichero cambió entre el 17 y el 21 de agosto de 2026.

Es una inferencia, no una observación guardada. Aquel barrido registró agregados, 68 servían y 0 bloqueaban, y no una fila por proveedor. No hay ninguna línea en nuestro registro que diga que ese proveedor lo permitía todo el 17 de agosto. Lo que tenemos es un total sin sitio para un bloqueador, y un catálogo que ya contenía a ese proveedor. Eso es sólido, y es más débil que un diff.

El arreglo es el obvio y ya es el plan: guardar el resultado por proveedor en vez del total, para que la próxima vez un cambio sea un diff y no una deducción. Lo escribimos en público porque el mismo fallo está probablemente en tu propia monitorización. Un agregado basta para notar que algo se movió y nunca para decir qué.


Por qué esto importa más el 15 de septiembre que ahora

Cloudflare cambia sus valores por defecto para bots de IA el 15 de septiembre de 2026. Dos partes de eso tocan este fichero.

La primera es que el cambio se aplica a las reglas gestionadas, que es la sección que aquí hace todo el bloqueo. Nadie en el proveedor tiene que tocar nada para que el comportamiento de su sitio cambie.

La segunda, y la que merece escribirse, es que los rastreadores que hacen búsqueda y entrenamiento a la vez pasan a estar bloqueados por cualquier ajuste que bloquee entrenamiento, incluidos los ajustes elegidos antes del cambio.

Para una empresa que vende visibilidad en respuestas de IA, esa es la dirección cara. Un bloqueo de entrenamiento es barato: pierdes presencia en corpus y conservas citaciones, que es un intercambio coherente. Un bloqueo de entrenamiento que además caza a los rastreadores mixtos no es barato, porque los mixtos son los que piden una página para citarla.

Nada de esto dice que haya pasado. El fichero de hoy bloquea entrenamiento y deja abierta la recuperación, que es exactamente lo que debería querer una empresa que quiere ser citada y no absorbida. Lo que decimos es que la postura la sostiene hoy un valor por defecto, y los valores por defecto se mueven el 15 de septiembre de 2026.


Lo que esto no demuestra

Un proveedor no es una tendencia. El resumen honesto es que un cero pasó a ser un uno sobre una población que además creció. El contenido es el mecanismo, no la tasa, y diríamos lo mismo si la semana que viene el recuento volviera a cero.

Una declaración no es un comportamiento. Un robots.txt dice qué se le pide a un rastreador. No establece que el rastreador obedeciera, que las páginas se citen, ni que cambiara nada en ninguna respuesta. Todas nuestras cifras de acceso de rastreadores llevan este límite y esta no es distinta.

No podemos demostrar que el fichero cambiara, solo que nuestro propio agregado de cuatro días antes no deja sitio para ello.

Y no preguntamos al proveedor. Esto es una lectura de un fichero público, no un informe sobre la intención de nadie. Un bloqueo gestionado es un ajuste, y un ajuste puede estar puesto por motivos que no tienen nada que ver con una postura sobre la IA.

Y los otros 76 son el hallazgo que hay debajo de este. 76 de 77 sirven un fichero que no prohíbe a ninguno de los 14 rastreadores que seguimos. Discuta lo que discuta esta categoría en público, sus propias puertas están abiertas.


Preguntas frecuentes

¿Bloquear rastreadores de entrenamiento es un error para una marca?

No por sí solo, y el intercambio se lee bien. Bloquear a GPTBot, ClaudeBot y Google-Extended te saca de los corpus de entrenamiento mientras deja a OAI-SearchBot, Claude-User y Googlebot libres para pedir tus páginas cuando un asistente contesta una pregunta. Si tu preocupación es que te absorban y tu objetivo es que te citen, ese es el ajuste coherente. Se vuelve un problema cuando una regla pensada para entrenamiento caza también a los rastreadores que recuperan, que es lo que cambia el 15 de septiembre de 2026.

¿Cómo compruebo mi propio fichero?

Pide tudominio.com/robots.txt y busca # BEGIN Cloudflare Managed content. Si está, la lista de bloqueos de dentro no es tuya y se moverá cuando se muevan los valores por defecto del proveedor. Lee todos los grupos y no solo el primero, porque un fichero gestionado y tus propias reglas pueden apuntar los dos a *. Comprueba el ápice y el www por separado, porque pueden servir ficheros distintos.

¿Un robots.txt gestionado puede sustituir al que escribí yo?

Sí, y ese es el riesgo que conviene conocer. El fichero gestionado se puede servir en lugar del tuyo, así que una declaración que commiteaste puede dejar de servirse sin que cambie nada en tu repositorio. Nosotros auditamos nuestro propio ajuste justo por eso, porque para una empresa que publica declaraciones de rastreo, que se las sustituyan en silencio sería el fallo más vergonzoso disponible.

¿Por qué una lista de rastreadores y no un solo número?

Porque entrenamiento y recuperación son permisos distintos y un recuento único esconde la diferencia. La lista cubre los dos lados de cada proveedor grande, así que un fichero que bloquea uno y permite el otro se ve como tal en vez de colapsar en una puntuación. Este fichero es el caso: un solo número se habría leído como media lista bloqueada, cuando el hecho útil es qué mitad.

¿Content-Signal hace algo por sí solo?

Es una declaración, no una ejecución, y es joven. Merece la pena ponerla porque declara la intención de forma legible por máquina y, según el preámbulo que viene con estos ficheros, se plantea como una reserva de derechos bajo el copyright europeo. Lo que no hace es parar a un rastreador. Las líneas Disallow son lo que obedece un rastreador conforme, y ninguna de las dos cosas obliga a un rastreador que ignora el fichero.

Pregúntale a la IA sobre este artículo

Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.

Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.

Escrito por

Maher El Ouahabi

CTO y cofundador de EchoWi

Construye el software que enseña a las marcas lo que la IA dice de ellas, y qué cambiar para que la siguiente respuesta sea mejor. Doce motores, medidos antes y después.

LinkedIn Maher El Ouahabi (se abre en una nueva pestaña)