Saltar al contenido
Visibilidad IAGEO
ES

Pasamos la auditoría estándar de rastreadores a 66 proveedores de visibilidad en IA. La pasaron los 66.

Tres comprobaciones, sesenta y seis proveedores, cero fallos. Un pleno no es buena noticia sobre la categoría, es mala noticia sobre las comprobaciones.

· Actualizado · 11 min de lectura

Todas las herramientas de este mercado venden una comprobación de acceso de rastreadores, y todas hacen las mismas tres: leer robots.txt, pedir la página, buscar rutas escondidas. Las pasamos a los sesenta y seis proveedores de nuestro catálogo, nosotros incluidos. Las pasaron los sesenta y seis.

Eso no es un cumplido a la categoría. Es un resultado sobre las comprobaciones, y lo podemos decir con cierta autoridad, porque nuestro propio dominio las pasó las tres un día en el que un rastreador estaba siendo rechazado en nuestro CDN.

Aviso: EchoWi es uno de los sesenta y seis y vende medición de visibilidad en IA, así que un estudio que concluye que la comprobación gratuita no informa de nada es un estudio con interés. Los tres métodos están descritos enteros más abajo, la fecha es el 11 de agosto de 2026, los once nombres de rastreador buscados están listados, y los recuentos están en nuestro registro de mediciones. Nada en él falsifica un user-agent, por una razón que explica la sección de método.


La versión corta

  1. Cero de sesenta y seis bloquean algún rastreador de IA en robots.txt. Se buscaron once agentes, de GPTBot a Applebot-Extended.
  2. Sesenta y seis de sesenta y seis sirven a un cliente HTTP plano, que es lo que son la mayoría de los rastreadores.
  3. Cero esconden precios, comparativas o documentación de los rastreadores. Las únicas rutas prohibidas que hay son feeds, rutas de administración y duplicados con parámetros.
  4. Dieciséis nombran rastreadores de IA explícitamente, y los dieciséis los permiten, lo cual no cambia nada, porque un rastreador que nadie menciona ya está permitido.
  5. Un pleno en las tres es exactamente lo que enseñaba nuestro propio sitio mientras bloqueaba a un rastreador, y ese es el sentido del artículo.
  6. No se falsificó ningún user-agent en nada de esto, porque mandar el nombre de un rastreador desde tu propia máquina no demuestra nada y es como se hacen casi todas estas auditorías.

Las tres comprobaciones, y qué pregunta cada una de verdad

Leer robots.txt. Pregunta qué ha declarado el sitio. Es una instrucción publicada para rastreadores que se portan bien y es la única de las tres que no se puede falsificar, porque el fichero es del sitio.

Pedir la página. Pregunta si un servidor devuelve contenido a un cliente que no es un navegador. Mandamos un user-agent que dice lo que es, echowi-accessibility-check, en vez de fingir ser GPTBot. Esa distinción es la diferencia entera entre una medición y una conjetura: una cadena falsa de rastreador mandada desde nuestra máquina no es ese rastreador, y un CDN que decide por estado de bot verificado y por IP de origen la dejará pasar siempre. Cualquier auditoría que pruebe el acceso mandando el nombre de otro no está probando nada.

Buscar rutas escondidas. Pregunta si las páginas comercialmente útiles, precios, comparativas y documentación, quedan excluidas del rastreo.

Esas tres son las que corre una auditoría gratuita de visibilidad en IA. Son razonables y son baratas, que es por lo que todas las herramientas las incluyen.


Los resultados

ComprobaciónProveedores que pasan
robots.txt no bloquea ningún rastreador de IA66 de 66
Sirve a un cliente HTTP plano66 de 66
No esconde precios, comparativas ni documentación66 de 66

Los once agentes buscados fueron GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, anthropic-ai, PerplexityBot, Perplexity-User, Google-Extended, Bytespider, CCBot y Applebot-Extended.

Tampoco declina nadie en la otra dirección: preguntados los mismos sesenta y seis qué declaran en vez de qué bloquean, cinco tienen una directiva de Content Signals y las cinco permiten. Vuelto a medir tres días después sobre un catálogo mayor, y leyendo todas las líneas de directiva en vez de la primera, siete declaran Content Signals y uno rechaza el entrenamiento, que es también donde está escrito el error de instrumento que produjo el recuento anterior. Las rutas prohibidas que sí existen son mantenimiento. Surfer excluye un parámetro de paginación del blog, Semrush excluye variantes con parámetros de seguimiento y la búsqueda de su blog, MaxAEO excluye feeds de comentarios, Rankability excluye directorios de administración de WordPress, Ahrefs excluye consultas de archivo, Alhena excluye páginas de etiquetas, SE Ranking excluye un directorio estático de herramientas y Ceyo excluye documentación de integración de algunos socios. Ni uno de los sesenta y seis excluye una página que un comprador querría ver.


Los dieciséis que escribieron reglas que no hacen nada

Dieciséis proveedores nombran rastreadores de IA explícitamente en robots.txt: Airefs, Cloudflare AEO, EchoWi, KIME, MaxAEO, Omnibound, Qwairy, Rank Prompt, Rankability, Rankscale, SE Ranking, ScalePost, Siftly, Superlines, Surfeo y Wellows.

Los dieciséis los permiten. Y un permiso explícito para un rastreador al que nadie estaba bloqueando no cambia ningún comportamiento, porque el estado por defecto de un rastreador sin mencionar ya es permitido. Escribir User-agent: GPTBot seguido de Allow: / produce el mismo acceso que no escribir nada.

Así que la única diferencia medible entre esos dieciséis y los otros cincuenta es que dieciséis se tomaron la molestia de declarar una intención. Es razonable hacerlo, porque así una futura regla comodín no se llevaría por delante a los rastreadores nombrados. No es acceso, y una lista de comprobación que lo puntúa como un punto está puntuando un comentario.

Estamos entre los dieciséis. Este párrafo nos aplica.


Por qué un pleno es el tipo equivocado de tranquilidad

Aquí está el caso que deja finas a las tres comprobaciones, y es el nuestro.

Nuestro robots.txt permite a todos los rastreadores de IA por su nombre. Nuestras páginas son estáticas y se sirven a cualquier cliente que las pida. No se esconde nada. En las tres comprobaciones de arriba nuestro dominio puntúa perfecto, y puntuaba perfecto el día en que descubrimos que un rastreador de IA importante estaba siendo retado en casi cada petición que nos hacía.

La causa no estaba en robots.txt y no podía estarlo. Bot Fight Mode de Cloudflare reta a cualquier bot que no esté en su lista de verificados, corre fuera del Ruleset Engine, así que una regla WAF no puede eximir a nadie, y decide por estado de bot verificado y por IP de origen, no por la cadena que mande un cliente. Ninguna de las tres comprobaciones ve nada de eso. Lo único que podía verlo eran los propios registros del CDN, que no son públicos, y por eso un tercero corriéndonos la auditoría estándar habría producido un verde y se habría equivocado.

Eso generaliza de forma incómoda. Sesenta y seis proveedores pasando tres comprobaciones te dice que sesenta y seis proveedores no han publicado una instrucción para que te vayas. No te dice nada de lo que hacen sus CDN, y la configuración del CDN es donde vivía el fallo que sufrimos de verdad.


Qué preguntar en su lugar

Pide el registro, no la comprobación. La pregunta que tiene respuesta es qué rastreadores llegaron a tu origen, con qué frecuencia y con qué códigos de estado. Ese dato existe en los registros de tu CDN o de tu servidor y en ningún otro sitio. Si una herramienta te dice que tu sitio es accesible para rastreadores de IA sin haberlos leído, te ha dicho lo que podía ver y no lo que preguntaste.

Cruza el user-agent con la ruta pedida. La atribución por user-agent no vale en ninguna de las dos direcciones. Cuando miramos qué había estado pidiendo el nombre de un rastreador en nuestro caso, las rutas incluían ficheros de clave privada y nombres de fichero de credenciales, que es un escáner de vulnerabilidades vistiendo el nombre de un rastreador y no un rastreador. Un rastreador legítimo pide artículos.

Parte la ventana por el momento del cambio. Si arreglas algo, no midas a través del arreglo. Un agregado que abarca el antes y el después describe la media de dos regímenes y ninguno de los dos, y así es como un arreglo que funcionó se reporta como un arreglo a medias.

Y trata un verde como la ausencia de un tipo de problema. Pasar estas tres significa que no le has dicho a los rastreadores que se vayan. Eso merece confirmarse, cuesta un minuto, y es donde esta clase de auditoría termina y no donde deja de ser útil.


Qué no demuestra

Nadie fue probado por acceso real. Ni una medición de aquí establece que un rastreador llegue a ninguno de estos sesenta y seis sitios, el nuestro incluido. Eso exigiría los registros de cada proveedor.

Una lectura, un día. robots.txt cambia, y un proveedor podría añadir mañana una regla de bloqueo. Los once agentes son los que se buscaron; un agente fuera de esa lista podría estar bloqueado y no aparecería.

Bloquear no es el único fallo. Un sitio puede ser rastreado y seguir siendo incitable, que es la mayor parte de lo que mide el resto de este blog.

Un 403 no siempre es un bloqueo. La página de precios de un proveedor devolvió 403 a el cliente plano de la comprobación mientras su portada devolvía 200. Eso es compatible con una regla de gestión de bots y compatible por igual con un límite de tasa o con una regla por ruta, y no las hemos distinguido, así que no cuenta como fallo en la tabla de arriba.

Y estamos dentro de la muestra. EchoWi es uno de los sesenta y seis y puntúa igual que todos en las tres, que es el argumento entero y no una salvedad.


Preguntas frecuentes sobre el acceso de rastreadores de IA

¿Un robots.txt permisivo significa que los rastreadores de IA pueden leer mi sitio?

No, y es el error más común de esta categoría. robots.txt es una instrucción para rastreadores que eligen obedecerla. No dice nada de si tu CDN reta la petición antes de que tu servidor la vea, y los productos de gestión de bots deciden por estado de bot verificado y por IP de origen, no por el fichero. Nuestro propio sitio permite a todos los rastreadores de IA por su nombre y tenía a uno de ellos retado en casi cada petición.

¿Puedo probar el acceso mandando el user-agent del rastreador?

No, y hacerlo produce un falso aprobado siempre. Una petición desde tu máquina llevando PerplexityBot como user-agent no es PerplexityBot, y cualquier capa de gestión de bots que valga lo que cuesta decide por la lista de verificados y por la IP de origen. Corrimos esa prueba una vez sobre diez agentes, sacamos diez 200 y dimos la capa por limpia. No lo estaba. Lo único que lo zanjó fueron los registros de peticiones del propio CDN.

Si nadie bloquea rastreadores de IA, ¿por qué comprobarlo?

Porque un bloqueo es barato de causar y caro de pasar por alto. Una regla de denegar por defecto en un producto de bots, una plantilla de cortafuegos, una configuración heredada de una agencia, y el rastreador desaparece sin que nada en la página lo enseñe. Comprobarlo vale el minuto que cuesta. Lo que no vale es tratar el verde como una afirmación sobre tu visibilidad, que es otro problema con otras causas.

¿Qué diferencia hay entre GPTBot y ChatGPT-User en robots.txt?

Hacen trabajos distintos y bloquearlos tiene consecuencias distintas. GPTBot es el rastreador de entrenamiento e indexación, y ChatGPT-User es la petición que se hace cuando la pregunta de un usuario provoca que se recupere una página en vivo. Bloquear el primero es una decisión sobre datos de entrenamiento. Bloquear el segundo te saca de respuestas que se están escribiendo ahora mismo. Dieciséis proveedores de esta muestra los nombran por separado, lo que sugiere que la distinción se entiende en este mercado incluso donde las reglas no surten efecto.

¿Debería escribir reglas Allow explícitas para rastreadores de IA?

No cuesta nada y no concede nada. Un rastreador sin mencionar ya está permitido, así que un permiso explícito no cambia ningún comportamiento hoy. La razón de escribirlas es que mantiene a un rastreador nombrado fuera de cualquier regla comodín que tú o una agencia añadáis más adelante, que es una pequeña cobertura y no una mejora. Nosotros las hemos escrito, y este artículo es la razón de que no nos apuntemos el tanto.

¿Cómo sería una auditoría de rastreadores de verdad útil?

Leería los registros de tu CDN o de tu servidor en vez de hacer peticiones desde otro sitio, informaría por rastreador y por código de estado, cruzaría el user-agent con las rutas pedidas para separar a los escáneres que visten nombres de rastreador, y partiría cualquier ventana en el momento en que cambió una configuración. Todo eso necesita acceso a tu infraestructura, que es por lo que la versión gratuita de esta comprobación hace las tres cosas de arriba, y por lo que esas tres cosas devuelven sesenta y seis resultados limpios.

Pregúntale a la IA sobre este artículo

Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.

Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.

Escrito por

Maher El Ouahabi

CTO y cofundador de EchoWi

Construye el software que enseña a las marcas lo que la IA dice de ellas, y qué cambiar para que la siguiente respuesta sea mejor. Doce motores, medidos antes y después.

LinkedIn Maher El Ouahabi (se abre en una nueva pestaña)