The New York Times y CNBC bloquean todos los rastreadores de IA que comprobamos. El AI Overview de Google los cita igual.
Pedimos las URL que citaron nueve respuestas de AI Overview y leímos su robots.txt. Ninguna muerta, y 11 editores citados bloquean rastreadores de IA.
Todos los estudios de citación en IA, el nuestro incluido, registran qué dominios cita un motor y se paran ahí. Nadie comprueba si la cita resuelve, que cuesta una petición HTTP. Cogimos todas las URL impresas en nueve respuestas de AI Overview en cuatro idiomas, 79 citas sobre 58 hosts, y las pedimos todas. Ninguna estaba muerta. Después leímos el robots.txt de cada host citado, y 11 de ellos prohíben rastreadores de IA mientras salen citados en la respuesta. Dos, The New York Times y CNBC, prohíben los diez rastreadores que comprobamos, Google-Extended incluido, y cada uno es la segunda fuente de su respuesta.
Lo útil no es la contradicción. Es que lo que a la gente le dicen que haga sobre el rastreo de IA, y lo que decide si apareces en una respuesta de IA, son dos sistemas distintos que no se hablan.
Transparencia: EchoWi vende medición de visibilidad en IA, así que un hallazgo que dice que el robots.txt no controla la presencia en AI Overview es de los que nos convienen. Las nueve preguntas, el mercado y el idioma de cada una, cada URL con su estado HTTP y cada línea de robots.txt citada abajo están en nuestro registro de mediciones, y los ficheros robots.txt son públicos, así que esto se puede repetir en nuestra contra en una tarde.
La versión corta
- 79 citas, 58 hosts, 9 preguntas, 4 idiomas, una lectura de AI Overview cada una. Cuatro en Estados Unidos en inglés, dos en España, dos en Alemania y una en Francia, cada una en su idioma.
- Nada estaba muerto. 71 URL respondieron, 8 rechazaron a un cliente HTTP normal con 403, y ninguna devolvió 404.
- Tampoco se había movido nada. Cero de las 79 redirigieron a otro sitio distinto de sí mismas, así que la URL que imprime una respuesta es la URL que sirve la página.
- De los 55 hosts que nos dejaron leer su robots.txt, 17 nombran algún rastreador de IA. Los otros 38 sencillamente no han escrito nunca una regla sobre ninguno.
- 11 de esos 17 prohíben al menos un rastreador, y los 11 salen citados igual.
- The New York Times y CNBC prohíben cada uno los diez que comprobamos, Google-Extended incluido. Wirecutter es la segunda cita de la pregunta de auriculares y CNBC la segunda de la de nóminas.
- Forbes prohíbe seis y permite explícitamente OAI-SearchBot, y es la primera cita de esa misma pregunta. Eso no es un descuido, es una política: fuera el rastreador que entrena, dentro el que busca. Y esa política no es exclusiva de Forbes: leyendo los mismos ficheros en los anfitriones donde la gente publica, se rechaza mucho más al rastreador que entrena que al que busca, y once de esos anfitriones admiten a Googlebot mientras dejan fuera al menos a un rastreador de IA.
- Así que un robots.txt no dice nada sobre si un sitio aparecerá en AI Overview, en ninguna de las dos direcciones, lo que también significa que el robots.txt de un competidor no te dice nada del suyo.
Qué hicimos
Nueve preguntas de compra, cada una hecha una vez al AI Overview de Google, en el mercado y el idioma en que la haría quien compra. Cuatro son software de empresa, donde nuestro registro ya tiene filas contra las que comparar. El resto son categorías de consumo, tarjetas de viaje y auriculares, añadidas en dos pasadas posteriores: primero porque los editores que escriben reglas de rastreo son medios, y las preguntas de software de empresa apenas citan alguno, y después en España, Francia y Alemania porque todos los que bloqueaban en las dos primeras pasadas eran estadounidenses.
Para cada cita hicimos una petición GET, seguimos las redirecciones y registramos el estado y la URL finales.
GET y no HEAD, y esa elección tiene una cicatriz detrás. Nuestro propio comprobador de enlaces usaba HEAD cuando se escribió y reportó cinco fuentes muertas; dos de las cinco contestan 200 a un GET. Un método que un servidor no está obligado a soportar no es prueba de que falte una página, y con aquella lista habríamos anotado como rotas dos citas perfectamente vivas.
Después, para cada host distinto, pedimos https://host/robots.txt y buscamos un grupo dirigido a cada uno de diez rastreadores de IA nombrados: GPTBot, OAI-SearchBot, ChatGPT-User, Google-Extended, PerplexityBot, ClaudeBot, CCBot, Applebot-Extended, Bytespider y anthropic-ai. Un host cuenta como que bloquea sólo cuando el grupo dirigido a ese agente lo prohíbe todo.
Nada estaba muerto, y eso merece un párrafo
71 de 79 respondieron. 8 devolvieron 403 al cliente que usamos. Cero devolvieron 404, 410 ni nada del rango de muertas, y cero redirigieron a una dirección distinta.
Esperábamos encontrar al menos unas cuantas citas rancias, porque esa es la forma de la queja que hace la gente sobre las respuestas generadas. En esta muestra no hay ninguna. Las páginas a las que apunta una respuesta están ahí.
Los 403 no son un hallazgo sobre esas páginas y no vamos a disfrazarlos de uno. Son protección antibot rechazando a un cliente desconocido desde un sitio, y el motor que las citó entró sin problema. Esa distinción no es un tecnicismo, es la misma que hace funcionar el resto de esta pieza: lo que un servidor te hace a ti no es lo que le hace a un rastreador.
Los editores que bloquean un rastreador y salen citados igual
| Host | Prohíbe | Permite |
|---|---|---|
| www.nytimes.com | los 10 comprobados, Google-Extended incluido | ninguno |
| www.cnbc.com | los 10 comprobados, Google-Extended incluido | ninguno |
| www.nerdwallet.com | Google-Extended | ninguno |
| recordingnow.com | GPTBot, ChatGPT-User, CCBot, anthropic-ai | ninguno |
| www.facebook.com | Applebot-Extended | GPTBot, Google-Extended, PerplexityBot, ClaudeBot |
| viajes.nationalgeographic.com.es | GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeBot, CCBot, Bytespider | ninguno |
| www.01net.com | CCBot, Bytespider | ninguno |
| www.frandroid.com | CCBot | ninguno |
| www.forbes.com | GPTBot, PerplexityBot, ClaudeBot, Applebot-Extended, Bytespider, anthropic-ai | OAI-SearchBot, CCBot |
| routine-automation.com | GPTBot, Google-Extended, ClaudeBot, CCBot, Applebot-Extended, Bytespider | ninguno |
| www.equalpaytoday.org | CCBot | ninguno |
Las dos líneas que sostienen el argumento se releyeron a mano en vez de fiarlas al parser que las encontró, porque un parser que define su propio universo es la forma más común de que un estudio así salga mal:
www.cnbc.com/robots.txt
User-agent: Google-Extended
Disallow: /
www.forbes.com/robots.txt
User-agent: GPTBot
Disallow: /
User-Agent: OAI-SearchBot
Allow: /
CNBC es la segunda cita de la respuesta de AI Overview a «¿cuál es el mejor servicio de nóminas para una pequeña empresa?». Forbes es la primera.
Los que nunca escribieron una regla
Los 11 que bloquean son la minoría interesante. El número grande de la tabla es el de debajo: de los 55 hosts cuyo robots.txt pudimos leer, 38 no nombran ni uno solo de los diez rastreadores de IA. Ni para permitirlos, ni para bloquearlos. No tienen postura.
Eso conviene ponerlo al lado de lo que vende la categoría. Ha crecido una industria entera de consejos sobre directivas de rastreo de IA, y la mayoría de los editores que de verdad ocupan plazas de citación en estas respuestas no han escrito nunca una. Salen citados porque Googlebot los indexó, que ya era verdad antes de que nada de esto existiera.
También pone precio al consejo. Si escribes una regla, te unes a una minoría de 17 en esta muestra, y 11 de esos 17 salen citados a pesar de lo que escribieron. La regla no es lo que sostiene la plaza. Nuestra auditoría aparte de lo que implementa esta misma categoría encontró el mismo orden, con proveedores adoptando la convención que no tiene lector demostrado y saltándose la que tiene especificación.
Por qué pasa, y por qué no es un truco
Google-Extended no es el rastreador que trae páginas para Google. Es un control sobre si el contenido que Google ya tiene puede usarse para Gemini y para grounding. AI Overview se monta desde el índice de búsqueda de Google, que construye Googlebot, y ningún editor de esta muestra prohíbe Googlebot, porque eso los sacaría de la búsqueda entera.
Así que la secuencia es: Googlebot rastrea, se construye el índice, AI Overview saca su respuesta de ese índice, y las reglas que un editor escribió para GPTBot y Google-Extended nunca estuvieron en ese camino.
No es un truco de nadie. Forbes tiene la configuración más coherente de la tabla: fuera el rastreador que construye un corpus de entrenamiento, dentro el que contesta una búsqueda. Lo que demuestra es que son palancas separadas, y sólo una está conectada con lo que casi todo el mundo teme perder.
Y no es una costumbre americana
Todos los que bloqueaban en las dos primeras pasadas eran estadounidenses: CNBC, Forbes, The New York Times, NerdWallet. Eso es un confusor de verdad, y la pieza no podía distinguir «los editores bloquean» de «los editores americanos bloquean», porque las preguntas española y alemana que llevaba eran software de empresa, que apenas cita un medio.
Así que preguntamos tres más, una por mercado europeo, en las categorías que habían producido a los americanos: tarjetas de viaje en España y Alemania, auriculares en Francia.
También bloquean. Viajes National Geographic en España prohíbe siete de los diez, GPTBot entre ellos, y es la primera cita de esa respuesta. 01net prohíbe dos y Frandroid uno, dos cabeceras tecnológicas francesas, las dos citadas. Ahora hay quien bloquea en los cuatro mercados.
Y la versión bonita de eso no sobrevive. Leyendo sólo las filas europeas, el patrón parece que los americanos bloquean los rastreadores grandes y los europeos sólo los recolectores de poco valor: las dos cabeceras francesas prohíben CCBot y Bytespider y dejan pasar a GPTBot. Encaja perfecto con esas filas. Se cae contra el resto de la tabla, porque el National Geographic español bloquea GPTBot y el Equal Pay Today estadounidense no bloquea más que CCBot. Once que bloquean repartidos en cuatro mercados no sostienen una afirmación sobre el carácter de un mercado, y no la vamos a hacer.
El único contraste que merece nombre es un editor, no un país. BILD permite explícitamente PerplexityBot, CCBot, Applebot-Extended y Bytespider, que es la postura contraria a la de los demás medios citados aquí y es lo que parece un acuerdo de licencia escrito dentro de un robots.txt.
Qué cambia esto para tres personas distintas
Si publicas y has bloqueado rastreadores de IA para proteger tu trabajo, no te has sacado de las respuestas de IA de Google, y quizá no era eso lo que querías. Conviene saber qué está haciendo cada una de tus reglas, porque el resultado visible, que te citen sin clic, lo produce el rastreador que no puedes bloquear sin salir de la búsqueda.
Si vendes o compras visibilidad en IA, el robots.txt de un competidor no es información sobre su presencia. 11 de los 17 hosts de aquí que mencionan un rastreador de IA están bloqueando alguno y saliendo citados igual. Cualquier auditoría que lea el robots.txt y deduzca quién va a aparecer en una respuesta está leyendo el fichero equivocado.
Si construyes herramientas de medición, los 403 importan más que los bloqueos. 8 de 79 URL citadas rechazan a un cliente normal. Un comprobador que corra desde una sola dirección y las marque como inalcanzables reportaría esas 8 fuentes de una respuesta viva como rotas, y se equivocaría con todas.
Lo que esto no demuestra
Nueve preguntas, una superficie, una lectura cada una, un día. Esto es Google AI Overview el 14 de agosto de 2026 en cuatro mercados. No dice nada de ChatGPT, Perplexity ni Gemini, que recuperan distinto y necesitarían cada uno su propia medición.
Las categorías no son una muestra. Se eligieron porque nuestro registro ya las cubre, así que estas filas se pueden comparar con las anteriores. Eso es lo contrario de un sorteo aleatorio.
17 hosts nombrando un rastreador sigue siendo poco de donde razonar, y 11 de 17 no es una tasa que defendamos como la del sector. Lo que sostienen los 11 es una afirmación de existencia, que es todo lo que necesita el argumento: bloquear rastreadores de IA es compatible con ser fuente destacada de una respuesta de IA, y aquí hay 11 sitios haciéndolo. Esta pieza se ha ampliado dos veces, de 4 de 8 a 8 de 12 a 11 de 17, y cada vez la proporción aguantó en vez de caerse. Merece decirse porque podría haber ido al revés, y el lector no puede saberlo por la cifra final.
Tres hosts no nos sirvieron el robots.txt, contestando 403, y van contados aparte.
Nada de esto es causal. No cambiamos un robots.txt y vimos moverse una cita. Ese experimento es posible y nadie lo ha publicado.
Preguntas frecuentes sobre bloquear rastreadores de IA
¿Bloquear GPTBot me saca del AI Overview de Google?
No. GPTBot es el rastreador de OpenAI y no participa en cómo Google construye AI Overview, que sale del índice de búsqueda de Google. En nuestra muestra, 11 editores prohíben rastreadores de IA y los 11 salen citados en respuestas de AI Overview, incluidos dos que prohíben los diez que comprobamos.
¿Google-Extended controla si aparezco en AI Overview?
No en nada de lo que observamos. Google-Extended gobierna si el contenido puede usarse para Gemini y para grounding, no si Googlebot te rastrea ni si el índice de búsqueda alimenta un AI Overview. CNBC prohíbe Google-Extended y es la segunda fuente citada en la respuesta de nóminas que medimos el 14 de agosto de 2026.
¿Las respuestas de IA citan páginas que ya no existen?
En esta muestra no. Pedimos las 79 URL que imprimieron nueve respuestas de AI Overview y ninguna devolvió un estado de muerta, y ninguna redirigió a otro sitio. Ocho devolvieron 403 al cliente que usamos, que es protección antibot y no una página que falte.
¿Puedo saber por el robots.txt de un competidor si va a salir en respuestas de IA?
No, y esta es la consecuencia práctica. De los 17 hosts citados que nombran algún rastreador de IA, 11 bloquean alguno y salen citados igual. Un robots.txt describe lo que un sitio le pide a rastreadores nombrados, no qué superficie lo va a citar.
¿Debo comprobar las fuentes citadas con una petición HEAD?
No. Un servidor no está obligado a soportar HEAD, y tratar un fallo de HEAD como página que falta produce falsos positivos. Nuestro propio comprobador de enlaces hacía exactamente eso y reportó dos páginas vivas como muertas antes de cambiarlo a GET siguiendo redirecciones.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.