48 de los 76 sitios que rechazan el entrenamiento de IA no escribieron ese rechazo
En tres estratos de dominios citados, 48 de los 76 rechazos al entrenamiento de IA eran un valor por defecto, y 53 de las 81 señales tecleadas lo permiten.
Un Content Signal es la única línea legible por máquina que dice qué puede hacer un sistema de IA con tu página después de leerla. Se la pedimos a tres estratos disjuntos de dominios citados. 2.002 sirvieron un robots.txt y 129 declaran una señal, y el número interesante no es ninguno de los dos: de los 76 que rechazan el entrenamiento de IA, 48 no escribieron ese rechazo, y de las 81 declaraciones que sí tecleó una persona, 53 permiten el entrenamiento.
Cualquier recuento de «la web está apagando el entrenamiento de IA» leído del robots.txt a escala está contando, en parte, la decisión de producto de un proveedor. Aquí está el tamaño de esa parte sobre una población medible.
Aviso: EchoWi vende medición de visibilidad en IA, así que un estudio sobre quién declara bien sus preferencias es un estudio con interés. El método es una petición GET a
/robots.txtpor dominio y una comprobación de si cada líneaContent-Signal:cae dentro de un bloque# BEGIN Cloudflare Managed content. La fecha es el 24 y el 25 de agosto de 2026, las tres poblaciones y todos los umbrales se escribieron antes de su primera petición, cada dominio que declara sale nombrado en nuestro registro de mediciones, y cualquiera puede repetirlo contra nosotros en un minuto.
La versión corta
-
547 dominios preguntados, 511 sirvieron un robots.txt. 26 contestaron un reto de bot, 5 no se pudieron alcanzar, 5 no tenían fichero. Esos tres van aparte, porque un reto no es un fichero ausente.
-
31 de los 511 declaran un Content Signal. Uno de cada 16, sobre una población elegida por haber sido citada en respuestas de IA.
-
10 de los 31 llevan todas sus líneas dentro de un bloque gestionado de Cloudflare. No las tecleó nadie de esos sitios.
-
Las 10 líneas gestionadas son la misma cadena, byte a byte. Un valor por defecto, no diez decisiones.
-
16 dominios rechazan el entrenamiento de IA. Para 10 de ellos, el rechazo es el valor por defecto. Ese es el hallazgo: declarar es sobre todo un acto humano y rechazar sobre todo no lo es.
-
Y entre los 21 que sí teclearon algo, hay sólo 6 redacciones distintas. Tres de ellas cubren 18 dominios. Esa parte no estaba predicha en el primer brazo y allí se reporta como observación.
-
Repetido sobre 379 dominios disjuntos, aguanta. 24 declaran, 9 son el valor por defecto gestionado, la redacción gestionada sigue siendo una sola cadena, y el recuento de redacciones, esta vez congelado como predicción, salió en 3 redacciones cubriendo 11 de 15.
-
Preguntado a una segunda convención, salen los mismos veinte sitios. De los 120 dominios que prohíben a un rastreador de IA con nombre, 20 lo hacen solo por el bloque gestionado, y 19 de esos 20 son los mismos dominios cuyo Content Signal era el valor por defecto. Una sola función de producto escribe las dos cosas.
-
El valor por defecto no es un interruptor, es una postura. Deja fuera a
GPTBot,ClaudeBotyGoogle-Extendedy no toca aOAI-SearchBot,Claude-UserniGooglebot: bloquear el entrenamiento y conservar la búsqueda, en veinte sitios que no lo escribieron. -
Y sobre un tercer estrato de 1.221 dominios citados una vez, el mecanismo se da la vuelta. Agregando los tres, 48 de los 76 sitios que rechazan el entrenamiento de IA no escribieron ese rechazo, y de las 81 declaraciones que sí tecleó una persona, 53 permiten el entrenamiento. Dos de cada tres señales tecleadas por un humano dicen que sí; la que escribe la máquina siempre dice que no.
Por qué la pregunta es la autoría y no la adopción
La convención es simple. Una línea en el robots.txt dice search=yes, o ai-train=no, o ai-input=yes, y una máquina que lea el fichero aprende qué permite el editor. Diez días antes le hicimos la misma pregunta a los proveedores de visibilidad en IA, y allí la respuesta fue 9 de 80.
Lo que cambió entre los dos estudios no es la pregunta. Es que el instrumento aprendió a hacer una segunda.
Cloudflare, que propuso la convención, puede insertar un bloque gestionado en el robots.txt de un cliente. Ese bloque lleva su propia cabecera de comentarios y su propia línea Content-Signal. Leída en plano, una declaración dentro de él se parece exactamente a una que tecleó un editor. El fichero dice lo mismo de las dos formas, y el recuento sale igual de las dos formas.
No son la misma afirmación. «Este editor decidió no permitir el entrenamiento» y «la CDN de este editor tiene un valor por defecto y el editor no lo ha cambiado» describen mundos distintos, y sólo uno de ellos es evidencia sobre lo que quieren los editores. Separarlos no cuesta nada en cuanto buscas los marcadores del bloque, y cambia el titular.
Qué preguntamos
La población son los dominios registrables que este registro tiene anotados como citados en tres o más sitios de sus mediciones, colapsando www. y los subdominios al nombre registrable. Son 547 dominios. Se preguntó a todos. No se eligió ninguno.
| Preguntados | 547 |
| Sirvieron un robots.txt | 511 |
| Contestaron un reto de bot | 26 |
| No se pudieron alcanzar | 5 |
| No sirvieron fichero | 5 |
Los tres cubos que siguen al primero se mantienen aparte a propósito. Un reto es un hecho sobre el borde y no sobre el fichero, y un anfitrión que nunca contesta es un hecho sobre nuestra lectura y no sobre el sitio. Meter cualquiera de los dos en «no declara» inflaría la mayoría silenciosa con sitios que sencillamente no leímos.
31 de los 511 declaran al menos una línea Content-Signal. Uno de cada dieciséis, y eso sobre una población elegida por haber sido citada en respuestas de IA, que si acaso escora hacia sitios que prestan atención a esto.
Un tercio de las declaraciones no las tecleó nadie
La predicción, congelada antes de la primera petición, era que el 60 por ciento o más de los dominios que declaran llevaría todas sus líneas dentro de un bloque gestionado, con un 30 por ciento o menos retirando la idea entera.
La respuesta es 10 de 31, o sea el 32 por ciento, que cae un punto por encima del umbral de retirada y se publica como lo que es: parcial, y mucho más pequeño de lo predicho. La mayoría de las declaraciones de esta población no son un valor por defecto de una CDN. Alrededor de un tercio lo son.
Merece la pena decirlo claro porque el titular contrario estaba disponible y habría sido más dramático. No es lo que dice el dato.
La segunda predicción se cumplió exacta. Las 10 declaraciones gestionadas llevan la cadena idéntica, search=yes,ai-train=no,use=reference, espaciado incluido, y en todos los ficheros que abrimos vive en la misma línea de un bloque estructuralmente idéntico. Es un valor por defecto desplegado 10 veces, no 10 sitios convergiendo en la misma redacción.
Los rechazos van al revés
La tercera predicción es donde el estudio se gana su titular.
De los 31 dominios que declaran, 16 rechazan el entrenamiento de IA: su línea contiene ai-train=no. Partido por quién la escribió:
| Rechazos tecleados fuera de un bloque gestionado | 6 |
| Rechazos que son el valor por defecto gestionado | 10 |
O sea que los dos estadísticos apuntan en direcciones contrarias sobre la misma población. Declarar es sobre todo un acto humano, y rechazar sobre todo no lo es. Dos tercios de los rechazos de esta muestra los colocó un valor por defecto que el dueño del sitio puede no haber visto nunca, y mucho menos elegido.
Nada de esto dice que esos editores estén en desacuerdo con el rechazo. Un valor por defecto puede expresar perfectamente lo que alguien quiere. Lo que no puede es servir de evidencia de que decidieron algo, y un titular de la forma «el N por ciento de los sitios ya bloquea el entrenamiento de IA» es exactamente esa clase de afirmación sobre evidencia.
Seis redacciones para veintiuna declaraciones
Esta parte no estaba predicha, y se reporta como observación y no como resultado, porque el análisis se eligió después de ver los datos.
Entre los 21 dominios que declaran fuera de un bloque gestionado hay 6 redacciones distintas, y 3 de ellas explican 18 dominios. Siete empresas sin relación publican ai-train=yes, search=yes, ai-input=yes. Seis publican los mismos tres campos en otro orden. Cinco publican ai-train=no, search=yes, ai-input=yes. Sólo 3 dominios de todo el conjunto llevan una redacción que aparece una vez.
Comprobamos si la cadena de los siete dominios es un solo gestor de contenidos emitiendo un solo fichero, porque habría sido la explicación barata. No lo es. Sus robots.txt van de 9 a 130 líneas y la línea Content-Signal cae desde la primera hasta la 132, en contextos completamente distintos.
Después comprobamos la fuente obvia, que costó una petición. contentsignals.org, el sitio de referencia de la convención, publica esa cadena exacta con ese espaciado exacto. Así que la lectura más probable es que siete editores copiaron el ejemplo, que es algo normal y razonable de hacer y tampoco es lo mismo que escribir una preferencia.
Vuelto a correr sobre una muestra en la que no se encontró
Una cifra encontrada en una muestra es una cifra sobre esa muestra hasta que aparece en otra. Así que las mismas preguntas fueron a un estrato disjunto: los 379 dominios registrables que este registro ha visto citados exactamente dos veces, que no comparten ni un miembro con los 547 de arriba. Las cuatro predicciones y sus umbrales se escribieron antes de la primera petición.
361 sirvieron un robots.txt, 12 contestaron un reto, 5 no se pudieron alcanzar, 1 no tenía fichero. 24 declaran un Content Signal.
| Brazo 1, citados 3 o más veces | Brazo 2, citados exactamente dos | |
|---|---|---|
| Dominios preguntados | 547 | 379 |
| Declarando | 31 | 24 |
| Declarantes con todo gestionado | 10, o el 32 por ciento | 9, o el 38 por ciento |
| Redacciones gestionadas distintas | 1 | 1 |
| Rechazando el entrenamiento | 16 | 19 |
| Rechazos que son el valor por defecto | 10 | 9, o el 47 por ciento |
La cuota de gestionadas replica. La predicción era del 17 al 47 por ciento, o sea a menos de quince puntos del primer brazo, y volvió en 38.
La redacción única replica. Las 9 declaraciones gestionadas del segundo brazo llevan la misma cadena que las 10 del primero.
La afirmación sobre los rechazos replica en dirección y no en el nivel predicho, y eso hay que decirlo exacto. La predicción escrita era «la mitad o más», y 9 de 19 es el 47 por ciento, así que se incumple por un dominio. El umbral de retirada era uno de cada cinco, y no está ni cerca. Así que la frase honesta es que el valor por defecto explica cerca de la mitad de los rechazos en los dos brazos, no la mayoría.
Y el recuento de redacciones, que ayer era una observación, se congeló como predicción y aguantó. En el segundo brazo, 15 dominios declaran fuera de un bloque gestionado usando 7 redacciones, y las 3 más comunes cubren 11 de ellos, o el 73 por ciento, contra un umbral de la mitad. Agregando sólo esa afirmación, porque es la única que los dos brazos hacen sobre el mismo objeto: 36 declaraciones tecleadas, 10 redacciones distintas, 3 de las cuales cubren 28.
La redacción tecleada más común de los dos brazos no es la permisiva. Es ai-train=no, search=yes, ai-input=yes, en 11 dominios sin relación, byte a byte.
La misma pregunta a un segundo fichero, y los mismos veinte sitios
Un Content Signal es una línea de una convención joven. La forma antigua de decirle a un rastreador de IA que no entre es una regla Disallow con el rastreador nombrado, y lleva años disponible. Si la autoría es una propiedad real y no un artefacto de una convención, tiene que aparecer también allí.
Así que los mismos 870 ficheros servidos se leyeron otra vez, esta vez para el veredicto que catorce rastreadores de IA con nombre reciben en la raíz del sitio, y una segunda vez con el bloque gestionado quitado, para ver qué veredictos producen las líneas propias del sitio.
| Brazo 1 | Brazo 2 | |
|---|---|---|
| Dominios que sirven robots.txt | 510 | 360 |
| Prohíben al menos a un rastreador de IA | 82 | 38 |
| De esos, el bloqueo es solo el texto gestionado | 10 | 10 |
| Dominios que no nombran a ningún rastreador de IA | 349 | 271 |
La predicción, escrita antes de la petición, era que como mucho uno de cada cinco bloqueadores sería el valor por defecto, razonando que un Disallow con nombre es un acto más viejo y más deliberado que una línea de señal. Salió al 12 % en el primer brazo, cómodamente dentro.
El número estaba bien y el razonamiento estaba mal, que es peor que estar equivocado, porque nadie lo vuelve a revisar.
Los veinte dominios cuyo bloqueo de rastreadores es solo el texto gestionado son, diecinueve de ellos, los mismos dominios cuyo Content Signal es solo el texto gestionado. No una población parecida. La misma lista. Así que la diferencia entre el 12 % de los bloqueadores y el 32 % de los declarantes no es un hecho sobre que las reglas Disallow sean más deliberadas que las líneas de señal. Son los mismos veinte sitios divididos por dos denominadores distintos.
Qué dice de verdad el valor por defecto
Este es el bloque, de uno de los veinte, sin quitar nada:
# BEGIN Cloudflare Managed content
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
User-agent: Amazonbot
Disallow: /
...
User-agent: Google-Extended
Disallow: /
User-agent: GPTBot
Disallow: /
User-agent: meta-externalagent
Disallow: /
# END Cloudflare Managed Content
Permite todo a todos, y a continuación nombra a nueve rastreadores y cierra la puerta a cada uno. Léase la lista y es una postura, no un interruptor: GPTBot fuera y OAI-SearchBot no. ClaudeBot fuera y Claude-User no. Google-Extended fuera y Googlebot no.
Eso es bloquear el entrenamiento y conservar la búsqueda, expresado de forma idéntica en veinte sitios de dos estratos disjuntos, y ninguno de los veinte lo escribió.
Si esos editores están de acuerdo con ello es otra pregunta que esto no puede contestar, y un valor por defecto puede reflejar perfectamente lo que quiere el dueño del sitio. Lo que ve nuestro instrumento es quién tecleó la línea, y es lo único que vamos a afirmar con él.
Por qué importa que el valor por defecto tenga opinión
Cualquier lectura de estos ficheros que los trate como preferencia expresada tiene ahora un suelo debajo. No porque los editores sean descuidados, sino porque la capa es lo bastante pequeña como para que una sola función de producto la mueva.
Hay un efecto de segundo orden que merece nombrarse, y apunta al lado contrario de la preocupación habitual. Este registro mide, sobre la misma población, que los rastreadores de entrenamiento se rechazan mucho más a menudo que los de búsqueda. El valor por defecto gestionado es una política de bloquear el entrenamiento y conservar la búsqueda, así que parte de esa diferencia podría ser el defecto y no la web. Quitando el texto gestionado y volviendo a contar, la diferencia se estrecha y aguanta: GPTBot pasa de 3,4 veces OAI-SearchBot a 2,6, y ClaudeBot de 2,5 veces Claude-User a 1,9.
La dirección es de la web. Parte del tamaño era del proveedor.
El confusor que el diseño nombró por delante
Un dominio citado dos veces es un estrato menos citado que uno citado tres o más, y los dos brazos difieren en algo que el diseño no predijo: 19 de 24 declarantes rechazan el entrenamiento en el segundo brazo, contra 16 de 31 en el primero. Eso es un 79 por ciento contra un 52.
Este diseño no puede decir si eso es el estrato, el tipo de sitio o el azar sobre números pequeños. Va escrito aquí en vez de explicado, porque una diferencia de este tamaño merece nombrarse aunque el estudio que la encontró no pueda resolverla.
Qué puede y qué no puede significar «tecleada»
Éste es el límite que importa, y el recuento de redacciones de arriba es lo que lo hace medible en vez de retórico.
Nuestro instrumento separa las líneas dentro de un bloque gestionado de Cloudflare de las que están fuera. Es una distinción real y es exactamente lo que permiten ver los marcadores del bloque. Es más estrecha que la autoría. Una línea pegada de un sitio de referencia, una línea añadida por un plugin, una línea heredada de una plantilla cuentan todas como tecleadas, porque ninguna vive en un bloque gestionado.
Así que 21 es un techo del número de declaraciones con autor en esta muestra, no una estimación. El suelo, si tratas cada redacción repetida como copiada, es 3. La verdad está en medio, y ninguna lectura del robots.txt por sí sola puede localizarla.
Preferimos publicar ese rango que el techo con una etiqueta segura encima.
Lo que cuesta el veredicto en la raíz, medido
El límite de abajo dice que aquí un veredicto de rastreador es el veredicto en la raíz del sitio, y que un dominio siempre podría prohibir a un rastreador en una sección. Eso merece un número y no una salvedad, y el número salió de los ficheros que el barrido ya tenía, así que no costó ninguna petición.
Los 120 bloqueadores usan un Disallow: / a secas. Ni uno acota el bloqueo a una sección. En eso coincidieron dos rutas, el parser y un barrido de texto de los grupos hecho a mano, que es como este registro comprueba una afirmación con la que piensa liderar.
La otra mitad son los dominios que dejan pasar a todos los rastreadores de IA en la raíz. Son 750, y a cada uno se le pusieron diez rutas corrientes: secciones de artículo y de blog, una página de búsqueda, un prefijo de API y un fichero subido.
| De los 750 que permiten a todos los rastreadores en la raíz | |
|---|---|
| Prohíben a alguno en una ruta probada | 130 |
| …donde la misma regla frena también a Googlebot | 114 |
| …donde Googlebot pasa y el rastreador de IA no | 16 |
Esa fila de en medio es todo el asunto. Una regla de ruta que también frena a Googlebot es una regla de robots corriente sobre una sección, no una política sobre IA, y contarlas juntas reporta 130 bloqueos de IA por ruta donde hay 16. Un barrido que no preguntara si la regla es específica de IA exageraría esta capa por ocho.
Los 16 son /api/, /search y /wp-content/uploads/: infraestructura, no editorial. Así que el veredicto en la raíz es la respuesta entera para todos los bloqueadores, y se deja alrededor de uno de cada cincuenta del resto, en rutas donde nadie publica artículos.
Diez rutas son diez rutas, así que 16 es un suelo y no un recuento.
Un tercer estrato, y la tasa de bloqueo cae con la profundidad de citación
Los dos brazos de arriba eran 547 y 379 dominios. El 25 de agosto leímos los mismos dos ficheros para los 1.221 dominios registrables que nuestro registro ha visto citados exactamente una vez, un estrato disjunto de los dos y más grande que los dos juntos. Los mismos catorce agentes, el mismo detector de bloque gestionado, el mismo día que su gemelo de llms.txt.
| De los dominios que sirvieron un robots.txt | Citados 3+ | Citados dos veces | Citados una vez |
|---|---|---|---|
| Sirvieron | 510 | 360 | 1.132 |
| Prohíben a uno de los diez publicados | 15,5 % | 10,3 % | 9,0 % |
| Nombran alguna regla de rastreador de IA | 32 % | 25 % | 27 % |
| De los bloqueadores, valor por defecto gestionado | 12 % | 26 % | 28 % |
La tasa de bloqueo cae de forma monótona con cuánto hemos visto citado a un dominio, y la de nombrado no. Tres estratos disjuntos, un instrumento, un día. Es lo contrario de lo que predice la historia de que bloquear te cuesta citaciones, y no es una afirmación causal: la lectura obvia es que los dominios que vemos citados más a menudo son editores grandes, y los editores grandes son los que tienen una posición legal sobre el entrenamiento de IA.
Y la parte del bloqueo que no tecleó nadie va en la otra dirección. Entre los sitios que bloquean, la proporción cuyo bloqueo es enteramente el valor por defecto gestionado va 12, 26 y 28 % según el estrato está menos citado. O sea que cuanto más adentro de la cola miras, más parte del rechazo de la web es la decisión de producto de una CDN y no la decisión de un editor, que es el hallazgo de este artículo medido sobre una población en la que no se encontró.
Contra los umbrales que este estudio congeló antes de su primera petición: la tasa de los diez publicados cae en el 9,0 %, por debajo del límite inferior de 11,6 del intervalo alrededor del 20 % publicado originalmente, así que esa cifra no describe este estrato y el artículo lo dice en vez de promediarlo. El control de Googlebot pasa con 1.130 de 1.132, y el agente más bloqueado vuelve a ser de entrenamiento, CCBot con 80.
El estrato de la cola, y dos de cada tres señales tecleadas dicen que sí
El estudio publicado leyó dos estratos. El tercero se congeló antes de la primera petición, sobre los 1.221 dominios registrables que este registro tiene citados exactamente una vez, disjuntos de los dos brazos de arriba, y se eligió porque la mitad de rastreo de esta misma pieza acababa de medir un gradiente: la cuota gestionada de los bloqueadores sube según baja la citación. Si esa forma es de la web y no de una convención, tenía que aparecer también aquí.
| Predicho | Umbral | Medido | |
|---|---|---|---|
| Cuota de declarantes | 4 a 9 % | fuera de la banda | 6,5 %, 74 de 1.130 |
| Gestionadas sobre declarantes | 40 % o más | 30 o menos lo mata | 39 %, parcial |
| Gestionadas sobre los que rechazan | 45 % o más | 25 o menos retira el titular | 71 %, 29 de 41 |
| Tres redacciones tecleadas mayores | la mitad o más | 73 %, 33 de 45 |
La adopción replica tres veces y casi al decimal. 6,1 %, 6,6 y 6,5, en tres estratos disjuntos que van de una citación a más de tres. Escribir un Content Signal no es propiedad de cuánto te citan.
La segunda predicción se quedó a una décima de su umbral y se publica como parcial. El listón era 40 y la cifra es 39,2. La dirección es monótona, 32, 38 y 39, y la fuerza no llega, así que el gradiente no se puede dar por cruzado de convención. Redondear 39,2 a «prácticamente 40, confirmado» habría sido elegir la lectura después de ver el dato.
La cuarta aguantó en el 73 % exacto del segundo brazo, que es la segunda vez que una predicción ascendida de una observación posterior vuelve a cumplirse sobre una muestra en la que no se encontró.
El hallazgo que el diseño no predijo
Agregando los tres estratos disjuntos, el estudio dice algo que con uno solo no podía decir: de 2.002 dominios que sirven robots.txt, 129 declaran un Content Signal, 76 de ellos rechazan el entrenamiento de IA, y 48 de esos 76 no escribieron ese rechazo.
Ahora dale la vuelta. 81 de las declaraciones las tecleó una persona, y 53 de esas 81 permiten el entrenamiento de IA.
Dos de cada tres señales que teclea un humano dicen que sí. La que escribe una máquina siempre dice que no. El valor por defecto emite una sola cadena y esa cadena es un rechazo, así que toda declaración gestionada rechaza: satura a los que rechazan y se diluye entre los declarantes. Es exactamente por eso que la segunda predicción salió parcial y la tercera salió alta, y el diseño congelado decía por adelantado que ese reparto significaría que la diferencia está en qué se declara y no en quién lo declara.
Así que un recuento de «la web está apagando el entrenamiento de IA», leído del robots.txt a esta escala, mide la decisión de producto de un proveedor más que una opinión. La gente que se molesta en teclear una preferencia dice mayoritariamente que pasen.
Qué hizo el instrumento, dicho en voz alta
El barrido se corrió tres veces el mismo día, porque repetirlo no cuesta nada. Declarantes 74, gestionadas 29, tecleadas 45, rechazos 41 y redacciones gestionadas 1, las tres veces. Lo único que se movió es el denominador, 1.131, 1.132 y 1.130, con uno o dos anfitriones parpadeando entre contestar y no. Un estadístico cuyo numerador se repite tres veces y cuyo denominador oscila dos vale mucho más que una lectura sola.
El recuento de rechazos es un suelo por exactamente uno, y el detector se dejó como estaba a propósito. Un sitio escribe indexed-content=allow, ai-training=disallow, ai-search=allow, que no son las claves que define Content Signals: la especificación conoce search, ai-input y ai-train. Nuestro detector busca ai-train=no, así que esa fila no cuenta como rechazo aunque la intención es evidente. Ensanchar el detector movería los dos brazos publicados sin que nadie sepa cuántas de sus filas usan otro vocabulario, así que se declara la excepción en vez de hacerlo.
Y una cosa más que sólo escribe una persona: un sitio publica ai-train=si, el valor en español dentro de una especificación que sólo conoce yes y no. Una máquina no comete esa errata. Es la evidencia más barata que hay de que las 45 declaraciones tecleadas las tecleó alguien.
Qué no enseña esto
Dos convenciones, dos días, tres poblaciones. 547 dominios citados tres o más veces, 379 citados exactamente dos y 1.221 citados exactamente una vez, leídos el 24 y el 25 de agosto de 2026, y los tres elegidos por citación, así que ninguno es una muestra de la web y ninguna cuota de aquí se traslada a una.
Declarar no es cumplir, y no declarar no es bloquear. Un Content Signal expresa una preferencia. No fuerza nada, un rastreador es libre de ignorarlo, y los 1.873 dominios que no declaran nada no han negado nada por ello. El silencio es silencio.
Un valor por defecto gestionado no es un desacuerdo. Podemos ver quién tecleó la línea. No podemos ver si el editor está de acuerdo con ella, si activó la función a propósito, ni si ha leído alguna vez su propio robots.txt.
Un robots.txt es lo que sirve el borde, no lo que contiene el repositorio. Esto lo sabemos por experiencia: una declaración nuestra fue invisible para un barrido porque una CDN seguía sirviendo una versión cacheada con un año de TTL.
Los dos brazos difieren en algo que ninguno predijo. El estrato menos citado rechaza el entrenamiento mucho más a menudo, 19 de 24 declarantes contra 16 de 31, y este diseño no puede decir si eso es el estrato, el tipo de sitio o el azar sobre números pequeños.
Un veredicto de rastreador aquí es el veredicto en la raíz del sitio. Un dominio que permite a GPTBot en / puede prohibirlo en una sección, y uno contado como bloqueador puede permitir una ruta que no preguntamos. La raíz es la pregunta comparable entre 870 ficheros; no es el fichero entero. Lo que eso cuesta está medido arriba en vez de quedarse en una salvedad.
Y no hemos medido si algo de esto cambia la citación. Nada de aquí conecta una declaración con salir citado más o menos a menudo. Eso necesita otro diseño, y decirlo sale más barato que insinuar el vínculo.
Qué debería llevarse un editor
Si tienes un Content Signal que no escribiste, tienes una postura declarada sobre el entrenamiento de IA que no elegiste. Eso vale treinta segundos: abre tu propio /robots.txt, busca Content-Signal, y mira si la línea vive dentro de un bloque cuyo comentario nombra a tu CDN.
Si es así, la decisión sigue estando disponible. Conviértela en tu propia línea, o deja el valor por defecto puesto a propósito. Cualquiera de las dos está bien. Lo que no está bien es enterarte por el estudio de otro.
Y si estás leyendo un titular sobre cuánta web ha apagado el entrenamiento de IA, la pregunta que hay que hacer es la que este estudio existe para hacer: ¿cuántos lo teclearon?
La misma disciplina es lo que separa una cifra de visibilidad accionable de una que no lo es. Saber que un asistente te nombró no es saber que citó tu página, y saber que una preferencia está declarada no es saber que la declaró una persona. Esa distinción es lo que mide nuestra plataforma, una superficie y un mercado cada vez, y es la razón de que este estudio se pudiera correr.
Todas las cifras de aquí están al lado de todas las demás mediciones que publicamos, cada una con su fecha, su población y su método, en nuestro registro de mediciones.
Preguntas frecuentes sobre quién declara las preferencias de IA
¿Qué es un Content Signal?
Una línea en el robots.txt que declara qué pueden hacer los sistemas automáticos con una página después de descargarla. El vocabulario viene de un estándar propuesto en el IETF por el grupo de trabajo de AI Preferences, y los campos de uso común son search, ai-input y ai-train, cada uno en sí o no. Expresa una preferencia y no fuerza nada.
¿Cuántas webs declaran uno?
31 de los 511 dominios que pudimos leer, el 24 de agosto de 2026. Es aproximadamente 1 de cada 16, sobre una población de 547 dominios registrables elegidos por haber sido citados en respuestas de IA. No es una muestra de la web, y una cuota medida sobre otra población sería otra cifra.
¿Puede una CDN añadir un Content Signal a mi robots.txt?
Sí, y 10 de las 31 declaraciones que encontramos son exactamente eso. Cloudflare puede insertar un bloque gestionado en el fichero que sirve, marcado con un comentario # BEGIN Cloudflare Managed content, y la línea Content-Signal de dentro es un valor por defecto de la plataforma y no algo que escribiera el dueño del sitio. Las 10 de esta muestra llevan la cadena idéntica.
¿Cómo sé si escribí yo mi Content Signal?
Abre tu propio /robots.txt y mira qué rodea a la línea. Si vive entre comentarios que nombran un bloque gestionado, la colocó tu CDN. Si vive entre tus propias reglas, alguien de tu sitio la puso ahí, aunque eso siga sin decirte si la escribió o la pegó de una página de referencia.
¿Rechazar el entrenamiento de IA en el robots.txt lo impide de verdad?
No, y nada de este estudio mide el cumplimiento. Un Content Signal es una preferencia declarada en un fichero que los rastreadores pueden leer y pueden ignorar. Lo que sí te da es un registro público, fechado y legible por máquina de lo que pediste, que es una cosa distinta y más modesta que la imposición.
¿Por qué importa quién tecleó la línea?
Porque un recuento de preferencias declaradas se está leyendo como evidencia de la intención de los editores. En esta población, declarar es sobre todo un acto humano y rechazar sobre todo no lo es: 10 de los 16 rechazos son la misma cadena por defecto. Cualquier conclusión de la forma «los editores se están volviendo contra el entrenamiento de IA» tiene que restar los que no eligió nadie.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.