Pedimos la misma reserva de hotel de cuatro formas. En España la cifra casi no se movió y no sobrevivió ni una fuente.
Una intención, cuatro redacciones, dos mercados. En España la cuota estable se mantuvo entre el 30% y el 48% y ningún dominio sobrevivió a las cuatro.
Cogimos una pregunta, cómo reservar un hotel, y la hicimos de cuatro formas distintas en Estados Unidos y de cuatro formas distintas en España. En España la cuota estable salió al 42%, 41%, 48% y 30%, que parece una medición fiable de una categoría. De esas cuatro redacciones, el número de fuentes que sobrevivió a las cuatro fue cero.
Ese es el hallazgo, y es peor que la inestabilidad. Una métrica que se mueve te avisa de que no puedes fiarte. Esta se queda quieta mientras lo que hay debajo se sustituye entero.
Aviso: EchoWi vende medición de visibilidad en IA y este estudio contradice algo que publicamos cinco días antes. La respuesta a un conflicto de interés es un método que se pueda comprobar, así que las cuatro redacciones, los dos mercados, las tres superficies, el número de pasadas y la fecha están todos abajo, y cada fila está en nuestro registro público de mediciones.
La versión corta
- En España la cifra aguantó y las fuentes no. Cuatro redacciones devolvieron 42%, 41%, 48% y 30% de estabilidad. Entre las cuatro, cero dominios aparecieron en todas las pasadas de todas las redacciones.
- En Estados Unidos reformular movió la cifra 57 puntos, del 92% al 35%, sin cambiar nada más que las palabras.
- Nuestro mejor resultado publicado no sobrevive a esto. El estudio de viajes encontró 24 dominios aguantando entre pasadas y lo llamó un núcleo sobre el que trabajar. Pregunta lo mismo de cuatro formas y el núcleo son tres dominios:
reddit.com,youtube.comyfrommers.com. - La sensibilidad a la redacción también depende del mercado. La pregunta americana osciló 57 puntos entre redacciones. La española, 18.
- Una de las redacciones no consiguió producir un AI Overview de forma fiable, en ninguna de las dos sesiones, y eso es un hecho sobre esa frase y no sobre la superficie.
Qué medimos
| Intención | Reservar un hotel, constante |
|---|---|
| Redacciones | 4 por mercado, en el idioma del mercado, cada una como la formula alguien de verdad |
| Mercados | Estados Unidos e inglés, España y español, fijados de forma explícita |
| Superficies | Google AI Overview, Google AI Mode y Gemini, agrupadas por redacción |
| Pasadas | 2 por redacción, anotadas por redacción y no supuestas |
| Caché | Saltada. Cada pasada es una llamada nueva |
| Fecha | 10 de agosto de 2026 |
Las cuatro redacciones españolas fueron «¿cuál es la mejor web para reservar hoteles?», «¿dónde reservo un hotel por internet?», «¿qué web de reservas de hotel es más fiable?» y «mejor web para ofertas de hotel baratas». Las cuatro inglesas son sus equivalentes. Las ocho están en el registro con el prompt tal y como se envió.
Dos filas llevan una nota en vez de una lectura limpia, y las dos están en el registro. La segunda redacción inglesa se midió dos veces porque su primera sesión parecía rota; no lo estaba, y se publican las dos sesiones. La tercera redacción española paró tras una sola pasada en su primer intento, lo que vuelve trivialmente estable a cualquier fuente, así que ese intento queda fuera de todas las cifras de aquí y se conserva en el registro porque ocurrió.
Este diseño tiene un único propósito: atacar nuestra propia afirmación publicada más fuerte. Hace cinco días contamos que una pregunta americana de hoteles retuvo 24 de 25 fuentes entre pasadas, luego 24 de 26 en una segunda sesión, los mismos veinticuatro dominios por nombre, y escribimos que seis o siete fuentes estables son un brief y veinticuatro son un mapa. Este estudio pregunta de qué es mapa.
Las ocho celdas
| Mercado | Redacción | Cuota estable | Citadas | Aguantan |
|---|---|---|---|---|
| Estados Unidos | «what is the best website to book hotels» | 92% | 24 | 22 |
| Estados Unidos | «which hotel booking site is most reliable» | 83% | 18 | 15 |
| Estados Unidos | «best site for cheap hotel deals» | 58% | 31 | 18 |
| Estados Unidos | «where should I book a hotel online» | 35% | 20 | 7 |
| España | «¿qué web de reservas de hotel es más fiable?» | 48% | 25 | 12 |
| España | «¿cuál es la mejor web para reservar hoteles?» | 42% | 31 | 13 |
| España | «¿dónde reservo un hotel por internet?» | 41% | 27 | 11 |
| España | «mejor web para ofertas de hotel baratas» | 30% | 20 | 6 |
| citadas en cada pasada | fuentes distintas citadas | |
|---|---|---|
| EE.UU. · best website | 22 | 24 |
| EE.UU. · most reliable | 15 | 18 |
| EE.UU. · cheap deals | 18 | 31 |
| EE.UU. · where should I | 7 | 20 |
| España · más fiable | 12 | 25 |
| España · mejor web | 13 | 31 |
| España · dónde reservo | 11 | 27 |
| España · ofertas baratas | 6 | 20 |
Los dos bloques se leen distinto, porque fallan de dos maneras distintas. El bloque americano es una caída de 57 puntos que cualquier panel enseñaría como un problema. El español son cuatro cifras dentro de una banda de 18 puntos, que cualquier panel enseñaría como una categoría comportándose de forma consistente.
El bloque español es el peligroso
Cuatro redacciones, 42%, 41%, 48%, 30%. Si midieras una de ellas cada semana, reportarías una cifra estable alrededor del 40% y nadie la cuestionaría.
Ahora cuenta las fuentes en vez del porcentaje.
| Dominios que aguantaron | Compartidos con la fila de arriba | |
|---|---|---|
| «¿cuál es la mejor web para reservar hoteles?» | 13 | |
| «¿dónde reservo un hotel por internet?» | 11 | 4 |
| «¿qué web de reservas de hotel es más fiable?» | 12 | 4 |
| «mejor web para ofertas de hotel baratas» | 6 | 2 |
Entre las cuatro redacciones españolas, el número de dominios que aguantó en todas las pasadas de todas ellas es cero. Sesenta y un dominios distintos aparecieron en algún punto de las ocho pasadas españolas. Ninguno estuvo de forma fiable en las cuatro maneras de preguntar.
Los solapamientos por pares dicen lo mismo con más precisión. Medidos como intersección sobre unión, las cuatro redacciones españolas comparten entre 0,06 y 0,32 de sus conjuntos estables. Las dos más parecidas, con 0,32, siguen discrepando en dos tercios de lo que citan.
Así que la descripción honesta del resultado español es: la cifra es una propiedad de la categoría y las fuentes son una propiedad de la frase. Son dos hechos distintos y solo el segundo te dice qué página escribir.
El bloque americano, y lo que nos cuesta
Las redacciones americanas caen del 92% al 35%, y la lectura tentadora es que algunas redacciones son simplemente peores. Las fuentes tampoco dicen eso.
Entre las cuatro redacciones americanas aparecieron 53 dominios distintos. Tres aguantaron en todas las pasadas de todas ellas: reddit.com, youtube.com y frommers.com. Por pares, los conjuntos estables comparten entre 0,16 y 0,38.
Hace cinco días publicamos que la pregunta americana de hoteles devolvió los mismos veinticuatro dominios en dos sesiones separadas y que veinticuatro fuentes estables son un mapa sobre el que trabajar. Aquella medición era correcta y la repetiríamos. Lo que enseña este estudio es que el mapa es el mapa de una frase. Cambia la frase por otra que un cliente teclearía igual de bien, y veintiuno de aquellos veinticuatro dejan de ser fiables.
No retiramos la cifra anterior. La acotamos, que es lo que un proveedor de esta categoría casi nunca le hace a su mejor número.
La sensibilidad a la redacción tampoco es constante
Los dos mercados no solo se diferencian en nivel, se diferencian en cuánto importa la redacción.
| Amplitud entre cuatro redacciones | |
|---|---|
| Estados Unidos | 57 puntos, del 92% al 35% |
| España | 18 puntos, del 48% al 30% |
Es la misma forma que encontró el estudio de viajes al variar el mercado en vez de las palabras: dos preguntas a tres puntos en Alemania y a 53 en Estados Unidos. Los dos estudios aterrizan en el mismo sitio desde direcciones opuestas. Ni el mercado, ni la vertical, ni la pregunta, ni la redacción son un coeficiente que se aplique. Cada combinación es su propia medición, y la única forma de conocer una celda es medir esa celda.
Hay además un detalle práctico que vale más de lo que parece. La redacción «where should I book a hotel online» produjo un AI Overview en solo una de dos pasadas, en las dos sesiones que lanzamos. Algunas maneras de preguntar no disparan esa superficie de forma fiable, y un informe que agrupa superficies enseñará eso como poca visibilidad en vez de como inventario ausente.
Qué no demuestra este estudio
- Una intención, dos mercados, ocho celdas comparables. Cada porcentaje tiene un denominador de veintitantos o treinta y tantos.
- Dos pasadas, no tres. «Citada en cada pasada» es un listón más fácil con dos pasadas, así que estas cifras no son comparables con mediciones de tres, incluidas partes de nuestro estudio de agencias, que midió ese efecto en unos diez puntos.
- Cuatro redacciones no son el espacio de redacciones. Elegimos cuatro que un comprador reconocería. Otras cuatro darían otras cifras, y eso es el punto y no un defecto. Conviene añadir que una parte creciente de las frases que llegan a una web no las teclea un comprador, las ensambla un programa, que es como el prompt de sistema de un competidor apareció en nuestro Search Console.
- Tres superficies, no cuatro. ChatGPT queda fuera porque la vía que usamos no devuelve lista de fuentes para él, y publicar eso como un cero sería publicar nuestro instrumento. Yendo directo a la interfaz sí se puede medir, y ahí encontramos que ChatGPT no citó ninguna fuente en 39 de 40 respuestas de una categoría entera, que es un hecho sobre esa categoría y no sobre nuestra ruta.
- Una sesión por celda, salvo dos. La segunda redacción inglesa tiene dos sesiones y la tercera española tiene un primer intento descartado. Las dos se nombran arriba y las dos están en el registro.
- No comprobamos si las redacciones son igual de frecuentes. El volumen de búsqueda te diría por qué frase optimizar; este estudio solo te dice que la elección importa.
- Nada de esto es causal. Cambiamos las palabras y anotamos lo que volvió, sin intervenir en ninguna página.
Preguntas frecuentes sobre este estudio
¿Reformular una pregunta cambia qué fuentes cita una IA?
Sí, y más que cambiar de país. Preguntar por la reserva de hotel de cuatro formas en Estados Unidos movió la cuota de fuentes citadas en cada pasada del 92% al 35%, y solo 3 dominios de 53 aguantaron en las cuatro redacciones. En España, 0 dominios de 61 aguantaron en las cuatro.
Si el porcentaje se mantiene, ¿mi visibilidad en IA es estable?
No necesariamente, y esta es la trampa que el estudio se construyó para enseñar. Cuatro redacciones españolas devolvieron 42%, 41%, 48% y 30%, una banda lo bastante estrecha como para parecer una medición fiable, sin compartir un solo dominio entre las cuatro. Que una cifra se quede quieta no es prueba de que las fuentes que la sostienen sean las mismas.
¿Cuántos prompts debería seguir por pregunta?
Más de una redacción, y cuántas depende del mercado. Sobre la misma intención, las redacciones americanas se abren 57 puntos y las españolas 18, así que un solo prompt es un proxy mucho peor en Estados Unidos que en España. No hay número universal, y por eso publicamos las celdas en vez de una regla.
¿Esto contradice vuestro estudio de viajes anterior?
Lo acota. Aquel estudio reportó una pregunta americana de hoteles reteniendo 24 de 25 fuentes y repitiendo con 24 de 26 y los mismos dominios, y esa medición sigue en pie. Este enseña que esos veinticuatro son propiedad de esa frase exacta: al reformularla sobreviven tres. Los dos resultados están en el registro y la cifra anterior no se ha tocado.
¿Qué superficies de IA se midieron?
Google AI Overview, Google AI Mode y Gemini, agrupadas por redacción, con la caché saltada para que cada pasada sea una llamada nueva. ChatGPT falta a propósito: la vía usada aquí no devuelve lista de fuentes para él, y un cero producido por un instrumento es indistinguible de un cero real.
¿Dónde puedo ver las filas en crudo?
En nuestro registro de mediciones, que lleva las diez filas de este estudio con cada prompt tal y como se envió, su mercado, sus superficies, su número de pasadas y su fecha, incluidas las dos filas excluidas o marcadas y el motivo de cada una.
Dónde te deja esto
Si le reportas visibilidad en IA a alguien, la instrucción de este estudio es corta. Sigue la frase, no el tema, y sigue más de una frase por tema. Un solo prompt te da un número que es real para ese prompt y te dice muy poco del siguiente, incluso cuando el siguiente significa lo mismo para un lector humano.
Y si una herramienta te enseña un porcentaje estable semana tras semana, pregúntale de qué dominios está hecho ese porcentaje. En nuestro bloque español el porcentaje habría parecido correcto durante un mes. Debajo, cuatro maneras de preguntar una cosa no compartían ni una sola fuente fiable.
Publicamos el resultado de los veinticuatro dominios hace cinco días y lo seguimos sosteniendo. Esto es lo que vale, medido contra la única prueba que importaba: preguntar lo mismo con palabras que no habíamos usado.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.