Preguntamos a la IA por la mejor agencia diecinueve veces en cuatro mercados. Casi todo lo que citó había desaparecido en la pasada siguiente.
Diecinueve preguntas de compra, cuatro mercados, tres superficies, 46 pasadas. De 408 fuentes citadas, el 58% salió una sola vez y un tercio aguantó siempre.
Lanzamos diecinueve preguntas del tipo «cuál es la mejor agencia para X» a tres superficies de IA en cuatro mercados. Entre todas citaron 408 fuentes. Doscientas treinta y ocho de ellas, el 58%, aparecieron en una sola pasada y ya no estaban en la siguiente.
Ese es el número que una agencia necesita antes de meter una cifra de visibilidad en IA en un informe de cliente, porque decide qué significa la cifra. Una fuente citada una vez no es una posición en la respuesta. Es una moneda que ha salido cara.
Aviso: EchoWi vende medición de visibilidad en IA y compite en esta categoría. Eso es un conflicto, y la respuesta a un conflicto es un método comprobable y no una promesa de neutralidad. Abajo está todo lo necesario para repetirlo, incluso en contra nuestra: las preguntas, las superficies, los mercados, el número de pasadas y las fechas.
La versión corta
- De 408 fuentes citadas, 238 salieron exactamente una vez. Es el 58%. También era el 58% cuando este estudio tenía cuatro preguntas menos y dos mercados menos, que es lo más tranquilizador que contiene.
- Un tercio largo aguantó en todas las pasadas. 129 de 408, el 32%. Ese tercio es la única parte de una respuesta de IA sobre la que merece la pena construir una estrategia.
- La cifra se mueve 10 puntos solo por el número de pasadas. Las preguntas que corrieron dos veces dan un 37% estable; las que corrieron tres, un 27%. Mismo método, mismas superficies, misma semana.
- El mercado cambia la respuesta, pero no de forma fiable. De cuatro comparaciones emparejadas por vertical y por número de pasadas, dos difieren en 15 y 35 puntos y dos difieren en 3 y 2.
- No consigues las pasadas que pides. Diez de las diecinueve preguntas descansan en dos pasadas o en una, porque la medición se paró antes y lo dijo. Anotar lo que corrió en vez de lo que se pidió es la diferencia entre un denominador y un deseo.
Qué medimos
| Preguntas | 19, todas del tipo «cuál es la mejor agencia de marketing para [vertical]», en el idioma de cada mercado. 18 llevan cifra de estabilidad; una devolvió una sola pasada y queda fuera de todos los porcentajes |
|---|---|
| Verticales | Hoteles, despachos de abogados, clínicas, ecommerce, salud, SaaS B2B, SEO de marca blanca y educación superior |
| Superficies | Google AI Overview, Google AI Mode y Gemini, agrupadas por pregunta |
| Mercados | Estados Unidos e inglés, España y español, Francia y francés, Alemania y alemán, fijados de forma explícita |
| Pasadas | 46 en total, 45 en el análisis, de 1 a 3 por pregunta, anotadas por pregunta y no supuestas |
| Caché | Saltada. Cada pasada es una llamada nueva |
| Fechas | 9 y 10 de agosto de 2026 |
Tres cosas de esa tabla deciden si algo de esto significa algo.
El mercado se fija de forma explícita en cada pasada. La medición viene por defecto en Estados Unidos e inglés. Una pregunta en francés dejada por defecto la responde el mercado americano y nada en la salida lo dice, lo que habría producido cuatro resultados sospechosamente parecidos y una conclusión completamente equivocada.
El número de pasadas es el que corrió de verdad. Diez preguntas devolvieron menos pasadas de las pedidas y la herramienta lo dijo. Escribir tres ahí habría inventado un tercio de un denominador, y inventar denominadores es justo el fallo contra el que existe este registro. Cada pregunta de abajo es una fila del registro de mediciones con el número que volvió, no con el que pedimos. También significa que las preguntas de dos pasadas y las de tres no son directamente comparables, y eso resultó ser lo más útil del estudio.
ChatGPT no está. Es la superficie por la que más preguntan y la que menos podemos defender midiendo por esta vía, porque la ruta que usamos no devuelve su lista de fuentes. Un cero de instrumento es indistinguible de un cero real, así que se queda fuera en lugar de publicarse como ausencia.
Cuánto de una respuesta de IA se queda quieto
Agrupa las tres superficies por pregunta y tienes un conjunto de dominios citados. Sepáralo en los que están en todas las pasadas, los que están en exactamente una, y los del medio:
| Fuentes | Sobre 408 | |
|---|---|---|
| Citadas en todas las pasadas | 129 | 32% |
| Citadas más de una vez, no siempre | 41 | 10% |
| Citadas exactamente una vez | 238 | 58% |
| citadas siempre | fuentes distintas citadas | |
|---|---|---|
| EE.UU. · abogados, 2 pasadas | 13 | 20 |
| España · hoteles, 2 pasadas | 9 | 16 |
| Francia · clínicas, 2 pasadas | 8 | 16 |
| EE.UU. · SaaS B2B, 2 pasadas | 7 | 19 |
| EE.UU. · hoteles, 3 pasadas | 6 | 17 |
| España · ecommerce, 3 pasadas | 9 | 28 |
| EE.UU. · SEO marca blanca, 2 pasadas | 8 | 25 |
| Francia · abogados, 3 pasadas | 7 | 22 |
| Francia · ecommerce, 2 pasadas | 9 | 29 |
| EE.UU. · salud, 2 pasadas | 6 | 20 |
| EE.UU. · ecommerce, 3 pasadas | 7 | 24 |
| Alemania · abogados, 2 pasadas | 7 | 25 |
| Francia · hoteles, 3 pasadas | 7 | 26 |
| EE.UU. · educación superior, 3 pasadas | 6 | 23 |
| España · clínicas, 3 pasadas | 5 | 22 |
| Alemania · hoteles, 2 pasadas | 5 | 24 |
| Alemania · clínicas, 3 pasadas | 6 | 29 |
| España · abogados, 3 pasadas | 4 | 23 |
Ninguna de las dieciocho preguntas tuvo mayoría estable. La mejor fue una pregunta estadounidense sobre despachos de abogados, 13 de 20, y esa corrió dos veces. También es la que cayó a 7 de 24 cuando la repetimos al día siguiente, que tiene sección propia más abajo. La peor fue una española sobre despachos, 4 de 23, y esa corrió tres. Lo que nos lleva a la parte que cambia cómo se lee cualquier cifra de esta categoría.
El número de pasadas mueve la cifra, y aquí está cuánto
«Citada en todas las pasadas» es un listón más fácil con dos pasadas que con tres. Eso es aritmética, no un hallazgo. El hallazgo es que podemos ponerle tamaño desde dentro de un mismo estudio, porque los dos grupos se midieron la misma semana con el mismo método:
| Preguntas | Cuota estable | Citadas una sola vez | |
|---|---|---|---|
| Corrieron dos veces | 9 | 37% | 63% |
| Corrieron tres veces | 9 | 27% | 54% |
| value | |
|---|---|
| Preguntas con dos pasadas | 37% |
| Preguntas con tres pasadas | 27% |
Diez puntos. En una diapositiva, 37% y 27% son dos historias distintas sobre la posición de un cliente, y lo que las separa aquí no es el cliente, ni el mercado, ni la vertical, ni la semana. Es cuántas veces alguien pulsó el botón.
Esta es la consecuencia práctica, y conviene decirla sin rodeos. Una cifra de visibilidad citada sin su número de pasadas no es una medición, es un titular. Si una herramienta informa de que una marca aparece en cierta proporción de respuestas de IA, la primera pregunta es en cuántas respuestas, y la segunda es si esas pasadas salieron de una sesión o de varios días. Las nuestras salieron de sesiones únicas, que es exactamente por qué no afirmamos que estos porcentajes describan agosto: describen estas pasadas.
Hemos medido aparte la versión de un día para otro y es peor: repetir la misma pregunta dos días después reprodujo las cuentas casi exactamente y cambió casi todos los nombres. Y midiendo seis categorías en vez de una, el número de pasadas que necesita una categoría para poder describirse iba de unas tres a unas treinta, que es por qué un estándar único de la casa no sobrevive al contacto con una segunda vertical.
No consigues las pasadas que pides, y eso no es una nota al pie
Cada pregunta de este estudio pidió tres pasadas. Diez de las diecinueve volvieron con dos o con una, y la medición lo dijo cada vez en lugar de rellenar el total. Cuando volvimos el 10 de agosto a añadir cuatro preguntas más en Francia y Alemania, tres de las cuatro se pararon antes y una devolvió una sola pasada, que es por qué esa no lleva ningún porcentaje en todo el artículo.
Eso merece publicarse por sí solo. Una cifra de estabilidad es una fracción, y el denominador no es algo que elijas, es algo que te dan. Si una herramienta pide diez pasadas a un asistente, recibe seis, y publica «citada en el 60% de las pasadas» contra un denominador de diez, la cifra está mal en una dirección que no favorece a nadie en concreto y confunde a todo el mundo.
La comprobación es sencilla y no la ofrece nadie: pregunta a tu proveedor qué pasa cuando una pasada falla. Si la respuesta es que se publica el número pedido, los porcentajes llevan un denominador inventado dentro, y desde fuera no hay forma de saber de qué tamaño. La nuestra está en el registro: la columna de pasadas es lo que volvió.
Repetimos dos un día después, y la mejor se vino abajo
Todo lo anterior está medido dentro de sesiones únicas, que es la debilidad que los límites del final de este artículo llevan diciendo desde el principio. Así que el 10 de agosto volvimos a lanzar dos de las preguntas del día 9, mismo mercado, mismas superficies, mismo método.
| Pregunta | 9 de agosto | 10 de agosto |
|---|---|---|
| Abogados, EE.UU. | 13 de 20 estables, 65%, 2 pasadas | 7 de 24 estables, 29%, 2 pasadas |
| Ecommerce, EE.UU. | 7 de 24 estables, 29%, 3 pasadas | 7 de 23 estables, 30%, 2 pasadas |
La pregunta más estable de todo el estudio resultó ser la menos reproducible. Los despachos pasaron del 65% al 29% en un día, con el mismo número de pasadas los dos días, así que esto no es el efecto aritmético descrito arriba. Es la misma pregunta recibiendo otra respuesta.
Ecommerce, un resultado corriente de la zona media, volvió casi con el mismo número. Ahí los números de pasadas difieren, dos contra tres, así que no es una comparación limpia y no la tratamos como tal. Lo que sí se puede decir es que la cifra anodina fue la que se reprodujo.
Eso invierte el instinto. Una puntuación de estabilidad alta y solitaria parece la evidencia más fuerte de la página y es de la que menos hay que fiarse, porque hay muchas más maneras de ser inestable que estable y a un valor atípico le queda más camino de caída. Si vas a volver a comprobar una sola cifra de un informe de cliente antes de enviarlo, comprueba la mejor.
Y a veces sobrevive, que es justo por qué el consejo es comprobar y no desconfiar. Una pregunta de reserva de viaje medida la misma semana, con las mismas tres superficies y las mismas dos pasadas, volvió con 24 de 25 fuentes estables y luego con 24 de 26 en una segunda sesión, con los mismos veinticuatro dominios las dos veces. Una cifra alta no es sospechosa por ser alta. Volver a medir es lo que separa un núcleo real de una sesión afortunada, y solo una de las dos merece que le escribas un brief de contenidos.
Una cosa no te la podemos decir, y la culpa es nuestra y no del método. Las filas del 9 de agosto anotaron cuántas fuentes eran estables, no cuáles, así que estos dos días se comparan en tamaño y no en identidad. Si las siete fuentes estables de despachos del segundo día son siete de las trece originales o siete distintas, no se puede responder con lo que escribimos.
Una tercera sesión, el mismo día, responde la parte que no podíamos. Lanzamos la pregunta de despachos una vez más el 10 de agosto, en una sesión nueva. Se paró después de una sola pasada, así que no produce tasa de estabilidad y no derivamos ninguna. Una pasada sí puede responder otra cosa: qué fuentes volvieron.
Las siete fuentes estables de la segunda sesión aparecieron otra vez:
reddit.com, answeringlegal.com, natlawreview.com, exults.com,
rebuttalpr.com, mycase.com y lawyerist.com. Diez de las diecisiete de una
sola vez de esa sesión también reaparecieron, y tres dominios eran nuevos. Los
dos conjuntos citados se solapan en 0,63 por Jaccard.
Así que el porcentaje es más volátil que las fuentes que describe. Una cifra que se movió 36 puntos está montada sobre un núcleo que no se movió nada. Eso merece separarse en un informe de cliente: «tu puntuación de estabilidad ha bajado» y «han cambiado las páginas que sostienen la respuesta» son frases distintas, y esta semana solo la primera era cierta.
El motivo es mecánico y no misterioso. «Citada en todas las pasadas» es un criterio sin apenas tolerancia con dos o tres pasadas: una fuente que falte en una pasada se cae entera del numerador, y con un numerador de un solo dígito eso es un vaivén grande de porcentaje a partir de un cambio pequeño en la respuesta. El núcleo sobrevive; el estadístico que lo describe, no.
El arreglo obvio no funciona, y eso merece un párrafo. Si «citada en todas las pasadas» es demasiado frágil, el sustituto natural es la tasa media de citación, que tolera que una fuente falte en una pasada en vez de descartarla. Aplicada a estas dos sesiones parece portarse mucho mejor: 0,825 bajando a 0,646, una caída relativa del 22% frente al 55% de la cuota estable.
Esa mejora es una ilusión, y lo dice el álgebra. Con dos pasadas una fuente sale
en una pasada o en las dos, así que su tasa es 0,5 o 1, y la media es
exactamente 0,5 + 0,5 × (cuota estable). Es la misma cifra reescalada sobre un
rango de la mitad de ancho. No puede ser menos volátil de ninguna forma que
signifique algo, y no lleva información que la primera cifra no llevara.
Con tres pasadas hay tres niveles, un tercio, dos tercios y uno, y la media deja de ser una transformación lineal de la cuota estable. Así que la tolerancia se compra con pasadas, no con fórmulas. Un estadístico más listo sobre dos pasadas es maquillaje, y este estuvo a punto de publicarse como hallazgo.
Mismo vertical, distinto mercado: las cuatro comparaciones limpias
La mayoría de las comparaciones entre mercados de estos datos están contaminadas por el número de pasadas. Cuatro no lo están, porque coinciden en vertical y en pasadas:
| Vertical | Pasadas | Diferencia | ||
|---|---|---|---|---|
| Hoteles | 2 | España 56% (9 de 16) | Alemania 21% (5 de 24) | 35 puntos |
| Abogados | 3 | Francia 32% (7 de 22) | España 17% (4 de 23) | 15 puntos |
| Ecommerce | 3 | España 32% (9 de 28) | Estados Unidos 29% (7 de 24) | 3 puntos |
| Clínicas | 3 | España 23% (5 de 22) | Alemania 21% (6 de 29) | 2 puntos |
La fila de clínicas es la que fuimos a buscar. La primera versión de este estudio tenía tres de estas comparaciones y dos discrepaban, que no basta para distinguir un patrón de una casualidad, así que medimos ecommerce y clínicas en Francia y Alemania precisamente para añadir pares limpios. Compró uno: la pregunta alemana de clínicas es la única de las cuatro que devolvió las tres pasadas.
Dos de las cuatro difieren mucho y dos apenas difieren. Es el resumen honesto y más útil que una regla limpia. El mercado no es un modificador que puedas aplicar a una cifra. Una medición posterior sí encontró uno en otra pregunta, haciendo la cadena idéntica dos veces en vez de contar dentro de una lectura, y las dos cifras no están en conflicto porque miden cosas distintas. Los hoteles españoles dieron la segunda respuesta más estable de todo el estudio y los despachos españoles la menos estable, en el mismo mercado, en el mismo idioma y el mismo día.
Si hay un patrón ahí dentro, este estudio no lo ve. Lo que sí puede decir es que una agencia que corra la misma medición para dos clientes en dos países debe esperar que la fiabilidad de los dos informes sea distinta, y no dar por hecho que la diferencia es culpa del cliente.
La cantidad citada se mueve menos que lo citado, y Alemania es la excepción
| Mercado | Preguntas | Media de fuentes distintas por pregunta |
|---|---|---|
| Estados Unidos | 7 | 21,1 |
| España | 4 | 22,3 |
| Francia | 4 | 23,3 |
| Alemania | 3 | 26,0 |
Cinco fuentes entre el más ancho y el más estrecho, sobre recuentos de tres a siete preguntas. Ningún mercado construye su respuesta con muchísimo menos material, y el mercado más grande es el que usa menos.
Eso importa para quien planee entrar en un mercado dando por hecho que uno más pequeño es una respuesta más fácil de ocupar. Con esta evidencia no es más fina, es algo más ancha y menos estable: Alemania cita más fuentes por pregunta y retiene menos entre pasadas.
Qué hacer con esto si informas a clientes
Pon el número de pasadas al lado de cada porcentaje. Es el único cambio que hace defendible un informe de visibilidad en IA, y casi nadie en esta categoría lo hace. Nuestras propias cifras se mueven diez puntos solo por eso.
Informa del conjunto estable por separado de la cola larga. Un cliente que ve veinte fuentes citadas y oye que no está en ninguna reacciona distinto que uno al que le dicen que la respuesta tiene un núcleo de seis y una cola de catorce que cambia cada vez. Lo segundo es cierto y lo primero es un susto.
No montes un plan de contenidos contra una cita única. El 58% de aquello contra lo que estarías planificando no estará cuando lo compruebes. El tercio que aguanta es donde merece la pena escribir un brief, y es lo bastante pequeño como para nombrarlo página por página.
Pregunta a tu proveedor si sus pasadas repetidas saltan la caché. Si no la saltan, una línea de tendencia diaria es una línea plana por construcción, y una puntuación de estabilidad montada encima mide su infraestructura y no tu visibilidad. Es una pregunta con respuesta correcta y sale barata.
Y mide el mercado en el que vendes, no el que trae por defecto tu herramienta. Cada pasada de aquí llevó país e idioma fijados de forma explícita, que no es el valor por defecto en ninguna parte, y es la diferencia entre cuatro resultados y un resultado copiado cuatro veces.
Qué no demuestra este estudio
- Diecinueve preguntas son pocas. Cuatro mercados, ocho verticales, y solo cuatro verticales aparecen en más de un mercado. Cada porcentaje de aquí tiene un denominador en decenas, no en millares.
- Una pregunta queda fuera de todos los porcentajes. La pregunta alemana de ecommerce devolvió una sola pasada, y a ese tamaño toda fuente es trivialmente estable y trivialmente única. Está en el registro porque el registro anota lo que pasó, y fuera del análisis porque no puede responder a lo que el análisis pregunta.
- Dos pasadas y tres pasadas no son el mismo experimento, y por eso se publican aparte en vez de agregados en un titular. El 32% mezcla ambos y hay que leerlo como un punto medio, no como una tasa. Sobrevivió a que el estudio pasara de quince preguntas a diecinueve y de dos mercados a cuatro, que es evidencia de que es un punto medio estable, no una prueba.
- Dos preguntas tienen un segundo día y diecisiete no. Las pasadas dentro de una sesión te hablan de esa sesión, y las dos que repetimos discrepan sobre cuánto importa eso. Afirmar que una fuente se cita de forma duradera exige días, no pasadas, en todo el conjunto.
- Tres superficies, no cuatro. ChatGPT queda fuera porque la ruta que usamos no devuelve su lista de fuentes, y publicar eso como cero sería publicar nuestro instrumento.
- Una sola formulación por pregunta. Un estudio español de esta misma clase de pregunta usó cuatro formulaciones y encontró 49 fuentes citadas sin que ninguna apareciera en las cuatro, así que estos conjuntos pertenecen a estas formulaciones y no a la intención que hay detrás.
- Citar no es recomendar, y ausencia no es veredicto. Una fuente citada respondió bien a la pregunta. Una ausente puede ser excelente y simplemente no tener quien escriba sobre ella.
- Nada de esto es causal. No cambiamos nada y anotamos lo que volvió.
- La pregunta alemana de hoteles va desigual. AI Overview respondió una vez donde las otras dos superficies respondieron dos, y se anota como dos pasadas en lugar de suavizarse.
Preguntas frecuentes sobre este estudio
¿Cuánto varían las respuestas de IA en preguntas de compra de agencia?
Un tercio largo de las fuentes citadas aguantó en todas las pasadas, y el 58% salió exactamente una vez. En diecinueve preguntas y cuatro mercados, ninguna pregunta tuvo mayoría estable: la mejor fue 13 de 20 fuentes sobre dos pasadas y la peor 4 de 23 sobre tres. Cualquier respuesta suelta de una IA a una pregunta de compra está hecha en su mayoría de fuentes que no estarán en la siguiente.
¿Por qué el número de pasadas cambia una puntuación de visibilidad en IA?
Porque «citada en todas las pasadas» es un listón más fácil con dos pasadas que con tres. En este estudio, las preguntas que corrieron dos veces dieron un 37% de fuentes estables y las que corrieron tres un 27%, medidas la misma semana con el mismo método. Diez puntos de una puntuación aparente de estabilidad son el número de pasadas y nada más, y por eso un porcentaje publicado sin su denominador no se puede comparar con nada.
¿Cambian las respuestas de IA entre países para la misma pregunta?
A veces mucho y a veces nada. Comparando solo preguntas con el mismo vertical y el mismo número de pasadas, las respuestas de hoteles en España y Alemania difieren en 35 puntos de estabilidad, las de despachos en Francia y España en 15, las de ecommerce en España y Estados Unidos en 3, y las de clínicas en España y Alemania en 2. Dos huecos grandes y dos pequeños, sobre cuatro comparaciones, no son una regla sobre mercados.
¿Debería una agencia informar de visibilidad en IA a sus clientes?
Sí, con dos cosas pegadas: el número de pasadas detrás de cada porcentaje, y una separación entre las fuentes que salen siempre y las que salen una vez. Sin el número de pasadas la cifra no se puede comparar con el informe siguiente. Sin la separación, un cliente lee una cola larga de casualidades como si fuera una posición competitiva.
¿Qué superficies de IA se midieron?
Google AI Overview, Google AI Mode y Gemini, agrupadas por pregunta, con la caché saltada para que cada pasada sea una llamada nueva. ChatGPT falta a propósito: la ruta usada aquí no devuelve su lista de fuentes, y un cero producido por un instrumento es indistinguible de un cero real.
¿Cómo repito esta medición?
Haz la misma pregunta con país e idioma fijados de forma explícita, al menos tres veces, en cada superficie por separado, con la caché desactivada, y anota lo que corrió de verdad y no lo que pediste. Esa última parte no es puntillismo: diez de nuestras diecinueve preguntas volvieron con menos pasadas de las pedidas. Luego cuenta tres cosas: fuentes distintas, fuentes presentes en todas las pasadas y fuentes presentes una sola vez. Esos tres números son el estudio entero, y el tercero es el que no publica nadie.
Dónde te deja esto
Lo que no esperábamos es lo poco que sostiene una respuesta de IA. Diecinueve preguntas, cuatro mercados, tres superficies, y el 58% de todo lo citado fue algo de una sola vez. Esa cifra no se movió cuando el estudio creció en cuatro preguntas y dos mercados, que es lo más parecido a una réplica que tiene.
La parte sobre la que se trabaja es el tercio que aguanta, y es lo bastante pequeña como para nombrarla: seis o siete fuentes por pregunta. Eso es un brief de contenidos, no un cuadro de mando, y es la misma conclusión a la que llegamos midiendo qué cita la IA cuando le preguntan por universidades, donde el núcleo estable eran residencias de estudiantes y academias en vez de las propias instituciones.
Si llevas informes de visibilidad para clientes, la mejora más barata que tienes disponible no es una herramienta mejor. Es imprimir el número de pasadas al lado del porcentaje, y separar el núcleo de la cola. Las dos son gratis, y las dos son la diferencia entre un informe sobre el que un cliente puede actuar y una cifra que te va a recitar cuando se mueva.
Si quieres esa medición para tus propias cuentas, esto lo hacemos con agencias.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.