Le hicimos a Google la misma pregunta dos veces. En Estados Unidos no cambió nada y en Francia cambió la mitad.
Una pregunta de compra repetida a los minutos, en cuatro mercados. Las fuentes que aguantan volvieron al 100% en EE. UU. y sólo al 50% en Francia.
Hazle a Google una pregunta de compra, apunta las fuentes que su AI Overview cita en todas las pasadas, y vuelve a hacer la cadena idéntica unos minutos después. En Estados Unidos te devuelve la misma lista, nombre por nombre. En Francia te devuelve la mitad.
Esa diferencia no es de la pregunta, porque es la misma pregunta. No es del día, porque las dos lecturas están a minutos. Es una propiedad del mercado en el que estás midiendo, y decide si una lectura única de tu visibilidad significa algo.
Cómo se midió: Una pregunta de compra desnuda por mercado, localizada, sobre el AI Overview de Google con nuestras propias herramientas de medición. Cada lectura se queda con los dominios citados en todas las pasadas, y después se pregunta la cadena idéntica otra vez en la misma sesión y se comparan los dos conjuntos. Todas las lecturas están al mismo listón de dos pasadas, así que ninguna comparación de aquí enfrenta un conjunto más duro contra uno más blando. Cuatro mercados, tres categorías, 18 de agosto de 2026, con un segundo brazo que repite seis celdas con listones de tres, cuatro y cinco pasadas. Las filas completas están en nuestro registro de mediciones, y los prompts exactos están más abajo, para que cualquiera pueda repetirlo en contra nuestra.
Aviso: EchoWi vende medición de visibilidad en IA, así que un hallazgo sobre lo poco fiable que puede ser una lectura única es un hallazgo sobre lo que vendemos. Los prompts, la superficie, los mercados, el listón y la fecha están aquí, que es lo que lo hace comprobable en vez de algo que haya que creernos.
La versión corta
- La misma pregunta, hecha dos veces, devuelve las mismas fuentes duraderas el 100% de las veces en Estados Unidos y el 50% en Francia.
- Todos los mercados tienen un núcleo estable. Entre 3 y 6 dominios vuelven cada vez que preguntas, en los cuatro.
- Lo que cambia es el borde. El número de fuentes que salen en una lectura y no en la otra va de 0 en Estados Unidos a 4 en Francia.
- El mercado es casi todo, y un mercado intermedio enseña que no es todo. Sobre 3 categorías en los dos mercados extremos, las lecturas francesas nunca suben por encima de las americanas. Pero Alemania devuelve un 67% en CRM y un 100% en contabilidad, las dos con el mismo listón, así que dentro de un solo mercado la pregunta mueve la cifra un tercio.
- La consecuencia práctica es una regla para leer cualquier informe de visibilidad en IA: si estás en el núcleo, estás siempre; si estás en el borde, una lectura única es una moneda al aire.
- Una lectura perfecta caduca. La pregunta americana de CRM devolvió 4 dominios duraderos por la mañana y 12 por la tarde del mismo día, con el mismo listón de cinco pasadas y con cada lectura individual impecable.
Qué se midió, exactamente
La unidad es una pregunta de compra desnuda de la forma «mejor X para una pequeña empresa», escrita como la escribiría un comprador de ese mercado, en el idioma de ese mercado.
En cada lectura se pregunta dos veces a la superficie y nos quedamos sólo con los dominios citados las dos. Ese conjunto es la lectura. Después se pregunta la cadena idéntica otra vez en la misma sesión, sale un segundo conjunto, y los dos se comparan con un Jaccard: los dominios en los dos, divididos por los dominios en cualquiera.
Dos detalles hacen casi todo el trabajo aquí y ninguno es decoración.
Todas las lecturas están al mismo listón de dos pasadas. Un conjunto de dominios que sobrevivió a cinco pasadas es más pequeño y más duro que uno que sobrevivió a dos, así que comparar entre listones mide el listón además del mundo. Una versión anterior de esta medición tenía exactamente ese problema, con un mercado comparado a cinco pasadas contra dos y otro a cuatro contra tres, y por eso esos números no están en este artículo.
Los prompts están congelados y publicados. Son:
| Mercado | Categoría | Prompt |
|---|---|---|
| Estados Unidos | CRM | what is the best CRM for a small business? |
| Alemania | CRM | beste CRM Software für kleine Unternehmen |
| España | CRM | mejor CRM para una pequeña empresa |
| Francia | CRM | meilleur CRM pour une petite entreprise |
El resultado
| Mercado | Vuelve | Núcleo | Borde |
|---|---|---|---|
| Estados Unidos | 100% | 4 | 0 |
| Alemania | 86% | 6 | 1 |
| España | 83% | 5 | 1 |
| Francia | 50% | 4 | 4 |
Eso son 57 puntos entre el más ancho y el más estrecho. Antes de correr las lecturas que faltaban escribimos un umbral: si los cuatro mercados caían dentro de quince puntos entre sí, no había diferencia de mercado que reportar y la observación se retiraba. No cayeron.
La celda americana merece una pausa. Los mismos cuatro dominios volvieron en tres lecturas distintas, una de ellas tomada a un listón de cinco pasadas en vez de dos. Eso no es un resultado estable, es la lista idéntica cada vez que preguntamos.
Francia era la celda dramática, así que la replicamos antes de escribir nada de esto. Una tercera lectura francesa, a un listón más estricto de tres pasadas, devolvió cinco dominios, cuatro de los cuales aparecen en las otras dos. El núcleo francés es real. Lo que se mueve es todo lo que hay alrededor.
El resumen correcto es núcleo y borde, no «Francia es inestable»
La frase que apetece es que la respuesta francesa no es fiable, y está mal de una forma que le importa a quien intente actuar sobre ella.
Todos los mercados tienen un núcleo que vuelve siempre, y los núcleos se parecen en tamaño: 4 en Estados Unidos, 6 en Alemania, 5 en España, 4 en Francia. Una marca que esté en ese núcleo está siendo recomendada de forma consistente, en Francia exactamente igual que en Estados Unidos.
Lo que cambia por un factor de cuatro es el borde: 0 dominios en Estados Unidos, 1 en Alemania y España, 4 en Francia. El borde es la parte de la respuesta que una lectura única decide a cara o cruz.
Así que la pregunta que hay que hacerle a cualquier cifra de visibilidad en IA no es «cómo de estable es este mercado». Es en cuál de los dos estoy, y una lectura no te lo puede decir. Dos sí.
¿Mercado o categoría? La prueba que decide
Una tabla de cuatro mercados medida en una categoría no es un hallazgo sobre mercados. Podría ser igual de bien un hallazgo sobre CRM, y nuestra propia investigación anterior es el motivo para tomárselo en serio: cuando medimos diecinueve preguntas de compra de agencias en cuatro mercados, la dispersión dentro de un mismo mercado entre verticales era tan grande como cualquier cosa entre mercados, y aquel estudio concluye por escrito que el mercado no es un modificador que puedas aplicar a una cifra.
Así que antes de publicar esto corrimos dos categorías más en los dos mercados extremos, con la regla de retirada escrita primero: si cualquier categoría francesa subía por encima de cualquier americana, esto era variación de categoría y el hallazgo estaba muerto.
| Categoría | Estados Unidos | Francia |
|---|---|---|
| CRM | 100% | 50% |
| Contabilidad | conjunto idéntico | 60% |
| Gestión de proyectos | 100% | 43% |
Las bandas no se cruzan. La lectura francesa más alta es el 60% y la americana más baja es el 100%.
Y esto no tumba el estudio de agencias, porque los dos miden cosas distintas. Aquel preguntaba, dentro de una sola lectura, qué fracción de todo lo citado sobrevivía a todas las pasadas. Este pregunta si el conjunto que sobrevive vuelve cuando preguntas otra vez. Un mercado puede citar muchísimas fuentes de una sola vez, puntuando bajo en la primera medida, y reproducir perfectamente su núcleo duradero, puntuando alto en esta. Las dos cifras son reales y son respuestas a preguntas distintas.
La fila de contabilidad de Estados Unidos lleva asterisco a propósito. Su segunda lectura volvió a un listón de una pasada en vez de dos, así que no puede entrar en una comparación y no está contada en nada de lo de arriba. Se menciona por lo que enseñó: a ese otro listón devolvió los mismos trece dominios, nombre por nombre.
Con un listón más estricto, y preguntando otra vez el mismo día
Todas las celdas de arriba se leen con un listón de dos pasadas, que es el más bajo que usamos. La pregunta evidente es si algo de esto sobrevive a pedir más, así que 6 de esas celdas se volvieron a leer con listones de tres, cuatro y cinco pasadas, cada pareja con el mismo listón, y van aparte de la tabla anterior en vez de sumadas: un Jaccard entre dos lecturas no se compara entre listones, porque la unanimidad sobre cinco es una prueba más dura que sobre dos.
| Mercado | Categoría | Listón | Vuelve |
|---|---|---|---|
| Estados Unidos | CRM | 5 pasadas | 100% |
| Estados Unidos | Contabilidad | 3 pasadas | 100% |
| Alemania | Contabilidad | 5 pasadas | 100% |
| España | Contabilidad | 2 pasadas | 100% |
| Francia | Contabilidad | 4 pasadas | 75% |
| Alemania | CRM | 3 pasadas | 67% |
4 de las 6 vuelven idénticas y la más baja es 67%. Así que el efecto no es un artefacto de un listón flojo. Francia sigue siendo el mercado más bajo de los presentes, y las celdas americanas siguen saliendo perfectas con listones donde el conjunto son doce dominios y no cuatro.
Y una fila de aquí retira una frase que publicamos esta misma mañana. Alemania contesta 67% en CRM y 100% en contabilidad, las dos con el mismo listón, o sea un tercio del conjunto moviéndose dentro de un solo mercado. «Es el mercado y no la categoría» solo se podía decir de los dos extremos, donde la categoría no tiene nada que mover: Francia no puede bajar del suelo americano porque el suelo americano es el 100%. Un mercado intermedio es donde esa afirmación puede fallar, y falla.
La misma pregunta, el mismo listón, cinco horas después
La cadena americana de CRM es la celda más reproducible de este estudio. Con un listón de cinco pasadas devuelve los mismos doce dominios dos veces, y una tercera lectura con listón de cuatro devuelve esos doce otra vez. Esa misma mañana, la cadena idéntica con el mismo listón de cinco devolvió cuatro.
Los cuatro están dentro de los doce, así que no se perdió nada. La respuesta se ensanchó por tres en unas horas, y no lo hace el listón: subir un listón de unanimidad solo puede quitar dominios de un conjunto duradero, nunca añadirlos, así que la respuesta de la tarde está citando al menos doce dominios en cada una de sus cinco pasadas donde la de la mañana citaba cuatro en cada una de las suyas.
Esa es la mitad incómoda de todo lo anterior. Dentro de una sesión, esta celda es tan fiable como llega a ser una medición de este tipo. A lo largo de una tarde, dos tercios de lo que dice hoy no estaban esta mañana. Que una lectura se repita dentro de una sesión no es evidencia de que una lectura tomada más tarde el mismo día vaya a coincidir con ella, y un panel que muestrea una vez al día está muestreando un conjunto que puede triplicarse entre muestras.
Qué hacer con esto
Nunca actúes sobre una lectura. Es todo el contenido práctico del estudio y cuesta una llamada más satisfacerlo. Si una fuente aparece en dos lecturas tomadas con minutos de diferencia, está en el núcleo. Si aparece en una, no has aprendido casi nada sobre ella.
Pregúntale a un proveedor de cuántas lecturas salió su número, que es una pregunta distinta de cuántas pasadas. Una herramienta puede promediar diez pasadas dentro de una lectura y aun así enseñarte un conjunto que no se reproducirá cuando vuelva a preguntar mañana. Pasadas dentro de una lectura y lecturas repetidas no son el mismo control y no arreglan el mismo problema.
Espera que un informe francés y uno americano difieran en fiabilidad, y no lo leas como que el sitio de un cliente es peor que el de otro. Con esta evidencia, casi toda la diferencia está en el mercado y una parte está en la pregunta: Alemania se mueve un tercio entre dos categorías.
Qué no demuestra esto
- Una superficie. Esto es sólo el AI Overview de Google. ChatGPT, Gemini y AI Mode recuperan distinto y necesitarían su propia medición, y nuestro propio trabajo sigue encontrando que un resultado en una superficie dice poco de otra.
- Dos lecturas por celda. Un Jaccard entre dos lecturas es una observación, no una distribución. Una tercera lectura por celda convertiría este recorrido en un rango, y ese es el siguiente paso obvio antes que más mercados.
- Tres categorías, cuatro mercados, un día. La comparación entre mercados a lo largo de categorías descansa sólo en Estados Unidos y Francia. Alemania y España tienen una categoría cada uno.
- Minutos, y después una tarde. Las tablas son dentro de una sesión. La única celda que volvimos a leer horas después se había triplicado, así que lo que queda sin probar son días y semanas, no solo meses, y una celda no es una tasa.
- Nada de aquí es causal. Podemos decir que los mercados difieren en esta medida. No podemos decir qué de esos mercados produce la diferencia, y no probamos ninguna explicación.
Preguntas frecuentes sobre repetir una medición
¿Qué significa «vuelve» exactamente aquí?
Es un índice de Jaccard entre dos lecturas de la pregunta idéntica. Cada lectura se queda sólo con los dominios citados en todas sus pasadas, así que ya es un conjunto duradero y no todo lo que se mencionó. La cifra es el tamaño del solapamiento dividido por el tamaño de la unión: 100% significa que las dos lecturas nombraron exactamente los mismos dominios, y 50% que la mitad de lo que apareció entre las dos apareció sólo en una.
¿Por qué dos pasadas por lectura y no más?
Porque todas las lecturas de la comparación tienen que estar al mismo listón, y dos era el listón que todos los mercados podían dar de verdad en una sesión. Un conjunto duradero construido con cinco pasadas es más duro que uno construido con dos, así que mezclarlos mediría el listón en vez del mercado. Donde una celda volvió a otro listón, la dejamos fuera de la comparación y lo dijimos.
¿Significa esto que una herramienta de visibilidad en IA no sirve en Francia?
No, y la separación entre núcleo y borde es por qué. Una marca francesa en el núcleo sale citada cada vez que preguntamos, tan consistentemente como una americana. Lo que una lectura francesa única no puede decirte es de qué lado de esa línea estás, y el arreglo es una lectura más, no otra herramienta.
¿Es lo mismo que decir que las respuestas de IA son aleatorias?
Es casi lo contrario. Entre 3 y 6 dominios vuelven cada vez en todos los mercados que medimos, incluido el menos reproducible. Hay una estructura estable en los cuatro. El desacuerdo entre lecturas vive enteramente en los bordes de la respuesta.
¿Cómo compruebo esto en mi propia categoría?
Coge tu pregunta de compra, hazla dos veces en la misma hora con el mismo número de pasadas cada vez, y apunta los dominios citados en todas las pasadas de cada lectura. Compara las dos listas. Si coinciden estás mirando un núcleo; si coinciden a medias, cualquier informe de una sola lectura sobre tu categoría te está diciendo menos de lo que parece.
¿Por qué la fila de contabilidad de Estados Unidos no lleva número?
Porque su segunda lectura contestó una pasada donde la primera contestó dos, y una lectura de una pasada hace duradero por construcción a todo dominio citado. Meterla en la tabla habría comparado dos cosas distintas. Se queda en el artículo porque lo que sí enseñó merece saberse: a ese otro listón devolvió los trece dominios idénticos.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.