Saltar al contenido
Visibilidad IAInvestigación

Cero fuentes españolas en 400 mediciones: lo que revela medir bien la visibilidad en IA

1.600 mediciones de salud ocular en España. ChatGPT no citó ni un dominio español, y dos formulaciones de una intención comparten el 37 % de sus fuentes.

· Actualizado · 10 min de lectura

Un usuario español, preguntando en español, desde España, por un problema de salud ocular, recibe de ChatGPT respuestas fundadas casi por completo en el sistema público de salud británico. En 400 mediciones no apareció ni una sola fuente española.

El dato es llamativo, pero no es de lo que va este artículo. Va de cómo se mide, y de por qué la mayoría de los números de visibilidad en IA que circulan hoy no aguantan una comprobación.

Cómo está hecho el estudio

Elegimos un vertical concreto, la salud ocular, y lo medimos en España y en español. Cinco intenciones clínicas, cada una formulada de cuatro maneras distintas, cada formulación lanzada 20 veces contra cuatro motores: Google AI Overview, Google AI Mode, Gemini y ChatGPT. En total, 1.600 mediciones, ejecutadas el 9 de agosto de 2026.

La pregunta que queríamos responder no era quién sale más. Era si el número que devuelve una herramienta cuando lanza una pregunta una vez significa algo.

Hallazgo 1: solo un motor da respuestas reproducibles

Lanzamos la misma pregunta 20 veces contra cada motor y medimos cuánto se parecen los conjuntos de fuentes entre tiradas, con el índice de Jaccard. Un 1,00 significaría citar exactamente lo mismo cada vez.

Google AI Overview0,93Google AI Mode0,52Gemini0,52ChatGPT0,41
Índice de Jaccard medio entre las fuentes citadas en 20 tiradas de la misma pregunta. Un 1,00 sería citar exactamente lo mismo cada vez. Salud ocular, España, español, 9 de agosto de 2026.
Solape medio entre las fuentes citadas en 20 tiradas de la misma pregunta, por motor
value
Google AI Overview93
Google AI Mode52
Gemini52
ChatGPT41
MotorSolape medioMedianaPreguntas sin ninguna cita en 20 tiradas
Google AI Overview0,931,000 de 20
Google AI Mode0,520,410 de 20
Gemini0,520,367 de 20
ChatGPT0,410,323 de 20

La columna de la mediana dice más que la de la media. En AI Overview la mediana es 1,00: en más de la mitad de las preguntas el conjunto de fuentes fue exactamente el mismo en las veinte tiradas. Repitió el conjunto exacto en 11 de 20 preguntas, y su peor caso fue 0,39, que sigue por encima de la media de cualquiera de los otros tres.

En los otros tres la mediana está por debajo de la media, que es la forma estadística de decir que unas pocas preguntas estables tiran del promedio hacia arriba mientras la mayoría se comporta peor de lo que la media sugiere.

Google AI Overview es prácticamente determinista. Los otros tres no.

Dos ejemplos de lo que significa un 0,52. En AI Mode, «qué es la blefaritis» devolvió 52 dominios distintos en 20 tiradas y solo 2 aparecían de forma consistente. En «picor en los ojos», el mismo motor vio 43 dominios y su núcleo estable fue de cero: ni uno solo sobrevivió a las veinte tiradas.

Una pregunta con núcleo cero y 43 dominios vistos no es una pregunta que hayas perdido. Es una pregunta en disputa, y saber cuáles de las tuyas están en ese estado vale más que un porcentaje sobre el conjunto.

Y hay una columna que suele pasarse por alto. Gemini no citó nada en 7 de sus 20 preguntas, y ChatGPT en 3 de 20. No es que la marca no salga: es que no hay respuesta con fuentes que analizar. Cualquier porcentaje calculado sobre esas preguntas está dividiendo por un denominador que incluye tiradas donde no había nada que medir.

Hallazgo 2: en AI Overview basta una medición

Consecuencia directa de lo anterior: en AI Overview, una sola tirada recupera el 96 % del conjunto estable de fuentes.

1 tirada0,962 tiradas0,963 tiradas0,935 tiradas0,9210 tiradas0,9815 tiradas0,96
Cuánto del núcleo estable de fuentes recupera una estimación hecha con k tiradas, frente al núcleo observado en 20, en Google AI Overview. La curva es plana: la vigésima tirada no sabe más que la primera. Salud ocular, España, español, 9 de agosto de 2026.
Recuperación del núcleo estable de fuentes en AI Overview según el número de tiradas
value
1 tirada96
2 tiradas96
3 tiradas93
5 tiradas92
10 tiradas98
15 tiradas96

Lo interesante de esa curva es que no es una curva. No sube con más tiradas: se mueve entre 0,92 y 0,98 desde la primera. La tirada número veinte no sabe más que la primera.

En los otros tres motores no se llega a ese nivel de recuperación ni con las veinte. Son motores distintos que exigen métodos distintos, y tratarlos igual es el primer sitio donde se rompe un informe.

Hallazgo 3: cambiar la redacción cambia las fuentes

Este es el importante, y es el que cuesta más aceptar.

En AI Overview, que es el motor estable, dos formulaciones de la misma intención comparten de media solo el 37 % de sus fuentes. El motor cuyo solape consigo mismo es de 0,93 cambia dos tercios de la lista cuando reformulas la pregunta. Y no es un defecto suyo: es el mejor de los cuatro también en esto.

entre las 4 formulacionessolo V1 frente a V2AI Overview0,37 a 0,68Gemini0,10 a 0,50AI Mode0,17 a 0,13ChatGPT0,00 a 0,00
Solape entre los núcleos de cuatro formulaciones de la misma intención, y el mismo dato restringido al par más parecido de todos, la versión escueta frente a la que añade una preposición. Un 1,00 sería citar lo mismo. En ChatGPT los dos valores son cero. Salud ocular, España, español.
Solape entre formulaciones de la misma intención, por motor
entre las 4 formulacionessolo V1 frente a V2
AI Overview3768
Gemini1050
AI Mode1713
ChatGPT00

El segundo punto de cada fila es el par más parecido que se puede construir, la versión escueta frente a la que solo añade una preposición. Ni ahí aguantan. AI Mode empeora al restringirlo, 0,13, y ChatGPT marca cero en las dos columnas: dos formas de preguntar lo mismo no compartieron ni una sola fuente.

Los pares que medimos:

Par de formulacionesFuentes compartidas
«blefaritis» frente a «tengo los párpados irritados y con costras»19 %
«blefaritis» frente a «blefaritis en los párpados»25 %
«orzuelo» frente a «tengo un bulto en el párpado»30 %
«párpado hinchado» frente a «hinchazón en el párpado»100 %

Lee las dos últimas filas juntas. «Párpado hinchado» y «hinchazón en el párpado» son la misma frase reordenada y comparten el 100 % de las fuentes. «Blefaritis» y «blefaritis en los párpados» es añadir tres palabras que no cambian el significado clínico, y comparten el 25 %.

A veces una preposición no cambia nada y a veces lo cambia casi todo. No se puede predecir sin medir.

El caso del 19 % es el que debería preocupar a cualquier marca de salud. «Blefaritis» es como lo escribe quien ya sabe el nombre de lo que tiene. «Tengo los párpados irritados y con costras» es como lo escribe quien todavía no lo sabe, que es exactamente la persona que aún no ha elegido a quién comprarle. Son dos conjuntos de fuentes casi disjuntos para la misma dolencia.

Hallazgo 4: ChatGPT no cita a España

Volvemos al gancho, ahora con la tabla delante. Origen de los dominios citados, sobre 400 tiradas por motor, todas en español y con localización en España:

AI Overview34,9 % (24 de 61 dominios)Gemini30,1 % (35 de 161)ChatGPT0,0 % (0 de 12)
Porcentaje de las citas que fueron a dominios españoles, sobre 400 tiradas por motor, todas en español y con localización en España. Salud ocular, 9 de agosto de 2026.
Porcentaje de citas a dominios españoles, por motor
value
AI Overview34.9%
Gemini30.1%
ChatGPT0%
MotorDominios distintosEspañolesCitas a dominios españoles
AI Overview612434,9 %
Gemini1613530,1 %
ChatGPT1200,0 %

Dos cosas en esa tabla, y la segunda es peor que la primera.

La primera es el cero. La segunda es el 12. ChatGPT construyó todas sus respuestas de salud ocular en español a partir de doce dominios en total, frente a los 161 de Gemini. No es solo que no cite a España: es que apenas cita.

Los doce, con su peso: nhs.uk el 38 % de las citas, mayoclinic.org el 17 %, eyewiki.aao.org el 11 %, medlineplus.gov el 10 %, moorfields.nhs.uk el 7 %, y por debajo del 1 % cada uno guysandstthomas.nhs.uk, uhs.nhs.uk, hantsiow.icb.nhs.uk, magazine.medlineplus.gov y store.aao.org.

Casi la mitad de sus citas van al sistema público de salud británico. Y un detalle que remata la lectura: cuando cita MedlinePlus cita la versión en inglés, no la española, que existe.

Un paciente español recibe, en su idioma, la sanidad pública británica.

Qué hacer con esto

  1. Pregunta siempre por las tiradas y por la redacción exacta. Si alguien te enseña que tu cuota de voz en ChatGPT es del 12 %, ese número necesita dos datos más para significar algo: cuántas tiradas hay detrás y con qué formulación exacta. Con 3 de 20 preguntas sin citar nada, se mueve solo.
  2. La unidad de medida no es la pregunta, es la intención con sus variantes. Hay que medir al menos cuatro formas de preguntar lo mismo, y una de ellas tiene que ser cómo lo escribiría una persona describiendo su síntoma, no cómo lo escribiría un especialista.
  3. Puedes estar dentro de «blefaritis» y fuera de «tengo los párpados irritados». Ese hueco no lo ve ninguna herramienta que mida por palabra clave, porque para una herramienta así son dos palabras clave distintas y para tu cliente es la misma dolencia un martes y un jueves.
  4. Para una marca española de salud, hoy ChatGPT no es un terreno que se gane escribiendo en español. Y conviene decirlo con precisión, porque no es un problema tuyo: no es que no estés tú, es que no está nadie de tu país. Eso cambia la conclusión estratégica. No es un hueco de contenido que puedas cerrar con más artículos.

Qué medimos nosotros

En echowi medimos intenciones con sus variantes, repetidas, por motor y por mercado, y guardamos las fuentes que construyeron cada respuesta además de si la marca salió nombrada. Lo hacemos así porque los números de arriba son la razón: un informe que agrega cuatro motores con comportamientos tan distintos, sobre una sola redacción y una sola tirada, describe una tirada de dados con un decimal.

Los límites, antes de que los diga otro

  • Un vertical, un mercado, un idioma. Salud ocular, España, español. No sabemos si la estabilidad de AI Overview aguanta en consultas de producto o de negocio local, donde además dispara mucho menos.
  • Cinco intenciones y cuatro formulaciones. El diseño es factorial y limpio, pero veinte preguntas no son una muestra del vertical.
  • Esto mide estabilidad instantánea, no estabilidad en el tiempo. Todas las tiradas caben en un rato. La misma consulta dentro de un mes puede citar otra cosa, y eso no está medido aquí. Es el experimento siguiente, y es el que decide si el seguimiento mensual que vende este mercado significa algo.
  • El núcleo estable se define como aparecer en al menos el 90 % de las tiradas. Es una elección nuestra. Con otro umbral cambian los tamaños; el orden entre motores no.
  • La curva de recuperación se compara contra el núcleo de veinte tiradas, que es la mejor estimación disponible, no la verdad.
  • Nada de esto es causal. Medimos qué citaron los motores, no por qué.

No lo generalizamos a otros verticales ni a otros mercados, y cualquiera con acceso a los cuatro motores puede repetirlo en el suyo.

Preguntas frecuentes sobre cómo medir la visibilidad en IA

¿Cuántas tiradas hacen falta para medir visibilidad en IA?

Depende del motor. En Google AI Overview, una sola tirada recupera el 96 % del conjunto estable de fuentes. En Google AI Mode, Gemini y ChatGPT, con solape medio entre 0,41 y 0,52, veinte tiradas siguen sin alcanzar ese nivel de recuperación.

¿Cambia la respuesta si reformulo la pregunta?

Sí, y bastante más de lo que parece. En AI Overview, dos formulaciones de la misma intención comparten de media el 37 % de sus fuentes. Medimos un par que comparte el 100 % y otro que comparte el 19 %, y no hay forma de saber cuál es cuál sin lanzarlo.

¿Por qué ChatGPT no cita webs españolas de salud?

No podemos decir por qué, solo qué medimos: sobre 400 tiradas en español y con localización en España, ChatGPT usó 12 dominios distintos y ninguno era español. El 38 % de sus citas fueron a nhs.uk.

¿Sirve de algo una cuota de voz medida con una sola tirada?

En AI Overview es defendible, porque su solape entre tiradas es de 0,93. En los otros tres no, y en dos de ellos hay además preguntas que no devuelven ninguna fuente, lo que introduce en el denominador tiradas donde no había nada que medir.

Pregúntale a la IA sobre este artículo

Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.

Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.

Escrito por

Maher El Ouahabi

CTO y cofundador de EchoWi

Construye el software que enseña a las marcas lo que la IA dice de ellas, y qué cambiar para que la siguiente respuesta sea mejor. Doce motores, medidos antes y después.

LinkedIn Maher El Ouahabi (se abre en una nueva pestaña)