Saltar al contenido
AI VisibilityGEO
ES

Veinte preguntas de compra en cuatro mercados, y una categoría donde el resumen casi no sale

Veinte preguntas de compra en cuatro mercados, una lectura cada una, sin reintentos. Diecisiete contestaron todas; las tres que no, misma categoría.

· 20 min de lectura

Todos los productos de visibilidad en IA informan de un cero de la misma manera. Ninguno puede decirte si el motor contestó y te dejó fuera, o si el motor no contestó. Hicimos preguntas de compra en Estados Unidos, España, Alemania y Francia, una lectura por celda, tres pasadas cada una, sin reintentos saliera lo que saliera, y el estudio ha crecido hasta 84 lecturas sobre 10 categorías, 5 formas de pregunta y 2 superficies. 37 de las 40 celdas devolvieron un AI Overview en todas las pasadas. Las 3 que no son la misma categoría, y en esa categoría la superficie devolvió 3 pasadas de 3 en Alemania, 2 en Estados Unidos, 1 en Francia y 0 en España.

Que el resumen salga es mucho más una propiedad de la pregunta que del mercado. Pero en la pregunta donde no es fiable, no es fiable de forma distinta en cada mercado, que es la parte que un panel no te puede enseñar.

Disclosure: EchoWi vende medición de visibilidad en IA, así que un estudio que sostiene que algunas cifras de visibilidad describen una superficie que no llegó a salir es un estudio con interés. Aquí está todo lo necesario para repetirlo: cada cadena exacta, las superficies, los cuatro mercados en sus propios idiomas, tres pasadas por celda, las fechas y las 84 lecturas en nuestro registro de mediciones. Cada brazo son veinte llamadas, así que cualquiera puede correr el que quiera en contra nuestra.


La versión corta

  1. 40 celdas: 10 preguntas de compra en 4 mercados, cada una en su propio idioma. Una lectura por celda, tres pasadas pedidas, en el AI Overview de Google.
  2. 37 de 40 devolvieron un resumen en las tres pasadas. Para la mayoría de preguntas de compra en la mayoría de mercados, la superficie simplemente está.
  3. Los 3 déficits son una sola categoría, gestores de contraseñas. Todas las demás celdas de todos los mercados contestaron enteras.
  4. Esa categoría recorre el rango entero. Alemania 3 de 3, Estados Unidos 2 de 3, Francia 1 de 3, España 0 de 3, la misma noche.
  5. Sin reintentos, a propósito. Una lectura corta es el resultado, no un fallo que corregir, y releer sólo las cortas es como una muestra se selecciona por su propio resultado.
  6. La predicción que dejamos escrita antes era falsa, y la sección que lo cuenta dice cómo.

Por qué le importa a alguien cuál es el denominador

Un informe de visibilidad te dice que no te citaron. Detrás de esa frase hay dos mundos completamente distintos.

En el primero, el motor produjo una respuesta, eligió ocho fuentes, y ninguna eras tú. Eso es un problema de contenido y de autoridad, es el que toda herramienta de esta categoría está construida para describir, y el trabajo que sale de ahí es el que vendemos.

En el segundo, el motor no produjo nada. No hubo respuesta, ni lista de citas, ni ocho fuentes. No se citó a nadie, ni a tus competidores, ni a los que ya están dentro. Tu cero es idéntico al de todo el mundo y no dice absolutamente nada de tus páginas.

Los dos se ven igual en todos los paneles que hemos visto, el nuestro incluido. El número es cero en los dos casos.

Hemos llegado a esta distinción dos veces por caminos distintos. Un barrido de preguntas de compra local encontró una forma de pregunta entera donde el AI Overview de Google no salía nunca, mientras AI Mode contestaba siempre en la misma llamada. Y en un estudio de palabra clave contra pregunta, una frase francesa de palabras clave no devolvió nada en seis pasadas mientras la forma de pregunta de la misma intención salió y citó cinco fuentes estables. Las dos veces el hecho interesante no era a quién se citaba, era que no había nada dentro de lo que citar.

Lo que ninguna de las dos contestó es con qué frecuencia pasa eso en preguntas de compra corrientes, que es adonde apunta casi toda la medición.

El diseño, y la única regla que hace que valga la pena

Cinco categorías, elegidas porque dos brazos anteriores de nuestro estudio de forma ya las usaban, así que las cadenas son unas que hemos medido antes y se pueden comprobar contra el registro. Cada una preguntada en cuatro mercados, en el idioma de ese mercado, en forma de palabra clave para que la redacción quede fija. Tres pasadas por celda en el AI Overview. Veinte celdas en total.

Una lectura por celda, y sin reintentos, saliera lo que saliera. Esa regla es el estudio.

Contar las pasadas contestadas de todas las lecturas de AI Overview que ya hay en nuestro registro produce un gradiente de mercado de aspecto impecable. No vale nada, por tres motivos separados, y cada uno basta por su cuenta. Los brazos cubren conjuntos de preguntas distintos, diecinueve categorías en un mercado y cinco en los demás. Se leyeron en días distintos. Y las lecturas cortas se releyeron, así que el brazo que produjo más lecturas cortas acumuló más filas extra, o sea que la muestra quedó seleccionada exactamente por el resultado que se estaba midiendo.

Ese último es la trampa que este registro ya tiene documentada en sus propios números de control, y conviene nombrarla sin rodeos: si reintentas las lecturas que salen finas, tu política de reintento se convierte en tu resultado.

Así que sin reintentos. Una celda que contestó una de tres queda registrada como una de tres y se queda ahí.

Qué volvió

CategoríaEstados UnidosEspañaAlemaniaFrancia
CRM3333
Gestores de contraseñas2031
Hosting web3333
Tiendas online3333
Cuentas de empresa3333
Contestadas de 1514121513

Dieciséis de estas veinte celdas están en tres de tres. La decimoséptima completa es la de gestores de contraseñas en Alemania, que es de lo que va la fila de debajo.

Todos los déficits del estudio son una categoría. Cuatro mercados, cinco categorías, y el único tipo de celda que alguna vez dejó de salir en todas las pasadas es gestores de contraseñas.

Esa categoría hace después algo que ninguna otra hace. Devuelve tres de tres en Alemania, dos de tres en Estados Unidos, una de tres en Francia y nada en España, la misma noche, con la misma herramienta, preguntando la frase equivalente en cada idioma. Las otras cuatro categorías están planas en los cuatro mercados.

Cinco categorías no eran suficientes categorías, así que añadimos cinco más

«Los tres déficits son una categoría» descansa sobre cuantas categorías hayas preguntado. Con cinco puede ser cierto porque haya una categoría mal educada en el mundo, o porque cinco no bastan para encontrar la segunda. El estudio no podía separarlo y un lector tampoco.

Así que salieron cinco más: gestión de proyectos, email marketing, contabilidad, VPN y creadores de webs, en los mismos cuatro mercados, misma regla, sin reintentos. El umbral se escribió antes: nada nuevo corto y la afirmación se publica sobre diez categorías; algo nuevo corto y el titular se reescribe en cuatro idiomas para nombrar el recuento de categorías con déficit.

Las 20 celdas nuevas contestaron todas las pasadas. Así que el estudio es 37 de 40 sobre 10 categorías, y todos sus déficits siguen siendo una categoría de diez.

No vamos a explicarlo, porque no medimos ningún mecanismo. Lo que sí se puede decir es qué le hace a un número que alguien está comprando: en España, un informe sobre esa categoría construido con una sola lectura habría enseñado cero citaciones para todo el mercado, y la lectura correcta de ese cero es que no había nada dentro de lo que citar.

Releímos la única celda interesante antes de escribir sobre ella

Una sola lectura que produce un gradiente limpio es justo la forma con la que este registro se ha quemado antes. La regla que nos escribimos es que cuando una celda da un resultado llamativo, la siguiente llamada es la réplica y no la redacción. Así que la pregunta de gestores de contraseñas se hizo una segunda vez en los cuatro mercados, mismas cadenas, mismas tres pasadas, misma regla de no reintentar.

Gestores de contraseñasPrimera lecturaSegunda lectura
Alemania33
Estados Unidos23
Francia11
España00

El orden aguantó y nadie cruzó a nadie. Alemania sigue arriba, España sigue abajo, y la única celda que se movió se movió hacia arriba: Estados Unidos pasó de dos de tres a tres de tres, que la empata con Alemania en vez de reordenar nada.

Hay dos cosas que valen más que el orden.

España está ahora en 0 de 6 pasadas contestadas, en dos lecturas y dos fechas. Seis peticiones de AI Overview sobre una pregunta de compra comercial corriente, y seis veces no salió nada, mientras la frase alemana equivalente salió en las seis suyas. Un informe de visibilidad de esa categoría en ese mercado, con las pasadas que sean, enseñaría a todos los proveedores en cero.

Francia devolvió exactamente una de tres, dos veces. Eso es distinto de una celda simplemente ruidosa. Dos lecturas independientes cayendo en la misma fracción se parece más a una tasa parcial de renderizado que a una mala noche, y es la primera celda de este estudio que se puede describir así.

Las dos lecturas van impresas y ninguna sustituye a la otra. Una media de dos escondería los dos únicos números que un lector puede comprobar, y con recuentos tan pequeños la media es lo menos informativo que hay.

El recuento del titular, 17 de 20, sigue siendo a propósito la primera lectura de cada celda. Meter una réplica dentro significaría que el número cambia cada vez que releemos algo, que es como una cifra deja de ser comprobable.

Otras cuatro cosas que teclea un comprador

Todas las celdas hasta aquí son la misma forma, mejor X. Es una de varias cosas que alguien teclea antes de comprar. También pregunta cuánto cuesta, cómo se comparan las opciones, cómo elegir, y si hay una gratis, y un informe que dice que una categoría no tiene visibilidad las está juntando todas.

Así que las cinco categorías originales se preguntaron de cuatro formas más, en Estados Unidos, misma regla y sin reintentos, dejando fijos mercado y categoría para que la forma sea lo único que se mueve. La fila de mejor ya existía, lo que convierte esto en una comparación dentro de la categoría además de dentro del mercado.

Contestadas de 3CRMContraseñasHostingTiendasCuentas
mejor32333
precio32303
comparativa31333
cómo elegir13333
gratis33333

16 de las 20 celdas nuevas contestaron todas las pasadas. Las 4 que no se parten en dos clases, y separarlas es de lo que va todo este estudio: 2 salieron cortas porque la superficie no salió, y 2 porque la herramienta paró antes. El cero de la celda de precio de tiendas online es la segunda clase, no la primera.

Los dos déficits de superficie son gestores de contraseñas. Contando también su celda de mejor, esa categoría sale corta en 3 de sus 5 formas mientras ninguna otra categoría sale corta en ningún sitio donde la medición terminara.

Así que la forma no parece ser lo que decide si sale un resumen, y la lectura por categoría sobrevive a preguntarla de cuatro maneras más. Eso vale más que el brazo original, porque «una categoría es poco fiable» medido de cinco formas es una afirmación distinta de la misma frase medida de una.

Un mercado, y esta sección no dice nada de los otros tres. Las formas se preguntaron sólo en inglés y en Estados Unidos.

Las mismas veinte preguntas en la otra superficie

El brazo de arriba no puede decir por qué una celda salió corta, y no lo intenta. Sí puede decir barato una cosa que cambia el consejo: si la otra superficie contesta la misma pregunta.

Así que las mismas 20 celdas fueron a AI Mode. Mismas cadenas, mismos mercados e idiomas, mismas tres pasadas, misma regla de no reintentar.

Contestadas de 15AI OverviewAI Mode
Estados Unidos1415
España1215
Alemania1515
Francia1314

Todas las celdas que salieron cortas en el AI Overview devolvieron tres de tres enteras en AI Mode. Las 3. Emparejando dentro de la celda, AI Mode fue más alto en 3 celdas, igual en 16 y más bajo en 1.

El caso más nítido es el que este estudio lleva rodeando. La frase española de gestores de contraseñas va ya por 0 de 6 pasadas pedidas de AI Overview en las dos lecturas de este estudio. En AI Mode, la misma cadena en el mismo mercado y el mismo día contestó 3 de 3 y citó dieciséis dominios.

Eso zanja qué es el cero español. No es una pregunta que nadie pueda contestar, ni una categoría sin fuentes. Es una superficie decidiendo no salir mientras la otra contesta la misma pregunta y reparte dieciséis citas. Un informe de visibilidad que enseñe cero para ese mercado y esa categoría está describiendo la maquetación de Google, no el contenido de nadie.

El umbral con el que se congeló este brazo pedía 20 de 20 y devolvió 19. La excepción es el hosting web francés a dos de tres, y su resultado lleva la bandera de parada temprana de la propia herramienta, así que lo que se quedó corto fue la medición y no la superficie negándose. Lo tratamos como la primera rama con la excepción nombrada y no como un tercer patrón, y esta frase existe para que un lector pueda discrepar de esa decisión.

Una cosa que esto no puede hacer, y es el motivo de que no haya ningún porcentaje combinado más arriba: los dos brazos se leyeron en días distintos. Toda comparación de aquí es dentro de una celda, donde la pregunta y el mercado se cancelan, y nada de esto es una tasa entre superficies.

La predicción que escribimos antes, y por qué nos equivocamos

El diseño se congeló antes de la primera llamada, con la predicción y el umbral escritos dentro. Los dos merecen citarse porque la predicción falló.

Predijimos que el orden del gradiente contaminado anterior se reproduciría más o menos: Estados Unidos arriba y Francia abajo. El umbral decía que si no se reproducía, publicaríamos que no, y corregiríamos la observación anterior en vez de suavizarla.

Alemania contestó todas las pasadas pedidas y España fue la que menos contestó. Francia queda a una pasada de Estados Unidos. No sobrevivió ninguno de los dos extremos de la predicción.

Así que el gradiente anterior eran los conjuntos de preguntas, los días distintos y la selección por reintento, no los mercados. Una nota de instrumento de nuestro estudio de forma decía que Francia entregaba menos lecturas completas que Alemania, y quitada la selección, Francia queda a una pasada del brazo estadounidense y Alemania sale perfecta. Esa nota está corregida en sus cuatro idiomas en vez de desaparecer sin más, y la corrección está ahí para que un lector que vio la primera versión encuentre la segunda.

Hay algo más pequeño que conviene admitir al lado. La misma frase francesa de gestores de contraseñas no devolvió nada en seis pasadas repartidas en dos lecturas el día anterior, y una de tres aquí. Tres lecturas de una cadena en dos días: nada, nada, y luego algo. Una sola lectura de esa celda podría haber informado honestamente de que «la superficie no sale nunca aquí» o de que «la superficie sale un tercio de las veces», y son afirmaciones distintas.

Qué cambia esto si compras o construyes medición

Pregúntale a cualquier proveedor qué significa su cero. No si mide AI Overviews, que a eso todos dicen que sí. Pregunta si un cero en su informe distingue «el motor contestó y no te citó» de «el motor no contestó». Si no lo saben responder, ese número son dos números con una sola etiqueta.

Pregunta cuántas pasadas hay detrás de una celda, y qué pasa con las cortas. Una pasada es una moneda al aire disfrazada de medición, y una herramienta que reintenta en silencio hasta conseguir respuesta está informando de su política de reintento.

No generalices un fallo de renderizado entre mercados. La única categoría que falló aquí falló por una cantidad distinta en cada mercado, y las cuatro que no fallaron no fallaron en ninguno. Lo que gobierne esto no es un ajuste nacional que se pueda consultar.

Y tampoco lo generalices entre superficies. Esto es sólo el AI Overview de Google. Nuestro propio trabajo ha encontrado repetidamente que un resultado medido en una superficie no viaja a otra, y el barrido local es el ejemplo más nítido: la superficie que se negaba a contestar la contestaba siempre el AI Mode del propio Google, en la misma llamada.

La versión práctica, para quien haga sus propias comprobaciones: anota cuántas pasadas contestaron, al lado del recuento de citas, siempre. No cuesta nada, es la diferencia entre los dos ceros, y casi nadie lo hace.


Límites

40 celdas. Diez categorías en cuatro mercados basta para enseñar que los dos resultados existen y no se acerca a estimar con qué frecuencia ocurre cada uno. Cada cifra de aquí es un recuento.

Una lectura por celda, salvo una. Es el diseño y es también el límite principal: una sola lectura no puede separar una categoría que sale un tercio de las veces de una que se midió en mala noche. La única celda que dio un resultado que mereciera contarse se leyó una segunda vez en los cuatro mercados, y esas 4 lecturas van al lado de la primera en vez de dentro. Todas las demás celdas del estudio siguen siendo una sola lectura.

2 superficies, y sólo una en todas partes. El AI Overview de Google en todos los brazos, y AI Mode en las veinte celdas de la sección emparejada. Nada de aquí describe ChatGPT, Gemini ni Perplexity.

5 formas de pregunta, y sólo una en todos los mercados. La frase de palabras clave se mantiene fija en los cuatro mercados para poder compararlos; las otras cuatro formas se preguntaron sólo en Estados Unidos. Ya sabemos que la forma de pregunta de una consulta francesa de gestores de contraseñas salió cuando la de palabra clave no, así que la forma importa y este estudio ya mide parte de ella en vez de sólo dejarla fija.

2 fechas de calendario. La primera sesión cruzó la medianoche local, así que sus filas llevan dos fechas para menos de cuarenta minutos transcurridos. Todo lo añadido después se leyó en la segunda de esas fechas. Ningún brazo de aquí abarca un día.

Nada de esto es causal. No se cambió ninguna página y no se midió nada antes y después. Esto es lo que devolvió la superficie.


Preguntas frecuentes sobre si el AI Overview llega a salir

¿Siempre aparece un AI Overview en una búsqueda comercial?

No. En este estudio 37 de 40 celdas devolvieron uno en todas las pasadas, así que en preguntas de compra normalmente sí, pero una categoría no devolvió nada en un mercado y una pasada de tres en otro. Un barrido aparte de preguntas de servicio local encontró una forma de pregunta entera donde no aparecía nunca. Así que «normalmente» es la palabra correcta y «siempre» no lo es.

Si el AI Overview no sale, ¿significa que no soy visible?

Significa lo contrario de lo que sugiere un panel. Si el resumen no salió, no se citó a nadie dentro: ni a ti, ni a tus competidores, ni a los que ya estaban. Un cero de una pasada donde no salió nada no dice absolutamente nada de tus páginas, mientras que un cero de una pasada donde el motor contestó y eligió otras ocho fuentes dice muchísimo. Son el mismo número y piden respuestas opuestas.

¿Sale menos el AI Overview fuera de Estados Unidos?

En este estudio no, y predijimos que sí. Alemania devolvió resumen en las 30 pasadas pedidas, Estados Unidos en 29, Francia en 28 y España en 27. El brazo alemán fue el más completo y el estadounidense no fue el primero. Un recuento anterior nuestro sugería otra cosa y estaba midiendo su propia política de reintento.

¿Por qué se comporta una categoría distinto de todas las demás?

No lo sabemos, y no medimos ningún mecanismo, así que no vamos a ofrecer uno. Lo que sí se puede decir es que no es un ajuste de mercado: la misma categoría devolvió tres de tres, dos de tres, una de tres y ninguna de tres en cuatro mercados distintos la misma noche, mientras las otras cuatro categorías devolvían tres de tres en todos.

¿Cuántas pasadas debería usar una medición de visibilidad?

Más de una, y el número tiene que verse en el informe. Una sola pasada no distingue una citación estable de una casualidad, y no distingue una citación ausente de una respuesta ausente. Tres es el mínimo que usamos para cualquier cosa publicada, y hasta tres es poco: un listón estricto de «citada en todas las pasadas» tira una fuente entera si una pasada se despista.


Dónde te deja esto

La conclusión útil no es que los AI Overviews sean poco fiables. En cuatro de las cinco categorías de aquí salieron en todas las pasadas de todos los mercados, que es una superficie estable con cualquier criterio razonable.

La conclusión es que la fiabilidad no es uniforme, no sigue al mercado, y el modo de fallo es invisible en el único número que informa la mayoría de las herramientas. Una categoría de este estudio pequeño produjo en España un cero que no significa nada sobre el contenido de nadie, y habría aparecido en un informe idéntico a un cero que lo significa todo.

Si te llevas un hábito de aquí, llévate el barato: cuenta las respuestas, no sólo las citas.

Pregúntale a la IA sobre este artículo

Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.

Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.

Escrito por

Maher El Ouahabi

CTO y cofundador de EchoWi

Construye el software que enseña a las marcas lo que la IA dice de ellas, y qué cambiar para que la siguiente respuesta sea mejor. Doce motores, medidos antes y después.

LinkedIn Maher El Ouahabi (se abre en una nueva pestaña)