Saltar al contenido
AI VisibilityGEO
ES

La mitad de lo que cita una IA desaparece en seis días. La otra mitad casi no se mueve.

Catorce preguntas de compra medidas dos veces en agosto y otra vez seis días después. El conjunto citado solapa un 50 % y el núcleo aguanta un 73 %.

· Actualizado · 16 min de lectura

Toda herramienta de visibilidad en IA quiere venderte un gráfico de tus fuentes más citadas a lo largo del tiempo. Construimos uno con mediciones reales y después le hicimos la pregunta que el gráfico no puede contestar: cuando una fuente desaparece de él, ¿se ha ido de verdad?

14 preguntas de compra, hechas el 15 y el 16 de agosto y otra vez el 22. Misma superficie, mismo mercado, mismo idioma y el mismo número de pasadas las dos veces. El conjunto citado entero solapa un 50 % entre la línea base y seis días después. El conjunto de dominios que volvió en las dos lecturas de la línea base aguanta un 73 %.

O sea que la mitad de lo que cita un asistente es distinta en una semana, y la mitad duradera es otra cosa y se comporta de otra manera. Un gráfico que reporta un solo número no te puede decir cuál de las dos se movió.

Transparencia y método: EchoWi vende medición de visibilidad en IA, así que un estudio sobre si estos gráficos significan algo es un estudio sobre nuestra propia categoría. El diseño, el estadístico que decide, las dos predicciones y el umbral de retirada se escribieron y se commitearon antes de la primera llamada. Las preguntas, la superficie, el mercado, las fechas y el número de pasadas contestadas por celda están en nuestro registro de mediciones, y con eso cualquiera puede repetirlo en contra nuestra.

La versión corta

  1. El conjunto citado entero se renueva cerca de la mitad en seis días. Solapamiento mediano del 50 % sobre 12 celdas comparables.
  2. El núcleo aguanta un 73 %. Núcleo es el dominio que volvió en las dos lecturas de la línea base, no el que apareció una vez.
  3. La durabilidad es propiedad de la pregunta, no del método. 4 celdas conservaron todo su núcleo. 4 conservaron exactamente la mitad. Misma superficie, mismo mercado, mismo listón y los mismos seis días.
  4. Tres celdas que parecían perfectamente estables no lo eran. Las tres ganaron ruido en cuanto hubo un tercer punto.
  5. Reformular la pregunta casi no cuesta nada. 5 de 6 intenciones devolvieron un conjunto idéntico desde una palabra clave y desde una pregunta el mismo día.

Por qué una cuota es la unidad equivocada

Antes de la pregunta del tiempo hay una pregunta de medición, y equivocarse en ella inventa la respuesta.

Pregunta lo mismo dos veces y el número de fuentes citadas una vez se mueve mucho. El número de las citadas todas las veces apenas se mueve. Así que un porcentaje construido como duraderas sobre el total tiene un numerador casi constante y un denominador que vaga, y eso produce una cifra que parece una medición y se comporta como una moneda al aire.

Debajo hay una segunda trampa, y vale más de lo que casi nadie supondría. Más pasadas contestadas son más ocasiones de que un dominio aparezca alguna vez, así que una lectura de diez pasadas tiene un conjunto mayor que una de tres. Compara una lectura de diez contra una línea base de tres y el núcleo parecerá que se hundió, cuando lo que pasó es que la segunda lectura tuvo más oportunidades de añadir desconocidos.

Ese confusor lo medimos directamente sobre las celdas de nuestro registro con dos o más fechas:

CeldasNúcleoBordeCuota de núcleo
Distinto número de pasadas10145418 %
Mismo número de pasadas668543 %

El 18 % estaba midiendo el listón y no el mundo. Veinticinco puntos de diferencia, de una variable que nadie pone en el gráfico. Todas las cifras de este estudio salen de celdas que contestaron el mismo número de pasadas en las dos fechas, y las dos que contestaron menos quedan fuera y contadas aparte en vez de compararse a un listón más bajo.

Seis días después

12 celdas califican. La retención es la fracción del núcleo de la línea base que sigue citada el 22 de agosto.

PreguntaNúcleoSigue citadoRetención
best grammar checker44100 %
best note taking app22100 %
what is the best payroll service for a small business?5480 %
best crm for small business4375 %
what is the best AI coding assistant?10770 %
best vpn service3267 %
best payroll service for a small business10550 %
best website to book flights2150 %
what are the best running shoes for beginners?4250 %

Mediana del 73 %, contra un solapamiento mediano del 50 % para el conjunto citado entero. El núcleo es la mitad duradera por 23 puntos.

Y la distribución importa más que la mediana. 4 celdas conservaron todo y 4 conservaron exactamente la mitad. No hay gran cosa en medio. Que tu categoría tenga una respuesta estable es propiedad de tu categoría, y ninguna cantidad de muestreo convierte una inestable en estable.

Las celdas que parecían perfectas eran las que no tenían nada que equivocar

3 celdas devolvieron una línea base donde todos los dominios citados aparecían en las dos lecturas. Cero ruido. Leído deprisa, eso es el sueño: un conjunto fijo de fuentes sobre el que ponerse a trabajar.

Predijimos antes de medir que al menos 2 de las 3 ganarían ruido con un tercer punto, porque un conjunto que coincide en dos lecturas ha pasado un listón muy bajo, no ha demostrado ser fijo.

Las 3 lo hicieron. Una pasó de diez dominios sin ruido a siete dominios compartiendo cinco con la línea base. Otra pasó de diez a once compartiendo siete.

Esa es la parte que esconde un gráfico semanal. Una fuente que ha aparecido dos veces no está asentada, y una herramienta que te enseña dos puntos y una recta entre ellos te está enseñando una recta.

Por qué existe la mitad que se renueva

Un asistente replanifica la recuperación en cada petición. No está leyendo un índice fijo de fuentes de confianza y citando de él, y las fuentes que sobreviven a todas las lecturas de una pregunta tienen otra pinta que las que aparecen una vez. En estas celdas la mitad duradera la dominan unos pocos destinos grandes que salen en muchas preguntas sin relación entre sí, y la mitad que se renueva es larga, fina y está hecha sobre todo de páginas que encajan con una redacción de una pregunta un día concreto.

Por eso las dos mitades se reportan por separado y no sumadas. Trabajar la mitad duradera es un trabajo distinto de trabajar la que se renueva, y sólo uno de los dos se puede planificar.

Reformular casi no cuesta, y la excepción es la misma dos veces

Seis de las catorce celdas son la misma intención de compra en dos formas, una palabra clave y una pregunta entera. El mismo día y al mismo listón:

5 de 6 devolvieron un conjunto idéntico de dominios. No parecido, idéntico.

La sexta es la de nóminas, y también se separó en la línea base. Dos lecturas con una semana en medio, y la misma intención es la que se parte las dos veces mientras las otras cinco aguantan. Eso no es ruido, es una propiedad de esa pregunta.

Para quien compra un seguidor, ésta es la mitad útil. La preocupación de que tus números dependan de cómo se redactó exactamente el prompt es real, y está concentrada en una minoría de intenciones en vez de repartida. Pero no puedes saber cuál de tus intenciones es la inestable sin preguntarla de más de una forma, y casi nada en el mercado lo hace.

Qué significa esto si estás comprando medición de visibilidad en IA

El gráfico no es inútil. Está reportando dos cosas distintas sumadas, y la útil es la pequeña.

  • Pregunta qué cuenta el número. Un porcentaje de fuentes duraderas sobre fuentes totales se mueve sobre todo con el total. Pide el conjunto.
  • Pregunta cuántas pasadas, y si ese número está fijo. Una comparación entre semanas donde el número de pasadas contestadas deriva está midiendo la deriva. Lo medimos en veinticinco puntos.
  • Pregunta si la herramienta corre más de una redacción por intención. A 5 de 6 intenciones les da igual, y encontrar la sexta es todo el valor.
  • Y pregunta si separa el núcleo del ruido, porque seis días movieron la mitad del conjunto y dejaron tres cuartos del núcleo en paz. Son dos historias distintas sobre tu visibilidad y sólo una merece que actúes.

Si quieres esa separación sobre tu propia categoría en vez de sobre la nuestra, eso es lo que hace nuestro producto, y el método de arriba es el que usa.

La superficie no es el eje mayor, y predijimos que lo sería

El límite declarado de este estudio era una superficie, así que lo cerramos: las mismas 12 celdas leídas en AI Mode el mismo día, así que el emparejamiento es dentro de la celda y sólo cambia la superficie.

La predicción, escrita y commiteada antes de la primera llamada, era que la superficie pesaría más que una semana. No pesa.

Solapamiento mediano
Misma superficie, seis días de diferencia50 %
Las dos superficies, el mismo día50 %

Ése es el umbral de retirada que el diseño nombró, así que la afirmación de que mezclar superficies añade más ruido que un mes de deriva se retira aquí y no se deja caer en silencio.

Y lo que escondía el Jaccard es mejor que lo que predijimos. Un solapamiento bajo entre un conjunto ancho y uno estrecho puede describir contención y no desacuerdo, y esto es contención: una mediana del 94 % del conjunto de AI Overview cabe dentro del de AI Mode, que es 1,52 veces más ancho. 6 de las 12 celdas están contenidas del todo y sólo 2 bajan de la mitad.

O sea que las dos superficies de Google no están contestando con fuentes distintas. Una contesta con un superconjunto de la otra, y el Jaccard castiga al lado estrecho por ser estrecho. Si te citan en AI Overview, casi seguro te citan en AI Mode, y al revés es una moneda al aire.

Las dos celdas que lo rompen merecen nombrarse porque son desacuerdo de verdad y no anchura: las dos redacciones de la pregunta de vuelos comparten sólo 3 de 7, con AI Mode contestando desde Skyscanner, Frommers y US News donde AI Overview contestaba desde Kayak, Expedia y Quora. Mismo día, mismo mercado, misma pregunta, dos secciones de viajes distintas.

Dos superficies de Google encajan una dentro de otra. La tercera no.

La contención es el hallazgo de arriba, y salió de dos superficies que comparten índice. Eso deja una pregunta que un comprador necesita contestada: ¿una superficie contiene a la otra porque así funciona la recuperación, o porque esas dos son la misma recuperación vista a dos anchuras?

Gemini sobre las mismas 12 celdas, el mismo día, lo separa. No encaja.

Mismas 12 celdas, mismo díaContención mediana
AI Overview dentro de AI Mode94 %
Gemini dentro de AI Mode42 %
Gemini dentro de AI Overview37 %

Ése era el umbral de retirada que nombró el diseño, así que la afirmación de que un conjunto estrecho cabe dentro de uno ancho queda acotada a la pareja sobre la que se midió, y no se publica como propiedad de las superficies.

Y el par de números es todo el asunto. Gemini contra AI Overview da un Jaccard de 0,25, y AI Overview contra AI Mode da 0,50. Parecen la misma clase de número, el doble de coincidencia en un caso. No lo son en absoluto. Uno es un conjunto estrecho viviendo dentro de uno ancho; el otro son dos conjuntos que de verdad no comparten fuentes. Sólo la cifra de contención los separa, y ninguna herramienta del mercado la reporta.

Gemini es además algo más estrecho que AI Overview, una mediana del 0,87 de su tamaño, así que esto no va de anchura. Es una recuperación distinta con el nombre de la misma empresa encima.

Lo que significa si estás gastando dinero en medición: vigilar AI Overview te dice casi todo lo que aprenderías de AI Mode, y casi nada de Gemini. Cinco de las ocho celdas comparables comparten menos de la mitad de las fuentes de Gemini con AI Overview. Si tu herramienta reporta un número de Google, pregunta de qué superficie salió, porque la otra es otro mercado.

Y el encaje es estadounidense

Si una superficie de Google contiene a la otra porque comparten índice, eso tiene que aparecer en cualquier mercado. Así que las mismas ocho intenciones en alemán, en Alemania, sobre las dos superficies, cada par en una sola llamada para que las dos lecturas no puedan separarse.

Aparece más débil.

Contención mediana, AI Overview dentro de AI Mode
Estados Unidos94 %
Alemania, todas las celdas comparables50 %
Alemania, las 5 celdas leídas a tres pasadas67 %

El 50 % era el umbral de retirada que nombró el diseño, así que la cifra estadounidense pasa a ser una afirmación sobre ese mercado y no sobre la arquitectura de Google.

Las dos cifras alemanas son las dos honestas y difieren por un motivo que conviene decir en voz alta. La contención es una fracción del conjunto de AI Overview, así que cuando las dos superficies contestan menos pasadas los dos conjuntos se estrechan y la fracción baja. Las dos celdas que contestaron dos veces son las dos más bajas de la tabla. Eso sesga este brazo hacia abajo, que es lo contrario del brazo de Gemini, donde sólo se movía el listón de un lado y un listón bajo empujaba la contención hacia arriba. Un número de pasadas no es un ajuste neutro: hacia dónde dobla una cifra depende de qué lado de la fracción estreche.

Y el control es lo que hace que el brazo signifique algo. Si las respuestas alemanas hubieran usado las mismas fuentes que las estadounidenses, esto sería un mercado medido dos veces. No lo hacen: unidas pregunta a pregunta, el solapamiento mediano entre los conjuntos alemán y estadounidense es de 0,11, de 0,03 a 0,27, y las dos celdas más bajas comparten un solo dominio de treinta y tantos. Alemania es otro conjunto de fuentes, y dentro de él las dos superficies se relacionan de otra manera.

Una celda alemana no devolvió AI Overview en tres pasadas. Eso es una superficie que declina aparecer, no un cero, y queda excluida y nombrada en vez de contada.

Lo que le cuesta a un comprador: el atajo es local. En Estados Unidos, vigilar AI Overview te dice casi todo AI Mode. En Alemania te dice entre la mitad y dos tercios, y el conjunto alemán de AI Mode es 1,67 veces más ancho. Si vendes en más de un país, allí las dos superficies son dos mediciones y no una.

Lo que esto no demuestra

  • Tres superficies de Google y dos mercados. La retención es sólo AI Overview en Estados Unidos; las mitades de superficie añaden AI Mode y Gemini sobre las mismas celdas, y la de mercado repite la medida de contención en Alemania. ChatGPT y Perplexity recuperan de otra manera y por esta vía ChatGPT no devuelve fuentes en absoluto, así que su cero sería del instrumento.
  • Dos mercados y dos idiomas. Todo lo anterior a la sección de mercado es Estados Unidos en inglés; la medida de contención se repite en Alemania en alemán, y el control entre mercados está en el registro.
  • Dos puntos y luego un tercero. Seis días son un intervalo, no una tendencia, y aquí nada dice que la tasa de renovación sea constante.
  • 12 celdas comparables. Una mediana sobre 12 es una dirección y no una cifra precisa, y las dos celdas excluidas por contestar a un listón más bajo están nombradas en el registro en vez de descartadas en silencio.
  • Nada de esto es causal. Medimos qué cambió, no por qué.

Preguntas frecuentes

¿Qué diferencia hay entre el núcleo y el resto?

El núcleo es el conjunto de dominios citados en todas las lecturas de una pregunta y no sólo en algunas. El resto apareció al menos una vez. La distinción importa porque los dos se comportan distinto en el tiempo: en este estudio el núcleo retuvo un 73 % en seis días y el conjunto entero solapó un 50 %.

¿Preguntar más veces hace el número más estable?

No como la gente espera. Más pasadas suben el número de fuentes vistas al menos una vez, así que un estadístico estricto de citada todas las veces se vuelve más difícil de satisfacer según muestreas más. Por eso las comparaciones en el tiempo tienen que dejar fijo el número de pasadas, y por eso medimos veinticinco puntos de diferencia entre listones mixtos y listones casados.

¿Una fuente que desapareció del gráfico se ha ido de verdad?

Muchas veces no. En este estudio, la mitad del conjunto citado entero era distinta a los seis días mientras tres cuartos del núcleo seguían. Un dominio que se cae de una vista semanal puede haber estado en la mitad que se renueva todo el tiempo, y por eso el gráfico útil enseña el núcleo y el borde por separado en vez de una sola línea.

¿Cuántas veces debería preguntar una herramienta cada pregunta?

Las suficientes para distinguir una citación estable de una casualidad, y el mismo número cada vez que compara. Importa más que el número no derive entre las semanas que se comparan que cuál sea exactamente, porque entonces la comparación mide el muestreo y no el mercado.

¿La redacción del prompt cambia la respuesta?

Para la mayoría de intenciones, no. 5 de 6 intenciones devolvieron aquí un conjunto idéntico desde una forma de palabra clave y una de pregunta el mismo día. La sexta devolvió conjuntos distintos en las dos fechas en que se midió, y por eso lo honesto es preguntar cada intención de más de una forma en vez de suponer que la redacción es segura.

Pregúntale a la IA sobre este artículo

Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.

Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.

Escrito por

Maher El Ouahabi

CTO y cofundador de EchoWi

Construye el software que enseña a las marcas lo que la IA dice de ellas, y qué cambiar para que la siguiente respuesta sea mejor. Doce motores, medidos antes y después.

LinkedIn Maher El Ouahabi (se abre en una nueva pestaña)