Saltar al contenido
Visibilidad IAGEO
ES

Leímos una pregunta ocho veces. Las fuentes no se movieron, se movió la respuesta, y eso rompe la métrica que usa todo el mundo.

Doce dominios citados en siete de ocho pasadas y uno en una. «Citada en todas las pasadas» no mide estabilidad, mide si cazaste la pasada rara.

· 12 min de lectura

Todas las cifras de estabilidad de este sitio se apoyan en el mismo listón: una fuente cuenta si fue citada en todas las pasadas que respondieron, tres pasadas por pregunta. Ayer ese listón hizo pasar una celda de cero fuentes estables a doce entre dos lecturas separadas por una hora, así que dejamos de añadir celdas y leímos una sola pregunta a fondo. Ocho pasadas respondidas. Doce dominios citados en siete de ellas, y un dominio, google.com, citado en una. Una segunda pregunta dio la forma idéntica con cinco pasadas: doce en cuatro, google.com en una. Las fuentes no parpadean. Una pasada de cada cinco a ocho devuelve otra respuesta, y el listón estricto tira las doce a la vez cuando tu muestra la contiene.

Eso convierte «citada en todas las pasadas» en una medición de tu suerte al muestrear en vez de de algo sobre las fuentes, y lo hemos estado publicando.

Acotado el mismo día. Cuatro preguntas más con este marco y esta superficie no enseñan el mecanismo de abajo, así que es de estas dos preguntas y no de AI Mode: un recuento estable de cero resulta ser tres hechos distintos, y una categoría devuelve las mismas nueve fuentes en todas las pasadas. La aritmética de aquí no cambia para las dos preguntas sobre las que se midió.

Transparencia: EchoWi vende medición de visibilidad en IA, y esta pieza retira un estadístico que usamos en nueve estudios publicados y que los productos de esta categoría reportan como cifra de titular. Las dos preguntas, la superficie, el mercado y los recuentos de pasadas están en nuestro registro de mediciones, así que la aritmética de abajo se puede comprobar y repetir en contra nuestra.


La versión corta

  1. Doce dominios, un recuento. Leída ocho veces, doce fuentes fueron citadas en exactamente siete pasadas cada una. Un parpadeo independiente esparce los recuentos; doce cayendo en el número idéntico es una pasada compartida que falta.
  2. La pasada rara cita a Google y nada más. google.com es el único dominio presente en la pasada de la que faltan los otros doce, en las dos preguntas.
  3. Así que el listón es todo o nada. Muestrea tres pasadas sin la rara y tienes doce fuentes estables. Muestrea tres con ella y tienes cero. Nada de las fuentes cambió.
  4. La probabilidad de cazarla a tres pasadas es del 33 al 49 % en estas dos preguntas. Eso no es un margen de error, es una moneda al aire que decide entre una respuesta vacía y una llena.
  5. Lo que hay que reportar es la frecuencia, siete de ocho, y no un aprobado o suspenso contra un listón que una sola pasada puede vetar.

Qué hicimos exactamente

El estudio entre superficies de ayer publicó que cuatro celdas no devolvían ninguna fuente estable en AI Mode. Repreguntadas una hora después, las cuatro devolvieron una, y nóminas en Estados Unidos pasó de cero a doce siendo los doce exactamente los dominios que la primera vez estaban en dos pasadas de tres. Retiramos la afirmación el mismo día, y la pregunta obvia era si se movía el listón o las fuentes.

Así que en vez de otra celda, una pregunta leída tan a fondo como llega la herramienta. Pedimos diez pasadas y salieron ocho, y se dice porque el denominador de cada recuento de abajo son las pasadas que ocurrieron y no las que se pidieron.

Dos preguntas, una forma

PreguntaPasadas respondidasDominios en una menos que todasDominio de la pasada rara
Mejor servicio de nóminas812google.com en 1
Mejor software de contabilidad512google.com en 1

La columna importante es la tercera. Doce fuentes a las que falta exactamente una pasada, en las dos preguntas, sin ninguna fuente en seis de ocho ni en ocho de ocho.

Si cada fuente fuera poco fiable por su cuenta, los recuentos se esparcirían: algunas en ocho, algunas en seis, algunas en cinco. No se esparcen nada. Doce dominios compartiendo un solo recuento es lo que parece desde fuera una pasada que falta, y por eso el agregado merece leerse en vez de ojearse.

El control: las mismas dos preguntas en AI Overview

Si una pasada de cada cinco a ocho contesta distinto, la pregunta obvia es si eso es de AI Mode o de la medición. Así que las dos preguntas se leyeron igual en AI Overview.

LecturaPasadasCitados en todasCitados una vezPasada compartida
AI Mode, nóminas801
AI Mode, contabilidad501
AI Overview, nóminas96 de 60no
AI Overview, contabilidad104 de 2012no

Ninguna lectura de AI Overview tiene la forma. Ningún dominio se queda solo en una pasada mientras todo lo demás se queda en una menos que el total, así que la pasada degenerada es una propiedad de AI Mode en estas cuatro lecturas y no de la herramienta que mide las dos.

Pero AI Overview tampoco es determinista, y la primera lectura casi nos convence de que lo era. Nóminas devolvió seis dominios, los seis citados en las nueve pasadas respondidas, sin ninguna cola. Eso es lo más estable que llega a ser una capa de recuperación, y era tentador escribir que AI Overview simplemente no se mueve. La lectura de contabilidad lo mató: cuatro dominios en las diez pasadas, uno en nueve, dos en ocho, uno en dos y doce dominios citados exactamente una vez cada uno.

Así que las dos superficies rompen el mismo estadístico de dos maneras distintas. En AI Mode una sola pasada puede vaciar el conjunto estable. En AI Overview el conjunto se erosiona según se añaden pasadas, porque el listón pide unanimidad y cada pasada extra es otra oportunidad de perderla.

Qué significa eso para nuestras propias cifras publicadas

Esta es la parte incómoda. Nuestro registro tiene una fila de contabilidad de Estados Unidos en AI Overview con trece dominios estables a tres pasadas. Leída diez veces, la misma pregunta en la misma superficie tiene cuatro.

Las dos son correctas y contestan preguntas distintas. Trece es cuántas fuentes volvieron en las tres pasadas de aquella lectura. Cuatro es cuántas volvieron en las diez de esta. El listón es una función del número de pasadas, y siempre lo fue.

Eso no invalida las comparaciones construidas encima, porque cada celda del estudio de categorías emparejadas se midió a tres pasadas y se compara contra otras celdas a tres pasadas. Lo que sí retira es una lectura de esos números que nunca escribimos pero que haría cualquiera: un recuento de conjunto estable no es una estimación de cuántas fuentes son estables. Es un recuento de lo que sobrevivió a un número concreto de pasadas, y va al lado de ese número.

La aritmética que convierte esto en un problema

Si una pasada de cada n devuelve la respuesta rara, la probabilidad de que una muestra de k pasadas la contenga es 1 - (1 - 1/n)^k.

Pasadas muestreadasNóminas, rara 1 de 8Contabilidad, rara 1 de 5
333 %49 %
549 %67 %
1074 %89 %

Lee esa tabla en el sentido correcto, porque es contraintuitiva. Más pasadas hacen que el listón estricto devuelva cero más a menudo, no menos. El listón pide unanimidad, y la unanimidad se pone más difícil según crece la muestra. Un producto que lanza tus prompts a diario y reporta cuántas fuentes salieron absolutamente todas las veces está corriendo una prueba que su propia diligencia garantiza que falle.

Eso es lo contrario de como debería comportarse una métrica de estabilidad, y es sobre lo que se apoyaban nuestras propias cifras de tres pasadas.

Por qué el cero y el doce eran los dos verdad

Nóminas de Estados Unidos en AI Mode, primera lectura: tres pasadas, una de ellas la rara, cero fuentes citadas en las tres. Segunda lectura una hora después: tres pasadas, ninguna de ellas la rara, doce fuentes citadas en las tres.

Las dos lecturas son correctas. Ninguna describe las fuentes. Con 1 de cada 8, una lectura de tres pasadas cae en cero alrededor de un tercio de las veces, y la primera cayó.

Esto explica además un caso que publicamos cuatro días antes y que entonces no supimos explicar. En nuestro trabajo entre días una pregunta de marketing por email no devolvió nada estable una tarde y siete dominios una hora después, y esos siete eran exactamente las fuentes que habían estado en dos pasadas de tres. Escribimos entonces que un listón estricto y una recuperación que se mueve producen un conjunto vacío sin que nada esté roto. Era correcto y vago. El mecanismo es una sola pasada degenerada, y se ve en cuanto lees lo bastante a fondo.

Qué cambiamos

No borramos las cifras de conjunto estable. Siguen siendo la respuesta honesta a «qué fuentes volvieron en todas las pasadas de esta lectura», y todas van publicadas con su número de pasadas al lado. Lo que no son es una propiedad de la pregunta, y nuestros estudios que tratan un cambio en ese número como un cambio en el mundo necesitan el matiz que da esta pieza.

La cifra que lideraremos es la frecuencia. Siete de ocho es un hecho sobre la fuente. Cero de tres, cuando las tres incluían la rara, es un hecho sobre la muestra.

Y la segunda pregunta que hacerle a un proveedor ya tiene compañera. Después de «¿tus pasadas saltan la caché?», pregunta qué le pasa a su cifra de estabilidad cuando sube el número de pasadas. Si baja, está reportando unanimidad, y la unanimidad no es estabilidad.

Lo que esto no demuestra

Dos preguntas, una superficie, un mercado, un día. Esto es AI Mode en Estados Unidos en inglés el 12 de agosto de 2026. Las dos lecturas de AI Overview de arriba son un control del mismo día y el mismo mercado, no una afirmación general sobre esa superficie, y nada de esto dice con qué frecuencia pasa a lo largo de semanas.

La pasada compartida es una inferencia de recuentos, no una observación de pasadas. La herramienta devuelve cuántas pasadas citaron cada dominio, no cuáles. Lo que convierte esa lectura en algo más que una suposición es que los doce recuentos son idénticos en las dos preguntas, y que una lectura aparte de tres pasadas devolvió los doce en tres de tres, lo que no puede pasar si sus pasadas ausentes estuvieran repartidas.

Las dos lecturas pararon antes de tiempo. Pedimos diez pasadas y salieron ocho y cinco. Por eso las dos tasas de pasada rara, 1 de 8 y 1 de 5, son estimaciones de una sola lectura cada una y no mediciones, y por eso la tabla de probabilidad es un rango y no una constante.

Y una pasada degenerada no es necesariamente un solo tipo de pasada. Vemos que google.com es el único dominio citado en ella. No vemos si fue una respuesta más corta, una negativa o una ruta de recuperación distinta, y esta medición no se diseñó para separarlas.

Preguntas frecuentes sobre medir la estabilidad de las citas

¿Qué mide de verdad «citada en todas las pasadas»?

Con esta evidencia, si tu muestra incluyó la pasada que contesta distinto. Leyendo una pregunta ocho veces, doce fuentes fueron citadas en siete pasadas cada una y un dominio en la restante. Una muestra de tres pasadas que contenga esa pasada reporta cero fuentes estables; una que no la contenga reporta doce, y las fuentes eran idénticas las dos veces.

¿Lanzar más prompts hace más fiable una puntuación de estabilidad?

Esta clase de puntuación no. Un listón que exige la fuente en todas las pasadas se pone más difícil de superar según se añaden pasadas, así que más diligencia produce una cifra más baja en vez de más firme. En nuestra pregunta de nóminas la probabilidad de que el listón estricto devuelva cero sube del 33 % a tres pasadas al 74 % a diez.

¿Qué habría que reportar en su lugar?

La frecuencia de citación de cada fuente, con el número de pasadas al lado. Siete de ocho es comprobable y habla de la fuente. Un aprobado o suspenso contra la unanimidad lo puede voltear una sola pasada y habla de la muestra.

¿Por qué una pasada citó solo a Google?

No lo sabemos, y esta medición no puede decirlo. Lo que se ve es que en las dos preguntas hay exactamente una pasada donde las doce fuentes habituales están ausentes y google.com está presente. Si esa pasada fue una respuesta más corta o una ruta de recuperación distinta es otra pregunta que necesita inspección por pasada en vez de agregados.

¿Significa esto que vuestros estudios anteriores están mal?

Los recuentos están bien y la interpretación necesitaba estrecharse, que es por lo que esto se publica en vez de arreglarse en silencio. Un conjunto estable es una descripción exacta de una lectura. Tratar un cambio en él como un cambio en lo que cita el motor es la parte que no sobrevive, y la pieza de ayer sobre superficies ya lleva dentro la retractación que empezó esto.

¿Cómo repito esto en contra vuestra?

Coge una pregunta de compra, hazla de ocho a diez veces en una superficie y en un mercado, y anota cuántas pasadas citaron cada dominio en vez de si cada dominio superó todas. Si los recuentos se agrupan en un solo número, uno por debajo del total, tienes la misma forma, y el listón que cita todo el mundo está midiendo tu muestra.

Pregúntale a la IA sobre este artículo

Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.

Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.

Escrito por

Maher El Ouahabi

CTO y cofundador de EchoWi

Construye el software que enseña a las marcas lo que la IA dice de ellas, y qué cambiar para que la siguiente respuesta sea mejor. Doce motores, medidos antes y después.

LinkedIn Maher El Ouahabi (se abre en una nueva pestaña)