Una categoría citó las mismas 13 fuentes siempre. Otra citó 49 y casi ninguna se repitió.
42 mediciones de AI Overview en seis categorías: la estabilidad fue de repetirse todas las fuentes a casi ninguna. Remedida un día después, una se invirtió.
Pregúntale tres veces a Google AI Overview cuál es el mejor asistente de código con IA y cita trece fuentes, las mismas trece cada vez. Pregúntale tres veces a qué firma contratar para un CFO externo y cita dieciocho, de las cuales doce aparecen una sola vez.
Misma superficie. Mismo mercado. Mismo día. Mismo número de pasadas. La diferencia es enteramente la categoría por la que preguntas.
Importa porque todos los productos de visibilidad en IA del mercado, el nuestro incluido, te venden un número de pasadas. Si el número correcto son tres en una categoría y treinta en otra, aplicar la misma tasa de muestreo a todos los clientes está mal para la mayoría, y nadie en este mercado publica la cifra que te diría en cuál de los dos casos estás.
Cómo está medido: Google AI Overview, con scraping real y no con la API de un modelo, fijando país e idioma de forma explícita en cada llamada. Caché saltada, cada pasada una llamada nueva, ejecución en serie. Diez mediciones, 42 pasadas en total, del 5 al 7 de agosto de 2026. Contamos dominios citados, no menciones de marca: son resultados distintos y mezclarlos es el error más común de esta categoría. Cada prompt, mercado, fecha y número de pasadas queda registrado literalmente en nuestro registro de mediciones.
El resultado
| Categoría | Mercado | Pasadas | Dominios citados | En todas | Exactamente una vez |
|---|---|---|---|---|---|
| Asistentes de código con IA | EE.UU. | 3 | 13 | 13 | 0 |
| Reserva de vuelos | EE.UU. | 3 | 6 | 6 | 0 |
| Auriculares con cancelación de ruido | EE.UU. | 2 | 4 | 4 | 0 |
| CRM para pymes | EE.UU. | 4 | 11 | 3 | 4 |
| Herramientas de visibilidad IA | España | 3 | 11 | 5 | 4 |
| Herramientas de visibilidad IA | Francia | 3 | 13 | 3 | 7 |
| Herramientas de visibilidad IA | España | 3 | 17 | 3 | 11 |
| Servicios de CFO externo | EE.UU. | 3 | 18 | 3 | 12 |
| Herramientas de visibilidad IA | EE.UU. | 4 | 23 | 3 | 14 |
| Agencias GEO | España | 14 | 49 | 0 | 39 |
| value | |
|---|---|
| Asistentes de código con IA, EE.UU. | 100% |
| Reserva de vuelos, EE.UU. | 100% |
| Auriculares con cancelación, EE.UU. | 100% |
| Herramientas de visibilidad IA, España | 45% |
| CRM para pymes, EE.UU. | 27% |
| Herramientas de visibilidad IA, Francia | 23% |
| Herramientas de visibilidad IA, España | 18% |
| CFO externo, EE.UU. | 17% |
| Herramientas de visibilidad IA, EE.UU. | 13% |
| Agencias GEO, España | 0% |
Lee las dos últimas columnas juntas. Arriba, todas las fuentes que usó la respuesta las usó siempre. Abajo, se citaron cuarenta y nueve dominios en catorce pasadas y ninguno apareció en todas.
La comparación que no admite excusas
Los números de pasadas distintos hacen difícil comparar el centro de esa tabla, así que aquí está el par que no tiene nada que explicar.
Asistentes de código con IA y servicios de CFO externo. Los dos en Estados Unidos, los dos en inglés, los dos en Google AI Overview, los dos con tres pasadas, los dos medidos el 7 de agosto de 2026.
| Asistentes de código | Servicios de CFO externo | |
|---|---|---|
| Dominios citados | 13 | 18 |
| Citados en las tres pasadas | 13 | 3 |
| Citados exactamente una vez | 0 | 12 |
Uno de los dos es completamente reproducible con tres pasadas. El otro, al mismo coste y la misma tarde, no te dice casi nada con tres pasadas: dos tercios de lo que habrías visto era irrepetible.
Si le vendieras a esas dos empresas el mismo informe mensual, una estaría recibiendo una medición y la otra ruido con un gráfico encima.
Qué lo predice de verdad, y qué no
Lo primero que uno piensa es la antigüedad de la categoría. Falla en las dos direcciones.
Los asistentes de código con IA tienen unos tres años y son perfectamente estables. El software de CRM tiene treinta años y devolvió tres dominios estables de once. Ser nuevo no causa inestabilidad.
Lo segundo que uno piensa es el tamaño o el dinero. También falla: reservar vuelos es de las consultas más disputadas comercialmente de internet y devolvió seis dominios, los seis estables.
Lo que tienen en común las filas inestables es más sutil, y lo damos como hipótesis y no como hallazgo porque diez mediciones no bastan para establecerlo:
La inestabilidad sigue al número de páginas intercambiables que compiten por responder. Las firmas de CFO externo, las agencias GEO y los proveedores de visibilidad en IA han producido todos un cuerpo grande de páginas comerciales casi idénticas, cada una con una afirmación parecida y una autoridad parecida. No hay una fuente obviamente preferible, así que la recuperación monta un subconjunto plausible distinto cada vez. Donde una categoría tiene unas pocas fuentes claramente primarias, sea Gartner y GitHub para herramientas de código o un puñado de metabuscadores para vuelos, la recuperación encuentra las mismas y para.
Si eso es cierto, la consecuencia es contraintuitiva: más contenido en una categoría hace las citas menos estables, no más. Merece probarse en serio y pensamos hacerlo.
Las dos cosas que esto cambia en la medición
Una: tu tamaño de muestra es una propiedad de tu categoría, no de tu presupuesto.
El producto estándar de este mercado es un número fijo de pasadas por prompt y mes, vendido igual a todo el mundo. Nuestro catálogo de precios verificados enseña el rango: Nightwatch da treinta respuestas por prompt y mes en todos sus planes, Rank Prompt vende una bolsa de créditos que repartes tú, y varios proveedores directamente no publican la cifra.
Ninguna de esas opciones está mal. Lo que está mal es elegir entre ellas sin saber en qué mitad de esta tabla estás. Treinta respuestas al mes son generosas en una categoría como las herramientas de código y escasas en una como los servicios profesionales.
Dos: un informe suelto no distingue ausencia de ruido.
En las categorías inestables, la mayoría de dominios citados aparecieron una vez. Si tu marca es uno de ellos, un informe mensual que diga “citado” y el del mes siguiente que diga “no citado” no describe ningún cambio en el mundo. Harían falta muchas más observaciones antes de que la diferencia entre esos dos meses significara algo, y la aritmética de cuántas es implacable con muestras pequeñas.
Es la misma forma que encontramos al repetir dos días después un estudio de tres mercados: el agregado se reprodujo casi exacto mientras los nombres concretos cambiaban casi del todo. Totales estables, miembros inestables.
La prueba que puedes hacer tú
No necesitas nuestros datos. Necesitas los tuyos, y este es el procedimiento entero:
- Coge el prompt que de verdad te importa.
- Lánzalo tres veces, con país e idioma fijados de forma explícita y la caché saltada.
- Apunta los dominios citados en cada pasada.
- Cuenta cuántos aparecen en las tres.
Si aparecen casi todos, tres pasadas son una medición real en tu categoría y puedes gastar el resto del presupuesto en superficie: más prompts, más mercados, más motores.
Si aparecen pocos, tres pasadas son una foto y no una tasa. Gasta en repetición, y trata cualquier número mensual suelto, de cualquier proveedor, como provisional hasta tener pasadas suficientes para ponerle un intervalo.
Haz esto una vez por categoría, no una vez por prompt. Es una propiedad del espacio de preguntas en el que vendes y no va a cambiar de una semana a otra.
El hallazgo que no buscábamos
La medición de CRM se pidió tres veces y Google devolvió AI Overview solo una. Sin error y sin fallo: dos de las tres peticiones simplemente produjeron una página sin respuesta de IA. La repetimos pidiendo cuatro y salieron cuatro.
Ese es un tercer estado, y casi todo lo que se reporta en esta categoría lo mete dentro del segundo:
- Apareces en la respuesta.
- Hay respuesta y no estás en ella.
- No hay respuesta.
Una herramienta que informa de “0 menciones” este mes no te ha dicho nada sobre en cuál de los dos últimos estás, y piden reacciones opuestas. Si una pregunta a menudo no genera AI Overview, tu trabajo no es escribir una página mejor para ella. Es elegir otra pregunta, o aceptar que esa superficie no es donde se está atendiendo a ese comprador.
Ya escribimos sobre respuestas que llegan sin ninguna fuente, que es un caso emparentado pero distinto: allí la respuesta existe y no cita nada. Aquí la respuesta no existe. Los dos son invisibles dentro de un porcentaje de visibilidad.
Volvimos a medir una fila al día siguiente y se invirtió
La tabla de arriba son diez sesiones en días concretos. El 8 de agosto de 2026, un día después de medirla, lanzamos otra vez la fila de CRM: la misma cadena de prompt, la misma superficie, el mismo mercado y el mismo número de pasadas.
| CRM para pymes, EE.UU., Google AI Overview | 7 de agosto | 8 de agosto |
|---|---|---|
| Pasadas | 4 | 4 |
| Dominios citados | 11 | 7 |
| Citados en todas las pasadas | 3 | 7 |
| Citados exactamente una vez | 4 | 0 |
La categoría que le dio a este artículo su ejemplo de inestabilidad volvió perfectamente estable. El 27% pasó a 100% de un día para otro, sin cambiar nada por nuestra parte y sin nada que lo explique: prompt idéntico, mismo número de pasadas, un día de diferencia.
Una nota sobre lo cerca que estuvo de salir mal, porque es la misma trampa de la que trata este artículo. La primera remedición usó «what is the best CRM for a small business?», que le quita una palabra al prompt registrado, y devolvió siete de siete en cinco pasadas. Parecía el mismo resultado y no era la misma prueba. La comparación de arriba usa la cadena exacta del registro, porque un prompt que cambia en una palabra es otro prompt, y esa regla ya la hemos publicado.
De aquí salen tres cosas, y las dos primeras nos cuestan algo.
El orden de estabilidad de la tabla de arriba es una foto de sesiones, no una propiedad de las categorías. Escribimos que este artículo era una fotografía y no una serie. Esto es lo que significa esa frase cuando se cobra: una categoría puede pasar de la mitad inestable a lo más alto de la tabla en un día. Quien use nuestra tabla para decidir cada cuánto medir su categoría debería tratar la fila como una sola observación, que es lo que ha sido siempre cada fila.
El mecanismo que planteamos no queda respaldado por esto. Sugerimos que la inestabilidad sigue al número de páginas más o menos intercambiables que compiten por responder. La población de páginas de CRM en internet no cambió de forma apreciable entre un viernes y un sábado. Lo que se movió estaba en la recuperación y no en el corpus, así que un recuento estable de páginas que compiten no puede ser toda la explicación.
Y el consejo práctico sigue intacto, por una razón que conviene decir. Nada de esto sugiere que medir una vez sea seguro. Sugiere lo contrario: si una sola sesión puede dar 27% y la siguiente 100%, una sola sesión es exactamente lo que no puedes usar. La solución no cambia y ahora está mejor respaldada: repetir, con pasadas sin caché, y publicar el número de pasadas junto a cada cifra.
También añadimos una categoría que el conjunto original no cubría, medida el mismo día:
| Categoría | Mercado | Pasadas | Dominios citados | En todas | Exactamente una vez |
|---|---|---|---|---|---|
| Software de gestión de proyectos | EE.UU. | 3 | 18 | 4 | 8 |
Dieciocho dominios en tres pasadas, con cuatro que sobreviven a las tres, la sitúan en la mitad inestable y no junto a los vuelos y los asistentes de código.
Qué no demuestra esto
- Una sola superficie. Solo Google AI Overview. Desde entonces hemos hecho la misma pregunta a cuatro superficies y [ninguna fuente citada apareció en las cuatro] (/es/blog/cuatro-superficies-una-pregunta/), incluida la categoría de arriba del todo de esta tabla, cuya estabilidad dentro de una superficie era perfecta.
- Diez mediciones. Bastan para establecer que la diferencia entre categorías es grande y real. No bastan para ordenar las categorías con precisión, y desde luego no para demostrar el mecanismo que planteamos arriba.
- Los números de pasadas difieren. Un dominio tiene que salir 3 de 3 para ser estable con tres pasadas y 14 de 14 con catorce, así que la métrica se vuelve más dura cuantas más pasadas hay. Por eso el argumento se apoya en los pares con el mismo número de pasadas y no en la tabla entera. Eso no explica una diferencia entre 0% y 67% de irrepetibles con pasadas idénticas.
- Nada causal. Esto es observación. No cambiamos nada y medimos lo que volvió.
- Nada sobre calidad. Ser citado no es ser bueno. Dice qué encontró la capa de recuperación, no qué merece comprarse.
- Una foto, no una serie. Son sesiones sueltas en días concretos, y nuestras propias repeticiones enseñan sesiones que se contradicen entre sí. Trata cada fila como una observación.
Por qué publicamos esto
Va en contra de la versión más simple de nuestro propio producto. A un proveedor que vende medición de visibilidad en IA le conviene decir que medir es sencillo, que un número mensual significa lo que parece significar, y que el mismo paquete le sirve a todo el mundo.
Los datos dicen lo contrario en más de la mitad de las categorías que probamos, incluida la nuestra. Preferimos publicar el número que complica la venta antes que defender uno más simple que un cliente puede desmontar con tres pasadas.
Si quieres la aritmética de los tamaños de muestra, está en nuestra pieza sobre share of voice. Si quieres ver qué publica cada proveedor sobre cómo mide, que es menos de lo que esperarías, está en nuestra comparativa de todas las herramientas verificadas.
Preguntas frecuentes sobre la estabilidad de las respuestas de IA
¿Cuántas veces hay que lanzar un prompt para medir visibilidad en IA?
Depende de la categoría, y puedes averiguarlo tú mismo. Lanza el prompt tres veces con país e idioma fijados de forma explícita y cuenta cuántos dominios citados salen en las tres. En nuestras mediciones ese número fue desde todos hasta ninguno. Donde se repiten casi todas las fuentes, tres pasadas son una medición real. Donde se repiten pocas, hacen falta bastantes más antes de que una cifra mensual signifique algo.
¿Cambian las respuestas de IA entre peticiones idénticas?
En algunas categorías, casi nada. Preguntando tres veces por el mejor asistente de código con IA, Google AI Overview citó trece dominios y los mismos trece cada vez. En otras, muchísimo: catorce pasadas sobre agencias GEO en España citaron cuarenta y nueve dominios y ninguno apareció en todas.
¿Qué categorías dan las citas más estables?
En nuestra muestra, las categorías de producto y consumo asentadas: reserva de vuelos, auriculares con cancelación de ruido y asistentes de código con IA devolvieron todos sus dominios citados en todas las pasadas. Las menos estables fueron los servicios profesionales y el software B2B emergente, donde la mayoría de dominios citados apareció exactamente una vez.
¿Por qué iba a ser más estable una categoría nueva que una antigua?
La antigüedad no parece ser el factor. Los asistentes de código son una categoría joven y salieron perfectamente estables; el CRM tiene décadas y no. Nuestra hipótesis es que la estabilidad sigue a cuántas páginas intercambiables compiten por responder, de modo que una categoría con pocas fuentes claramente primarias las devuelve siempre y una saturada devuelve un subconjunto plausible distinto cada vez. Es una hipótesis, no un resultado.
¿Qué significa que mi marca salga un mes y al siguiente no?
En una categoría inestable, posiblemente nada. La mayoría de dominios citados en esas categorías apareció exactamente una vez de tres o cuatro, así que un cambio entre dos observaciones sueltas entra de lleno en el ruido. Antes de tratarlo como un movimiento real, comprueba cuántas pasadas hay detrás de cada número.
¿Google enseña siempre un AI Overview?
No, y para medir eso importa. Una de nuestras consultas devolvió AI Overview solo en una de tres peticiones, sin error en las otras dos. Un informe que enseña cero menciones no distingue entre “hubo respuesta y no estabas” y “no hubo respuesta”, y cada una pide una reacción distinta.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.