Todas las mediciones que hemos publicado se tomaron en una sola superficie. Hicimos las mismas cinco preguntas en otra.
Cambiar de superficie cuesta más que cambiar de día: solapamiento mediano de fuentes 0,40 frente al 0,63 de dos días, con preguntas idénticas.
Todas las filas de nuestro registro de mediciones se tomaron en el AI Overview de Google. Ese es el mayor límite de todo lo que hemos publicado, porque un hallazgo sobre cómo se diferencian las categorías podría ser un hallazgo sobre cómo recupera un producto. Así que cogimos las cinco preguntas de compra de nuestro estudio de categorías emparejadas y las hicimos otra vez en AI Mode, mismo mercado, mismas tres pasadas, misma regla de qué cuenta como fabricante, sin cambiar nada salvo la superficie. El solapamiento mediano entre los dos conjuntos de fuentes estables es de 0,40. Hacer la misma pregunta dos días después da 0,63. La superficie cuesta más que el día.
Una de las cinco categorías no comparte ni una fuente estable entre las dos superficies, otra no devuelve ninguna fuente estable en la superficie nueva, y las dos superficies no se ponen de acuerdo en qué categoría es la más favorable a los fabricantes.
Transparencia: EchoWi vende medición de visibilidad en IA, y esta pieza le pone un número a la parte más débil de nuestro propio trabajo publicado, que es de las cosas que a un vendedor le interesa dejar vagas. Las cinco preguntas están impresas en nuestro registro de mediciones con todos los dominios que devolvió cada superficie, así que la comparación se puede repetir en contra nuestra.
La versión corta
- El solapamiento mediano entre AI Overview y AI Mode es de 0,40, en las seis celdas de dos mercados donde las dos superficies contestaron las tres pasadas.
- Eso es peor que dos días. Las mismas preguntas repetidas con dos días de hueco en una sola superficie dieron una mediana de 0,63, y dos lecturas de la misma tarde dan de 0,67 a 0,70.
- Una categoría no comparte nada. Plataformas de tienda online devuelve cuatro dominios estables en cada superficie y ninguno está en las dos listas.
- Los extremos sobreviven y el orden no. Hosting web y tiendas online dan a los fabricantes cero plazas estables en las dos superficies. Pero contabilidad es la categoría más favorable en AI Overview y CRM lo es en AI Mode, así que el orden que publicamos no se traslada.
- Y un conjunto estable vacío es propiedad de una lectura, no de la superficie. Cuatro celdas no devolvieron nada estable en AI Mode la primera vez. Repreguntadas, las cuatro volvieron con conjunto, así que una afirmación que publicamos sobre esa base queda retirada más abajo.
Por qué este era el estudio que tocaba
Nuestro registro contiene todas las mediciones que sostienen lo que hay en este blog, y hasta hoy todas esas filas llevaban el mismo valor en la columna de superficie. La sección de límites de cada estudio lo dice. Lo que ninguno podía decir es cuánto cuesta.
El estudio de categorías emparejadas es lo más fuerte que tenemos: cinco preguntas de compra hechas en seis mercados, con un gradiente que va de hosting web con 1 plaza de fabricante de 27 hasta software de contabilidad con 14 de 37. Si ese gradiente es una propiedad de cómo recupera AI Overview y no de las categorías, el consejo práctico construido encima es un consejo sobre un producto de Google.
Así que: las mismas cinco preguntas, el mismo mercado, las mismas tres pasadas, la misma regla de fabricante, y solo cambia la superficie.
La comparación
| Categoría | AI Overview | AI Mode | Compartido |
|---|---|---|---|
| Hosting web | 0 de 5 | 0 de 2 | 0,40 |
| Plataformas de tienda online | 0 de 4 | 0 de 4 | 0,00 |
| CRM | 2 de 7 | 3 de 9 | 0,60 |
| Nóminas | 5 de 11 | sin conjunto estable | no comparable |
| Software de contabilidad | 6 de 13 | 3 de 12 | 0,39 |
Las dos primeras columnas son plazas en manos de fabricantes sobre plazas estables. La última es el solapamiento entre los dos conjuntos de dominios estables, que es la cifra que importa, porque una cuota puede coincidir mientras las fuentes de debajo cambian por completo. Cada celda de esta tabla y de la siguiente es la primera lectura de esa pregunta, y eso importa sobre todo en las celdas marcadas como no comparables: todas se repreguntaron, y lo que volvió está dos secciones más abajo.
Seis celdas son comparables. El solapamiento mediano es de 0,40, con un rango de 0,00 a 0,60.
El segundo mercado, y el hallazgo que no necesita mediana
Cuatro celdas comparables son pocas, así que corrimos el mismo diseño en España: las cinco preguntas de compra españolas que ya estaban en el registro con AI Overview, repetidas en AI Mode, el mismo día y con tres pasadas.
| Categoría | AI Overview | AI Mode | Compartido |
|---|---|---|---|
| Hosting web | 0 de 3 | sin conjunto estable | no comparable |
| Plataformas de tienda online | 1 de 3 | sin conjunto estable | no comparable |
| CRM | 1 de 6 | 0 de 3 | 0,50 |
| Nóminas | 2 de 6 | sin conjunto estable | no comparable |
| Software de contabilidad | 5 de 7 | 0 de 5 | 0,09 |
La mediana propia de España es 0,29 sobre dos celdas, y juntando los dos mercados el titular se queda exactamente donde estaba: 0,40 sobre seis celdas. El segundo mercado reprodujo al primero en vez de rescatarlo.
En la primera lectura, cuatro de las diez celdas de AI Mode no devolvieron ningún conjunto estable frente a ninguna en AI Overview, y publicamos eso como el hallazgo que no necesitaba mediana. Repreguntamos las cuatro. Las cuatro volvieron con conjunto estable, así que esa afirmación queda retirada. Nóminas en Estados Unidos pasó de cero a doce, y los doce son exactamente los dominios que la primera vez estaban en dos pasadas de tres. Nóminas en España pasó de cero a cinco, hosting español a dos y tiendas online español a dos.
Así que el conjunto vacío era una propiedad de una tarde y no de la superficie, y la versión honesta es más estrecha: AI Mode alcanza el listón estricto con menos fiabilidad que AI Overview, que es una afirmación sobre leerlo una vez. Quien informe de un conjunto vacío a partir de una sola lectura de esta superficie está informando de la lectura.
Lo que sí hicieron las relecturas es reforzar la cifra sobre la que habíamos sido prudentes. Usando la mejor lectura de cada celda hay diez celdas comparables en vez de seis, y el solapamiento mediano agrupado es de 0,33, con un rango de 0,00 a 0,60. Más bajo que el 0,40 de seis celdas, con más evidencia, y sigue muy por debajo del 0,63 que costaban dos días en una sola superficie.
Y la celda más nítida es la contabilidad española. En AI Overview es la más favorable a los fabricantes de todo el estudio, con 5 de 7 plazas estables en manos de empresas que venden software de contabilidad. En AI Mode la misma pregunta el mismo día devuelve cinco dominios estables y ninguno vende contabilidad: un extractor de datos de facturas, un comparador de software, una empresa de hosting, un ERP y YouTube. El solapamiento es de 0,09.
Qué significa esa cifra al lado de las que ya teníamos
Tenemos otras dos mediciones de la misma forma, y es la primera vez que las tres pueden sentarse en una tabla.
| Qué cambió | Solapamiento mediano |
|---|---|
| Nada, dos lecturas la misma tarde | 0,67 a 0,70 |
| Dos días, la misma superficie | 0,63 |
| La superficie, el mismo día | 0,40 |
Una comprobación va al lado de esa tabla, porque un Jaccard divide por la unión y por eso presenta un conjunto pequeño metido dentro de uno grande como desacuerdo. En las 6 celdas donde las dos superficies devolvieron conjunto estable, la razón mediana de tamaños es 1,3 y la mayor es 2,5, así que son conjuntos comparables y el 0,40 dice lo que parece decir.
Así que la superficie es el mayor de los tres, y es justo el que colapsa cualquier panel de esta categoría. Un producto que informa de «tu visibilidad en IA» como un solo número está promediando fuentes que se parecen menos entre sí de lo que una sola fuente se parece a sí misma dos días después.
La categoría que no comparte nada, y el control que la convierte en hallazgo
Plataformas de tienda online devuelve cuatro dominios estables en AI Overview y cuatro en AI Mode, y la intersección está vacía. AI Overview da Reddit, YouTube, Zapier y una galería de diseño. AI Mode da una plataforma de logística posventa, una guía de cómo montar una web y dos agencias de desarrollo.
Ese cero es la cifra de este estudio que más merece dudarse, así que releímos el lado de AI Overview esa misma tarde. Los cuatro dominios del registro volvieron, y uno más. La línea base no estaba rancia, y el cero es entre superficies y no entre días.
El orden no se traslada, y eso es una corrección de verdad
Nuestra pieza de categorías emparejadas publica el orden de las categorías como el hallazgo exportable, con el argumento de que la tasa es local y el orden viajó por seis mercados. No viaja entre superficies.
En AI Overview, contabilidad es la categoría más favorable a los fabricantes, con 6 de 13. En AI Mode lo es CRM, con 3 de 9, y contabilidad baja a 3 de 12. La afirmación que sobrevive a las dos es más estrecha y sigue sirviendo: las categorías donde los fabricantes no reciben nada no reciben nada en las dos superficies, y hosting y tiendas online son cero dos veces.
El conjunto vacío que una hora después no lo estaba
Trece dominios fueron citados en las tres pasadas de AI Mode y ninguno apareció en las tres. Eso no es que la superficie no conteste, y por eso merece decirse con cuidado: las tres pasadas devolvieron una respuesta con citas dentro, y ninguna fuente estuvo en todas.
Ya habíamos visto esta forma exacta. En nuestro trabajo entre días una pregunta de marketing por email no devolvió nada estable una tarde y siete dominios una hora después, y esos siete eran exactamente las fuentes que habían estado en dos pasadas de tres. Un listón estricto y una recuperación que se mueve producen un conjunto vacío sin que nada esté roto.
Por qué no hay columna de Gemini
Hicimos las mismas cinco preguntas también en Gemini, y las filas están en el registro. No llevan cuota de fabricante, por dos motivos que conviene separar.
Tres de las cinco pararon antes de tres pasadas, así que su listón de «citada en todas las pasadas» es dos y no tres, y no son comparables con nada de arriba.
El motivo mayor es que no podemos distinguir una lista corta de citas de una captura corta. De esta vía de medición ya se sabe que devuelve cero fuentes para un asistente importante, lo que significa que una lista corta aquí tiene dos causas posibles y desde fuera no se separan. Publicar una cuota de fabricante encima de eso sería publicar un artefacto con un signo de porcentaje.
Un detalle de esas filas sí merece nombrarse, porque se puede comprobar. La única fuente que aguantó todas las pasadas de Gemini en la pregunta de hosting es el blog de un proveedor de hosting, en una página que se compara con sus competidores. Es el patrón de nuestro trabajo sobre quién escribe las listas de mejores herramientas, apareciendo como la fuente más estable de una superficie.
La columna de Gemini, una semana después, y por qué la lista era corta
La sección de arriba dice que no hay columna de Gemini porque no podíamos distinguir una lista corta de citas de una captura corta. Era honesto y no era el final, así que volvimos con otra llamada.
No es ninguna de las dos. Preguntado por la llamada única cacheada en vez de por la repetida, Gemini devuelve entre 9 y 18 citas por respuesta, que no es un problema de captura. Las reparte entre 2 y 5 dominios.
Esa es toda la respuesta. Gemini imprime 3,80 citas por dominio distinto frente a 1,31 de AI Overview, medianas sobre seis preguntas en tres mercados el mismo día, y Gemini es más alto en 6 de las 6 celdas sin que los dos rangos se solapen. La lista corta era real y no era el instrumento: Gemini cita varios pasajes de la misma página, así que un puñado de fuentes sostiene una respuesta que parece bien citada.
Se ve en las propias citas. Las de Gemini son fragmentos de texto, anclados a una frase concreta de la página. Las de AI Overview apuntan a la página.
Eso da una tercera unidad, y es la que una herramienta se equivoca. En las seis respuestas Gemini imprimió 77 citas, que se resuelven en 23 páginas y 22 dominios. Sus páginas son casi exactamente una por dominio, y su recuento de citas es más del triple que cualquiera de las dos. Quien cuente URL de citas como fuentes reporta una respuesta de Gemini como tres veces mejor documentada de lo que está, y este registro ya publicó una corrección por cometer ese error en la otra dirección, contando URL como páginas en nuestro propio trabajo.
Qué le hace eso a una comparación
Con una ruta que captura, la comparación que este artículo no pudo hacer se vuelve posible, y cae donde el resto de la pieza predeciría. En esas seis preguntas, las dos superficies comparten 8 dominios de 47.
Dos propiedades de Google, las mismas preguntas, el mismo día, y cinco sextos de lo que cita una no lo cita la otra.
Ese es el hallazgo de superficie del principio de este artículo, medido entre dos productos de un mismo proveedor en vez de entre proveedores. Es la versión más fuerte que tenemos, porque a esta nadie puede atribuirla a otro índice ni a otro rastreador: sea lo que sea lo que separa a AI Overview de Gemini, no es que sean empresas distintas.
Y una cautela sobre la superficie en la que se apoya este artículo
Comprobando qué superficie cita páginas encontramos algo que alcanza a la cifra del principio de esta pieza.
Una respuesta de AI Mode imprime marcadores de cita numerados en su propio cuerpo, y la lista estructurada que leemos no siempre los trae todos. En 5 preguntas de 3 mercados y tres idiomas, la lista de AI Overview trajo todos los marcadores impresos en las 5 celdas, y la de AI Mode fue del 21 por ciento a todos. Esto lo leímos primero en dos celdas y escribimos que era cómo se parsea cada superficie. Un tercer mercado devolvió una respuesta de AI Mode con todos los marcadores que imprimía, así que no es eso: la captura es intermitente, no está partida por la mitad, y un recuento de AI Mode es por tanto un suelo de holgura desconocida y no uno que se corrija doblándolo. Gemini, leído en 5 de las mismas preguntas el mismo día, también trajo todos los marcadores que imprimía. De las 3 superficies que podemos leer así, 2 devuelven intacta la lista de citas de su propia respuesta y el hueco es solo de AI Mode.
Hacia dónde empuja eso depende de la cifra. Donde decimos que AI Mode cita mucho más ancho que AI Overview, un AI Mode infra-capturado hace que el hueco real sea mayor, así que esos números son suelos y el hallazgo aguanta.
La mediana de solapamiento del principio de este artículo es la que no pudimos razonar, así que la medimos. En cada celda donde tenemos la lista completa de marcadores en las dos superficies calculamos el Jaccard dos veces, una con la lista que devolvió la herramienta y otra con todos los marcadores que imprimió la respuesta. Ya son 4 celdas, cuando eran 2 al publicar este párrafo, y la corrección que hicimos entonces sobrevive a la ampliación: 2 celdas dejan corto el acuerdo y 2 lo dejan largo, por un factor de 1,4 a 2,7.
| Celda | Con la lista devuelta | Con todos los marcadores | Dominios caídos | Citados también por AI Overview |
|---|---|---|---|---|
| Tarjetas de viaje, EE. UU. | 0,07 | 0,19 | 10 | 3 |
| Contabilidad, España | 0,14 | 0,19 | 11 | 2 |
| Nóminas, EE. UU. | 0,43 | 0,29 | 7 | 0 |
| CRM, EE. UU. | 0,40 | 0,16 | 15 | 0 |
La última columna es el mecanismo entero, y es aritmética antes que hallazgo. Devolver un dominio caído que la otra superficie también cita sube la intersección; devolver uno que no cita sube la unión. Así que el solapamiento sube exactamente cuando la proporción de dominios caídos que la otra superficie comparte es mayor que el solapamiento ya medido, y eso se cumple en las 4 celdas porque no puede fallar.
Lo que sí está medido, y lo que hace el signo inaveriguable en la práctica, es que esa proporción va de 0 a 3 de cada 10 sin nada que la prediga. Que tu número salga alto o bajo lo deciden por completo los dominios que se llevó el truncamiento, que son justo la lista que no tienes. Quien publique un solapamiento entre superficies solo puede calcular la corrección recuperando antes lo que se cayó. Así que 0,40 arrastra un error de ese tamaño en una dirección conocible en principio e indisponible de hecho. Eso es peor que el suelo que afirmamos aquí al principio, y es lo que dice la medición en vez de lo que sugería el mecanismo.
Una de las 4 celdas necesita que se diga su procedencia, porque los dos lados no son simétricos. La respuesta española de AI Overview devolvió 5 dominios y no imprimió ni un marcador numerado, así que su conjunto sale de la lista devuelta mientras que el de AI Mode sale del cuerpo. Se incluye porque aquí la pregunta es qué hace el truncamiento de AI Mode, y AI Overview solo aporta el conjunto contra el que comparar. Se señala porque quien tiene derecho a comprobar la aritmética tiene derecho a saberlo.
Lo que no se mueve es la comparación con Gemini de esta sección. La lista de Gemini trae todos los marcadores que imprimen sus respuestas, igual que la de AI Overview, así que los 8 de 47 están medidos con un solo instrumento en los dos lados.
Y hay una segunda entrada que nunca habíamos variado. Cada lectura de este estudio es una pregunta, porque es lo que preguntan estos productos; preguntado en cambio como la frase de palabras clave que teclea un comprador, 4 categorías de 19 devuelven un conjunto de fuentes bastante distinto.
La cautela que viene con ello
Una lectura por pregunta y superficie, así que nada de esto es una tasa. Un dominio que falta en una respuesta puede estar en la siguiente, y este registro tiene medido que una lectura suelta es un sorteo y no una estimación.
Eso importa sobre todo por una tentación que tuvimos y no aceptamos. Cuatro de los editores de nuestro estudio de rastreadores prohíben Google-Extended, que es el control de uso para Gemini, y los cuatro están ausentes de estas respuestas de Gemini mientras salen citados en AI Overview. Se lee como un mecanismo confirmado. No lo es: solo 8 de los 43 dominios que no bloquean pasan tampoco, así que con esa tasa base el número esperado de bloqueadores presentes era menos de uno y observamos cero. Observar cero donde esperabas cero no distingue nada, y las filas del registro llevan esa aritmética al lado del resultado para que la cifra no se pueda citar sin ella.
Lo que esto no demuestra
2 mercados, un día, 10 preguntas, para la mediana de solapamiento. Esto es Estados Unidos en inglés y España en español el 12 de agosto de 2026, tres pasadas por superficie y pregunta. Ese es el alcance de la cifra que abre el artículo y no el de la pieza entera: la sección de Gemini y la de captura son posteriores y llegan a un tercer mercado, y cada una declara su alcance donde está. No es una serie temporal y aquí nada es causal.
6 celdas comparables siguen siendo pocas, y el conjunto de 10 con la mejor lectura es la misma debilidad con más filas. La mediana de seis solapamientos es un estadístico débil, y no lo publicaríamos solo. Es publicable porque va al lado de otras dos medianas medidas igual sobre más filas, porque el segundo mercado reprodujo al primero, y porque la dirección es la misma en cinco de las seis celdas.
La regla de fabricante es nuestra y es estricta. Un dominio cuenta como fabricante cuando su propia portada nombra el producto por el que se pregunta. Dos páginas de este lote, Salesforce y ADP, rechazan por completo las peticiones automáticas; Salesforce conserva la clasificación que ya tenía en el registro de cuando sí se podía leer, y ADP va marcada como sin decidir en su fila en vez de supuesta.
Y una superficie no es un usuario. AI Overview y AI Mode son las dos de Google, alcanzadas de forma distinta. Que dos superficies de Google discrepen tanto es el hallazgo; cuánta gente ve cada una es otra pregunta y no una que esto mida.
Preguntas frecuentes sobre medir entre superficies de IA
¿Una puntuación de visibilidad en una superficie predice las demás?
Con esta evidencia, no. Hacer cinco preguntas de compra idénticas en AI Overview y en AI Mode, en el mismo mercado y el mismo día, dio un solapamiento mediano de 0,40 entre los conjuntos de fuentes citadas en todas las pasadas, y una categoría no compartió ninguna. Eso es más bajo que el 0,63 que dieron las mismas preguntas repetidas con dos días de hueco en una sola superficie.
¿Qué superficie de IA debería medir?
Las que usan sus compradores, medidas por separado, y la respuesta honesta es que el número de superficies que se pueden medir es menor que el número que existe. Contra lo que argumenta este estudio es contra una cifra única mezclada: promediar superficies que coinciden al 0,40 produce un número que no habla de ninguna.
¿Mi categoría es más favorable a los fabricantes en unas superficies que en otras?
Sí, y el orden cambia. Software de contabilidad era la más favorable de cinco categorías en AI Overview y CRM lo era en AI Mode. Lo que aguantó en las dos fue el extremo bajo: hosting web y plataformas de tienda online dieron a los fabricantes cero plazas estables en cualquiera de las dos.
¿Qué significa que una superficie cite fuentes y ninguna sea estable?
Significa que la recuperación se movió entre pasadas, no que la superficie fallara. Nuestra pregunta de nóminas en AI Mode devolvió respuestas con citas las tres veces, trece dominios distintos en total, y ningún dominio apareció en las tres. Un listón estricto de «citada en todas las pasadas» informa de eso como conjunto vacío, que es correcto y se lee peor de lo que es.
¿Por qué no informar de una tasa media de citación?
Porque con dos o tres pasadas una media es sobre todo una versión reescalada del mismo recuento, y compra una tolerancia que solo más pasadas pueden dar de verdad. Preferimos publicar el conjunto de dominios, que cualquiera puede comprobar, antes que un estadístico más suave construido sobre las mismas tres lecturas.
¿Cómo repito esto en contra vuestra?
Coge las cinco preguntas del registro, haz cada una tres veces en dos superficies, en un mercado y en un día, quédate solo con los dominios que aparecen en todas las pasadas y calcula el solapamiento entre los dos conjuntos. Todo el diseño está en la frase anterior, y los dominios que salieron están impresos fila por fila.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.