Preguntamos a 19 categorías como palabra clave y como pregunta. Cuatro contestaron distinto.
11 de 15 categorías comparables devuelven fuentes idénticas se pregunte como se pregunte. 4 no comparten casi nada, y un control dice por qué.
Todos los productos de visibilidad en IA preguntan con preguntas, porque una pregunta es lo que uno teclea en un asistente. Pero un AI Overview salta también con la frase de palabras clave que un comprador teclea en Google, y nadie de esta categoría parece haber comprobado si las dos llegan a las mismas fuentes. Preguntamos a 19 categorías de las dos formas, en la misma superficie, el mismo mercado y el mismo día, después repetimos 5 de ellas en cada uno de otros tres mercados, y por último volvimos a preguntar 8 de las celdas estadounidenses a la mañana siguiente. Son 26 pares comparables, y los 11 que volvieron con fuentes idénticas están todos en el primero. En los 3 mercados europeos la cifra es 0 de 11.
La respuesta útil no es que la forma importe, ni que dé igual. Es que la respuesta depende del mercado. En Estados Unidos la forma casi siempre no cuesta nada y de vez en cuando lo cuesta casi todo. En España, Alemania y Francia ha costado algo en todas las celdas que hemos podido comparar, y más de lo que cuesta releer la misma redacción. Nada visible de una categoría dice en cuál de los dos casos estás, y ahora parece que nada visible de un mercado tampoco. Y en las ocho celdas estadounidenses a las que volvimos a la mañana siguiente, el día movió la respuesta más lejos de lo que la movió nunca ninguna de las dos formas.
Aviso: EchoWi vende medición de visibilidad en IA, y este estudio encuentra un punto ciego en cómo preguntan los productos de esta categoría, el nuestro incluido. Aquí va todo lo necesario para repetirlo: todas las cadenas exactas, la superficie, el mercado, el número de pasadas, la fecha y cada dominio nombrado en nuestro registro de mediciones. Repítelo en contra nuestra y publica otra respuesta.
El punto ciego lo encontramos primero en nuestro propio corpus
Esto empezó como una auditoría de nuestro registro, no como un estudio.
Antes de estas filas tenía 184 prompts distintos de todo lo que hemos publicado. Dos eran de forma de palabra clave, y los dos eran sintagmas en español y francés que quedaron de un experimento de redacción, no controles a propósito. Todo lo demás era una pregunta, con verbo y casi siempre con signo de interrogación.
No es un descuido nuestro en particular. Sale de para qué sirven estos productos. Uno compra medición de visibilidad en IA porque quiere saber qué dice de él un asistente, y a un asistente se le habla. Así que la unidad natural es un prompt.
El problema es que al AI Overview de Google no se llega sólo hablando. Salta encima de los resultados de siempre, con la frase que alguien teclea sin ningún verbo. Si las fuentes que hay detrás de esas dos entradas difieren, un producto que sigue sólo prompts está informando sobre una entrada que buena parte de los compradores no usa nunca.
Nadie lo había medido. Así que el eje merece un estudio propio, y es un eje distinto del trabajo de redacciones que ya está en este registro, que varía cómo se formula una pregunta manteniéndola pregunta.
El diseño, congelado antes de la primera llamada
19 categorías, cada una ya medida en nuestro registro como pregunta en AI Overview en Estados Unidos y en inglés, para que las lecturas nuevas se sumen a lo que ya tenemos en vez de quedarse al lado. Cada una preguntada de dos formas, tres pasadas pedidas por lectura, saltando la caché.
La forma de palabra clave es la frase que teclea un comprador. La forma de pregunta es la cadena que ya estaba en nuestro registro.
Una fuente cuenta como duradera cuando sale citada en todas las pasadas contestadas, que es el listón estricto que usa el resto de nuestro trabajo. answered se lee del resultado y nunca se supone de lo que se pidió, porque esta superficie no siempre contesta tres veces cuando se le piden tres.
Las predicciones se escribieron antes de ninguna llamada. Si la forma no importa, los dos conjuntos por categoría deberían solaparse más o menos como lo hace una relectura de la misma pregunta. Si importa tanto como la redacción, el solapamiento debería caer hacia la banda donde las variantes de redacción no comparten casi nada. Y el resultado caro habría sido una forma de palabra clave que no devolviera AI Overview ninguno, lo que habría hecho de esto un artículo distinto y mayor.
Lo que volvió
| Categoría | Pasadas contestadas | Duraderas, palabra clave | Duraderas, pregunta | Solapamiento |
|---|---|---|---|---|
| CRM | 3 y 3 | 4 | 4 | 1,00 |
| Asistentes de código con IA | 3 y 3 | 10 | 10 | 1,00 |
| Zapatillas de correr | 3 y 3 | 7 | 7 | 1,00 |
| Reserva de vuelos | 3 y 3 | 7 | 7 | 1,00 |
| Correctores gramaticales | 3 y 3 | 5 | 5 | 1,00 |
| Nóminas | 3 y 3 | 10 | 10 | 1,00 |
| Agendas | 3 y 3 | 9 | 9 | 1,00 |
| Plataformas de ecommerce | 3 y 3 | 8 | 4 | 0,33 |
| Email marketing | 2 y 2 | 5 | 6 | 0,22 |
| Gestores de contraseñas | 3 y 3 | 9 | 9 | 1,00 |
| Servicios VPN | 3 y 3 | 6 | 6 | 1,00 |
| Apps de notas | 3 y 3 | 8 | 8 | 1,00 |
| Creadores de webs | 3 y 3 | 8 | 8 | 1,00 |
| Hosting web | 3 y 3 | 6 | 6 | 0,33 |
| Cuentas bancarias de empresa | 3 y 3 | 7 | 9 | 0,33 |
11 de las 15 no son parecidas. Son los mismos dominios, todos, en las dos direcciones. Pregúntale a un AI Overview «best ai coding assistant» o «what is the best AI coding assistant?» y las diez fuentes que sobreviven a las tres pasadas son idénticas.
4 no se acercan a eso. Ecommerce comparte tres dominios de nueve vistos. Email marketing comparte dos de nueve. Hosting web y cuentas bancarias de empresa, las dos del segundo lote, comparten tres de nueve y cuatro de doce.
Cuatro pares quedan fuera, y merece decirse en vez de esconderse. Almacenamiento en la nube contestó dos veces de un lado y tres del otro, y la unanimidad sobre dos pasadas es un listón distinto de la unanimidad sobre tres, así que compararlos sería comparar dos varas. Otros tres fallaron por el lado de la pregunta: gestión de proyectos y auriculares contestaron una vez contra tres, y los servicios de CFO externo no contestaron ninguna mientras su forma de palabra clave contestaba dos. Una sola pasada contestada es un sorteo, no un conjunto duradero. Los cuatro pares están en el registro con sus recuentos reales.
Y esa es una segunda observación que a propósito no llamamos hallazgo. En tres de los cuatro pares excluidos fue la forma de pregunta la que contestó menos veces, y en uno la de palabra clave. Tres contra uno no es nada. Queda anotado para que un barrido mayor lo pueda probar, no porque nos lo creamos.
El control, que es el hallazgo de verdad
Un solapamiento de 0,22 entre formas parece concluyente y no demuestra nada por sí solo, y esta es la parte que se saltan casi todos los estudios de esta forma.
Las dos categorías que discrepan son categorías que nuestro registro ya sabe inestables. Una categoría inestable discrepa consigo misma al leerla dos veces. Así que un solapamiento bajo entre una palabra clave y una pregunta podría ser la forma, o podría ser que esa categoría te habría dado dos respuestas distintas a la misma pregunta de todos modos.
Hay exactamente una manera de separarlos, y es barata: leer la misma forma dos veces y ver qué cuesta.
| Categoría | Palabra clave contra pregunta | Pregunta contra sí misma, relectura |
|---|---|---|
| Email marketing | 0,22 | 1,00 |
| Plataformas de ecommerce | 0,33 | 0,60 |
| Cuentas bancarias de empresa | 0,33 | 1,00 |
| Hosting web | 0,33 | 0,43 |
Email marketing sale limpio. Preguntado dos veces igual, devuelve los seis dominios idénticos. Preguntado como palabra clave, comparte dos. Ahí no está pasando nada inestable ese día: la forma hace todo el trabajo.
Ecommerce es mixto y la lectura honesta lo dice. Su propia relectura de pregunta comparte 0,60, lejos de idéntica, así que parte de ese 0,33 es una categoría que se mueve sola. Pero 0,33 es menos que 0,60, así que la forma cuesta algo por encima.
Sin esas dos lecturas de más, la tabla de arriba habría sido un hallazgo sobre la forma que en parte era un hallazgo sobre la inestabilidad, y ningún lector podría haberlo distinguido.
Y después releímos el otro lado de las dos, porque la regla que salió de este estudio se le aplica a este estudio. Una celda que da el resultado que buscas se relee antes de contarla, y hasta ahora sólo se habían releído las formas de pregunta. La forma de palabra clave de ecommerce devolvió los 8 dominios idénticos, así que su 0,33 descansa sobre dos lecturas estables. La de email marketing contestó tres veces en vez de dos al releerla, que es otro listón y no es comparable, pero los dos dominios que sobrevivieron no están en ninguna de las dos lecturas de la forma de pregunta. Las dos discrepancias aguantan.
Francia no está en esa comparación a propósito. Sus relecturas de la misma forma se reportan en su propia sección, porque dos de ellas comparan lecturas tomadas a profundidades distintas y una de ellas es la comparación de profundidad misma. Ponerlas al lado de controles medidos a tres pasadas fijas sería exactamente el error que esta sección existe para nombrar.
Lo que vale el control, en celdas
La segunda ampliación es la primera vez que se puede poner un número al párrafo de arriba, porque ya son 7 las celdas del estudio leídas dos veces con la misma forma. 3 de las 7 dejaron de discrepar en cuanto se hizo.
Los gestores de contraseñas parecían una discrepancia clara: la forma de pregunta devolvió 4 dominios duraderos contra los 9 de la palabra clave, un solapamiento de 0,44. Preguntada otra vez el mismo día, devolvió exactamente los 9 que tenía la palabra clave. Los creadores de webs hicieron lo mismo, 3 contra 8 en la primera lectura y los 8 idénticos al releer. La tercera es la celda de agendas de más abajo, donde el mismo mecanismo llevó un conjunto duradero hasta cero.
Sin esas llamadas de más, este estudio estaría reportando 7 categorías discrepantes de 15 en vez de 4, y la frase sobre que la forma casi nunca cuesta nada se habría retirado. Estaba escrito antes de las llamadas que tres o más discrepancias nuevas obligarían a esa retirada, y en las primeras lecturas fueron cuatro.
Dos cosas hay que decir de ese número para que nadie lo cite como una tasa.
- La selección no es aleatoria y no lo disimulamos. Una celda se relee porque su primera lectura parecía discrepante, así que «7 de 7 parecían discrepantes» es el procedimiento describiéndose a sí mismo, no un hallazgo. La única cifra que lleva información son las 3 que se resolvieron.
- La relectura no devuelve más de forma fiable. Los gestores de contraseñas pasaron de 4 dominios duraderos a 9 y los creadores de webs de 3 a 8, pero el hosting web bajó de 6 a 4 y las cuentas bancarias devolvieron los mismos 9 las dos veces. Lo que se mueve no es un efecto de calentamiento.
La versión incómoda, para cualquiera que venda una cifra así: una sola lectura de un prompt en forma de pregunta puede subestimar su propio conjunto duradero lo bastante como para inventar una diferencia que no existe, y nada dentro de esa lectura lo dice. La pista no está en el estadístico. Está en haber preguntado dos veces.
La celda donde el estadístico dijo cero y las fuentes eran las mismas
Las agendas merecen su propia sección, porque estuvieron a punto de entrar en la tabla como la mayor discrepancia del estudio y no son ninguna discrepancia.
La forma de palabra clave contestó las tres pasadas y citó diez dominios. Ninguno salió en las tres, así que su conjunto duradero estaba vacío y el solapamiento contra la forma de pregunta era cero. La forma de pregunta, misma superficie y mismo día, devolvió nueve dominios en todas las pasadas.
Cero contra nueve es lo más lejos que llega esta medida. Pero los nueve dominios
que devolvió la pregunta son exactamente los nueve que la palabra clave tenía
en dos pasadas de tres. Una pasada los tiró los nueve de golpe y metió
google.com en su lugar. Releída, la forma de palabra clave devolvió los mismos
nueve en las tres pasadas.
O sea que las fuentes fueron idénticas todo el tiempo y el estadístico dijo discrepancia total. Es una propiedad del listón de unanimidad, que este registro ya ha medido en otros estudios: una sola pasada degenerada vacía el numerador, y con tres pasadas no hay tolerancia que lo absorba.
De ahí salen dos cosas, y la segunda es la incómoda:
- Esta celda cuenta como idéntica, con la mejor de sus dos lecturas de palabra clave, y esa elección va declarada en vez de enterrada. Contar el cero habría sido contar el listón en vez de las fuentes.
- La medida que usa todo este estudio puede fabricar justo el resultado que el estudio busca. Lo encontramos aquí porque un cero al lado de un nueve era demasiado raro para aceptarlo, y la lectura honesta es que una diferencia menor producida igual se habría ido derecha a la tabla.
Qué significa si compras o construyes medición
Un prompt no es un sustituto de una palabra clave, a veces, y dónde vendes decide con qué frecuencia. Todo lo de esta sección es el brazo estadounidense. Si tu categoría es de las 11 que contestaron idéntico, puedes seguir prompts y dormir tranquilo. Si es de las 4 que no, tu informe basado en prompts describe un conjunto de fuentes que la mitad de tus compradores, la que llega por palabra clave, no ve nunca.
No puedes saber cuál eres desde fuera. No hay ninguna propiedad de estas categorías visible antes de medir que prediga el reparto, y el segundo lote se eligió para probar una. Las cuatro que discrepan son ecommerce, email marketing, hosting web y cuentas bancarias de empresa, así que la sospecha obvia es que sean las cercanas a la compra. No sobrevive a la columna de las idénticas: servicios VPN, gestores de contraseñas y creadores de webs se compran igual y contestaron idéntico de las dos formas, y una cuenta bancaria de empresa no se parece a una compra de ecommerce. Ni categoría, ni mercado, ni vertical las ordenan.
Así que la comprobación es la barata: pregúntalo de las dos formas una vez. No hace falta un programa. Coge tus cinco preguntas más importantes, pregunta cada una como la palabra clave que un comprador teclearía de verdad, y compara las fuentes. Si coinciden, para y vuelve a seguir prompts. Si no, acabas de descubrir que la mitad de tu medición apunta a la entrada equivocada.
Antes de nada, comprueba el día. En las ocho celdas estadounidenses que releímos a la mañana siguiente, la misma redacción se movió más de un día para otro de lo que se movieron las dos formas entre ellas. Si comparas el informe de esta semana con el de la pasada, lo primero que hay que descartar es el calendario, y la forma de descartarlo es preguntar la misma cadena dos veces el mismo día y ver a qué distancia caen.
Y pregúntale a tu proveedor cuál manda. Esta es la cuarta pregunta que hacerle a un proveedor, después de las tres que este corpus ya defiende: si sus pasadas saltan la caché, cuántas redacciones sigue por intención, y qué le pasa a su cifra de estabilidad cuando suben las pasadas. Añade: ¿mandas alguna vez la forma de palabra clave, y la reportas por separado?
La misma pregunta en una segunda superficie
Todo lo anterior es el AI Overview de Google, y este corpus tiene medido que un resultado en una superficie no viaja a otra: la mediana de solapamiento de fuentes duraderas entre AI Overview y AI Mode es 0,40, peor que preguntar lo mismo con dos días de diferencia en una sola superficie.
Así que la pregunta que merecía la pena no era si las mismas categorías discrepan en AI Mode. Era si el efecto de la forma existe allí siquiera. Cogimos 4 categorías, las dos que discreparon y dos que salieron idénticas, y preguntamos las mismas cadenas en AI Mode.
| Categoría | En AI Overview | En AI Mode |
|---|---|---|
| CRM | idéntica | idéntica, 7 dominios de las dos formas |
| Correctores gramaticales | idéntica | idéntica, 11 dominios de las dos formas |
| Email marketing | 0,22 | 0,08 |
| Plataformas de ecommerce | 0,33 | sin conjunto duradero que comparar |
El efecto de la forma se reproduce. Las dos categorías que eran idénticas en AI Overview lo son en AI Mode, y email marketing vuelve a discrepar y más fuerte: 8 dominios duraderos por la forma de palabra clave, 5 por la de pregunta, y sólo YouTube en común.
Ecommerce no se pudo medir, y eso se dice en vez de contarse. Su forma de pregunta no devolvió ningún conjunto duradero en AI Mode, en dos lecturas separadas, una con 45 dominios y otra con 32 de los cuales todos salieron en una sola pasada. Un conjunto vacío fuerza el solapamiento a cero pase lo que pase al otro lado, así que llamar a eso la mayor discrepancia del estudio habría sido leer el listón en vez de las fuentes.
Y hay una observación aparte sobre la superficie misma. 4 de las 11 lecturas de AI Mode no devolvieron ningún conjunto duradero, tres de ellas con la misma firma: una hilera de dominios en exactamente dos pasadas de tres, que es una pasada divergiendo entera y vaciando un listón de unanimidad. Releídas, dos de las tres volvieron completas. Quien mida AI Mode a tres pasadas contra un listón estricto debería esperar eso, y esperar que parezca un hallazgo.
El mismo diseño en un segundo mercado, y no sobrevive nada al viaje
Esta pieza lleva dos ampliaciones diciendo que lo que la movería es otro mercado u otra superficie. El brazo de superficie está arriba. España es el de mercado.
Cinco categorías, cada una ya una celda del brazo estadounidense de este mismo estudio, así que la comparación es categoría contra categoría y no España contra otra lista de preguntas. Dos de las cinco eran idénticas en Estados Unidos y tres discrepaban.
| Categoría | Estados Unidos | España | España, relectura de la misma forma |
|---|---|---|---|
| CRM | idéntico | 0,38 | 0,83 |
| Gestores de contraseñas | idéntico | sin AI Overview para la palabra clave | |
| Hosting web | 0,33 | 0,40 | 0,60 |
| Plataformas de ecommerce | 0,33 | 0,50 | 0,80 |
| Cuentas bancarias de empresa | 0,33 | 0,40 | 0,67 |
Ninguna de las cinco reproduce su resultado estadounidense. Discrepan 4 de las 4 celdas que se pueden medir, incluida la que era idéntica de las dos formas en inglés, y en las 4 el solapamiento entre formas queda por debajo del control de misma forma de esa misma celda. La forma hace trabajo por encima de la inestabilidad en todas ellas.
La quinta celda es el resultado más nítido que ha dado este estudio. Preguntado como pregunta, «¿Cuál es el mejor gestor de contraseñas?» devuelve un AI Overview. Preguntado como la palabra clave que teclea un comprador, «mejor gestor de contraseñas» no devuelve ninguno: 2 lecturas, 6 pasadas, cero respuestas y cero errores. Eso no es un solapamiento bajo y no es un fallo de instrumento. Es la superficie negándose a resumir, y significa que un comprador español que teclea la palabra clave no tiene ninguna respuesta de IA en la que estar, mientras que el mismo comprador que pregunta sí la tiene.
Es además el desenlace que el diseño original llamó el caro, escrito antes de ninguna llamada y alcanzado en la quinta categoría del tercer lote.
Este brazo necesitó su propio listón de comparación, y eso es un hallazgo y no contabilidad. 5 de sus 19 lecturas pararon antes de las tres pasadas que pedían, contra casi ninguna en los lotes estadounidenses. Así que una celda española se compara sólo donde las dos formas tienen una lectura que contestó tres veces, y entre esas cuenta el conjunto duradero mayor. Las cifras estadounidenses de arriba no las toca esa regla y se siguen calculando como siempre.
Lo que esto no hace es dejar mal el hallazgo estadounidense. Lo deja en Estados Unidos y en inglés: 11 de 15 idénticas allí, 0 de 4 idénticas aquí, misma superficie, mismo método, mismo listón.
El tercer mercado, y el que se sale resulta ser Estados Unidos
Dos brazos discrepaban sobre el titular de este mismo estudio. Estados Unidos decía que la forma casi nunca cuesta nada, 11 de 15. España decía que siempre cuesta algo, 0 de 4, y más de lo que cuesta releer la misma redacción. Cuatro celdas no dicen cuál de las dos es el caso general, así que corrimos un tercer mercado con el diseño y la predicción escritos antes.
Alemania cae del lado de España.
| Categoría, Alemania | Palabra clave contra pregunta | Misma redacción, leída dos veces |
|---|---|---|
| CRM | 40 | 57 |
| Gestores de contraseñas | 20 | 100 |
| Alojamiento web | 17 | 56 |
| Tiendas online | 50 | 100 |
4 celdas comparables, 0 idénticas, y las 4 por debajo de su propio control. La columna de la derecha es lo único que da sentido a la de la izquierda: es lo que cuesta la misma redacción cuando simplemente se vuelve a preguntar, así que una cifra entre formas por debajo de ella es la forma haciendo algo que releer no hace.
La banca de empresa está en el registro y no está en esa tabla. Su forma de pregunta contestó tres pasadas y las dos lecturas de palabra clave pararon en dos, y un conjunto duradero de dos pasadas es otro listón en una medida de unanimidad. Sus dos lecturas de palabra clave sí se comparan entre ellas, en 57 frente a un par comparable de 4.
Este brazo cambió una cosa del método, y pesa más que el resultado. Los brazos anteriores releían una celda porque parecía discrepante, así que «7 de 7 controladas» describe el procedimiento y no el estudio, y el registro lleva una clave propia diciéndolo. Aquí todas las celdas tuvieron su control, pareciera lo que pareciera. Eso cuesta cinco lecturas más y compra dos cosas: un número de control que un lector puede tomar al pie de la letra, y la primera vez que este estudio ve qué hace un control sobre una celda que coincidía.
2 de las 5 volvieron idénticas, 100 y 100. O sea que una relectura de la misma forma puede devolver exactamente el mismo conjunto duradero, que es lo que hace difícil explicar como ruido el 20 y el 50 entre formas de esas mismas categorías.
La salvedad sobre esos cien, porque es la que querríamos que planteara un lector: las dos eran celdas donde todos los dominios citados por la forma de palabra clave sobrevivieron a todas las pasadas, así que no había cola sobre la que el estadístico pudiera discrepar. Este registro ya llama a eso listón bajo y no conjunto fijo, y el hosting enseña por qué: su primera lectura de palabra clave tenía 9 de 9 duraderos y su control 5 de 9.
El cuarto mercado, y la celda que casi obliga a una retractación
Tres mercados siguen siendo pocos para una palabra tan grande como Europa, así que corrimos un cuarto: las mismas cinco categorías, las dos formas, tres pasadas cada una en AI Overview en Francia y en francés, el 16 de agosto de 2026.
Francia cae del lado de España y Alemania. 3 celdas comparables, 0 idénticas.
| Categoría, Francia | Palabra clave contra pregunta |
|---|---|
| CRM | 63 |
| Tiendas online | 50 |
| Cuentas de empresa | 71 |
Las dos categorías que faltan en esa tabla son la mitad más interesante.
Gestores de contraseñas no devolvió ningún AI Overview para la frase de palabras clave. 0 pasadas contestadas de 6, en dos lecturas separadas, mientras la forma de pregunta de la misma intención sí salió y citó 5 dominios estables. Eso no es un conjunto de fuentes distinto, es un hecho distinto: en esa celda la forma decide si hay algo dentro de lo que citar. Es la misma distinción sobre la que está construido nuestro estudio local, llegando por una dirección que no estábamos mirando. El hosting web se cayó por un motivo más aburrido: su forma de palabra clave nunca aguantó tres pasadas contestadas en dos lecturas.
Cuentas de empresa es la celda con control, y el control aguanta. Su forma de palabra clave se leyó dos veces a tres pasadas y devolvió los mismos seis dominios las dos veces. Así que el 71 contra la forma de pregunta es la forma haciendo algo, no una lectura discrepando consigo misma: la de palabra clave conserva un comparador de finanzas personales que la de pregunta tira, y la de pregunta conserva un servicio de contabilidad que la de palabra clave tira.
El control de tiendas online no aguanta, y aun así contamos la celda como divergente, que es algo con lo que se puede discutir. Su forma de pregunta, leída dos veces, comparte 3 de 5. Una celda cuya propia forma discrepa consigo misma así no puede sostener una afirmación sobre qué hace la forma. Está en el 0 de 3 porque el recuento es de celdas que no fueron idénticas, que no lo fue, y se nombra aquí para que nadie la cite como evidencia sobre la forma.
La lectura que nos habría hecho retirar una frase correcta
La celda de CRM se leyó primero a dos pasadas contestadas por lado, porque la superficie paró antes las dos veces. Las dos formas devolvieron los mismos seis dominios. Idénticas. Ese es el primer par idéntico europeo, habría sustituido el «0 en Europa» por un recuento en cuatro idiomas, y está mal.
Releída una hora después a tres pasadas contestadas por lado, los conjuntos duraderos son 7 y 6 compartiendo 5. La forma de palabra clave gana dos dominios que sobreviven a tres pasadas, la de pregunta conserva uno que la otra deja por debajo del listón.
El mecanismo no es sutil y este registro ya lo tenía escrito: un listón de unanimidad sobre menos pasadas es un listón más bajo, así que las lecturas más someras coinciden más. Lo que añade la celda es la dirección del daño. Una lectura fina no produjo aquí un resultado cauto, produjo una retractación, y una retractación se siente como la dirección humilde. No es automáticamente la segura, y es la primera vez en este corpus que estar falto de potencia empuja a publicar una corrección en vez de a evitarla.
Que es también por lo que toda celda comparable de todos los brazos de este estudio exige tres pasadas contestadas por los dos lados. La regla se escribió para el brazo alemán, y Francia es donde ha pagado.
Una nota de instrumento, y su segunda mitad queda retirada. 8 de 17 lecturas francesas no entregaron tres pasadas contestadas, contra 5 de 18 en el brazo alemán. Ese recuento se queda, porque es la razón de que Francia tenga 3 celdas comparables y no 5. Lo que escribimos a continuación, que si un AI Overview sale siquiera parece variar por mercado, no sobrevive a medirlo en condiciones.
Esas lecturas se releyeron cuando salieron cortas, así que el recuento de arriba es en parte nuestra propia política de reintento y no la superficie. Preguntado en limpio, una lectura por celda y sin reintentos en los cuatro mercados, el resumen salió en todas las pasadas en 37 de 40 celdas, Alemania contestó todas las pasadas pedidas, y todos los déficits del estudio eran una única categoría. Que el resumen falle es propiedad de la pregunta mucho más que del mercado, y la frase que decía lo contrario se corrige aquí en vez de desaparecer sin más.
Qué le hace eso al titular
En cuatro mercados hay 26 pares comparables y 11 idénticos, y los 11 están en Estados Unidos. Juntando los tres mercados europeos son 0 de 11.
No vamos a vestir eso como una regla sobre Europa. Tres mercados son tres, y el mecanismo no está medido: puede ser el idioma, puede ser cuánto contenido comparativo existe en cada mercado, puede ser algo de cómo se comporta la superficie fuera del inglés. Lo que sí se puede decir es más estrecho y basta para cambiar lo que hace un comprador: el hallazgo de que la forma casi nunca cuesta nada se midió en un mercado y no se ha reproducido en ninguno de los otros dos que probamos.
Los números de control no son comparables entre los tres brazos, y la culpa es nuestra
Todas las parejas de la misma forma de este estudio donde las dos lecturas contestaron tres pasadas, en AI Overview:
| Brazo | Parejas | Solapamiento mediano | Celdas controladas |
|---|---|---|---|
| Estados Unidos | 7 | 44 | 7 de sus 15 celdas comparables |
| España | 4 | 74 | 4 de sus 4 |
| Alemania | 4 | 79 | todas, por diseño |
No leas esa columna del medio como tres mercados. Los tres brazos releyeron una celda porque ya parecía discrepante, pero lo que decide si eso importa no es la regla, es si la regla dejó algo fuera. En España las cuatro celdas comparables eran discrepantes, así que la regla no seleccionó nada. En Estados Unidos cubrió 7 de 15, y un número sacado sólo de las celdas que sospechábamos describe nuestra sospecha y no el mercado.
Publicamos la tabla igualmente, con la tercera columna al lado, porque la alternativa es publicar tres medianas y dejar que un lector suponga que significan lo mismo. Dos se pueden leer tal cual y la estadounidense no.
Eso es lo que compró el cambio de diseño. En Alemania la comparación sobre la que descansa todo este estudio se puede hacer limpia: una mediana de control sin seleccionar de 79, y cuatro valores entre formas de 40, 20, 17 y 50, todos por debajo. España llega ahí por casualidad y no por diseño, porque su regla resultó cogerlo todo. En Estados Unidos la comparación está disponible celda a celda, que es como se reporta arriba, y no en agregado.
Una versión anterior de esta sección puso ese arreglo en cinco lecturas y dijo que afectaba a dos brazos. Las dos cifras estaban tecleadas y no contadas, y al contarlas salen 8 celdas sin control en Estados Unidos y ninguna en España. La versión corregida es la tabla de arriba.
Volvimos un día después, y el día movió más de lo que la forma movió nunca
Esta sección existe por un arreglo que falló. La mediana de control estadounidense se apoya en las celdas que releímos porque parecían discrepantes, así que fuimos a releer las 8 que nadie había sospechado. Todas las lecturas estadounidenses de este estudio son del 15 de agosto y esas ocho son del 16, lo que las convierte en la misma redacción con un día de diferencia y no en la misma redacción con minutos de diferencia. No pueden sustituir a un control del mismo día, y un control del mismo día no se puede añadir después.
A cambio contestan una pregunta mejor.
Las 8 celdas son idénticas entre formas. Dos redacciones distintas, preguntadas el mismo día, devolvieron exactamente el mismo conjunto duradero en todas. Preguntadas otra vez un día después con la palabra clave idéntica, el solapamiento mediano es 41, de 17 a 100.
| Celda | Mismo día, otra redacción | Misma redacción, día siguiente |
|---|---|---|
| CRM | 100 | 80 |
| Asistentes de código | 100 | 100 |
| Zapatillas de correr | 100 | 31 |
| Vuelos | 100 | 22 |
| Corrector gramatical | 100 | 44 |
| Nóminas | 100 | 100 |
| VPN | 100 | 38 |
| Apps de notas | 100 | 17 |
Seis de las ocho se mueven más de un día para otro de lo que se movieron entre una palabra clave y una pregunta. En esas seis, lo que estábamos midiendo es más pequeño que lo que manteníamos constante.
Qué significa y qué no. No tumba el estudio: dentro de un día, en estas ocho celdas estadounidenses, la forma no costó nada, que es lo que el estudio afirma. Lo que hace es ponerle tamaño. Si estás midiendo tu propia visibilidad y comparas un informe de palabra clave del lunes con uno de pregunta del martes, la diferencia que ves es más probablemente lunes contra martes que palabra clave contra pregunta.
También dice algo sobre comprar medición. Una herramienta que lanza tus prompts una vez al día y grafica la diferencia está graficando esto, y ocho celdas con mediana 41 es un gráfico muy ancho para leerlo como movimiento.
Ocho celdas, un mercado, un par de días. El registro ya lleva un estudio de dos días aparte, sobre otras preguntas, con mediana en torno a 62, así que este 41 no es una tasa y no lo tratamos como tal. Lo que sí es: la primera vez que este estudio tiene el día y la forma en la misma tabla.
Y las mismas ocho celdas en forma de pregunta: la forma no cambia la deriva
El seguimiento obvio, escrito antes de correrlo: si la forma es irrelevante dentro de un día, ¿lo es también entre días? Todos los productos de esta categoría lanzan preguntas, así que si las preguntas derivan más que las palabras clave, el estándar del sector es el más ruidoso.
No lo es. Las mismas 8 celdas, en forma de pregunta, releídas contra sus propias lecturas del 15 de agosto: la palabra clave es más estable en 2 celdas, la pregunta en 0, y hay 6 empates exactos. Medianas 41 y 35, y la diferencia entre ellas viene entera de las dos celdas que no empataron. El umbral fijado antes de medir pedía 7 u 8 de 8 en una dirección antes de nombrar ninguna, así que esto es un nulo y lo reportamos como tal.
Los seis empates son exactos, y esa es la parte que no fuimos a buscar. Son exactos porque las dos formas devolvieron el mismo conjunto duradero los dos días, así que sus solapamientos nocturnos son el mismo número. Lo que significa que las dos formas seguían coincidiendo el día 16 en seis de las ocho celdas, y discrepaban en dos: CRM en 56 y nóminas en 28.
| Celdas donde las dos formas coincidieron del todo | |
|---|---|
| 15 de agosto | 8 de 8 |
| 16 de agosto | 6 de 8 |
Así que el hallazgo con el que abre este artículo, que dentro de un día la forma casi nunca cuesta nada, se midió él mismo en un día, y al día siguiente costó algo en una cuarta parte de estas celdas. No es una retractación: el titular del brazo estadounidense se sostiene el 15 de agosto y el del alemán el 16. Es un tamaño para saber con cuánta fuerza sostenerlo.
Este segundo resultado no estaba preinscrito. Salió de notar que seis números coincidían exactamente, que es la clase de cosa que se encuentra después, y preferimos etiquetarlo antes que dejar que se lea como una predicción cumplida.
Límites
Dos superficies, de forma desigual. Las 13 categorías en el AI Overview de Google y 4 de ellas repetidas en AI Mode. No dice nada de Gemini ni ChatGPT, y nuestro propio trabajo ha encontrado repetidamente que un resultado medido en una superficie no viaja a otra.
4 mercados, 4 idiomas, 2 días. Estados Unidos en inglés el 15 de agosto de 2026, y España, Alemania y Francia en sus propios idiomas el 16 de agosto de 2026, más 8 celdas estadounidenses releídas el 16 que sólo se reportan en la sección sobre el día. Cada cifra de arriba dice a qué mercado pertenece. Las únicas agregadas entre mercados son los recuentos de los cuatro brazos en la sección del titular, y van declaradas como tales.
15 pares comparables. Es suficiente para establecer que los dos resultados existen y no para estimar con qué frecuencia sale cada uno. Trata «11 de 15» como la ilustración de un reparto, no como una tasa.
El listón estricto es estricto. Una fuente citada en dos pasadas de tres no cuenta como duradera, así que una sola pasada con mala suerte tira un dominio entero fuera del conjunto. Es una propiedad conocida de esta medida y es la razón de que los controles importen más que el titular.
Nada de esto es causal. No se cambió ninguna página y no se midió nada antes y después. Esto es lo que devolvieron las dos formas, no evidencia de por qué.
Preguntas frecuentes sobre la forma de la consulta
¿Una búsqueda por palabra clave y un prompt de IA son la misma consulta?
No son la misma cadena y este estudio va de si eso importa. En 11 de 15 categorías comparables las fuentes que había detrás eran idénticas, así que para esas la distinción es académica. En 4 eran casi disjuntas, así que para esas es la diferencia entre medir tu visibilidad y medir la de otro.
¿Por qué importa una diferencia de fuentes si la respuesta nombra los mismos productos?
Porque las fuentes son sobre lo que se puede actuar. No puedes cambiar fácilmente qué productos recomienda un asistente, pero sí puedes publicar, ser citado o ser reseñado en un sitio del que bebe. Si dos formas de la misma pregunta beben de sitios distintos, la lista de sitios donde merece la pena aparecer cambia con la forma.
¿Qué categorías salieron idénticas y cuáles no?
CRM, asistentes de código con IA, zapatillas de correr, reserva de vuelos, correctores gramaticales, nóminas, agendas, gestores de contraseñas, servicios VPN, apps de notas y creadores de webs devolvieron las mismas fuentes duraderas de las dos formas. Plataformas de ecommerce, email marketing, hosting web y cuentas bancarias de empresa no. No vemos ninguna propiedad de esas categorías que prediga el reparto, que es la parte incómoda.
¿Cómo hago yo esta comprobación?
Coge una pregunta que ya sigas. Escribe la frase de palabras clave que un comprador teclearía para la misma intención. Pregunta cada una varias veces en la misma superficie y el mismo día, quédate sólo con las fuentes que salen todas las veces, y compara los dos conjuntos. Después lee la misma forma dos veces, porque sin ese control no puedes distinguir una diferencia causada por la forma de una categoría que simplemente se mueve.
¿Significa esto que las herramientas basadas en prompts están mal?
No. Significa que están incompletas de una forma que nadie había cuantificado, nosotros incluidos, y que el tamaño del hueco es una propiedad de tu categoría y no de la herramienta. Una herramienta que sólo pregunta prompts acierta sobre los prompts.
¿Qué te haría cambiar de opinión sobre esto?
Más categorías, y ya van dos ampliaciones. Esta pieza publicó primero cinco pares comparables con tres idénticos; seis más la llevaron a nueve con siete idénticos; otras seis la llevan a 15 con 11 idénticos. La proporción apenas se ha movido en las tres, que es el desenlace menos vistoso posible y la razón de que sigamos negándonos a llamarlo una tasa. Lo que volvería a moverlo es otro mercado u otra superficie, porque todo esto es Estados Unidos en inglés y AI Overview.
Dónde te deja esto
El hallazgo es pequeño, barato de reproducir e incómodo para todos los que vendemos en esta categoría, nosotros incluidos. 4 de 19 categorías contestan a la palabra clave de un comprador con un conjunto de fuentes bastante distinto del que contestan a la pregunta equivalente, y dos de esas cuatro lo hacen siendo perfectamente estables cuando se les pregunta dos veces igual.
No es un argumento para abandonar los prompts. Es un argumento para gastar una tarde en averiguar si tu categoría es de aquellas en las que importa, porque la comprobación no cuesta casi nada y la alternativa es suponer una respuesta que es falsa en 4 categorías de 19.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.