Un recuento de fuentes estables no es lo que parece. Esto es lo que sí predice un conjunto de respuesta que se pueda nombrar.
Seis preguntas leídas a fondo y luego la misma intención preguntada de tres formas. Solo una redacción devuelve un conjunto que darle a un comprador.
Ayer publicamos un mecanismo: lees una pregunta de compra ocho veces y vuelven doce fuentes en siete pasadas cada una, con una pasada que no cita más que a Google, así que un listón estricto tira las doce a la vez cuando tu muestra contiene esa pasada. Lo escribimos como una propiedad de la superficie. Hoy hemos preguntado cuatro cosas más con el mismo marco de frase, la misma superficie y el mismo mercado, y la forma no aparece en ninguna de las 4 preguntas que añadimos. CRM devuelve nueve dominios y los nueve pasan todas las pasadas, medido dos veces. Hosting devuelve 41 y no pasa ninguno. Ecommerce devuelve 64 y no pasa ninguno. Así que «cero fuentes estables» son al menos tres hechos distintos con un solo número encima, y habíamos generalizado desde el caso de en medio.
Lo útil no es la rectificación. Es que los tres casos piden respuestas opuestas y el número no los distingue.
Transparencia: EchoWi vende medición de visibilidad en IA, y esto acota una afirmación que publicamos ayer y un estadístico que usamos en nueve estudios. Cada pregunta, con la superficie y el mercado en que se hizo, su número de pasadas y cada dominio con su recuento, está en nuestro registro de mediciones, así que esto se puede repetir en contra nuestra. La pieza ha crecido bastante más allá de la superficie y el mercado únicos con los que empezó, y la sección de límites del final dice exactamente cuánto.
La versión corta
- El barrido: seis preguntas, un marco de frase, una superficie, un mercado, un día. Solo cambia la categoría. Todo lo que viene después amplía uno de esos ejes.
- CRM devuelve nueve dominios y los nueve están citados en todas las pasadas respondidas, con esa cadena. Releído el mismo día, los mismos nueve dominios, otra vez todos. La unanimidad se puede conseguir, y el punto 7 dice lo que cuesta.
- Tres preguntas no devuelven nada estable, y no por el motivo de ayer. Gestores de contraseñas, hosting y ecommerce enseñan dispersión normal: sin recuento compartido, sin Google solitario, solo una cola larga.
- La forma de ayer aparece en 2 de 6 preguntas. Es real y no es la superficie.
- El control que importa: CRM y contabilidad respondieron cinco pasadas las dos. Misma profundidad, misma superficie, mismo mercado, mismo marco. Nueve de nueve contra cero de trece.
- Leído a fondo, solo sobrevive un conjunto fijo. Esa forma con tres pasadas es sobre todo el listón siendo poco profundo, y una celda que parecía fija en Reino Unido no conserva nada con siete.
- La misma intención en tres redacciones: 9 citados y 9 conservados, luego 80 y ninguno, luego 100 y ninguno. Mismo mercado, misma superficie, mismo día. Un conjunto fijo es de la superficie y la cadena juntas, y preguntar lo mismo en la otra superficie es lo que enseña cuál de las dos.
- Lo que predice un conjunto que se pueda nombrar no es el número de pasadas, es cuánto cita la respuesta. Las lecturas que citan nueve dominios o menos conservan del 56 al 100 por ciento; las que citan trece o más conservan como mucho el 40.
- Y la categoría más ancha no es ancha en la otra superficie. Tres de las mismas cadenas en AI Overview citan 6 o 7 dominios cada una, todos estables. Comercio electrónico son 104 en AI Mode y 6 aquí, así que el enigma del que trata el resto de esta página es de AI Mode y no de las categorías.
Qué hicimos
La lectura de ayer cogió dos preguntas en AI Mode en Estados Unidos y pidió diez pasadas de cada una. Hoy hemos cogido el mismo marco de frase, «cuál es el mejor X para una pequeña empresa», y hemos corrido cuatro categorías más igual. No cambió nada salvo la categoría.
Todas las lecturas pararon antes de diez. Se dice porque el denominador de cada recuento de abajo son las pasadas que ocurrieron, no las que se pidieron, y esos denominadores cambian de fila en fila.
Seis preguntas, tres formas
| Categoría | Pasadas respondidas | Dominios citados | Citados en todas | Recuento máximo |
|---|---|---|---|---|
| CRM | 5 | 9 | 9 | 5, por los nueve |
| Nóminas | 8 | 13 | 0 | 7, por doce |
| Contabilidad | 5 | 13 | 0 | 4, por doce |
| Gestores de contraseñas | 4 | 19 | 0 | 3, por dos |
| Hosting | 7 | 41 | 0 | 5, por tres |
| Plataformas de ecommerce | 4 | 64 | 0 | 3, por cuatro |
Lee la última columna antes que la cuarta. Cuatro de estas seis filas declaran cero fuentes estables, y la última columna dice que llegaron ahí de tres maneras distintas.
CRM es unánime. Nueve dominios, cada uno en las cinco pasadas, y ninguna cola. Nada salió una sola vez.
Nóminas y contabilidad son la forma de ayer. Doce dominios sentados en el recuento idéntico, uno por debajo de todas las pasadas, y un dominio solo en la pasada que a todos les falta. Una pasada difiere; las otras siete o cuatro coinciden del todo.
Contraseñas, hosting y ecommerce son dispersión. El recuento máximo lo alcanzan dos, tres o cuatro dominios, y lo demás se deshilacha. Ecommerce cita 64 dominios en cuatro pasadas, de los que 52 salen exactamente una vez.
Esos tres últimos no tienen una pasada degenerada a la que culpar. Tienen un abrupto que elige un conjunto distinto cada vez.
El control, y por qué es la fila importante
La objeción evidente a CRM es la profundidad: respondió cinco pasadas y nóminas respondió ocho, así que quizá CRM solo parece unánime porque se leyó menos a fondo.
Contabilidad respondió cinco pasadas también. Misma profundidad, misma superficie, mismo mercado, mismo marco de frase, mismo día. Contabilidad devuelve cero fuentes estables de trece citadas. CRM devuelve nueve de nueve.
Así que el número de pasadas no explica la diferencia, y el listón tampoco. Lo que las separa es la categoría.
Volvimos a medir el mejor número, precisamente por ser el mejor
Nueve de nueve sin cola es el tipo de resultado que suele ser un artefacto. Nuestra propia regla es volver a medir el número que más cambiaría la conclusión si se cayera, así que se preguntó CRM otra vez el mismo día.
Tres pasadas respondidas la segunda vez. Los mismos nueve dominios, comprobados por nombre, y los nueve citados en las tres pasadas: www.youtube.com, www.reddit.com, www.salesforce.com, slack.com, www.pcmag.com, www.uschamber.com, www.zoho.com, www.hubspot.com y fayedigital.com.
Sobrevivió. Eso importa más que la primera lectura, porque significa que hay categorías donde esta superficie responde desde un conjunto fijo, y a un comprador de una de ellas se le pueden nombrar las nueve páginas que tienen la respuesta a esa pregunta tal y como está redactada. Dos secciones más abajo, reformularla se lleva el conjunto.
Y el conjunto fijo es del mercado, no de la categoría
El resultado de CRM invita a una pregunta evidente, así que la hicimos el mismo día: ¿un conjunto de respuesta fijo es propiedad de la categoría o del mercado donde se midió? La misma pregunta, traducida, en la misma superficie en España, Francia y Alemania.
| Mercado | Pasadas respondidas | Dominios citados | Citados en todas |
|---|---|---|---|
| Estados Unidos | 5 | 9 | 9 |
| España | 4 | 50 | 0 |
| Francia | 6 | 42 | 0 |
| Alemania | 6 | 63 | 1 |
Una categoría, un marco de frase, 4 mercados. Estados Unidos cita nueve fuentes y conserva las nueve. Los otros tres citan entre 42 y 63 y conservan como mucho una.
Un control antes de leer esa tabla como una historia sobre mercados. Todas sus filas son AI Mode, y nuestro recuento de la capa de editores se midió en AI Overview. Preguntado en AI Overview en Francia el mismo día, la misma pregunta cita 8 dominios y conserva 5 con cuatro pasadas respondidas. En AI Mode en el mismo mercado cita 42 y no conserva ninguno. Ese par no está emparejado por pasadas, y la diferencia importa: cuatro contra seis, y más pasadas son más oportunidades de citar algo nuevo. Emparejado bien, sobre las 10 celdas donde las dos superficies se leyeron tres veces, AI Mode cita más en 7 y la mediana de la razón es 1,39, con un rango de 0,92 a 6,50. Así que la dirección sobrevive y el tamaño no: la superficie sí cambia cuántas fuentes se citan siquiera, en torno a la mitad más en la celda típica y no cinco veces, y una plaza medida en una superficie sigue sin decir nada de la otra.
España devuelve 50 dominios en cuatro pasadas respondidas y ninguno citado en todas. Releído, 34 dominios en cinco pasadas con exactamente uno citado siempre. Ninguna de las dos lecturas se parece en nada al nueve de nueve sin cola que dio Estados Unidos.
Las dos lecturas españolas ni siquiera coinciden entre ellas. El dominio que la primera tenía más alto, en tres pasadas de cuatro, está en una de cinco en la segunda. El dominio que la segunda tiene en las cinco pasadas estaba en dos de cuatro en la primera.
Y el conjunto estadounidense aguantó de un día para otro, y después aguantó a la profundidad. Preguntado otra vez al día siguiente con seis pasadas, volvieron los mismos nueve dominios, cada uno citado en todas las pasadas, y preguntado una cuarta vez con ocho, otra vez los mismos nueve. La profundidad es el eje que más amenaza a un conjunto fijo, porque más pasadas son más ocasiones de citar algo nuevo, y aquí no compró nada. Son 4 lecturas en 2 días y 22 pasadas respondidas, devolviendo el conjunto idéntico por nombre cada vez y sin cola en ningún momento. Nuestro trabajo entre días sobre otras preguntas dio un solapamiento mediano de fuentes de 0,63; esta celda está en uno.
Y esta aguantó al preguntarla en una segunda categoría, que es lo primero de hoy que lo hace. La banca de empresa en Estados Unidos cita 7 dominios y conserva los 7 con ocho pasadas, la celda estrecha más limpia de aquí. Preguntada en España, en español y en la misma superficie, cita 14 y conserva 2. Misma categoría, misma superficie, otro mercado, y la forma se da la vuelta igual que con CRM.
Cinco pasadas respondidas contra ocho, y las dos mitades de eso juegan a favor del hallazgo y no en contra: menos pasadas solo pueden citar menos dominios, y menos pasadas hacen más fácil la unanimidad.
Tres afirmaciones de esta pieza se acotaron a las pocas horas de publicarse hoy, cada una por la siguiente celda que medimos. Esta se probó igual y no se movió, así que es en la que hay que apoyarse: un conjunto fijo es propiedad de una categoría en un mercado, y el mercado hace más trabajo que la categoría.
Así que la frase de arriba necesita un mercado pegado. Hay categorías en un mercado donde esta superficie responde desde un conjunto fijo. La misma categoría a una frontera de distancia se monta de nuevo cada vez, y a un comprador de allí no se le pueden nombrar las páginas que tienen la respuesta, porque no hay tal conjunto que nombrar.
Y es de la redacción y de la superficie, no solo del mercado
Después de eso quedaba una pregunta, y es la que decide si todo esto sirve para algo. Los nueve dominios aguantaron 4 lecturas, 22 pasadas y 2 días, así que no son la casualidad de una sesión. Pero las cuatro lecturas preguntaron la misma cadena. Así que preguntamos la misma intención, en el mismo mercado, en la misma superficie y el mismo día, con otras palabras: qué CRM debería elegir una pequeña empresa.
Siete pasadas respondidas. 80 dominios citados y ninguno en todas las pasadas, el recuento más alto 5 de 7, y 59 dominios citados exactamente una vez. Es la lectura más ancha del registro, y sale de la celda que acabábamos de llamar el único sitio donde a un comprador se le puede dar una lista.
Los nueve no desaparecieron, que es la parte que hay que leer dos veces. Ocho
están en esta lectura, y salen entre 1 y 3 pasadas de 7: slack.com en 3,
www.hubspot.com en 2, y www.youtube.com, www.reddit.com,
www.salesforce.com, www.pcmag.com, www.zoho.com y fayedigital.com en 1
cada uno. Solo falta www.uschamber.com. Las fuentes siguen ahí. Lo que cambia
es si la respuesta se monta con ellas todas las veces o con una cola larga que
las incluye.
Las dos reformulaciones anteriores usaban el mismo marco, así que preguntamos una tercera que no. «Qué CRM debería elegir una pequeña empresa» sigue siendo una pregunta con un modal dentro, y el ensanchamiento podía ser de esa construcción y no de reformular. Así que preguntamos un imperativo sin pregunta ninguna: recomienda un CRM para una pequeña empresa. Ocho pasadas pedidas y ocho respondidas, la lectura más honda del registro. Cita 100 dominios y no conserva ninguno, el recuento más alto 5 de 8, y 66 dominios citados exactamente una vez. Cuatro de los nueve fijos ya no están y el mejor de los que quedan sale en 3 de 8.
| La misma intención, de tres formas | Pasadas | Citados | En todas |
|---|---|---|---|
| ¿Cuál es el mejor CRM para una pequeña empresa? | 5 | 9 | 9 |
| ¿Qué CRM debería elegir una pequeña empresa? | 7 | 80 | 0 |
| Recomienda un CRM para una pequeña empresa. | 8 | 100 | 0 |
Dos reformulaciones estructuralmente distintas ensanchan las dos, así que no es una construcción portándose mal.
Pero sí es una superficie portándose mal, y esa es la acotación que le hacía falta a este resultado. El imperativo se preguntó otra vez el mismo día, el mismo mercado y la misma cadena, en AI Overview en vez de AI Mode. Cita 12 dominios y conserva 3, frente a 100 y ninguno. Ocho de los nueve fijos están dentro, tres de ellos en todas las pasadas respondidas.
Así que el desplome es de AI Mode y no de reformular en sí. En AI Overview la misma reformulación que hizo añicos el conjunto de AI Mode deja uno estrecho en pie. La lectura honesta de las tres tablas de arriba es que la superficie fija cuánto puede ensancharse una respuesta y la redacción elige un punto dentro de ese rango.
Y esa lectura ya es demasiado fuerte, porque la segunda intención no la reproduce. La pregunta de visibilidad en IA se hizo en las dos superficies el mismo día con la misma cadena, y las dos lecturas respondieron cinco pasadas, así que no hay profundidad que discutir. AI Mode cita 29 frente a los 21 de AI Overview, y las dos conservan 2.
Esa razón es 1,38, y este registro ya publicó una mediana de 1,39 sobre diez celdas emparejadas por pasadas. El par nuevo cae sobre nuestra propia mediana, lo que convierte el par de CRM de 100 contra 12 en el atípico y no en la regla.
Así que ningún eje manda solo. La superficie, la cadena y el mercado mueven la anchura de una celda, la categoría no, y el resultado de CRM es donde los tres se alinearon a la vez. Quien se lleve un número de esta pieza que se lleve la mediana y no el extremo.
Las pasadas son cinco contra ocho, y las dos mitades de eso juegan en sentidos opuestos, así que las dos se dicen. Menos pasadas solo pueden citar menos dominios, así que la diferencia de anchura es conservadora y sobreviviría a más. Y menos pasadas hacen más fácil la unanimidad, así que el 3 es la dirección generosa y no nos apoyamos en él. Y esa tabla se lee hacia abajo y no a lo ancho: la fila estrecha es una redacción de tres, y es la menos profunda de las tres. Un conjunto fijo no es un sitio que puedas encontrar y luego ocupar. Es una cadena entre las muchas que un comprador puede teclear.
Así que un conjunto fijo es propiedad de la superficie y la cadena juntas, luego del mercado, y de la categoría nada.
Fuera del inglés la misma reformulación hace otra cosa, y esa es la mitad más
útil. El CRM francés en AI Overview, leído dos veces, conserva 5 de 9 citados
y 5 de 8. Preguntado con el mismo marco imperativo, recommandez un CRM pour
une petite entreprise, cita 18 y conserva 4. El recuento estable casi no se
movió. Sus nombres sí: solo www.shine.fr y foxeet.fr están en los dos, 2 de
los 7 dominios distintos que las dos lecturas conservan entre ambas.
Así que el resultado inglés, donde reformular deja el recuento estable en cero, no es la forma general. En francés el recuento sobrevive a la reformulación y los nombres de debajo se renuevan, que es la misma asimetría que este registro ya ha medido en otros ejes y la más peligrosa de las dos: un recuento que no se mueve se lee como un conjunto que no se mueve.
Qué ve de verdad quien sigue un solo prompt
Las tres redacciones de CRM son la misma intención, el mismo mercado, la misma superficie y el mismo día, así que sus fuentes se pueden juntar. Entre las tres citan 131 dominios distintos, y esto es lo que cada una por su cuenta te habría enseñado.
| Redacción | Dominios citados | Del total de 131 |
|---|---|---|
| ¿Cuál es el mejor CRM para una pequeña empresa? | 9 | 7% |
| ¿Qué CRM debería elegir una pequeña empresa? | 80 | 61% |
| Recomienda un CRM para una pequeña empresa. | 100 | 76% |
Cinco dominios salen en las tres: www.youtube.com, www.reddit.com,
www.salesforce.com, slack.com y www.hubspot.com. 78 de los 131, el 60%,
salen en exactamente una de las tres.
Haz tú la cuenta: junta las listas de dominios de las tres lecturas en nuestro registro de mediciones, cuenta las entradas distintas y divide el recuento de cada lectura entre ese total.
Esa es la versión práctica de todo lo anterior. Una herramienta que sigue un prompt por intención, que es como se vende esta categoría y como funciona hoy nuestro propio panel, te enseña entre el 7 y el 76 por ciento de las fuentes que construyen las respuestas de esa intención, y no puedes saber en qué extremo estás sin preguntar lo mismo de otra forma. Lo que alcanza una sola redacción no es la mayor parte, y lo que sobrevive a las tres son cinco dominios, dos de ellos plataformas y no editores.
La segunda intención acota ese rango, y afila el hallazgo en vez de suavizarlo. La pregunta de visibilidad en IA también se hizo de tres formas, y sus tres lecturas respondieron cinco pasadas, así que esa curva no lleva ninguna diferencia de profundidad dentro. Suman 44 dominios distintos, y cada lectura ve del 41 al 52 por ciento de ellos, muy lejos del suelo del 7 por ciento del conjunto de CRM. Así que el rango ancho de arriba es de esa intención, y en concreto de que dentro haya una redacción inusualmente estrecha.
Lo que aguanta en las dos intenciones es el otro número. 32 de los 44 dominios, el 73 por ciento, salen en exactamente una de las tres redacciones, contra el 60 por ciento en CRM. Y la curva se replica: una redacción alcanza una mediana del 48 por ciento de lo que encuentran las tres, y dos alcanzan el 75, contra el 61 y el 79 de CRM. Cuánto alcanza una sola redacción se mueve mucho entre intenciones. Cuánto es alcanzable solo por una redacción, no, y es la mayoría en las dos.
¿Y qué compra la segunda redacción? Tomando las tres lecturas de CRM en todos los órdenes posibles, para que la respuesta no dependa de con cuál empezaste: una redacción alcanza una mediana del 61 por ciento de lo que las tres encuentran juntas, y dos alcanzan una mediana del 79 por ciento.
La mediana no es lo interesante. Lo es el suelo. Una redacción va del 7 al 76 por ciento según cuál cogieras. Dos van del 62 al 99. La segunda redacción compra poquísimo en un día bueno y te rescata entera en uno malo, que es la forma de una prima de seguro y no la de una mejora de cobertura.
Y la tercera da el 100 por ciento por construcción, no por medición. El denominador es la unión de las redacciones que corrimos, así que la última siempre lo cierra. Ese número es aritmética y no evidencia, y quien te enseñe una curva de cobertura sacada de una muestra de prompts te debe la misma advertencia. Podemos decir qué se pierde una redacción frente a tres; no podemos decir cuánto se pierden las tres.
Y en la categoría de la que va esta pieza, ninguna redacción funciona
Todo lo de arriba se mide en categorías ajenas, y es a propósito: están concurridas, son comerciales y no tienen nada que ver con nosotros. Pero quien lee esto suele estar buscando una herramienta de visibilidad en IA, así que corrimos el mismo diseño sobre esa pregunta, en AI Overview y en Estados Unidos.
Las dos lecturas respondieron cinco pasadas, lo que hace de este el único par de redacciones del registro sin ninguna diferencia de profundidad entre sus lados.
| Herramientas de visibilidad en IA, Estados Unidos | Pasadas | Citados | En todas |
|---|---|---|---|
| ¿Cuál es la mejor herramienta de seguimiento de visibilidad en IA para una marca? | 5 | 21 | 2 |
| Recomienda una herramienta de seguimiento de visibilidad en IA para una marca. | 5 | 18 | 3 |
Ninguna de las dos redacciones produce un conjunto que darle a un comprador,
incluida la forma «cuál es la mejor» que en CRM produjo los nueve fijos. Los dos
conjuntos citados comparten 7 dominios de 32 distintos, un solapamiento de 0,22,
y de las cinco plazas estables de las dos lecturas exactamente un dominio
aguanta en las dos: www.youtube.com.
Merece pararse ahí si vendes en esta categoría, y no es un hallazgo cómodo para nadie que esté en ella. Quien le pregunta a un asistente qué herramienta usar no recibe una lista corta estable, recibe una distinta según cómo formule la pregunta, y la única fuente que sobrevive a la reformulación es una plataforma de vídeo y no un proveedor, un sitio de reseñas o una comparativa.
Y se replicó en otra categoría y en la otra superficie. La banca de empresa
en Estados Unidos citó 7 dominios y conservó los 7 con ocho pasadas, que es la
celda estrecha más limpia del registro. Preguntada como qué cuenta debería
abrir una pequeña empresa, cita 25 y conserva 3. Seis de los siete originales
siguen ahí, entre 1 y 5 pasadas de 5, y www.nerdwallet.com sigue citado
siempre.
Las pasadas no coinciden, cinco contra ocho, y eso juega a favor del hallazgo y no en contra. Menos pasadas solo pueden citar menos dominios, y esta citó tres veces y media más. Y menos pasadas hacen más fácil la unanimidad, y aun así la cuota estable cayó de todos los dominios a tres de veinticinco. La versión con listón estricto de esto ya la sabíamos por cuatro redacciones de una pregunta de hoteles, donde ningún dominio sobrevivió a las cuatro. Esta es la forma fuerte: no que el conjunto estable encoja al reformular, sino que una celda pueda pasar de nueve de nueve sin cola a ochenta citados y nada estable, a una reformulación de distancia.
Y un conjunto fijo de tres pasadas casi nunca lo es
La forma que hacía especial a CRM, todos los dominios citados pasando todas las pasadas, no es rara con tres pasadas. Nuestro estudio de categorías emparejadas tiene celdas así en varios mercados, así que cogimos la más fuerte que no fuera Estados Unidos y la leímos a fondo en su propia superficie.
Nóminas en Reino Unido citó 8 dominios con tres pasadas y pasaron los 8. Leído siete veces igual, cita 19 y pasan 0, con el recuento máximo en 6 de 7.
Así que la versión de tres pasadas de esa forma es sobre todo el listón siendo poco profundo. Dice que una categoría tiene pocas fuentes evidentes, no que tenga un conjunto fijo, y las dos cosas se ven idénticas hasta que alguien lee más hondo. De todas las celdas que hemos leído a fondo, la de CRM estadounidense es el único conjunto fijo que sobrevivió.
Es también una advertencia sobre nuestras propias tablas publicadas. Todos los recuentos estables del estudio de categorías emparejadas son de tres pasadas, lo que los hace una base justa para comparar celdas entre ellas y una base mala para decirle a un comprador qué páginas tienen una respuesta.
Leímos una pregunta seis veces seguidas, y el recuento se movió cada vez
Todo lo de arriba lee una pregunta una vez, a fondo, o la vuelve a leer otro día. Ninguna de las dos contesta la pregunta más llana, la que hace primero quien compra: si esto lo lanzo mañana y pasado, ¿estoy mirando el mismo número?
Así que leímos una pregunta seis veces seguidas, en una superficie, con tres pasadas por lectura, y luego lo repetimos con una segunda pregunta en otro mercado y otro idioma. Son 13 llamadas y 38 pasadas contestadas, todas del 14 de agosto de 2026. El diseño se escribió antes de la primera llamada, incluido qué lo mataría, porque el registro ya tenía esta pregunta abierta y no queríamos contestarla eligiendo el análisis después.
Esa pregunta abierta era si medir repetidamente encoge lo que ves. Cinco lecturas de un prompt el 10 de agosto dieron 18, 14, 11, 13 y 9 dominios citados, se tomaron en orden, y una secuencia decreciente tomada en orden no se distingue del ruido. Si fuera real le importaría a todo el mundo, porque significaría que el acto de vigilar degrada lo que se vigila.
No es real. Seis lecturas de la pregunta española dieron 7, 6, 7, 9, 8 y 10 dominios, y la más alta de las seis es la última. La pregunta americana se leyó seis veces también, de las cuales cinco completaron tres pasadas y una paró antes en dos; las cinco dieron 7, 15, 7, 7 y 7. No encoge nada.
La sesión tampoco lo explica, y establecerlo costó una celda más. En la posición seis del primer brazo metimos una pregunta que no se había hecho en esa sesión, mismo mercado, misma intención, y a propósito ninguna de las redacciones leídas antes. Si la caída hubiera sido cosa de estar al final de una sesión, la pregunta nueva habría vuelto pequeña. Devolvió 8 dominios, que está dentro del rango de la pregunta que ya se había leído cinco veces. Así que la secuencia del 10 de agosto era ruido que cayó en orden, y ahora está escrito como ruido en vez de quedarse abierto.
Lo que sí se movió
El recuento de duraderos. Seis lecturas de una pregunta reportaron entre 2 y 5 dominios duraderos, con el mismo prompt, la misma superficie y las mismas tres pasadas, leídas una detrás de otra.
Agregando las 18 pasadas, 3 de los 16 dominios vistos fallaron como mucho una pasada. Otros dos se quedan en 12 de 18, y esos dos son la razón de que las lecturas sueltas discrepen: una lectura ascendió los dos a duraderos y otra degradó uno de los tres que casi nunca faltan. Una lectura de tres pasadas no es una estimación ruidosa del conjunto duradero. Es un sorteo que cae en un conjunto distinto cada vez, y no lleva ninguna señal sobre cuáles de sus miembros son los fiables.
El único conjunto fijo, y su cola
La pregunta americana es la celda que este corpus ya había señalado como el único conjunto fijo que sobrevivió a una lectura profunda. Sobrevive también a esto, y de forma más convincente que antes. Cuatro de las cinco lecturas de tres pasadas devolvieron exactamente esos 7 dominios y nada más, y los siete son los mismos siete, nombre por nombre, que devolvió una lectura larga de la misma celda el mismo día.
La quinta lectura devolvió esos siete más 8 dominios que no volvieron a aparecer. Así que el conjunto fijo describe el núcleo, no el conjunto. Lee esa celda dos veces y tienes una posibilidad real de sacar la lectura de cada seis que hace que una categoría fija parezca una categoría que rota.
La regla que no pudimos quedarnos
La explicación bonita es que la variación vive entre llamadas y no dentro de ellas: un lote de pasadas comparte lo que comparta un lote, así que más pasadas en una llamada compran menos que las mismas repartidas en varias. Encaja perfecto con este brazo. La lectura larga no vio ninguna cola, y la cola apareció solo al volver a preguntar.
Se cae contra nuestras propias filas anteriores. En la misma categoría en España, Francia y Alemania, llamadas sueltas devolvieron 50, 42 y 63 dominios con 39, 28 y 36 de ellos vistos exactamente una vez, todo dentro de una llamada. Las colas ocurren dentro de una llamada, claramente. Lo que sí es cierto es más estrecho y se queda: en esta celda americana, las 6 llamadas devolvieron el núcleo y 1 de ellas trajo algo más.
Escribimos la versión muerta porque es la que va a proponer el siguiente que mire estos datos, y fuimos nosotros.
Y luego la versión barata, en cinco preguntas a la vez
La sección de arriba lee dos preguntas muchas veces. Nadie que compre una herramienta va a hacer eso. Va a leer una pregunta, mirar el número y volver a leerla la semana siguiente. Así que corrimos eso, en cinco categorías que el registro ya cubre, AI Overview, tres pasadas por lectura, dos lecturas comparables cada una.
Dos lecturas seguidas nombraron las mismas fuentes duraderas en 2 de las 5 preguntas y distintas en 3. El solapamiento mediano entre las dos lecturas de una pregunta es 0,67.
La peor celda es la que merece el espacio. El software de contabilidad citó 9 dominios y 0 superaron todas las pasadas. Releída minutos después, la misma pregunta citó 8 y los 8 superaron. Una tercera vez, los mismos 8. Las fuentes no habían cambiado nada: los ocho ya estaban en la primera lectura, en dos pasadas de tres, porque una pasada de esa primera lectura no citó más que Google. Una pasada de cada tres decidió si esta categoría no tenía ninguna fuente duradera u ocho.
Ese es el mecanismo con el que abre este artículo, visto por el otro lado. Allí explicaba por qué una lectura profunda devuelve cero. Aquí voltea una categoría entre dos lecturas que un comprador tomaría con una semana de diferencia y leería como una tendencia.
La que pasaría desapercibida
El hosting reportó 5 dominios duraderos en las dos lecturas, y no son los mismos cinco. Dos de los cinco cambiaron de sitio mientras el recuento se quedaba quieto. Cualquier cosa que reporte un recuento en vez de una lista no habría enseñado ningún cambio, que es peor que enseñar un número equivocado, porque no hay nada que notar.
Por eso el registro guarda las dos cifras por celda y por eso la tabla imprime dominios y no totales.
De qué están hechas las coincidencias, que es la parte incómoda
Las dos coincidencias perfectas son celdas donde todos los dominios citados superaron el listón en las dos lecturas, 2 de las 5. Nuestro diseño decía de antemano que esa forma es el listón siendo bajo y no un conjunto fijo, y este artículo ya ha publicado que un conjunto fijo de tres pasadas casi nunca lo es. Así que la lectura honesta no es que dos preguntas de cinco sean estables. Es que las dos preguntas que coincidieron son las dos donde el estadístico no tenía nada que equivocar.
Lo que esto no resuelve
Cinco preguntas, una superficie, un día, y categorías elegidas porque ya teníamos filas suyas. Las dos lecturas están a minutos, así que esto mide la coincidencia dentro de una sesión y no dice nada de una semana. Y dos lecturas pararon antes en dos pasadas; están en el registro con su recuento real y fuera de toda cifra emparejada, porque un listón que pide unanimidad es más débil con dos pasadas que con tres.
Y un cero tiene dos formas, que ahora se pueden contar
La entradilla de esta pieza dice que un listón estricto tira doce fuentes de
golpe cuando una pasada no cita más que Google. Eso era un mecanismo visto en una
lectura. Deja una forma detrás, y la forma se puede contar sin medir nada nuevo:
google.com citado exactamente una vez, y todos los demás dominios quedándose a
exactamente una pasada del listón.
Contando todas las lecturas de nuestro registro con tres o más pasadas contestadas, y dejando fuera las relecturas de abajo porque se eligieron por ser cero y subirían la cuota por construcción: 80 lecturas, de las cuales 18 devuelven cero fuentes duraderas. 8 de esas 18 tienen la forma de casi y 10 son dispersión corriente, donde el mejor dominio está muy por debajo del listón en vez de a una pasada. La forma no es solo que aparezca Google, porque 14 lecturas lo citan y solo 8 de ellas encajan.
Esos dos ceros piden respuestas opuestas. Un casi dice que las fuentes probablemente están y que el listón cazó una pasada mala. La dispersión dice que no hay nada que nombrar. El número reportado es el mismo.
Si el casi se recupera, probado con control
Releímos dos celdas de cada forma con tres pasadas. Aquí el control importa más que la prueba, porque este registro ya tiene medido que volver a leer mueve mucho el estadístico, así que una recuperación no significa nada si algo que no debería recuperarse no falla.
| celda | forma | cuota duradera al releer |
|---|---|---|
| Gestores de contraseñas, Estados Unidos | casi | 47 por ciento |
| CRM, Alemania | casi | 3 por ciento |
| Comercio electrónico, Estados Unidos | dispersa | 3 por ciento |
| Hosting, España | dispersa | 0 por ciento |
El mejor caso es limpio: los gestores de contraseñas citaron 19 dominios las dos veces y pasaron de ninguno en todas las pasadas a nueve. Nada cambió en las fuentes; cambió el listón. En AI Overview el día anterior, una celda de contabilidad hizo lo mismo y pasó a que todos los citados superaran.
Llevamos cada brazo a 5 celdas, y los brazos siguen solapándose por abajo. Las cuotas de casi son 2, 3, 47, 100 y 100 por ciento, con mediana 47. Las dispersas son 0, 0, 0, 3 y 6, con mediana 0. La celda de casi más baja sigue quedando por debajo de la dispersa más alta, así que una regla que diga «casi significa que las fuentes están» falla dos veces de cinco.
Lo que sí separó es el otro sentido. Ninguna celda dispersa pasó del 6 por ciento, y 3 de las 5 de casi volvieron con un 47 por ciento o más. La información es de una sola dirección: un cero disperso predijo otro casi cero todas las veces, y un cero de casi no predijo nada. Eso es más débil que la afirmación simétrica que habríamos preferido y es lo que sostienen diez lecturas.
Un aviso va en el techo de ese brazo y no debajo. 2 de las 10 relecturas devolvieron como duraderos todos los dominios que citaron, las dos celdas de casi al 100 por ciento, y este corpus ya llama a eso listón bajo y no conjunto fijo. Parte de esa recuperación es una respuesta más estrecha y no fuentes que vuelven.
La forma práctica sale barata igualmente. Si tu cero tiene la forma de casi, léelo otra vez antes de actuar. Una lectura más no cuesta casi nada y es la diferencia entre «ninguna fuente sostiene esta categoría» y «nueve sí».
Tres pasadas es un listón más débil que las cuatro a nueve de las lecturas originales, así que releer favorece la recuperación en los dos brazos. Por eso lo único que se cita arriba es el contraste, y por eso el contraste se reporta como que no separa.
Qué predice de verdad que haya un conjunto que nombrar
Leyendo juntas todas las mediciones profundas del registro, lo que separa una celda con conjunto fijo de una sin él no es el número de pasadas. Las medianas por número de pasadas van 78, 0, 3, 2, 0, 0, 100 y 20 por ciento, que no es ningún patrón.
Lo que las separa es cuántos dominios cita la respuesta de entrada. De 59 lecturas profundas, 14 citan nueve dominios o menos, 40 citan trece o más, y cinco quedan en medio: las estrechas conservan entre el 56 y el 100 por ciento de lo que citan, las anchas conservan como mucho el 40 por ciento. La profundidad tampoco lo explica, porque la lectura estrecha más honda es de 9 pasadas y la ancha más honda de 10.
Y el predictor se queda quieto, que es lo que decide si sirve. Un predictor que se mueve entre días no lo es, así que la celda más ancha del barrido se volvió a leer un día después con el mismo prompt, mercado, superficie y número de pasadas. Citó 64 dominios un día y 63 al siguiente, y no conservó ninguno las dos veces.
Las fuentes de debajo no se quedaron quietas en absoluto: 24 dominios de 103 distintos salen en las dos lecturas, un solapamiento de 0,23. O sea que el número se reproduce mientras se renueva casi toda la pertenencia.
Esa asimetría atraviesa este registro, y en todos los demás sitios el número estable era el que engañaba: una cuota que aguantaba mientras sus fuentes cambiaban enteras, una cuota de estabilidad que recorría cincuenta puntos sobre un numerador que no salía de siete. Este es el único sitio donde funciona al revés. La anchura es lo que se afirma, y es propiedad de la celda y no de qué páginas volvieron ese día.
Así que predijimos antes de medir, que es lo único que evita que esto sea una descripción. Banca de empresa en Estados Unidos citaba cuatro dominios con tres pasadas. El patrón dice que una celda que cita pocos los conserva, así que se leyó ocho veces: cita 7 y conserva los 7, sin cola. Es una cuarta celda del lado estrecho, en una combinación de mercado, categoría y superficie que antes no estaba.
Dos cosas que esto no es. El lado estrecho son 10 celdas distintas contra 29 del ancho, así que el lado que sostiene la afirmación es el flaco. Y un recuento de tres pasadas no predice el profundo: nóminas en Reino Unido citaba ocho con tres pasadas y diecinueve con siete, que es lo que la puso en el lado ancho. Qué tipo de celda tienes se aprende leyéndola a fondo, no contando una lectura superficial.
El confusor evidente es la superficie, y no sobrevive a la prueba. AI Overview cita menos dominios que AI Mode, así que «estrecho» podría ser una superficie con otro nombre. Separado por superficie, el hueco se mantiene dentro de cada una: en AI Overview las lecturas estrechas conservan del 56 al 100 por ciento y las anchas como mucho el 40, y en AI Mode las estrechas conservan el 100 y las anchas como mucho el 25. Esa prueba enseña también dónde esto es flaco, y conviene decirlo en la misma frase: el lado estrecho de AI Mode es 1 celda y el ancho de AI Overview son 8.
Y luego la predicción se apuntó al caso diseñado para romperla. CRM en Reino Unido es estrecha con tres pasadas, siete dominios, y ninguno estable. El patrón de anchura dice que una celda estrecha conserva lo que cita; la lectura de tres pasadas dice que no conserva nada. Leída ocho veces cita 6 y conserva los 6. Ahí el recuento superficial no era solo superficial, estaba invertido: la misma celda se lee como nada estable con tres pasadas y como seis fuentes todas las veces con ocho.
Y la inversión se replicó en una categoría que no habíamos leído nunca. VPN en Estados Unidos era el mismo montaje, seis dominios citados con tres pasadas y ninguno estable. Leída ocho veces cita seis y conserva los seis. Dos celdas independientes, las dos declarando nada estable con tres pasadas, las dos devolviendo un conjunto fijo completo al leerlas a fondo.
Qué le hace esto a lo de ayer
La pieza de ayer decía que las fuentes no parpadean y que una pasada de cada cinco a ocho responde distinto. Las dos mitades siguen siendo ciertas de las dos preguntas que midió, y su aritmética de probabilidad no cambia para ellas.
Lo que no debería haber dado a entender, y lo que un lector se llevaría razonablemente, es que eso describe AI Mode. Describe 2 de 6 preguntas que ya hemos leído a fondo en AI Mode en Estados Unidos. Las otras cuatro se reparten en dos grupos, y una de ellas no tiene pasada rara ninguna.
Es la segunda vez en dos días que un hallazgo nuestro necesita acotarse al llegar más preguntas, y la forma del error es idéntica las dos veces: un mecanismo limpio que explica la tanda que lo sugirió, publicado antes de comprobarlo contra una tanda que no.
Qué reportar en vez de un recuento de estables
Un recuento estable de cero no es un hallazgo por sí solo. Lo que separa los tres casos es la distribución de recuentos, y es una línea de aritmética:
- Todos los dominios citados en el máximo, como CRM, es un conjunto de respuesta fijo. Se trabaja en esas páginas.
- Casi todos a uno del máximo y uno solo por debajo, como nóminas, es una única pasada rara. El conjunto estable es real y tu muestra lo falló. Vuelve a leer antes de concluir.
- Recuentos que se deshilachan con una cola grande de una vez, como ecommerce, es una respuesta que se monta de nuevo cada vez. No hay conjunto estable sobre el que trabajar, y declarar cero es correcto e inútil sin la forma al lado.
Cualquier producto que reporte «fuentes estables: 0» para el segundo y el tercero está dando el mismo número a un casi acierto y a una ausencia.
Dónde no está la diferencia: la página que rankea
La explicación obvia de que CRM conteste desde un conjunto fijo y comercio electrónico no es que sus resultados de búsqueda sean distintos, uno asentado y otro abarrotado. Comprobarlo con el instrumento que produjo el enigma sería razonar en círculo, así que hace falta un segundo instrumento que no sepa nada del primero: los propios resultados orgánicos de Google para la cadena idéntica, leídos el mismo día.
Seis categorías, la misma cadena puesta a las dos capas, Estados Unidos en inglés.
| Categoría | Pasadas en AI Mode | Dominios citados | También en el top 20 orgánico | Citados fuera de la página que rankea |
|---|---|---|---|---|
| CRM | 8 | 9 | 8 | 1 |
| Nóminas | 8 | 13 | 10 | 3 |
| Software de contabilidad | 5 | 13 | 6 | 7 |
| Gestores de contraseñas | 4 | 19 | 7 | 12 |
| Hosting web | 7 | 41 | 8 | 33 |
| Plataformas de comercio electrónico | 9 | 104 | 7 | 97 |
El recuento de dominios citados que además rankean está entre 6 y 10 en las seis. Lo que va de 1 a 97 es la columna de al lado.
La versión en porcentaje, una cuota que cae del 89 por ciento al 7, no es un segundo hallazgo y no debe leerse como tal. Con el numerador casi constante, la cuota cae por aritmética. La observación es el numerador casi constante.
Hay además una comparación que esta tabla no hace. El recuento de dominios distintos de la propia página orgánica va de 13 a 16 en las seis, lo cual parece un resultado plano y no lo es: una página de veinte posiciones está acotada en veinte por construcción, así que esa planitud es del instrumento. Aquí solo se lee el solapamiento.
El control que permite comparar las categorías
Las filas están leídas a profundidades distintas, de cuatro pasadas respondidas a nueve, y la amplitud crece con las pasadas. Si el solapamiento creciera también con ellas, la tabla estaría midiendo profundidad. La celda más ancha se leyó dos veces exactamente por eso: 64 dominios citados con cuatro pasadas respondidas, y 104 con nueve. El solapamiento con la página que rankea fue 7 las dos veces, y los mismos siete dominios por nombre. Los 40 dominios nuevos vinieron todos de fuera de la página.
El mismo hueco leído por el otro extremo
Dada la vuelta, la tabla dice algo que un proveedor paga directamente. Entre 6 y 9 de los dominios que rankean no se citan nunca, en todas las categorías. En comercio electrónico eso incluye a cuatro de las propias plataformas: Shopify, Wix, BigCommerce y Sellfy rankean en el top veinte para esa cadena exacta, y ninguna de las cuatro se cita en nueve pasadas.
Citado no es nombrado. Este registro mantiene separados esos dos resultados en todas partes, y la distinción pesa aquí: una respuesta puede recomendar un producto largamente mientras cita la página de otro sobre él. Lo que se mide es de quién era la página citada.
Así que una posición en primera página compra un asiento en la mesa de la respuesta cuyo tamaño apenas cambia por categoría, y lo que cambia es lo grande que es el resto de la mesa. En CRM ese asiento son 8 de 9 fuentes. En comercio electrónico son 7 de 104. El mismo ranking vale dos cosas muy distintas, y en cuál de las dos estás se puede medir antes de gastar nada en ello.
Lo que esto sigue sin contestar es por qué. Dice dónde no está la diferencia. No está en la página que rankea, porque la página que rankea aporta más o menos lo mismo en todas partes. Lo que hace que una categoría conteste desde un conjunto fijo ocurre en lo que la superficie busca más allá de ella, y esta medición tampoco llega ahí.
Y un control de fuera de las preguntas de compra. Todas las celdas de arriba piden el mejor producto de una categoría. Preguntando en cambio cómo rankear en AI Overviews, que es otra intención en otro sector, AI Mode en 6 pasadas citó 36 dominios y 8 de ellos estaban en el top 20 orgánico. Eso es el 53 por ciento de la página que rankea, la mediana de las doce. Siete dominios que rankean no se citaron en seis pasadas, Ahrefs en la quinta posición entre ellos.
Y un control en la otra superficie, que acota todo lo anterior. Todas las celdas de arriba son AI Mode. Tres de las mismas cadenas puestas a AI Overview el mismo día y en el mismo mercado citan 6 o 7 dominios cada una, todos en todas las pasadas respondidas, y se llevan del 21 al 33 por ciento de su página que rankea. Comercio electrónico es el caso más nítido: 104 dominios citados en AI Mode y 6 en AI Overview, con la pregunta idéntica. O sea que la amplitud por categoría de la que trata toda esta sección es una propiedad de AI Mode, y en AI Overview la categoría ancha es tan fija como la estrecha.
El mismo diseño en un segundo mercado
Todo lo de arriba es un solo mercado, y la regla de este propio registro es que un resultado medido en un mercado es un resultado medido en un mercado. Así que las seis categorías se corrieron otra vez en España, en español, contra la propia página que rankea en España para la cadena española idéntica, el 14 de agosto de 2026.
España contesta más ancho en todas. Su categoría más estrecha cita 25 dominios donde la más estrecha de Estados Unidos cita 9, así que nada en España se parece al conjunto fijo de nueve.
| Categoría | Dominios citados | También en el top 20 orgánico | Cuota de la página que rankea |
|---|---|---|---|
| Nóminas | 25 | 6 | 67 por ciento |
| Gestores de contraseñas | 27 | 6 | 40 por ciento |
| Software de contabilidad | 39 | 8 | 50 por ciento |
| Hosting web | 50 | 4 | 50 por ciento |
| CRM | 77 | 12 | 75 por ciento |
| Plataformas de comercio electrónico | 114 | 9 | 56 por ciento |
En las 18 celdas de los 3 mercados, el conjunto citado va de 9 a 114 y el recuento de dominios citados que además rankean va de 4 a 12.
La última columna es con lo que hay que comparar los tres mercados, y es la razón de que exista. Un recuento crudo de solapamiento está limitado por cuántos dominios tiene la página que rankea, y dos de las páginas españolas devolvieron nueve y ocho dominios orgánicos en vez de quince. Una cuota de la página que cada celda tuvo de verdad no está limitada así. En Estados Unidos esa cuota va del 44 al 63 por ciento, en España del 40 al 75 y en Alemania del 27 al 63. Los dos primeros mercados caen justo por encima de la mitad. Alemania cae en el 44 y es el primero que queda por debajo, que es justo para lo que se añade un tercer mercado.
O sea que se cita en torno a media primera página, en los tres mercados, tanto si la respuesta se apoya en nueve fuentes como si se apoya en ciento catorce.
Dos cosas que esta tanda hace mejor que la primera. Todas las celdas españolas respondieron exactamente seis pasadas, así que la comparación entre categorías está emparejada por pasadas, mientras que las filas estadounidenses iban de cuatro a nueve pasadas respondidas y necesitaban el control de profundidad para sostenerse. Y el hallazgo ya no descansa en un solo mercado, que es lo que este registro le pide a una afirmación antes de enunciarla en general.
Lo que dieciocho celdas no pueden zanjar es si esa cuota se mueve con lo ancho que cite una celda. Lo que sí enseñan son los dos rangos: un conjunto citado que va de 9 a 114, y una cuota de primera página que va del 27 al 75 por ciento.
Y un tercer mercado, leído menos hondo
Todo lo de arriba son dos mercados leídos a seis pasadas o más. Las mismas seis categorías se corrieron otra vez en Alemania, en alemán, el 14 de agosto de 2026, con el mismo diseño y la misma cadena puesta a las dos capas. Las seis contestaron tres pasadas de tres.
| Categoría | Dominios citados | También en el top 20 orgánico | Cuota de la página que rankea |
|---|---|---|---|
| Software de contabilidad | 11 | 7 | 44 por ciento |
| CRM | 12 | 5 | 29 por ciento |
| Nóminas | 13 | 10 | 63 por ciento |
| Gestores de contraseñas | 16 | 4 | 27 por ciento |
| Hosting web | 45 | 9 | 60 por ciento |
| Plataformas de comercio electrónico | 45 | 4 | 44 por ciento |
Hay que leer la columna del medio, no la de la izquierda. Son lecturas de tres pasadas donde España corrió seis, y esta misma pieza ya enseñó que un recuento de tres pasadas no predice el profundo: nóminas en Reino Unido citaba ocho con tres pasadas y diecinueve con siete. Así que un rango citado de 11 a 45 no es comparable con el español, y lo estrecho de la izquierda es en parte profundidad.
La columna que sí es comparable es la que defiende el propio control de profundidad de este estudio. Leer la celda estadounidense más ancha con cuatro pasadas y otra vez con nueve llevó su conjunto citado de 64 a 104 y dejó el recuento que además rankea en 7 las dos veces: lo citado se mueve con la profundidad y el solapamiento no. En Alemania ese solapamiento va de 4 a 10, dentro del 4 a 12 que ya habían fijado los dos primeros mercados. Un tercer idioma no movió ninguno de los dos extremos.
Lo que Alemania sí mueve es la cuota de la página que rankea, hacia abajo. Su suelo es del 27 por ciento contra el 40 de España, y su mediana es 44, la primera de los tres mercados que cae por debajo de la mitad.
Y la otra superficie apunta aquí al revés, que es lo que el control estadounidense no predecía.
Tres de estas cadenas alemanas fueron a AI Overview el mismo día, las mismas tres categorías que ya estaban controladas en Estados Unidos. Allí AI Overview se apoya en la página que rankea menos que AI Mode, del 21 al 33 por ciento contra del 44 al 63. En Alemania se apoya más, en las tres: 59 contra 29, 50 contra 44 y 89 contra 44.
Tres celdas así de limpias suelen ser la frase y no el mercado, así que las mismas tres se preguntaron otra vez en alemán de otra forma, en las dos superficies. AI Overview volvió con 53, 59 y 47 contra el 35, 53 y 47 de AI Mode. Entre las dos redacciones eso son 6 pares, 5 con AI Overview por encima, 1 empate exacto y 0 al revés.
Así que la dirección no es la redacción. El tamaño sí: comercio electrónico pasó de 45 puntos de diferencia a ninguno. Lo que sostienen estos pares es que en Alemania AI Overview no fue nunca la superficie que menos se apoya en la primera página, y ninguna distancia concreta.
Dos límites, porque este es el tipo de contraste que invita a una afirmación más grande de la que aguanta. El lado estadounidense son tres celdas con una sola redacción, así que la mitad de la comparación que no se ha repetido es la mitad sobre la que descansa el contraste. Y las cadenas estadounidenses son inglesas donde las alemanas son alemanas, así que esa mitad sigue moviendo país e idioma a la vez, que es justo el confusor que la nueva redacción alemana quitó sólo del lado alemán.
Lo que esto no demuestra
Nuestros recuentos de AI Mode son suelos, no recuentos. En 5 preguntas de 3 mercados, una respuesta de AI Mode imprime marcadores de cita numerados en su cuerpo y la lista estructurada trae desde el 21 por ciento de ellos hasta todos, mientras que la de AI Overview los trajo todos en todas las celdas. Lo medimos primero en dos celdas, lo leímos como una mitad constante, y un tercer mercado devolvió una respuesta de AI Mode con todos los marcadores que imprimía. Así que toda cifra de amplitud de AI Mode de aquí es al menos lo que dice, en una cantidad que cambia por celda y que no podemos acotar. Da la casualidad de que esa es la dirección segura para este artículo: donde decimos que AI Mode cita mucho más ancho que AI Overview, un AI Mode infra-capturado hace el hueco real mayor y no menor. Lo que descarta es corregir ninguno de estos números hacia arriba con un factor fijo, que es lo que invitaba la versión de dos celdas.
Se le quedó pequeño su propio límite, y este es el de ahora. Esto empezó siendo AI Mode en Estados Unidos en inglés un solo día, y esa frase siguió aquí después de dejar de ser cierta. Las lecturas cubren ya 2 superficies, 5 mercados, 4 idiomas y 4 días. Cada sección dice cuál usó, y ninguna cifra de aquí abarca más que la sección en la que está.
Las categorías no son muestra de nada. Se eligieron porque nuestro trabajo anterior ya las cubre, así que son las categorías contra las que podemos comparar, no un sorteo de la economía.
Las pasadas respondidas van de cuatro a ocho y eso no lo controlamos. La herramienta para antes y dice cuántas respondieron. Un listón que pide unanimidad es más duro con ocho pasadas que con cuatro, así que las filas no son intercambiables y la comparación que pesa es la que tiene las profundidades igualadas.
Por qué CRM es fijo y ecommerce no, seguimos sin poder decirlo. La sección de arriba descarta una respuesta y solo una: no es que la página que rankea sea distinta, porque la página que rankea aporta de seis a diez fuentes sea cual sea la categoría. Eso deja el mecanismo donde la medición no llega, en lo que la superficie recupera más allá de la primera página, y una historia plausible sobre fondos pequeños y categorías abarrotadas sigue siendo una hipótesis para un estudio mayor y no un hallazgo.
Aquí nada es causal ni pronostica nada. Son lecturas, no una intervención con control.
Preguntas frecuentes sobre conjuntos estables de citación
¿Cero fuentes estables significa que el motor es inestable?
Por sí solo no. En nuestras seis lecturas el cero llegó de dos maneras distintas: una donde doce de trece fuentes coincidían y una sola pasada difería, y otra donde decenas de fuentes salían una vez cada una. La primera es un casi acierto y la segunda una ausencia, y el recuento estable es idéntico en las dos.
¿Puede una respuesta de IA devolver las mismas fuentes siempre?
Sí, en algunas categorías. Preguntar por el mejor CRM para una pequeña empresa en AI Mode devolvió nueve dominios con todos citados en todas las pasadas respondidas, y una segunda lectura el mismo día devolvió los mismos nueve por nombre. Esa es una celda donde a un comprador se le puede enseñar exactamente qué páginas tienen la respuesta a esa pregunta tal y como está redactada. La misma intención preguntada con otras palabras, el mismo día en la misma superficie y el mismo mercado, citó 80 dominios y ninguno estable, así que la lista es de la redacción antes que de la categoría.
¿Rankear en primera página te hace citable en una respuesta de IA?
En parte, y en una cantidad que apenas cambia con la categoría. Poniendo la cadena idéntica a los resultados orgánicos de Google y a AI Mode el mismo día en seis categorías, el número de dominios citados que además rankean en el top 20 orgánico cayó entre 6 y 10 todas las veces, mientras el conjunto citado iba de 9 a 104. O sea que una posición en primera página aporta un número de fuentes más o menos fijo, y lo que decide si eso es casi toda la respuesta o una fracción es cuánto cita la superficie desde fuera de la página que rankea. En la categoría más estrecha fueron 8 de 9 fuentes; en la más ancha, 7 de 104.
¿Se cumple esto en AI Overview?
No, y es el límite más importante de esta página. Tres de las mismas cadenas puestas a AI Overview el mismo día citan 6 o 7 dominios cada una, todos en todas las pasadas respondidas, y se llevan del 21 al 33 por ciento de su página que rankea. El caso más claro es comercio electrónico: 104 dominios citados en AI Mode y 6 en AI Overview con la pregunta idéntica. La división entre ancho y estrecho sobre la que se construye esta página es una propiedad de AI Mode, así que una cifra medida en una superficie no dice nada de la otra.
¿Por qué decía vuestro artículo anterior que una pasada de cada ocho responde distinto?
Porque es lo que hicieron sus dos preguntas, y sigue siendo cierto de ellas. Cuatro preguntas más con el mismo marco y la misma superficie no lo enseñan, así que el mecanismo es de esas preguntas y no de la superficie. Esta pieza es esa corrección, publicada en vez de aplicada en silencio.
¿Cuántas pasadas debería usar una cifra de estabilidad?
Más de tres, y el número tiene que ir impreso al lado de la cifra. Un listón que pide una fuente en todas las pasadas se endurece según se añaden pasadas, así que la misma pregunta medida honestamente a tres y a diez produce recuentos distintos. En nuestro registro una pregunta da trece dominios estables a tres pasadas y cuatro a diez.
¿Qué debería preguntarle a un proveedor sobre esto?
Ahora tres cosas. Si sus pasadas saltan la caché, cuántas redacciones sigue por intención, y qué le pasa a su cifra de estabilidad cuando sube el número de pasadas. Y una cuarta si reporta un cero: si vino de una pasada rara o de cien fuentes saliendo una vez, porque no podrá contestar sin la distribución de recuentos.
¿Cómo repito esto?
Coge una pregunta de compra, hazla de cuatro a diez veces en una superficie y un mercado, y anota cuántas pasadas citaron cada dominio en vez de si cada dominio pasó todas. Luego hazlo con una segunda categoría en la misma sesión. Si las dos distribuciones tienen formas distintas, lo has reproducido, y el recuento estable solo lo habría escondido. Luego vuelve a hacer la primera pregunta con otras palabras, en la misma superficie y el mismo día, y junta las dos listas de dominios: ese es el paso del que depende esta pieza, y es el que el método de arriba no alcanza por sí solo.
Pregúntale a la IA sobre este artículo
Abre tu asistente con esta página ya cargada, para comprobar las cifras, discutir el método o preguntar qué significa en tu caso.
- ChatGPT (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Claude (se abre en una nueva pestaña. la pregunta va escrita, pulsa intro para enviarla)
- Perplexity (se abre en una nueva pestaña)
- Google AI Mode (se abre en una nueva pestaña)
Perplexity y Google responden directamente. ChatGPT y Claude dejan la pregunta escrita y esperan a que pulses intro, que es su comportamiento y no algo que podamos cambiar.