Posicionamiento Google

Los rankings de visibilidad en IA no son estables: nueva investigación revela ruido estadístico

Un nuevo estudio demuestra que los rankings de visibilidad en IA varían significativamente entre ejecuciones y que gran parte de los cambios se deben a ruido estadístico. Te explicamos cómo saber cuándo un ranking es confiable y qué significa esto para tu estrategia de contenidos.

Publicado el

Gráfico de fluctuaciones en rankings de visibilidad IA con líneas inestables y datos estadísticos
Search Engine Journal

Un nuevo paper de investigación —"Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement", del investigador Ronald Sielinski (cofundador de IQRush, una plataforma de medición de visibilidad en IA), publicado en arXiv en marzo de 2026— pone en jaque una de las métricas que más se usan para medir el impacto en las respuestas generadas por inteligencia artificial: los rankings de visibilidad en IA. Según la cobertura de Search Engine Journal sobre el estudio, estos rankings no son tan estables como se pensaba y gran parte de las variaciones que observamos entre mediciones son simplemente ruido estadístico.

El hallazgo es relevante para quienes usan herramientas como AI Overviews, Perplexity, ChatGPT Search o Claude para analizar dónde aparece su contenido. Un solo snapshot puede dar una impresión completamente equivocada de la realidad.

¿Por qué los rankings de visibilidad en IA cambian tanto?

El estudio analizó la variabilidad de las citas en tres motores de búsqueda generativa —Perplexity Search, OpenAI SearchGPT y Google Gemini—, combinando muestreos diarios durante nueve días consecutivos con muestreos de alta frecuencia cada diez minutos, y encontró que los puestos de las fuentes citadas cambian de forma significativa de una corrida a otra. Esto ocurre incluso cuando se mantiene idéntica la consulta y el modelo.

La explicación principal es el componente probabilístico inherente a los LLMs (Large Language Models). Cada generación de respuesta introduce variabilidad, lo que hace que un dominio que hoy aparece en primer lugar puede no aparecer en las próximas 10 ejecuciones.

Este fenómeno no es un bug de una herramienta específica, sino una característica del propio funcionamiento de la inteligencia artificial generativa.

La regla de parada que propone la investigación

Uno de los aportes más prácticos del paper es la propuesta de una regla de parada (stopping rule). En lugar de tomar una única medición o un promedio de tres corridas, el autor sugiere continuar ejecutando la misma consulta hasta que se cumplan ciertos criterios estadísticos de estabilidad.

Y acá está el dato que más debería hacer ruido entre quienes venden "reportes de visibilidad en IA": la cantidad de ejecuciones necesaria para estabilizar varía muchísimo según la plataforma. En Gemini, el estudio encontró estabilidad con unas 30 a 50 consultas según el tema. En Perplexity, hicieron falta entre 90 y 100. En SearchGPT, el mínimo fue de 150 consultas o más, y ni siquiera ahí hay garantías: el paper describe un patrón de "convergencia no monótona" en esa plataforma, donde el intervalo de confianza se angosta y vuelve a ensancharse a medida que se suman consultas, así que un análisis que se detenga en un punto angosto "por suerte" puede estar subestimando la incertidumbre real.

Esto tiene implicancias directas para agencias y equipos de SEO que están generando reportes mensuales de "visibilidad en IA". Un ranking basado en una o dos ejecuciones puede estar llevando a decisiones completamente erradas.

¿Qué significa esto para tu estrategia de contenidos?

Si estás optimizando para AI Overviews o para ser citado en respuestas de ChatGPT, la recomendación más sana es dejar de confiar en mediciones puntuales. En cambio, considera:

  • Adaptar el número de ejecuciones a la plataforma que estés midiendo: lo que alcanza en Gemini (30-50) puede ser insuficiente en Perplexity (90-100) o en SearchGPT (150+)
  • Monitorear la desviación estándar entre corridas para entender la volatilidad real de cada consulta
  • Dar más peso a señales de autoridad y E-E-A-T que a la posición exacta en un ranking inestable
  • Usar los rankings de visibilidad como indicador de tendencias a largo plazo, nunca como diagnóstico preciso de performance

Google mismo ha reconocido en su documentación sobre Search Generative Experience que las respuestas generadas pueden variar, aunque el contenido fuente siga siendo el mismo.

El rol de la consistencia editorial

Más allá de los números, lo que sí parece predecir mejor la visibilidad sostenida en IA es la consistencia y profundidad del contenido. Fuentes que publican regularmente contenido original, bien estructurado y respaldado por datos tienden a aparecer con mayor frecuencia, aunque no siempre en el mismo orden.

Esto refuerza la idea que venimos sosteniendo desde hace meses: la optimización para IA no reemplaza al SEO tradicional, sino que lo complementa. Los fundamentos (autoridad, relevancia, experiencia) siguen siendo los que más peso tienen cuando el ruido estadístico se quita de la ecuación.

Recomendaciones prácticas para marketers argentinos

Si estás midiendo visibilidad en IA para un cliente local, considera estas acciones concretas:

  1. No uses un número fijo de ejecuciones para todas las plataformas: en Gemini podés acercarte a un dato confiable con 30-50 consultas, pero en Perplexity o SearchGPT vas a necesitar bastantes más (90 o incluso 150+).
  2. Registra tanto la posición media como la frecuencia de aparición (cuántas veces aparece el dominio en las respuestas).
  3. Combina los datos de IA con métricas tradicionales de Search Console (impresiones orgánicas, CTR y posiciones en web search).
  4. Enfócate en crear contenido que responda preguntas complejas y de intención informacional elevada, que son las que más suelen derivar en respuestas generadas por IA.

La investigación viene a recordarnos algo que ya sabíamos pero que a veces olvidamos por la presión de entregar reportes: en SEO (y ahora también en AIO), la paciencia y el rigor metodológico terminan siendo las mejores herramientas.

¿Estás midiendo visibilidad en IA en tus proyectos? ¿Cuántas ejecuciones usás por consulta antes de considerar confiable el dato? Contanos en los comentarios.

← Volver al blog