Metodología

Cómo medimos la visibilidad en IA, y cuánta certeza tenemos.

Cada número en PromptHawk viene con sus pruebas: cuántas veces preguntamos, qué motores respondieron y cuánto fiarte del resultado.

Última actualización: junio de 2026

Por qué existe esta página

Los motores de respuesta de IA no dan la misma respuesta dos veces. Pregunta a ChatGPT lo mismo diez veces y obtendrás diez listas de marcas ligeramente distintas. No es un fallo de nuestro producto: así funcionan estos modelos.

Por eso no medimos una sola vez. Lanzamos cada prompt muchas veces, en cada motor, e informamos de la proporción de veces que apareces, junto con un rango de confianza a su alrededor. Cuando no tenemos datos suficientes para estar seguros, lo decimos en lugar de inventar un número.

Esta página explica exactamente cómo funciona. Sin cajas negras.

Sondeamos, no hacemos capturas puntuales

Para cada prompt que sigues, lo ejecutamos varias veces contra cada motor dentro de una ventana de medición. Una vez por ventana hacemos una ejecución «canónica» completa y fundamentada que captura las fuentes exactas que citó el motor; el resto son ejecuciones de muestreo más ligeras que comprueban si aparece tu marca. Tu tasa de visibilidad es la proporción de todas esas ejecuciones en las que apareces. Si apareces en 7 de 10, tu visibilidad es del 70%, con un rango de confianza alrededor.

  • Una ejecución completa y fundamentada por ventana captura las fuentes citadas; las ejecuciones de muestreo adicionales solo confirman si apareces. La detección es lo que determina la tasa, así que las ejecuciones ligeras la miden con la misma fidelidad, a una fracción del coste.
  • Más ejecuciones de los mismos prompts vale más que más prompts ejecutados una sola vez. Un conjunto pequeño de prompts medido muchas veces te dice más sobre si de verdad has cambiado que un conjunto enorme medido una vez.
  • Congelamos tu conjunto de prompts y la configuración de los motores dentro de una ventana, de modo que un cambio en tu puntuación significa un cambio en el mundo, no un cambio en cómo preguntamos.
  • Conservamos las respuestas en bruto detrás de cada puntuación, de modo que cualquier número se puede rastrear hasta las respuestas exactas que lo produjeron.

Una sola ejecución es una anécdota. La tasa agrupada a lo largo de muchas ejecuciones es una medición.

Cuántas ejecuciones incluye tu plan

La confianza viene del tamaño de la muestra. Los planes superiores agrupan más ejecuciones por prompt, en cada motor, a lo largo de la semana, de modo que tus rangos se estrechan y tus tendencias se vuelven fiables antes.

PlanEjecuciones por prompt, por motor y por semanaActualizaciónConfianza
Gratis≈3Bajo demandaSolo orientativo
Pro≈8SemanalRangos más estrechos, historial semanal
Business≈33Diaria, agrupada por semanaRangos más estrechos, historial diario

Se agrupan en una ventana semanal móvil: una ejecución completa y fundamentada más ejecuciones de muestreo más ligeras, sumadas en un único rango de confianza. El plan Gratis es orientativo: las muestras pequeñas dan rangos amplios y, al analizar solo a demanda, rara vez acumula el historial que necesita una tendencia. Los planes de pago analizan de forma programada, así que las tendencias aparecen solas a medida que se acumula ese historial. Las cifras aún demasiado escasas para fiarse se marcan como «Preliminar».

Qué significa el rango

Un intervalo de confianza es el rango en el que casi con certeza se sitúa tu visibilidad real. «62% (51–72%)» significa que, si repitiéramos estos análisis, esperaríamos que el número real cayera en ese rango unas 19 de cada 20 veces. Un rango más amplio significa que tenemos menos datos, no que estemos adivinando.

El rango no es una conjetura sobre cuánto podríamos equivocarnos: es la dispersión natural de un modelo que responde de forma distinta cada vez.

Cómo leer la amplitud

  • Un rango estrecho significa que tenemos confianza: muchas ejecuciones y respuestas consistentes.
  • Un rango amplio significa que hay que tener cuidado: pocas ejecuciones, o el motor no para de cambiar de opinión. Más ejecuciones lo estrechan.

Para tasas (visibilidad, cuota de voz, citas)

Usamos un intervalo de puntuación de Wilson con corrección por continuidad, el método estándar para tasas de tipo «x de n». Se mantiene honesto con muestras pequeñas y nunca informa de rangos imposibles como 102%. Nuestras muestras son pequeñas y nuestras tasas suelen estar cerca del 0% o del 100%, justo donde los métodos más simples subestiman la incertidumbre; la corrección hace que nuestros intervalos sean ligeramente conservadores a propósito: preferimos subestimar nuestra confianza antes que exagerarla.

lower = (2np̂ + z² − 1 − z·√(z²−2−1/n + 4p̂(n(1−p̂)+1))) / (2(n+z²)); upper = (2np̂ + z² + 1 + z·√(z²+2−1/n + 4p̂(n(1−p̂)−1))) / (2(n+z²)), z = 1.96

Para promedios (posición, cuota de voz)

Informamos del promedio de las ejecuciones con un margen de error: media ± t·(s/√n) al 95%, usando la distribución Student-t para muestras pequeñas. Deliberadamente no usamos bootstrap aquí: con los tamaños de muestra con los que trabajamos, el bootstrap arroja rangos demasiado estrechos, que es justo la falsa precisión que intentamos evitar.

mean ± t₀.₉₇₅,ₙ₋₁ · (s / √n)

Estimación del volumen de prompts

Cada prompt monitoreado recibe un volumen de búsqueda mensual estimado mediante un único modelo determinista que llamamos heuristic-v1. No usa ninguna API externa de palabras clave ni ningún panel opaco: el mismo prompt siempre produce el mismo número, y por eso podemos publicar cómo funciona. Considéralo una señal relativa de tamaño (qué prompts tienen más demanda), no una cifra de tráfico garantizada.

  • Partimos de una base de 8.000 búsquedas mensuales y la reducimos a medida que un prompt se hace más largo y específico: los términos cortos conservan la mayor parte, las preguntas de cola larga solo una fracción.
  • Clasificamos la intención de cada prompt según su redacción y la ponderamos por la demanda que suele tener esa intención: la informacional la mayor, después la comercial, la transaccional y la navegacional.
  • Las expresiones reconocibles de términos principales como «best», «how to» o «near me» reciben un pequeño impulso.
  • El resultado se redondea a dos cifras significativas y se acota a un rango razonable, para no insinuar una precisión falsa.

Las cuatro intenciones

Informacional
Aprender sobre el tema: «how», «what is», «guide», «tutorial». La demanda más amplia.
Comercial
Comparar opciones antes de comprar: «best», «vs», «review», «alternative».
Transaccional
Listo para actuar: «buy», «price», «discount», «free trial».
Navegacional
Ir a un lugar concreto: «login», «near me», «official», «download».
estimación = round2sig(8000 × factorLongitud(palabras) × factorIntención(intención) × min(1,15; 1 + impulsoTérmino)), acotada a [10, 50000]

La confianza se informa junto a cada estimación y se limita a 0,9: el modelo nunca afirma una certeza que no tiene. Una estimación con mayor confianza significa una señal de intención más clara y un prompt más corto y fácil de dimensionar.

Qué tan recientes son los datos

PromptHawk no funciona en tiempo real. Medimos según una programación e informamos de una instantánea reciente, no de lo que un motor diría en este preciso segundo.

Cada puntuación refleja la ventana de medición completada más reciente para tu plan. Registramos cuándo se recopiló cada medición, de modo que un número siempre pueda rastrearse hasta la ventana que lo produjo.

  • Semanal es una base razonable para la mayoría de las categorías; diaria es para términos de cambio rápido o de alto riesgo.
  • Hay un retardo entre el momento en que un motor cambia y el momento en que se refleja aquí: la recopilación, la puntuación y la agregación llevan tiempo.

Los motores que consultamos

Consultamos los motores de respuesta que tus clientes usan de verdad, y siempre te mostramos el desglose por motor: una victoria en Perplexity y una derrota en ChatGPT son hechos distintos. Tu puntuación principal de visibilidad es un promedio transparente ponderado por ejecuciones entre esos motores, con su propio rango de confianza; nunca oculta una derrota en un motor tras una victoria en otro.

ChatGPT (OpenAI)
Consultado sin sesión iniciada, modelo por defecto, respuestas capturadas literalmente.
Perplexity
Consultado sin sesión iniciada, modelo por defecto, con las fuentes citadas capturadas.
Google AI Overviews
Capturado del bloque de AI Overview, por separado de los resultados de enlaces azules.
Gemini (Google)
Consultado con grounding, modelo por defecto, fuentes citadas capturadas.
Claude (Anthropic)
Consultado con búsqueda web, modelo por defecto, fuentes citadas capturadas.

Añadimos motores a medida que ganan uso real y retiramos los que no podemos medir de forma fiable. Cuando la API propia de un motor no está disponible, puede responder en su lugar un sustituto claramente identificado, y registramos cuál se usó. La lista y la configuración actuales siempre se muestran aquí.

Lo que no haremos

La confianza es el producto. Por eso nos atenemos a reglas que la mayoría de las herramientas no publican:

  • No mostraremos una tendencia ni un cambio «+X%» que no podamos respaldar con datos. Si los rangos de dos periodos no se separan con claridad, decimos «Sin cambios medibles».
  • No ocultaremos el tamaño de la muestra. Cada número muestra en cuántas ejecuciones se basa.
  • No ocultaremos una derrota en un motor, ni mezclaremos regiones o conjuntos de prompts, para que un gráfico se vea más suave. La puntuación principal es un promedio transparente ponderado por ejecuciones y cada motor siempre se muestra por separado.
  • No fabricaremos precisión. Un número basado en demasiado pocas ejecuciones se marca como «Preliminar», no se disfraza de hecho.

Lo que esto no puede decirte

Medir las respuestas de IA es realmente difícil. Aquí es donde los números se detienen:

No determinismo de los motores
El mismo prompt produce respuestas distintas. Muestreamos para sortearlo; no podemos eliminarlo.
Sensibilidad a la formulación
Reformula un prompt y la lista de marcas puede cambiar. La formulación que sigues es una ventana a un tema, no el tema completo.
Sin garantía de exhaustividad
Medimos los prompts y los motores que sigues, no todas las preguntas que un comprador podría hacer.
Personalización y región
Las respuestas varían según la ubicación, la cuenta y el historial. Nosotros estandarizamos las nuestras; las de un usuario real serán distintas.
Actualizaciones de los modelos
Los motores cambian bajo nuestros pies. Un cambio puede reflejar el lanzamiento de un modelo, no tu trabajo.
Muestras pequeñas
Los planes bajos y los prompts que se activan rara vez producen rangos amplios. Es un límite real, mostrado con honestidad.

Definiciones claras

Ejecución
Una vez que enviamos un prompt a un motor y registramos la respuesta.
Tasa de visibilidad
La proporción de ejecuciones en las que tu marca aparece en la respuesta.
Cuota de voz
La parte que representa tu marca sobre todas las menciones de marcas en las ejecuciones.
Posición media
Dónde suele situarse tu marca en la lista de la respuesta, promediado a lo largo de las ejecuciones.
Intervalo de confianza
El rango en el que casi con certeza se sitúa tu valor real, dadas las ejecuciones que tenemos.
Margen de error
La mitad de la amplitud del rango de confianza: el ± junto a un número.
Preliminar
Basado en demasiado pocas ejecuciones como para fiarse con precisión. Solo orientativo.
Ventana de medición
El periodo a partir de cuyas ejecuciones se calcula una puntuación.

Preguntas

¿Por qué cambió mi puntuación si no hice nada?

Las respuestas de IA varían por sí solas. Si el cambio está dentro del rango de confianza, trátalo como ruido: por eso mostramos el rango.

¿Por qué mi rango es tan amplio?

Aún no hay ejecuciones suficientes, o el motor está siendo inconsistente con ese prompt. Más ejecuciones (o un plan superior) lo estrechan.

¿Esto es en tiempo real?

No. Informamos de una instantánea reciente según una programación, siempre con fecha y hora.

¿Son estas las respuestas exactas que ven los usuarios?

No: las respuestas varían según la persona, el lugar y el momento. Estandarizamos nuestras consultas para que las tendencias sean comparables, no idénticas a las de ningún usuario concreto.

¿Por qué aún no mostráis una tendencia?

Trazamos la línea cuando hay dos ventanas comparables con datos suficientes. Solo damos por bueno un cambio —un “+X %”— cuando los rangos de las dos ventanas se separan con claridad; si no, mostramos “sin cambios medibles”.

Compruébalo con tu propia marca.

Lanza un análisis y observa cómo aparecen las pruebas junto a cada número.