Comment nous mesurons la visibilité dans l’IA, et à quel point nous en sommes sûrs.
Chaque chiffre sur PromptHawk vient avec ses preuves : combien de fois nous avons demandé, quels moteurs ont répondu et à quel point faire confiance au résultat.
Dernière mise à jour : juin 2026
Pourquoi cette page existe
Les moteurs de réponse IA ne donnent jamais deux fois la même réponse. Posez dix fois la même question à ChatGPT et vous obtiendrez dix listes de marques légèrement différentes. Ce n’est pas un défaut de notre produit : c’est ainsi que fonctionnent ces modèles.
Nous ne mesurons donc pas une seule fois. Nous lançons chaque prompt de nombreuses fois, sur chaque moteur, et nous rapportons la proportion de fois où vous apparaissez, avec une plage de confiance autour. Quand nous n’avons pas assez de données pour être sûrs, nous le disons au lieu d’inventer un chiffre.
Cette page explique exactement comment cela fonctionne. Aucune boîte noire.
Nous sondons, nous ne figeons pas un instant
Pour chaque prompt que vous suivez, nous le lançons plusieurs fois sur chaque moteur au cours d’une fenêtre de mesure. Une fois par fenêtre, nous faisons une exécution « canonique » complète et sourcée qui capture les sources exactes citées par le moteur ; les autres sont des exécutions d’échantillonnage plus légères qui vérifient si votre marque apparaît. Votre taux de visibilité est la proportion de toutes ces exécutions où vous apparaissez. Apparaissez dans 7 sur 10 et votre visibilité est de 70 %, avec une plage de confiance autour.
- Une exécution complète et sourcée par fenêtre capture les sources citées ; les exécutions d’échantillonnage supplémentaires confirment seulement si vous apparaissez. C’est la détection qui détermine le taux, donc les exécutions légères la mesurent tout aussi fidèlement, pour une fraction du coût.
- Plus d’exécutions des mêmes prompts vaut mieux que plus de prompts lancés une seule fois. Un petit ensemble de prompts mesuré de nombreuses fois en dit plus sur le fait que vous avez réellement bougé qu’un ensemble énorme mesuré une fois.
- Nous figeons votre ensemble de prompts et les réglages des moteurs au sein d’une fenêtre, de sorte qu’un changement de votre score signifie un changement dans le monde, pas un changement dans notre façon de demander.
- Nous conservons les réponses brutes derrière chaque score, de sorte que tout chiffre remonte aux réponses exactes qui l’ont produit.
Une exécution isolée est une anecdote. Le taux agrégé sur de nombreuses exécutions est une mesure.
Combien d’exécutions inclut votre forfait
La confiance vient de la taille de l’échantillon. Les forfaits supérieurs agrègent plus d’exécutions par prompt, sur chaque moteur, sur la semaine : vos plages se resserrent et vos tendances deviennent fiables plus tôt.
| Forfait | Exécutions par prompt, par moteur et par semaine | Actualisation | Confiance |
|---|---|---|---|
| Gratuit | ≈3 | À la demande | Indicatif seulement |
| Pro | ≈8 | Hebdomadaire | Marges plus serrées, historique hebdomadaire |
| Business | ≈33 | Quotidienne, agrégée par semaine | Marges les plus serrées, historique quotidien |
Elles sont agrégées sur une fenêtre hebdomadaire glissante — une exécution complète et sourcée plus des exécutions d’échantillonnage plus légères, additionnées en une seule plage de confiance. L’offre Gratuite est indicative : de petits échantillons donnent des marges larges et, avec des analyses uniquement à la demande, elle accumule rarement l’historique qu’exige une tendance. Les offres payantes analysent selon un calendrier, donc les tendances apparaissent d’elles-mêmes à mesure que cet historique s’accumule. Les chiffres encore trop faibles pour être fiables sont signalés « Préliminaire ».
Ce que signifie la plage
Un intervalle de confiance est la plage dans laquelle se situe presque certainement votre visibilité réelle. « 62 % (51–72 %) » signifie que si nous relancions ces analyses, nous nous attendrions à ce que le vrai chiffre tombe dans cette plage environ 19 fois sur 20. Une plage plus large signifie que nous avons moins de données, pas que nous devinons.
La plage n’est pas une estimation de notre marge d’erreur : c’est la dispersion naturelle d’un modèle qui répond différemment à chaque fois.
Lire la largeur
- Une plage étroite signifie que nous sommes confiants : beaucoup d’exécutions, des réponses cohérentes.
- Une plage large invite à la prudence : peu d’exécutions, ou le moteur change sans cesse d’avis. Davantage d’exécutions la resserrent.
Pour les taux (visibilité, part de voix, citations)
Nous utilisons un intervalle de score de Wilson avec correction de continuité, la méthode standard pour les taux de type « x sur n ». Il reste honnête sur de petits échantillons et ne rapporte jamais de plages impossibles comme 102 %. Nos échantillons sont petits et nos taux se situent souvent près de 0 % ou de 100 %, précisément là où les méthodes plus simples sous-estiment l’incertitude ; la correction rend nos intervalles légèrement conservateurs à dessein : nous préférons sous-estimer notre confiance que la surestimer.
lower = (2np̂ + z² − 1 − z·√(z²−2−1/n + 4p̂(n(1−p̂)+1))) / (2(n+z²)); upper = (2np̂ + z² + 1 + z·√(z²+2−1/n + 4p̂(n(1−p̂)−1))) / (2(n+z²)), z = 1.96Pour les moyennes (position, part de voix)
Nous rapportons la moyenne sur les exécutions avec une marge d’erreur : moyenne ± t·(s/√n) à 95 %, en utilisant la distribution Student-t pour les petits échantillons. Nous n’utilisons délibérément pas le bootstrap ici : aux tailles d’échantillon avec lesquelles nous travaillons, le bootstrap rapporte des plages trop étroites, soit exactement la fausse précision que nous cherchons à éviter.
mean ± t₀.₉₇₅,ₙ₋₁ · (s / √n)Estimation du volume des prompts
Chaque prompt suivi reçoit un volume de recherche mensuel estimé par un unique modèle déterministe que nous appelons heuristic-v1. Il n'utilise aucune API tierce de mots-clés ni aucun panneau opaque : le même prompt produit toujours le même nombre, et c'est précisément pourquoi nous pouvons en publier le fonctionnement. Considérez-le comme un signal relatif de taille (quels prompts portent le plus de demande), non comme un chiffre de trafic garanti.
- Nous partons d'une base de 8 000 recherches mensuelles et la réduisons à mesure qu'un prompt devient plus long et précis : les termes courts en conservent l'essentiel, les questions de longue traîne une fraction.
- Nous classons l'intention de chaque prompt d'après sa formulation et la pondérons selon la demande qu'elle porte habituellement : l'informationnel le plus, puis le commercial, le transactionnel et le navigationnel.
- Les formulations reconnaissables de termes principaux comme « best », « how to » et « near me » reçoivent un léger bonus.
- Le résultat est arrondi à deux chiffres significatifs et borné à une plage raisonnable, pour ne jamais suggérer une fausse précision.
Les quatre intentions
- Informationnel
- Apprendre le sujet : « how », « what is », « guide », « tutorial ». La demande la plus large.
- Commercial
- Comparer les options avant d'acheter : « best », « vs », « review », « alternative ».
- Transactionnel
- Prêt à agir : « buy », « price », « discount », « free trial ».
- Navigationnel
- Se rendre à un endroit précis : « login », « near me », « official », « download ».
estimation = round2sig(8000 × facteurLongueur(mots) × facteurIntention(intention) × min(1,15 ; 1 + bonusTerme)), bornée à [10, 50000]La confiance est indiquée avec chaque estimation et plafonnée à 0,9 : le modèle ne revendique jamais une certitude qu'il n'a pas. Une estimation plus confiante traduit un signal d'intention plus clair et un prompt plus court, plus facile à dimensionner.
À quel point les données sont récentes
PromptHawk n’est pas en temps réel. Nous mesurons selon un calendrier et rapportons un instantané récent, pas ce qu’un moteur dirait à cette seconde précise.
Chaque score reflète la fenêtre de mesure achevée la plus récente pour votre forfait. Nous enregistrons quand chaque mesure a été collectée, de sorte qu’un chiffre puisse toujours être rattaché à la fenêtre qui l’a produit.
- Hebdomadaire est une base raisonnable pour la plupart des catégories ; quotidienne est pour les termes qui évoluent vite ou à fort enjeu.
- Il y a un décalage entre le moment où un moteur change et le moment où cela apparaît ici : la collecte, le scoring et l’agrégation prennent du temps.
Les moteurs que nous interrogeons
Nous interrogeons les moteurs de réponse que vos clients utilisent vraiment, et nous vous montrons toujours le détail par moteur : une victoire sur Perplexity et une défaite sur ChatGPT sont des faits différents. Votre score de visibilité principal est une moyenne transparente pondérée par les exécutions sur ces moteurs, avec sa propre plage de confiance ; il ne cache jamais une défaite sur un moteur derrière une victoire sur un autre.
- ChatGPT (OpenAI)
- Interrogé déconnecté, modèle par défaut, réponses capturées mot pour mot.
- Perplexity
- Interrogé déconnecté, modèle par défaut, avec les sources citées capturées.
- Google AI Overviews
- Capturé depuis le bloc AI Overview, distinct des résultats en liens bleus.
- Gemini (Google)
- Interrogé avec grounding, modèle par défaut, sources citées capturées.
- Claude (Anthropic)
- Interrogé avec recherche web, modèle par défaut, sources citées capturées.
Nous ajoutons des moteurs à mesure qu’ils gagnent en usage réel et retirons ceux que nous ne pouvons pas mesurer de façon fiable. Lorsque l’API propre d’un moteur n’est pas disponible, un substitut clairement identifié peut répondre à sa place, et nous indiquons lequel a été utilisé. La liste et les réglages actuels sont toujours affichés ici.
Ce que nous ne ferons pas
La confiance est le produit. Nous nous imposons donc des règles que la plupart des outils ne publient pas :
- Nous ne montrerons pas une tendance ni une variation « +X % » que nous ne pouvons pas étayer par des données. Si les plages de deux périodes ne se séparent pas nettement, nous indiquons « Aucun changement mesurable ».
- Nous ne cacherons pas la taille de l’échantillon. Chaque chiffre indique sur combien d’exécutions il repose.
- Nous ne cacherons pas une défaite sur un moteur, ni ne fondrons régions ou ensembles de prompts, pour rendre un graphique plus lisse. Le score principal est une moyenne transparente pondérée par les exécutions et chaque moteur est toujours montré séparément.
- Nous ne fabriquerons pas de précision. Un chiffre issu de trop peu d’exécutions porte la mention « Préliminaire », il n’est pas déguisé en fait.
Ce que cela ne peut pas vous dire
Mesurer les réponses IA est réellement difficile. Voici où les chiffres s’arrêtent :
- Non-déterminisme des moteurs
- Le même prompt donne des réponses différentes. Nous échantillonnons autour ; nous ne pouvons pas le supprimer.
- Sensibilité à la formulation
- Reformulez un prompt et la liste des marques peut changer. La formulation que vous suivez est une fenêtre sur un sujet, pas le sujet entier.
- Aucune garantie d’exhaustivité
- Nous mesurons les prompts et les moteurs que vous suivez, pas toutes les questions qu’un acheteur pourrait poser.
- Personnalisation et région
- Les réponses varient selon le lieu, le compte et l’historique. Nous standardisons les nôtres ; celles d’un utilisateur réel différeront.
- Mises à jour des modèles
- Les moteurs changent sous nos pieds. Un écart peut refléter la sortie d’un modèle, pas votre travail.
- Petits échantillons
- Les forfaits modestes et les prompts rarement déclenchés produisent des plages larges. C’est une limite réelle, montrée honnêtement.
Définitions simples
- Exécution
- Une fois où nous envoyons un prompt à un moteur et enregistrons la réponse.
- Taux de visibilité
- La proportion d’exécutions où votre marque apparaît dans la réponse.
- Part de voix
- La part de votre marque dans l’ensemble des mentions de marques sur les exécutions.
- Position moyenne
- Où votre marque se situe généralement dans la liste de la réponse, en moyenne sur les exécutions.
- Intervalle de confiance
- La plage dans laquelle se situe presque certainement votre valeur réelle, compte tenu du nombre d’exécutions dont nous disposons.
- Marge d’erreur
- La moitié de la largeur de la plage de confiance : le ± à côté d’un chiffre.
- Préliminaire
- Fondé sur trop peu d’exécutions pour être fiable avec précision. Indicatif uniquement.
- Fenêtre de mesure
- La période à partir des exécutions de laquelle un score est calculé.
Questions
Pourquoi mon score a-t-il changé alors que je n’ai rien fait ?
Les réponses IA dérivent d’elles-mêmes. Si le changement est dans la plage de confiance, considérez-le comme du bruit : c’est pourquoi nous montrons la plage.
Pourquoi ma plage est-elle si large ?
Pas encore assez d’exécutions, ou le moteur est incohérent pour ce prompt. Davantage d’exécutions (ou un forfait supérieur) la resserrent.
Est-ce en temps réel ?
Non. Nous rapportons un instantané récent selon un calendrier, toujours horodaté.
Sont-ce les réponses exactes que voient les utilisateurs ?
Non : les réponses varient selon la personne, le lieu et le moment. Nous standardisons nos requêtes pour que les tendances soient comparables, pas identiques à celles d’un utilisateur en particulier.
Pourquoi ne montrez-vous pas encore de tendance ?
Nous traçons la courbe dès qu’il existe deux fenêtres comparables avec assez de données. Nous ne validons un changement — un « +X % » — que lorsque les marges des deux fenêtres se séparent nettement ; sinon, nous affichons « aucun changement mesurable ».
Voyez-le sur votre propre marque.
Lancez une analyse et regardez les preuves apparaître à côté de chaque chiffre.