Un prompt n’est pas une mesure
Tester sa visibilité IA avec trois prompts un lundi matin, c’est juger un climat sur une après-midi. Ce qui sépare un audit d’une capture d’écran.

La tentation est universelle : ouvrir ChatGPT, poser la question du client, faire une capture. C’est rapide, c’est visuel, ça rassure. Et ça ne mesure rien.
Le même prompt ne donne pas la même réponse
Un modèle génératif est stochastique. Reposez la même question dix minutes plus tard, sur la même plateforme, et vous obtiendrez une formulation différente, parfois des sources différentes, parfois un verdict différent. Un point unique ne dit rien de la tendance — il dit seulement à quoi ressemblait le bruit à cet instant.
Trois passages, et un intervalle
La parade tient en deux gestes. D’abord, répéter : chaque requête est exécutée en triple passage, sur chaque plateforme. Ensuite, encadrer : un intervalle de confiance de Wilson à 95 % transforme un pourcentage brut en fourchette honnête. On ne dit plus « 80 % de citation », on dit « entre 70 et 87 %, avec ce niveau de certitude ».
La stabilité comme signal stratégique
En agrégeant tous ces passages, un chiffre émerge : la stabilité inter-runs. Quand elle dépasse 90 %, les verdicts sont systémiques, pas aléatoires. Ce qui est stable est structurel — donc à défendre si c’est acquis, à conquérir méthodiquement si c’est un manque. Ce qui bouge d’un run à l’autre est fragile, et ne mérite pas encore une décision.
Mesurer, au fond, c’est répéter. Un audit qui ne répète pas n’est pas un audit : c’est une anecdote bien cadrée.