← Le journal

Un prompt n’est pas une mesure

Tester sa visibilité IA avec trois prompts un lundi matin, c’est juger un climat sur une après-midi. Ce qui sépare un audit d’une capture d’écran.

Panneau de score GEO 3D décomposé en Visibilité, Intégrité et Influence, avec sa formule de pondération
MéthodeDonnées anonymisées

La tentation est universelle : ouvrir ChatGPT, poser la question du client, faire une capture. C’est rapide, c’est visuel, ça rassure. Et ça ne mesure rien.

Le même prompt ne donne pas la même réponse

Un modèle génératif est stochastique. Reposez la même question dix minutes plus tard, sur la même plateforme, et vous obtiendrez une formulation différente, parfois des sources différentes, parfois un verdict différent. Un point unique ne dit rien de la tendance — il dit seulement à quoi ressemblait le bruit à cet instant.

Trois passages, et un intervalle

La parade tient en deux gestes. D’abord, répéter : chaque requête est exécutée en triple passage, sur chaque plateforme. Ensuite, encadrer : un intervalle de confiance de Wilson à 95 % transforme un pourcentage brut en fourchette honnête. On ne dit plus « 80 % de citation », on dit « entre 70 et 87 %, avec ce niveau de certitude ».

La stabilité comme signal stratégique

En agrégeant tous ces passages, un chiffre émerge : la stabilité inter-runs. Quand elle dépasse 90 %, les verdicts sont systémiques, pas aléatoires. Ce qui est stable est structurel — donc à défendre si c’est acquis, à conquérir méthodiquement si c’est un manque. Ce qui bouge d’un run à l’autre est fragile, et ne mérite pas encore une décision.

Mesurer, au fond, c’est répéter. Un audit qui ne répète pas n’est pas un audit : c’est une anecdote bien cadrée.