Stabilité inter-runs
Aussi : reproductibilité inter-exécutions
Degré de constance d'une mesure répétée sur des exécutions identiques.
La stabilité inter-runs mesure à quel point un même relevé, répété dans des conditions identiques, donne le même résultat. La question est centrale sur les surfaces génératives : par construction, un moteur peut produire des réponses différentes pour un prompt de test rigoureusement identique, d'un appel à l'autre.
Cette variabilité change la façon d'interpréter une mesure. Un indicateur stable peut être lu tel quel ; un indicateur instable doit être répété et traité statistiquement avant d'être qualifié de signal plutôt que de bruit. Confondre les deux, c'est réagir à des fluctuations sans portée et faire du reporting sur du hasard.
Pour une agence, évaluer la stabilité est un préalable méthodologique : avant de suivre une citation dans le temps, on vérifie qu'elle est reproductible. En pratique, on l'objective par un triple-run — trois exécutions au minimum — puis on ne retient que les mouvements dépassant l'amplitude normale. Un signal qui ne survit pas à la répétition n'est pas un résultat.

Besoin d’appliquer ce concept sur un cas concret ?
Parler de votre prochaine mission