← Lexique

Inférence

Aussi : inference

Phase d'utilisation du modèle où il génère une réponse à partir d'une entrée.

L'inférence est l'exécution d'un modèle déjà entraîné pour produire une sortie à partir d'une entrée. C'est la phase d'usage, par opposition à l'entraînement qui, lui, façonne le modèle.

C'est là que se jouent le coût et la latence au quotidien. Chaque appel d'un pipeline de génération est une inférence facturée au nombre de tokens traités ; multipliée par des milliers de pages, l'addition devient un poste de dépense à part entière.

On l'optimise par le choix du modèle — le plus léger qui tient la qualité —, la mise en cache des appels répétés et la limitation de la longueur des prompts et des sorties. Mesurer le coût par contenu produit permet d'arbitrer sereinement entre qualité et budget.

L'inférence est la phase d'usage, facturée au token, appel après appel.
Entraînement vs inférenceDonnées anonymisées

Besoin d’appliquer ce concept sur un cas concret ?

Parler de votre prochaine mission