← Lexique

Latence

Aussi : latency

Délai entre l'envoi d'une requête au modèle et l'obtention de la réponse.

La latence est le temps écoulé entre l'appel au modèle et la réception de sa réponse. Elle croît avec la taille du modèle, la longueur du contexte et du texte généré, et le recours à un raisonnement étape par étape.

Elle pèse sur deux plans : le débit d'un pipeline de génération qui traite des lots, et l'expérience quand la génération se fait en direct pour un utilisateur. Une latence mal maîtrisée plafonne le volume produit à coût constant.

On la réduit en choisissant un modèle adapté, en bornant les tokens générés, en évitant le chain-of-thought quand il n'apporte rien, et en parallélisant les appels. On la mesure de bout en bout, car une récupération lente compte autant que l'inférence elle-même.

Modèle, contexte, longueur de sortie et raisonnement s'additionnent.
Ce qui alourdit la latenceDonnées anonymisées

Besoin d’appliquer ce concept sur un cas concret ?

Parler de votre prochaine mission