Tokenisation
Aussi : tokenization
Découpage d'un texte en tokens selon le vocabulaire du modèle.
La tokenisation convertit un texte brut en une suite de tokens tirés du vocabulaire du modèle. Étape invisible mais structurante, elle fixe combien de tokens « coûte » un texte et comment le modèle perçoit un mot rare, un nom propre ou une URL.
Elle agit directement sur le budget et la couverture. Un même sens ne pèse pas le même nombre de tokens selon la langue ou la graphie, et un terme technique éclaté en plusieurs fragments devient plus difficile à manier. En amont d'un pipeline de génération, ce découpage influence aussi la façon dont une entité est segmentée, donc reconnue.
Côté praticien, on observe la tokenisation en comptant les tokens d'un contenu type avant de l'injecter en récupération. Anticiper le gonflement lié aux langues, aux caractères accentués ou aux chaînes techniques évite de saturer la fenêtre de contexte et de faire dériver le coût sans s'en apercevoir.

Besoin d’appliquer ce concept sur un cas concret ?
Parler de votre prochaine mission