TF-IDF
Aussi : Term Frequency-Inverse Document Frequency
Pondération d'un terme selon sa fréquence locale et sa rareté globale.
TF-IDF (Term Frequency-Inverse Document Frequency) pondère un terme en combinant deux quantités : sa fréquence dans un document et sa rareté dans l'ensemble du corpus. Un mot fréquent ici mais rare ailleurs obtient un poids fort, jugé caractéristique de la page.
C'est une mesure statistique classique, antérieure aux embeddings et toujours utile pour l'analyse lexicale. Elle éclaire ce qui distingue un texte de la masse, sans prétendre en capturer le sens comme le font les vecteurs denses.
Pour une agence, elle rend des services concrets : repérer le vocabulaire distinctif d'une page, comparer un contenu à ceux qui se positionnent, détecter des termes surexploités. On la combine à des signaux plus sémantiques comme la salience d'entité, en gardant à l'esprit sa limite : elle raisonne sur les mots, non sur les concepts.

Besoin d’appliquer ce concept sur un cas concret ?
Parler de votre prochaine mission