← Lexique

Common Crawl

Aussi : CommonCrawl

Corpus web ouvert et gratuit, largement utilisé pour entraîner les modèles.

Common Crawl est une association à but non lucratif qui explore le web et publie gratuitement d'énormes archives de pages, au format WARC. Ces jeux de données, ouverts et régulièrement mis à jour, sont devenus une infrastructure de fait pour la recherche et l'industrie de l'IA.

Leur importance vient de leur réutilisation : ces archives constituent une source majeure d'entraînement pour de nombreux modèles de langage. Autrement dit, ce que Common Crawl capture peut se retrouver, indirectement, dans la connaissance interne de modèles que l'on ne contrôle pas.

Le point de contrôle est le crawler CCBot, qui se régule dans le robots.txt. L'autoriser ou le bloquer influe indirectement sur la présence de vos contenus dans les corpus d'entraînement. C'est l'un des plus anciens leviers d'action sur l'usage IA des données, antérieur aux robots dédiés des grands fournisseurs — et donc parfois oublié dans les politiques récentes, alors qu'il reste actif.

Common Crawl publie des archives ouvertes réutilisées comme corpus d'entraînement par de nombreux modèles.
Des archives aux modèlesDonnées anonymisées

Besoin d’appliquer ce concept sur un cas concret ?

Parler de votre prochaine mission