← Lexique

CCBot

Crawler de Common Crawl, source indirecte de données d'entraînement des modèles.

CCBot est le robot d'exploration de Common Crawl, qui alimente ses vastes archives web publiques. Il s'agit de l'un des crawlers les plus anciens du paysage, bien antérieur aux robots dédiés lancés récemment par les grands fournisseurs d'IA.

Son enjeu est indirect mais réel. Comme ces archives servent à entraîner de nombreux modèles de langage, autoriser ou bloquer CCBot dans le robots.txt influe sur la présence de vos contenus dans les corpus d'entraînement — non pas d'un modèle unique, mais de tout un ensemble qui puise dans la même source ouverte.

Pour une agence, c'est un point de contrôle à ne pas oublier dans une politique complète de gestion des robots. Beaucoup de configurations récentes listent GPTBot, ClaudeBot ou consorts mais laissent CCBot passer par inadvertance, réintroduisant par la bande les contenus qu'on croyait exclure. La décision — autoriser pour la couverture, bloquer pour le contrôle — mérite d'être posée explicitement plutôt que subie.

Régler CCBot dans le robots.txt agit indirectement sur la présence dans les corpus d'entraînement ouverts.
Autoriser ou bloquer CCBotDonnées anonymisées

Besoin d’appliquer ce concept sur un cas concret ?

Parler de votre prochaine mission