Exploration (crawl)
Aussi : Crawl · Crawling
Parcours des URL par un robot pour en récupérer le contenu.
L'exploration désigne le parcours des URL par un robot qui suit les liens, lit le fichier robots.txt et récupère le HTML de chaque page rencontrée. C'est la porte d'entrée du pipeline : rien ne peut être indexé qui n'ait d'abord été exploré, et une page jamais visitée reste hors de portée du moteur.
Elle dépend de trois leviers concrets : les directives d'accès, la qualité du maillage interne et le budget d'exploration alloué au domaine. Une page bien reliée depuis des pages fréquentées est visitée plus tôt et plus souvent qu'une page profonde ou orpheline, dont la découverte peut prendre des jours.
Pour l'agence, l'enjeu est de vérifier ce qui est réellement exploré, non ce qu'on suppose l'être : les journaux serveur font foi, là où les outils ne produisent que des estimations. Une URL explorée n'est pas nécessairement indexée, mais l'inverse est impossible — d'où la priorité donnée à la découvrabilité avant l'indexation.

Besoin d’appliquer ce concept sur un cas concret ?
Parler de votre prochaine mission