robots.txt
Fichier racine qui régule l'accès des robots aux URL du site.
Placé à la racine du domaine, le robots.txt distribue des autorisations d'accès par user-agent : quels chemins un robot donné peut parcourir, lesquels lui sont interdits. C'est la première porte que rencontre un explorateur.
La confusion la plus fréquente, y compris côté client, est de croire qu'il pilote l'indexation. Il ne régule que l'exploration : une URL bloquée ici mais liée ailleurs peut rester dans l'index, sans que le moteur puisse en lire un éventuel noindex. Pour retirer une page, on passe par meta robots, pas par un Disallow.
C'est aussi le point de contrôle des robots d'IA générative : on y arbitre, agent par agent, la présence dans les corpus. Une règle trop large peut fermer la porte à des moteurs que l'on voudrait justement voir citer le site.

Besoin d’appliquer ce concept sur un cas concret ?
Parler de votre prochaine mission