SEO & Search

Robots.txt

Fichier indiquant aux robots des moteurs de recherche quelles pages crawler ou ignorer.

Le fichier robots.txt est un fichier texte placé à la racine de votre site qui donne des instructions aux robots d'exploration des moteurs de recherche : quelles pages ou sections du site ils peuvent ou ne peuvent pas explorer.

Comment écrire les directives

Le fichier vit à la racine du domaine et s’organise par groupes : un User-agent ciblé, puis des règles Allow et Disallow, sensibles à la casse. Ajoutez la ligne Sitemap avec l’URL complète du plan de site. Testez chaque règle avant publication, un Disallow général oublié après une recette bloque l’exploration de tout le site.

Blocage crawl vs désindexation

Interdire le crawl ne retire pas une page de l’index : Google peut continuer à afficher l’URL sans description s’il trouve des liens externes vers elle. Pour retirer réellement une page, laissez-la explorable et posez une balise noindex, ou protégez-la par mot de passe. Bloquer une URL déjà en noindex empêche justement Google de lire l’instruction.

Cas limites à connaître

Le fichier ne protège rien : tout le monde peut le lire, n’y listez donc jamais vos répertoires sensibles. Ne bloquez ni les feuilles de style ni le JavaScript, les moteurs en ont besoin pour rendre la page correctement. Enfin, les robots d’IA générative se pilotent par des user-agents dédiés, un blocage générique ne suffit plus.

Exemple concret

Un éditeur SaaS bloque une section de recherche interne avec une règle trop large qui couvre aussi son dossier ressources. En trois semaines, 180 articles sortent de l’index et le trafic organique chute de 35 %. Après correction de la règle et resoumission du sitemap, le niveau initial revient en cinq semaines.

Termes associés

Robots.txt en pratique : SEO & Search

Pour aller au-delà de la définition, découvrez notre pilotage stratégique multi-canal.

Voir Accompagnement stratégique