Robots.txt
Gérer le trafic d’exploration sans croire désindexer : syntaxe, emplacement, confusions courantes.
Le fichier robots.txt (protocole d’exclusion des robots) est un fichier texte place a la racine d’un site qui indique aux robots d’exploration les URL qu’ils peuvent ou non parcourir. Il gere le trafic de crawl, pas l’indexation. En SEO, le fichier robots.txt protege le budget de crawl mais ne desindexe pas une page.
Comment fonctionne le fichier robots.txt ?
Le fichier robots.txt se trouve a une seule adresse par site et par protocole : la racine du domaine, sous la forme https://exemple.fr/robots.txt. Chaque robot d’exploration serieux lit ce fichier avant de parcourir le site. Le robots.txt s’organise en groupes de regles. Chaque groupe commence par une ligne User-agent (le robot vise, ou l’asterisque pour tous), puis une ou plusieurs directives Disallow (chemins interdits) et Allow (exceptions autorisees). Le fichier robots.txt accepte aussi la ligne Sitemap, qui pointe vers le plan de site XML. Le protocole reste declaratif : Googlebot et les crawlers legitimes respectent le robots.txt, mais rien n’oblige un robot malveillant a s’y conformer. Google traite au maximum les 500 premiers kibioctets du fichier ; au-dela, les regles sont ignorees.
Pourquoi le fichier robots.txt est important pour le SEO ?
Le fichier robots.txt est important pour le SEO parce qu’il oriente le budget de crawl vers les pages utiles et ecarte les zones sans valeur pour la recherche : recherche interne, panier, comptes, parametres d’URL, facettes. Sur un gros site, cette maitrise evite que les robots gaspillent leurs ressources sur des URL dupliquees au detriment des pages strategiques. Une precision essentielle : selon Google Search Central, le robots.txt sert a gerer le trafic d’exploration, pas a masquer une page des resultats. Une URL bloquee au crawl peut toujours apparaitre dans la SERP si elle est referencee par des liens externes, faute d’avoir pu lire un eventuel noindex. Le robots.txt n’est donc pas un outil de desindexation.
| Critere | Disallow (robots.txt) | noindex (meta robots / X-Robots-Tag) |
|---|---|---|
| Agit sur | Le crawl (exploration) | L’indexation (affichage en SERP) |
| Empeche l’indexation ? | Non, l’URL peut rester indexee si referencee | Oui, la page sort de l’index apres crawl |
| Condition pour agir | Lu avant l’exploration | La page doit rester crawlable pour etre lue |
| Erreur classique | Bloquer une page qu’on veut desindexer | Mettre noindex ET Disallow (le noindex n’est jamais lu) |
Le fichier robots.txt empeche-t-il l’indexation d’une page ?
Non, le fichier robots.txt n’empeche pas l’indexation. Une directive Disallow bloque l’exploration, mais une URL deja connue ou referencee par d’autres sites peut rester dans l’index de Google, affichee sans description. Pour retirer une page des resultats, il faut la laisser crawlable et utiliser une balise meta noindex ou un en-tete X-Robots-Tag, ou la proteger par mot de passe.
Ou se trouve le fichier robots.txt d’un site ?
Le fichier robots.txt se trouve toujours a la racine du domaine, a l’adresse /robots.txt (par exemple https://exemple.fr/robots.txt). Il ne peut y en avoir qu’un par host et par protocole : un fichier distinct est necessaire pour un sous-domaine (blog.exemple.fr) et pour chaque schema (http et https). Un robots.txt place dans un sous-repertoire n’est jamais pris en compte par les moteurs.
Exemple concret de fichier robots.txt
Un fichier robots.txt herite d’un environnement de preproduction bloque souvent tout le site apres la mise en ligne, avec un simple Disallow sur la racine. Sur WordPress, une configuration saine ecarte l’administration et les URL a faible valeur, autorise l’endpoint ajax necessaire au rendu, et declare le sitemap.
# A eviter : bloque l'exploration de tout le site
User-agent: *
Disallow: /# Correct : cible les zones inutiles, autorise l'ajax, declare le sitemap
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /panier/Sitemap: https://exemple.fr/sitemap_index.xmlErreur frequente observee en audit
Cas réel. Sur un site voyage à fort volume, un mauvais pattern d’URL avait généré environ 14 000 pages inutiles. Les bloquer directement dans le robots.txt aurait été une erreur : Googlebot n’aurait plus pu les explorer, et les URLs déjà connues auraient pu rester indexées sans être correctement traitées. La correction a consisté à nettoyer le maillage interne, consolider les pages canoniques et utiliser le robots.txt uniquement pour limiter le crawl des zones sans valeur SEO.
Faire expliquer ce terme par une IA
Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.
Sources
- 1Google Search Central, Presentation du fichier robots.txt · mis a jour le 18 decembre 2025
- 2IETF, RFC 9309 Robots Exclusion Protocol · septembre 2022
- 3Google Search Central Blog, A note on unsupported rules in robots.txt · 2 juillet 2019
Trois idées reçues sur le robots.txt
Le fichier robots.txt gère le trafic d’exploration. Les confusions viennent de ce qu’on lui prête en matière d’indexation ou de sécurité.
Le robots.txt met une page hors de Google. Il empêche l’exploration, pas l’indexation. Une URL bloquée mais liée depuis l’extérieur apparaît dans les résultats, sans extrait.
La directive crawl-delay régule Googlebot. Googlebot ignore cette directive non standard. Google ajuste son rythme sur les temps de réponse et les erreurs du serveur.
Le robots.txt protège une zone privée. Le fichier est public et lisible par tous. Lister un répertoire sensible revient à en publier l’adresse.
Questions fréquentes
Un sous-domaine a-t-il besoin de son propre robots.txt ?−
Oui, le fichier vaut pour un seul nom d’hôte. Un blog en sous-domaine ne lit pas le robots.txt du domaine principal. Chaque hôte, et chaque protocole, porte le sien.
Que se passe-t-il si le robots.txt renvoie une erreur ?+
Une erreur 5xx prolongée conduit Google à suspendre l’exploration. Une réponse 404 est traitée comme une autorisation complète. La disponibilité du fichier compte donc autant que son contenu.
Faut-il déclarer le sitemap dans le robots.txt ?+
Oui, la ligne Sitemap indique son adresse à tous les moteurs. Elle complète la soumission dans la Search Console. Un seul fichier référence ainsi plusieurs sitemaps.
