Mis à jour le 8 juillet 2026 · Relu et vérifié par Damien Hernandez
Robots.txt : definition, role et bonnes pratiques SEO
Le fichier robots.txt (protocole d’exclusion des robots) est un fichier texte place a la racine d’un site qui indique aux robots d’exploration les URL qu’ils peuvent ou non parcourir. Il gere le trafic de crawl, pas l’indexation. En SEO, le fichier robots.txt protege le budget de crawl mais ne desindexe pas une page.
A retenir
- Le robots.txt est un standard officiel de l’IETF depuis septembre 2022 (RFC 9309).
- Google ne prend plus en charge la directive noindex dans le robots.txt depuis le 1er septembre 2019.
- Une URL bloquee dans le robots.txt peut rester indexee si d’autres sites la referencent (Google Search Central).
Comment fonctionne le fichier robots.txt ?
Le fichier robots.txt se trouve a une seule adresse par site et par protocole : la racine du domaine, sous la forme https://exemple.fr/robots.txt. Chaque robot d’exploration serieux lit ce fichier avant de parcourir le site. Le robots.txt s’organise en groupes de regles. Chaque groupe commence par une ligne User-agent (le robot vise, ou l’asterisque pour tous), puis une ou plusieurs directives Disallow (chemins interdits) et Allow (exceptions autorisees). Le fichier robots.txt accepte aussi la ligne Sitemap, qui pointe vers le plan de site XML. Le protocole reste declaratif : Googlebot et les crawlers legitimes respectent le robots.txt, mais rien n’oblige un robot malveillant a s’y conformer. Google traite au maximum les 500 premiers kibioctets du fichier ; au-dela, les regles sont ignorees.
Pourquoi le fichier robots.txt est important pour le SEO ?
Le fichier robots.txt est important pour le SEO parce qu’il oriente le budget de crawl vers les pages utiles et ecarte les zones sans valeur pour la recherche : recherche interne, panier, comptes, parametres d’URL, facettes. Sur un gros site, cette maitrise evite que les robots gaspillent leurs ressources sur des URL dupliquees au detriment des pages strategiques. Une precision essentielle : selon Google Search Central, le robots.txt sert a gerer le trafic d’exploration, pas a masquer une page des resultats. Une URL bloquee au crawl peut toujours apparaitre dans la SERP si elle est referencee par des liens externes, faute d’avoir pu lire un eventuel noindex. Le robots.txt n’est donc pas un outil de desindexation.
| Critere | Disallow (robots.txt) | noindex (meta robots / X-Robots-Tag) |
|---|---|---|
| Agit sur | Le crawl (exploration) | L’indexation (affichage en SERP) |
| Empeche l’indexation ? | Non, l’URL peut rester indexee si referencee | Oui, la page sort de l’index apres crawl |
| Condition pour agir | Lu avant l’exploration | La page doit rester crawlable pour etre lue |
| Erreur classique | Bloquer une page qu’on veut desindexer | Mettre noindex ET Disallow (le noindex n’est jamais lu) |
Votre robots.txt bloque-t-il des pages strategiques ? Demander un audit technique
Le fichier robots.txt empeche-t-il l’indexation d’une page ?
Non, le fichier robots.txt n’empeche pas l’indexation. Une directive Disallow bloque l’exploration, mais une URL deja connue ou referencee par d’autres sites peut rester dans l’index de Google, affichee sans description. Pour retirer une page des resultats, il faut la laisser crawlable et utiliser une balise meta noindex ou un en-tete X-Robots-Tag, ou la proteger par mot de passe.
Ou se trouve le fichier robots.txt d’un site ?
Le fichier robots.txt se trouve toujours a la racine du domaine, a l’adresse /robots.txt (par exemple https://exemple.fr/robots.txt). Il ne peut y en avoir qu’un par host et par protocole : un fichier distinct est necessaire pour un sous-domaine (blog.exemple.fr) et pour chaque schema (http et https). Un robots.txt place dans un sous-repertoire n’est jamais pris en compte par les moteurs.
Exemple concret de fichier robots.txt
Un fichier robots.txt herite d’un environnement de preproduction bloque souvent tout le site apres la mise en ligne, avec un simple Disallow sur la racine. Sur WordPress, une configuration saine ecarte l’administration et les URL a faible valeur, autorise l’endpoint ajax necessaire au rendu, et declare le sitemap.
# A eviter : bloque l'exploration de tout le site
User-agent: *
Disallow: /
# Correct : cible les zones inutiles, autorise l'ajax, declare le sitemap
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /panier/
Sitemap: https://exemple.fr/sitemap_index.xml
Erreur frequente observee en audit
Cas réel. Sur un site voyage à fort volume, un mauvais pattern d’URL avait généré environ 14 000 pages inutiles. Les bloquer directement dans le robots.txt aurait été une erreur : Googlebot n’aurait plus pu les explorer, et les URLs déjà connues auraient pu rester indexées sans être correctement traitées. La correction a consisté à nettoyer le maillage interne, consolider les pages canoniques et utiliser le robots.txt uniquement pour limiter le crawl des zones sans valeur SEO.
Sources
- Google Search Central, Presentation du fichier robots.txt · mis a jour le 18 decembre 2025
- IETF, RFC 9309 Robots Exclusion Protocol · septembre 2022
- Google Search Central Blog, A note on unsupported rules in robots.txt · 2 juillet 2019
Termes lies

Damien Hernandez · Consultant SEO senior, 15 ans d’experience (Accor, Louvre Hotels, Infopro Digital). Specialiste SEO technique et GEO (optimisation pour les moteurs generatifs).