Robots.txt
Gérer le trafic d’exploration sans croire désindexer : syntaxe, emplacement, confusions courantes.
Le fichier robots.txt (protocole d’exclusion des robots) est un fichier texte place à la racine d’un site qui indique aux robots d’exploration les URL qu’ils peuvent ou non parcourir. Il gere le trafic de crawl, pas l’indexation. En SEO, le fichier robots.txt protege le budget de crawl mais ne desindexe pas une page.
Comment fonctionne le fichier robots.txt ?
Le fichier robots.txt se trouve a une seule adresse par site et par protocole : la racine du domaine, sous la forme https://exemple.fr/robots.txt. Chaque robot d’exploration sérieux lit ce fichier avant de parcourir le site. Le robots.txt s’organise en groupes de règles. Chaque groupe commence par une ligne User-agent (le robot vise, ou l’astérisque pour tous), puis une ou plusieurs directives Disallow (chemins interdits) et Allow (exceptions autorisées). Le fichier robots.txt accepte aussi la ligne Sitemap, qui pointe vers le plan de site XML. Le protocole reste déclaratif : Googlebot et les crawlers légitimes respectent le robots.txt, mais rien n’oblige un robot malveillant a s’y conformer. Google traite au maximum les 500 premiers kibioctets du fichier ; au-delà, les règles sont ignorées.
Pourquoi le fichier robots.txt est important pour le SEO ?
Le fichier robots.txt est important pour le SEO parce qu’il oriente le budget de crawl vers les pages utiles et ecarte les zones sans valeur pour la recherche : recherche interne, panier, comptes, paramètres d’URL, facettes. Sur un gros site, cette maitrise evite que les robots gaspillent leurs ressources sur des URL dupliquées au détriment des pages stratégiques. Une précision essentielle : selon Google Search Central, le robots.txt sert à gérer le trafic d’exploration, pas à masquer une page des résultats. Une URL bloquée au crawl peut toujours apparaître dans la SERP si elle est referencee par des liens externes, faute d’avoir pu lire un éventuel noindex. Le robots.txt n’est donc pas un outil de désindexation.
| Critère | Disallow (robots.txt) | noindex (meta robots / X-Robots-Tag) |
|---|---|---|
| Agit sur | Le crawl (exploration) | L’indexation (affichage en SERP) |
| Empeche l’indexation ? | Non, l’URL peut rester indexée si referencee | Oui, la page sort de l’index après crawl |
| Condition pour agir | Lu avant l’exploration | La page doit rester crawlable pour être lue |
| Erreur classique | Bloquer une page qu’on veut désindexer | Mettre noindex ET Disallow (le noindex n’est jamais lu) |
Le fichier robots.txt empeche-t-il l’indexation d’une page ?
Non, le fichier robots.txt n’empeche pas l’indexation. Une directive Disallow bloque l’exploration, mais une URL déjà connue ou referencee par d’autres sites peut rester dans l’index de Google, affichée sans description. Pour retirer une page des résultats, il faut la laisser crawlable et utiliser une balise meta noindex ou un en-tête X-Robots-Tag, ou la protéger par mot de passe.
Ou se trouve le fichier robots.txt d’un site ?
Le fichier robots.txt se trouve toujours à la racine du domaine, à l’adresse /robots.txt (par exemple https://exemple.fr/robots.txt). Il ne peut y en avoir qu’un par host et par protocole : un fichier distinct est nécessaire pour un sous-domaine (blog.exemple.fr) et pour chaque schema (http et https). Un robots.txt place dans un sous-répertoire n’est jamais pris en compte par les moteurs.
Exemple concret de fichier robots.txt
Un fichier robots.txt herite d’un environnement de préproduction bloque souvent tout le site après la mise en ligne, avec un simple Disallow sur la racine. Sur WordPress, une configuration saine ecarte l’administration et les URL à faible valeur, autorise l’endpoint ajax nécessaire au rendu, et declare le sitemap.
# A eviter : bloque l'exploration de tout le site
User-agent: *
Disallow: /# Correct : cible les zones inutiles, autorise l'ajax, declare le sitemap
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /panier/Sitemap: https://exemple.fr/sitemap_index.xmlErreur fréquente observée en audit
Cas réel. Sur un site voyage à fort volume, un mauvais pattern d’URL avait généré environ 14 000 pages inutiles. Les bloquer directement dans le robots.txt aurait été une erreur : Googlebot n’aurait plus pu les explorer, et les URLs déjà connues auraient pu rester indexées sans être correctement traitées. La correction a consisté à nettoyer le maillage interne, consolider les pages canoniques et utiliser le robots.txt uniquement pour limiter le crawl des zones sans valeur SEO.
Faire expliquer ce terme par une IA
Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.
Sources
- 1Google Search Central, Présentation du fichier robots.txt · mis à jour le 18 décembre 2025
- 2IETF, RFC 9309 Robots Exclusion Protocol · septembre 2022
- 3Google Search Central Blog, A note on unsupported rules in robots.txt · 2 juillet 2019
Trois idées reçues sur le robots.txt
Le fichier robots.txt gère le trafic d’exploration. Les confusions viennent de ce qu’on lui prête en matière d’indexation ou de sécurité.
Le robots.txt met une page hors de Google. Il empêche l’exploration, pas l’indexation. Une URL bloquée mais liée depuis l’extérieur apparaît dans les résultats, sans extrait.
La directive crawl-delay régule Googlebot. Googlebot ignore cette directive non standard. Google ajuste son rythme sur les temps de réponse et les erreurs du serveur.
Le robots.txt protège une zone privée. Le fichier est public et lisible par tous. Lister un répertoire sensible revient à en publier l’adresse.
Questions fréquentes
Un sous-domaine a-t-il besoin de son propre robots.txt ?−
Oui, le fichier vaut pour un seul nom d’hôte. Un blog en sous-domaine ne lit pas le robots.txt du domaine principal. Chaque hôte, et chaque protocole, porte le sien.
Que se passe-t-il si le robots.txt renvoie une erreur ?+
Une erreur 5xx prolongée conduit Google à suspendre l’exploration. Une réponse 404 est traitée comme une autorisation complète. La disponibilité du fichier compte donc autant que son contenu.
Faut-il déclarer le sitemap dans le robots.txt ?+
Oui, la ligne Sitemap indique son adresse à tous les moteurs. Elle complète la soumission dans la Search Console. Un seul fichier référence ainsi plusieurs sitemaps.
