Crawl et indexation Niveau · Débutant Lecture 4 min

Robots.txt

Gérer le trafic d’exploration sans croire désindexer : syntaxe, emplacement, confusions courantes.

Définition courte

Le fichier robots.txt (protocole d’exclusion des robots) est un fichier texte place a la racine d’un site qui indique aux robots d’exploration les URL qu’ils peuvent ou non parcourir. Il gere le trafic de crawl, pas l’indexation. En SEO, le fichier robots.txt protege le budget de crawl mais ne desindexe pas une page.

À retenir
01Le robots.txt est un standard officiel de l’IETF depuis septembre 2022 (RFC 9309).
02Google ne prend plus en charge la directive noindex dans le robots.txt depuis le 1er septembre 2019.
03Une URL bloquee dans le robots.txt peut rester indexee si d’autres sites la referencent (Google Search Central).

Comment fonctionne le fichier robots.txt ?

Le fichier robots.txt se trouve a une seule adresse par site et par protocole : la racine du domaine, sous la forme https://exemple.fr/robots.txt. Chaque robot d’exploration serieux lit ce fichier avant de parcourir le site. Le robots.txt s’organise en groupes de regles. Chaque groupe commence par une ligne User-agent (le robot vise, ou l’asterisque pour tous), puis une ou plusieurs directives Disallow (chemins interdits) et Allow (exceptions autorisees). Le fichier robots.txt accepte aussi la ligne Sitemap, qui pointe vers le plan de site XML. Le protocole reste declaratif : Googlebot et les crawlers legitimes respectent le robots.txt, mais rien n’oblige un robot malveillant a s’y conformer. Google traite au maximum les 500 premiers kibioctets du fichier ; au-dela, les regles sont ignorees.

Pourquoi le fichier robots.txt est important pour le SEO ?

Le fichier robots.txt est important pour le SEO parce qu’il oriente le budget de crawl vers les pages utiles et ecarte les zones sans valeur pour la recherche : recherche interne, panier, comptes, parametres d’URL, facettes. Sur un gros site, cette maitrise evite que les robots gaspillent leurs ressources sur des URL dupliquees au detriment des pages strategiques. Une precision essentielle : selon Google Search Central, le robots.txt sert a gerer le trafic d’exploration, pas a masquer une page des resultats. Une URL bloquee au crawl peut toujours apparaitre dans la SERP si elle est referencee par des liens externes, faute d’avoir pu lire un eventuel noindex. Le robots.txt n’est donc pas un outil de desindexation.

CritereDisallow (robots.txt)noindex (meta robots / X-Robots-Tag)
Agit surLe crawl (exploration)L’indexation (affichage en SERP)
Empeche l’indexation ?Non, l’URL peut rester indexee si referenceeOui, la page sort de l’index apres crawl
Condition pour agirLu avant l’explorationLa page doit rester crawlable pour etre lue
Erreur classiqueBloquer une page qu’on veut desindexerMettre noindex ET Disallow (le noindex n’est jamais lu)

Le fichier robots.txt empeche-t-il l’indexation d’une page ?

Non, le fichier robots.txt n’empeche pas l’indexation. Une directive Disallow bloque l’exploration, mais une URL deja connue ou referencee par d’autres sites peut rester dans l’index de Google, affichee sans description. Pour retirer une page des resultats, il faut la laisser crawlable et utiliser une balise meta noindex ou un en-tete X-Robots-Tag, ou la proteger par mot de passe.

Ou se trouve le fichier robots.txt d’un site ?

Le fichier robots.txt se trouve toujours a la racine du domaine, a l’adresse /robots.txt (par exemple https://exemple.fr/robots.txt). Il ne peut y en avoir qu’un par host et par protocole : un fichier distinct est necessaire pour un sous-domaine (blog.exemple.fr) et pour chaque schema (http et https). Un robots.txt place dans un sous-repertoire n’est jamais pris en compte par les moteurs.

Exemple concret de fichier robots.txt

Un fichier robots.txt herite d’un environnement de preproduction bloque souvent tout le site apres la mise en ligne, avec un simple Disallow sur la racine. Sur WordPress, une configuration saine ecarte l’administration et les URL a faible valeur, autorise l’endpoint ajax necessaire au rendu, et declare le sitemap.

# A eviter : bloque l'exploration de tout le site User-agent: * Disallow: /# Correct : cible les zones inutiles, autorise l'ajax, declare le sitemap User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Disallow: /?s= Disallow: /panier/Sitemap: https://exemple.fr/sitemap_index.xml

Erreur frequente observee en audit

Cas réel. Sur un site voyage à fort volume, un mauvais pattern d’URL avait généré environ 14 000 pages inutiles. Les bloquer directement dans le robots.txt aurait été une erreur : Googlebot n’aurait plus pu les explorer, et les URLs déjà connues auraient pu rester indexées sans être correctement traitées. La correction a consisté à nettoyer le maillage interne, consolider les pages canoniques et utiliser le robots.txt uniquement pour limiter le crawl des zones sans valeur SEO.

Aller plus loin

Faire expliquer ce terme par une IA

Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.

Sources

  1. 1Google Search Central, Presentation du fichier robots.txt · mis a jour le 18 decembre 2025
  2. 2IETF, RFC 9309 Robots Exclusion Protocol · septembre 2022
  3. 3Google Search Central Blog, A note on unsupported rules in robots.txt · 2 juillet 2019

Trois idées reçues sur le robots.txt

Le fichier robots.txt gère le trafic d’exploration. Les confusions viennent de ce qu’on lui prête en matière d’indexation ou de sécurité.

Mythe

Le robots.txt met une page hors de Google. Il empêche l’exploration, pas l’indexation. Une URL bloquée mais liée depuis l’extérieur apparaît dans les résultats, sans extrait.

Mythe

La directive crawl-delay régule Googlebot. Googlebot ignore cette directive non standard. Google ajuste son rythme sur les temps de réponse et les erreurs du serveur.

Mythe

Le robots.txt protège une zone privée. Le fichier est public et lisible par tous. Lister un répertoire sensible revient à en publier l’adresse.

Questions fréquentes

Un sous-domaine a-t-il besoin de son propre robots.txt ?

Oui, le fichier vaut pour un seul nom d’hôte. Un blog en sous-domaine ne lit pas le robots.txt du domaine principal. Chaque hôte, et chaque protocole, porte le sien.

Que se passe-t-il si le robots.txt renvoie une erreur ?+

Une erreur 5xx prolongée conduit Google à suspendre l’exploration. Une réponse 404 est traitée comme une autorisation complète. La disponibilité du fichier compte donc autant que son contenu.

Faut-il déclarer le sitemap dans le robots.txt ?+

Oui, la ligne Sitemap indique son adresse à tous les moteurs. Elle complète la soumission dans la Search Console. Un seul fichier référence ainsi plusieurs sitemaps.

Damien Hernandez, consultant SEO senior
Auteur

Damien Hernandez

Consultant SEO senior, 17 ans d’expérience (Accor, Louvre Hotels, Infopro Digital). Spécialiste SEO technique, analyse de logs et optimisation pour les moteurs génératifs (GEO).