Fichiers logs : définition, rôle et bonnes pratiques SEO

Mis à jour le 8 juillet 2026 · Relu et vérifié par Damien Hernandez

Fichiers logs : définition, rôle et bonnes pratiques SEO

Les fichiers logs (ou journaux serveur) sont les fichiers texte dans lesquels un serveur web enregistre chaque requête reçue, ligne par ligne. Chaque ligne consigne qui a demandé quoi, quand et avec quel code de réponse. En SEO, les fichiers logs sont la seule source exhaustive du passage réel de Googlebot sur un site.

À retenir

  • Un fichier log enregistre chaque requête HTTP reçue par le serveur, humains et robots confondus.
  • Le format Combined ajoute le référent et le User-Agent aux champs du Common Log Format (documentation Apache).
  • Au-delà de 10 000 URL, Google recommande d’analyser les logs pour comprendre le crawl (Google Search Central).

Comment fonctionnent les fichiers logs ?

Les fichiers logs sont générés automatiquement par le serveur web (Apache, Nginx, LiteSpeed, IIS). À chaque requête, le serveur écrit une ligne, appelée hit, dans le journal d’accès (access log). Une seule page vue peut produire plusieurs hits : un pour le HTML, un par image, un par fichier CSS ou JavaScript. Une ligne au format Combined contient l’adresse IP du client, l’horodatage, la ligne de requête (méthode, URL, version HTTP), le code de statut renvoyé, la taille de la réponse, le référent et le User-Agent. Le champ User-Agent permet d’isoler le passage de Googlebot des visites humaines. Les fichiers logs enregistrent aussi les incidents du serveur dans un fichier distinct, le journal d’erreurs (error log), séparé du journal d’accès.

Pourquoi les fichiers logs sont importants pour le SEO ?

Les fichiers logs sont importants pour le SEO parce qu’ils montrent le comportement réel des robots, et non une simulation. Un crawler comme Screaming Frog imite Googlebot en suivant les liens du site. Le fichier log, lui, enregistre ce que Googlebot a vraiment demandé, y compris des URL orphelines absentes du maillage interne. Le rapport d’exploration de la Search Console ne recense pas chaque URL requêtée : seuls les logs donnent le décompte complet des requêtes par URL, par code HTTP et par type de robot. Pour un site de plus de 10 000 URL, Google recommande explicitement d’analyser les logs afin de comprendre où part le budget de crawl.

CritèreJournal d’accès (access log)Journal d’erreurs (error log)
Contenu enregistréChaque requête HTTP reçueIncidents et diagnostics du serveur
Usage SEO principalSuivre le crawl de GooglebotRepérer les erreurs 5xx récurrentes
Champs clésIP, URL, code HTTP, User-AgentDate, gravité, message d’erreur

Faire auditer le crawl de votre site

Où sont stockés les fichiers logs d’un site web ?

Les fichiers logs d’un site web sont stockés sur le serveur d’hébergement, pas dans WordPress. Sur un hébergement mutualisé comme o2switch ou OVH, ils se récupèrent depuis le cPanel, section Metrics puis Raw Access Logs, ou en SSH dans le répertoire /var/log. Sur un serveur Apache ou Nginx, l’emplacement exact est fixé par la directive CustomLog. Pour une analyse SEO fiable, récupérez au minimum 30 jours d’historique.

Quelle est la différence entre les fichiers logs et Google Analytics ?

La différence entre les fichiers logs et Google Analytics tient à la méthode de collecte. Google Analytics repose sur un tag JavaScript exécuté par le navigateur : les robots, qui n’exécutent pas ce script, y restent invisibles. Les fichiers logs, écrits par le serveur à chaque requête, enregistrent au contraire l’ensemble du trafic, robots inclus. Pour observer le crawl de Googlebot, seuls les fichiers logs conviennent.

Exemple concret de fichier log

Un fichier log paraît illisible au premier abord, mais une seule ligne suffit à en comprendre la structure. Voici une ligne au format Combined correspondant au passage de Googlebot, suivie d’une commande qui isole les hits Googlebot et compte les codes HTTP renvoyés. Un pic de 404 ou de 5xx sur cette sortie signale un gaspillage de budget de crawl à corriger.

66.249.66.1 - - [08/Jul/2026:14:23:45 +0200] "GET /lexique-seo/ HTTP/1.1" 200 12483 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"

grep "Googlebot" access.log | awk '{print $9}' | sort | uniq -c | sort -rn

Erreur fréquente observée en audit

Cas réel. Sur un site voyage à fort volume, les fichiers logs ont confirmé que Googlebot passait réellement sur environ 14 000 pages inutiles générées par un mauvais pattern d’URL. Le crawl simulé montrait le problème, mais les logs prouvaient la consommation réelle du budget de crawl. La correction a consisté à retirer les liens internes vers ces variantes, consolider les pages canoniques et suivre la baisse des hits Googlebot sur les URLs sans valeur.

Sources

Termes liés

Damien Hernandez, consultant SEO senior

Damien Hernandez · Consultant SEO senior, 15 ans d’expérience (Accor, Louvre Hotels, Infopro Digital). Spécialiste SEO technique et GEO (optimisation pour les moteurs génératifs).

En savoir plus · LinkedInLinkedIn de Damien Hernandez