Fichiers logs
La seule source qui dit ce que les robots ont vraiment fait sur un site : où les trouver, comment les lire.
Les fichiers logs (ou journaux serveur) sont les fichiers texte dans lesquels un serveur web enregistre chaque requête reçue, ligne par ligne. Chaque ligne consigne qui a demandé quoi, quand et avec quel code de réponse. En SEO, les fichiers logs sont la seule source exhaustive du passage réel de Googlebot sur un site.
Comment fonctionnent les fichiers logs ?
Les fichiers logs sont générés automatiquement par le serveur web (Apache, Nginx, LiteSpeed, IIS). À chaque requête, le serveur écrit une ligne, appelée hit, dans le journal d’accès (access log). Une seule page vue peut produire plusieurs hits : un pour le HTML, un par image, un par fichier CSS ou JavaScript. Une ligne au format Combined contient l’adresse IP du client, l’horodatage, la ligne de requête (méthode, URL, version HTTP), le code de statut renvoyé, la taille de la réponse, le référent et le User-Agent. Le champ User-Agent permet d’isoler le passage de Googlebot des visites humaines. Les fichiers logs enregistrent aussi les incidents du serveur dans un fichier distinct, le journal d’erreurs (error log), séparé du journal d’accès.
Pourquoi les fichiers logs sont importants pour le SEO ?
Les fichiers logs sont importants pour le SEO parce qu’ils montrent le comportement réel des robots, et non une simulation. Un crawler comme Screaming Frog imite Googlebot en suivant les liens du site. Le fichier log, lui, enregistre ce que Googlebot a vraiment demandé, y compris des URL orphelines absentes du maillage interne. Le rapport d’exploration de la Search Console ne recense pas chaque URL requêtée : seuls les logs donnent le décompte complet des requêtes par URL, par code HTTP et par type de robot. Pour un site de plus de 10 000 URL, Google recommande explicitement d’analyser les logs afin de comprendre où part le budget de crawl.
| Critère | Journal d’accès (access log) | Journal d’erreurs (error log) |
|---|---|---|
| Contenu enregistré | Chaque requête HTTP reçue | Incidents et diagnostics du serveur |
| Usage SEO principal | Suivre le crawl de Googlebot | Repérer les erreurs 5xx récurrentes |
| Champs clés | IP, URL, code HTTP, User-Agent | Date, gravité, message d’erreur |
Où sont stockés les fichiers logs d’un site web ?
Les fichiers logs d’un site web sont stockés sur le serveur d’hébergement, pas dans WordPress. Sur un hébergement mutualisé comme o2switch ou OVH, ils se récupèrent depuis le cPanel, section Metrics puis Raw Access Logs, ou en SSH dans le répertoire /var/log. Sur un serveur Apache ou Nginx, l’emplacement exact est fixé par la directive CustomLog. Pour une analyse SEO fiable, récupérez au minimum 30 jours d’historique.
Quelle est la différence entre les fichiers logs et Google Analytics ?
La différence entre les fichiers logs et Google Analytics tient à la méthode de collecte. Google Analytics repose sur un tag JavaScript exécuté par le navigateur : les robots, qui n’exécutent pas ce script, y restent invisibles. Les fichiers logs, écrits par le serveur à chaque requête, enregistrent au contraire l’ensemble du trafic, robots inclus. Pour observer le crawl de Googlebot, seuls les fichiers logs conviennent.
Exemple concret de fichier log
Un fichier log paraît illisible au premier abord, mais une seule ligne suffit à en comprendre la structure. Voici une ligne au format Combined correspondant au passage de Googlebot, suivie d’une commande qui isole les hits Googlebot et compte les codes HTTP renvoyés. Un pic de 404 ou de 5xx sur cette sortie signale un gaspillage de budget de crawl à corriger.
66.249.66.1 - - [08/Jul/2026:14:23:45 +0200] "GET /lexique-seo/ HTTP/1.1" 200 12483 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"grep "Googlebot" access.log | awk '{print $9}' | sort | uniq -c | sort -rnErreur fréquente observée en audit
Cas réel. Sur un site voyage à fort volume, les fichiers logs ont confirmé que Googlebot passait réellement sur environ 14 000 pages inutiles générées par un mauvais pattern d’URL. Le crawl simulé montrait le problème, mais les logs prouvaient la consommation réelle du budget de crawl. La correction a consisté à retirer les liens internes vers ces variantes, consolider les pages canoniques et suivre la baisse des hits Googlebot sur les URLs sans valeur.
Faire expliquer ce terme par une IA
Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.
Sources
- 1Apache HTTP Server Documentation, Log Files · version 2.4
- 2Google Search Central, Gestion du budget d’exploration pour les grands sites · 2025
Questions fréquentes
Quelle taille atteignent les fichiers logs d’un site ?−
Le volume suit le trafic et la période conservée. Les hébergeurs appliquent une rotation quotidienne et compressent les fichiers. Sans archivage, les logs les plus anciens disparaissent avant toute analyse.
Les fichiers logs contiennent-ils des données personnelles ?+
Oui, l’adresse IP est une donnée personnelle au sens du RGPD. La conservation demande une durée définie et une base légale. Une anonymisation partielle des adresses reste compatible avec l’analyse des robots.
Peut-on analyser des logs sans outil payant ?+
Oui, les commandes grep, awk et sort suffisent pour un premier tri. Elles comptent les hits par répertoire, par code HTTP ou par User-Agent. Les outils dédiés apportent la visualisation et le croisement avec un crawl.
