GEO Niveau · Avancé Lecture 4 min

CCBot

Ce que Common Crawl collecte, qui réutilise ses jeux de données, et ce qu’un blocage coûte vraiment.

Définition courte

CCBot est le robot d’exploration de Common Crawl, une organisation à but non lucratif qui archive le web ouvert. Les jeux de données produits sont publics et servent à l’entraînement de nombreux modèles d’IA. CCBot respecte le robots.txt. En SEO, le bloquer coupe l’accès au réservoir commun de données, sans effet sur la recherche ni sur les moteurs de réponse IA.

À retenir
01Common Crawl archive le web ouvert depuis 2008, avec des jeux de données publics disponibles depuis 2013. La plupart des grands modèles generatifs ont été entraînés sur ces données (Fondation Mozilla, 2024).
02Le corpus Common Crawl filtre pesait 60 % du mix d’entraînement de GPT-3 (étude OpenAI Language Models are Few-Shot Learners, 2020). Un blocage de CCBot agit donc sur plusieurs modèles à la fois.
03CCBot est le deuxième bot le plus vise par des blocages explicites dans les robots.txt, juste derrière GPTBot (Ahrefs, août 2025, 140 millions de sites analyses).

Comment fonctionne CCBot ?

CCBot explore le web par vagues regulieres et archive les pages collectées dans des jeux de données publics, heberges sur l’infrastructure AWS et accessibles gratuitement. Le robot s’identifie par la chaîne User-Agent CCBot/2.0 et repose sur le framework open source Apache Nutch. CCBot respecte les directives du robots.txt, tient compte des sitemaps qui y sont déclarés et honore même une balise meta dédiée, meta name CCBot content nofollow, pour interdire le suivi des liens d’une page. La particularité de CCBot tient a la destination des données : contrairement à GPTBot ou ClaudeBot qui alimentent un seul acteur, les archives Common Crawl sont un bien commun. Elles servent de socle a de nombreux corpus d’entraînement, a des travaux académiques et a des outils d’analyse du web, sans que Common Crawl controle ces réutilisations.

Pourquoi CCBot est important pour le SEO ?

CCBot a un effet levier unique : un seul blocage retire les contenus futurs d’un réservoir exploite par de nombreux modèles à la fois. C’était le principal recours anti-ChatGPT en 2023, avant que les acteurs de l’IA ne déclarent leurs propres robots. La portée du blocage a change depuis. OpenAI, Anthropic ou Meta collectent désormais en direct via GPTBot, ClaudeBot ou Meta-ExternalAgent : bloquer CCBot en 2026 ne bloque plus ChatGPT, il ne ferme qu’une source parmi d’autres. Trois limites complètent le tableau. Les archives existantes ne sont pas rétroactivement purgées, aucun mécanisme de retrait n’existe. Le blocage prive aussi la recherche académique, usage historique du corpus. Et la visibilité n’est pas en jeu : CCBot n’alimente aucun moteur de réponse, son blocage est neutre pour les citations IA.

CritèreCCBotGPTBot
Opérateur et destinationCommon Crawl, archive publique reutilisee par de nombreux acteursOpenAI, jeux d’entraînement propriétaires
Portée d’un blocagePlusieurs modèles touches, mais une source parmi d’autresUn seul acteur touche, en direct
Effet sur la visibilité IAAucun, CCBot n’alimente pas de moteur de réponseAucun sur ChatGPT Search, gere par OAI-SearchBot

Qu’est-ce que Common Crawl ?

Common Crawl est une organisation à but non lucratif fondée en 2007 qui construit une archive ouverte du web. Ses collectes regulieres produisent des jeux de données publics, disponibles gratuitement depuis 2013. Ce corpus est devenu la matière première de l’IA generative : la plupart des grands modèles de langage ont été entraînés, au moins en partie, sur des données issues de Common Crawl (Fondation Mozilla, 2024).

Faut-il bloquer CCBot sur son site ?

Bloquer CCBot se justifie pour refuser que les contenus futurs alimentent le réservoir commun de l’IA. Le geste est sans risque : CCBot ne nourrit ni moteur de recherche ni moteur de réponse, la visibilité ne bouge donc pas. Deux lignes suffisent dans le robots.txt : User-agent: CCBot puis Disallow: /. Restez lucide sur la portée. Les archives déjà collectées demeurent. Et les grands acteurs crawlent désormais en direct avec leurs propres robots.

Exemple concret de blocage de CCBot

CCBot se bloque dans le robots.txt quand un site refuse que ses contenus futurs alimentent les archives Common Crawl. Exemple : un media peut interdire CCBot sur tout le site pour limiter la réutilisation de ses articles dans des jeux de données publics, tout en autorisant OAI-SearchBot, PerplexityBot ou Bingbot pour rester visible dans les moteurs de réponse. Le blocage de CCBot agit donc sur l’entraînement indirect, pas sur la citation dans ChatGPT Search, Perplexity ou Copilot.

User-agent: CCBot Disallow: /User-agent: OAI-SearchBot Allow: /User-agent: PerplexityBot Allow: /User-agent: Bingbot Allow: /

Erreur fréquente observée en audit

Cas réel. En audit GEO, l’erreur fréquente consiste à penser que bloquer CCBot bloque automatiquement l’usage des contenus par ChatGPT ou les citations dans les moteurs IA. CCBot alimente Common Crawl, pas ChatGPT Search, Perplexity ou Copilot en direct. La correction consiste à séparer les objectifs : bloquer CCBot pour limiter l’entraînement indirect, puis vérifier separement les robots de recherche et les fetchers qui conditionnent la visibilité IA.

Questions fréquentes

Bloquer CCBot retire-t-il mes contenus des modèles déjà entraînés ?−

Non, un blocage n’agit que sur les collectes futures. Les archives Common Crawl publiées restent téléchargeables par tous. Les modèles entraînés sur ces jeux de données conservent ce qu’ils en ont appris.

Bloquer CCBot affecte-t-il la visibilité dans ChatGPT ?+

Non, ChatGPT Search s’appuie sur l’index Bing et sur OAI-SearchBot. CCBot alimente Common Crawl, un réservoir de données ouvert. Les deux circuits restent séparés.

CCBot respecte-t-il le fichier robots.txt ?+

Oui, CCBot lit et applique le robots.txt. Une directive Disallow le tient à l’écart des URL visées. La prise en compte suit son cycle de crawl, qui s’étale sur plusieurs semaines.

Damien Hernandez, consultant SEO senior
Auteur

Damien Hernandez

Consultant SEO senior, 17 ans d’expérience (Accor, Louvre Hotels, Infopro Digital). Spécialiste SEO technique, analyse de logs et optimisation pour les moteurs génératifs (GEO).

Sources

  1. 1Brown et al. (OpenAI), « Language Models are Few-Shot Learners » · 2020, mix d’entraînement de GPT-3 consulter la source
  2. 2Ahrefs, « The AI Bots That ~140 Million Websites Block the Most » · août 2025, 140 millions de sites consulter la source
Aller plus loin

Faire expliquer ce terme par une IA

Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.