GEO Niveau · Intermédiaire Lecture 4 min

GPTBot

Ce que le robot d’OpenAI collecte pour l’entraînement, et ce que l’autoriser ou le bloquer implique.

Définition courte

GPTBot est le robot d’exploration d’OpenAI dedie a l’entrainement des modeles. Il collecte le contenu web public pour ameliorer les futurs modeles GPT qui alimentent ChatGPT. GPTBot respecte le robots.txt et s’identifie par un User-Agent declare. En SEO, l’autoriser ou le bloquer n’affecte que l’entrainement, pas la visibilite dans ChatGPT Search.

À retenir
01GPTBot a ete annonce par OpenAI en aout 2023. Sa mission declaree : collecter le contenu web public pour entrainer les futurs modeles GPT (documentation OpenAI).
02GPTBot etait le crawler IA le plus actif du web en 2025 (Cloudflare). Ses requetes ont bondi de 305 % entre mai 2024 et mai 2025. Sur un an glissant, sa part du trafic des crawlers IA et de recherche a plus que double, de 4,7 % a 11,7 % (Cloudflare, aout 2025).
03Bloquer GPTBot n’exclut pas un site de ChatGPT Search : la recherche repose sur OAI-SearchBot et sur l’index Bing (documentation OpenAI).

Comment fonctionne GPTBot ?

GPTBot fonctionne comme un crawler classique a grande echelle. Il explore les pages web publiques, en extrait le texte et alimente les jeux de donnees d’entrainement des modeles d’OpenAI. GPTBot s’identifie dans les logs serveur par la chaine User-Agent GPTBot/1.0, avec un lien vers sa documentation. OpenAI publie les plages d’adresses IP du robot, ce qui permet de verifier l’authenticite des visites. GPTBot respecte les directives du fichier robots.txt et declare exclure les contenus payants ainsi que les donnees personnelles identifiables. GPTBot ne travaille pas seul : OpenAI opere aussi OAI-SearchBot, qui construit l’index de ChatGPT Search, et ChatGPT-User, l’agent des consultations a la demande. Quand GPTBot et OAI-SearchBot sont tous deux autorises, OpenAI mutualise le crawl pour eviter les visites redondantes.

Pourquoi GPTBot est important pour le SEO ?

GPTBot cristallise la decision strategique du GEO : accepter ou non que ses contenus entrainent les modeles d’OpenAI. Autoriser GPTBot augmente la probabilite que la marque soit connue du modele lui-meme, hors de toute recherche web. Le bloquer protege les contenus de l’entrainement, choix fait par de nombreux medias depuis aout 2023. L’erreur classique consiste a confondre les roles : bloquer GPTBot ne retire pas un site des reponses de ChatGPT Search, et l’autoriser ne garantit aucune citation. La visibilite dans la recherche conversationnelle depend d’OAI-SearchBot et de l’index Bing. Second enjeu, la charge serveur. Le crawl d’entrainement represente en pic jusqu’a 8 fois le volume du crawl de recherche et 32 fois celui des actions utilisateurs. Cette domination est largement portee par GPTBot (Cloudflare Radar, decembre 2025).

CritereGPTBotOAI-SearchBot
RoleCollecte de contenus pour l’entrainement des modeles GPTConstruction de l’index de ChatGPT Search
Effet d’un blocageExclusion des donnees d’entrainement futuresDisparition des resultats de ChatGPT Search
LancementAout 2023Fin 2024, avec SearchGPT puis ChatGPT Search

Faut-il bloquer GPTBot sur son site ?

Bloquer GPTBot se justifie pour proteger des contenus a forte valeur editoriale de l’entrainement. C’est un choix repandu : GPTBot est le bot IA le plus bloque du web, par 5,89 % des sites analyses (Ahrefs, aout 2025, 140 millions de sites). Pour un site qui vit de sa visibilite, l’autoriser reste le bon calcul : un modele entraine sur vos contenus connait votre marque. Dans les deux cas, la presence dans ChatGPT Search ne change pas, car elle depend d’OAI-SearchBot.

Comment bloquer GPTBot dans le robots.txt ?

Pour bloquer GPTBot, ajoutez deux lignes au fichier robots.txt a la racine du site. Premiere ligne : User-agent: GPTBot. Seconde ligne : Disallow: /. Le blocage peut aussi etre partiel, en limitant le Disallow a un repertoire precis. GPTBot respecte ces directives selon la documentation OpenAI. Le blocage ne vaut que pour l’avenir : les contenus deja collectes restent dans les jeux d’entrainement existants.

Exemple concret de configuration GPTBot

GPTBot se configure separement d’OAI-SearchBot dans le robots.txt. Exemple : un site peut refuser que ses contenus servent a l’entrainement des futurs modeles OpenAI en bloquant GPTBot, tout en autorisant OAI-SearchBot pour rester visible dans ChatGPT Search. Cette configuration protege l’usage d’entrainement sans couper la citation dans les reponses de recherche, a condition que Bingbot reste aussi autorise.

User-agent: GPTBot Disallow: /User-agent: OAI-SearchBot Allow: /User-agent: ChatGPT-User Allow: /User-agent: Bingbot Allow: /

Erreur frequente observee en audit

Cas reel. En audit GEO, l’erreur frequente consiste a bloquer tous les User-Agents OpenAI en pensant viser uniquement l’entrainement. Le site bloque GPTBot, mais bloque aussi OAI-SearchBot et ChatGPT-User, ce qui coupe la recherche et les consultations a la demande. La correction consiste a separer les usages : GPTBot pour l’entrainement, OAI-SearchBot pour ChatGPT Search, ChatGPT-User pour les actions initiees par l’utilisateur, puis a verifier les codes retour dans les logs serveur.

Trois idées reçues sur GPTBot

Bloquer GPTBot passe pour un renoncement à ChatGPT, ce que la répartition des robots d’OpenAI dément.

Mythe

Bloquer GPTBot retire le site de ChatGPT. GPTBot ne sert qu’à l’entraînement. Les réponses citées reposent sur l’index Bing et sur OAI-SearchBot.

Mythe

Bloquer GPTBot efface les données déjà collectées. La directive vaut pour les collectes futures. OpenAI ne propose aucune procédure de retrait rétroactif.

Mythe

GPTBot ignore le fichier robots.txt. OpenAI déclare le respecter et publie ses plages d’adresses. Les logs serveur permettent de le vérifier.

Questions fréquentes

Bloquer GPTBot retire-t-il un site de ChatGPT ?

Non, GPTBot ne sert qu’à l’entraînement. Les réponses de ChatGPT Search reposent sur l’index Bing et sur OAI-SearchBot. Bloquer GPTBot laisse donc la visibilité intacte dans le produit.

Bloquer GPTBot efface-t-il les contenus déjà collectés ?+

Non, la directive vaut pour les collectes futures. Les modèles déjà entraînés conservent ce qu’ils ont appris. OpenAI ne propose aucune procédure de retrait rétroactif des données d’entraînement.

Comment vérifier que GPTBot respecte le blocage ?+

Les logs serveur montrent les requêtes portant ce User-Agent après la mise en place. Une décrue jusqu’à zéro confirme la prise en compte. Le délai dépend du cycle de relecture du robots.txt.

Damien Hernandez, consultant SEO senior
Auteur

Damien Hernandez

Consultant SEO senior, 17 ans d’expérience (Accor, Louvre Hotels, Infopro Digital). Spécialiste SEO technique, analyse de logs et optimisation pour les moteurs génératifs (GEO).

Sources

  1. 1Cloudflare, « From Googlebot to GPTBot: Who’s crawling your site in 2025 » · août 2025 consulter la source
  2. 2Cloudflare Radar, « 2025 Year in Review » · décembre 2025, part de GPTBot dans le crawl IA consulter la source
  3. 3Ahrefs, « The AI Bots That ~140 Million Websites Block the Most » · août 2025 consulter la source
Aller plus loin

Faire expliquer ce terme par une IA

Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.