GEO Niveau · Intermédiaire Lecture 4 min

GPTBot

Ce que le robot d’OpenAI collecte pour l’entraînement, et ce que l’autoriser ou le bloquer implique.

Définition courte

GPTBot est le robot d’exploration d’OpenAI dédié à l’entraînement des modèles. Il collecte le contenu web public pour améliorer les futurs modèles GPT qui alimentent ChatGPT. GPTBot respecte le robots.txt et s’identifie par un User-Agent declare. En SEO, l’autoriser ou le bloquer n’affecte que l’entraînement, pas la visibilité dans ChatGPT Search.

À retenir
01GPTBot a été annonce par OpenAI en août 2023. Sa mission déclarée : collecter le contenu web public pour entraîner les futurs modèles GPT (documentation OpenAI).
02GPTBot était le crawler IA le plus actif du web en 2025 (Cloudflare). Ses requêtes ont bondi de 305 % entre mai 2024 et mai 2025. Sur un an glissant, sa part du trafic des crawlers IA et de recherche a plus que double, de 4,7 % à 11,7 % (Cloudflare, août 2025).
03Bloquer GPTBot n’exclut pas un site de ChatGPT Search : la recherche repose sur OAI-SearchBot et sur l’index Bing (documentation OpenAI).

Comment fonctionne GPTBot ?

GPTBot fonctionne comme un crawler classique à grande échelle. Il explore les pages web publiques, en extrait le texte et alimente les jeux de données d’entraînement des modèles d’OpenAI. GPTBot s’identifie dans les logs serveur par la chaîne User-Agent GPTBot/1.0, avec un lien vers sa documentation. OpenAI publie les plages d’adresses IP du robot, ce qui permet de vérifier l’authenticité des visites. GPTBot respecte les directives du fichier robots.txt et declare exclure les contenus payants ainsi que les données personnelles identifiables. GPTBot ne travaille pas seul : OpenAI opere aussi OAI-SearchBot, qui construit l’index de ChatGPT Search, et ChatGPT-User, l’agent des consultations à la demande. Quand GPTBot et OAI-SearchBot sont tous deux autorises, OpenAI mutualise le crawl pour éviter les visites redondantes.

Pourquoi GPTBot est important pour le SEO ?

GPTBot cristallise la décision stratégique du GEO : accepter ou non que ses contenus entraînent les modèles d’OpenAI. Autoriser GPTBot augmente la probabilité que la marque soit connue du modèle lui-même, hors de toute recherche web. Le bloquer protege les contenus de l’entraînement, choix fait par de nombreux médias depuis août 2023. L’erreur classique consiste à confondre les rôles : bloquer GPTBot ne retire pas un site des réponses de ChatGPT Search, et l’autoriser ne garantit aucune citation. La visibilité dans la recherche conversationnelle dépend d’OAI-SearchBot et de l’index Bing. Second enjeu, la charge serveur. Le crawl d’entraînement represente en pic jusqu’à 8 fois le volume du crawl de recherche et 32 fois celui des actions utilisateurs. Cette domination est largement portée par GPTBot (Cloudflare Radar, décembre 2025).

CritèreGPTBotOAI-SearchBot
RôleCollecte de contenus pour l’entraînement des modèles GPTConstruction de l’index de ChatGPT Search
Effet d’un blocageExclusion des données d’entraînement futuresDisparition des résultats de ChatGPT Search
LancementAoût 2023Fin 2024, avec SearchGPT puis ChatGPT Search

Faut-il bloquer GPTBot sur son site ?

Bloquer GPTBot se justifie pour protéger des contenus à forte valeur éditoriale de l’entraînement. C’est un choix répandu : GPTBot est le bot IA le plus bloque du web, par 5,89 % des sites analyses (Ahrefs, août 2025, 140 millions de sites). Pour un site qui vit de sa visibilité, l’autoriser reste le bon calcul : un modèle entraine sur vos contenus connaît votre marque. Dans les deux cas, la présence dans ChatGPT Search ne change pas, car elle dépend d’OAI-SearchBot.

Comment bloquer GPTBot dans le robots.txt ?

Pour bloquer GPTBot, ajoutez deux lignes au fichier robots.txt à la racine du site. Première ligne : User-agent: GPTBot. Seconde ligne : Disallow: /. Le blocage peut aussi être partiel, en limitant le Disallow a un répertoire précis. GPTBot respecte ces directives selon la documentation OpenAI. Le blocage ne vaut que pour l’avenir : les contenus déjà collectes restent dans les jeux d’entraînement existants.

Exemple concret de configuration GPTBot

GPTBot se configure separement d’OAI-SearchBot dans le robots.txt. Exemple : un site peut refuser que ses contenus servent à l’entraînement des futurs modèles OpenAI en bloquant GPTBot, tout en autorisant OAI-SearchBot pour rester visible dans ChatGPT Search. Cette configuration protege l’usage d’entraînement sans couper la citation dans les réponses de recherche, à condition que Bingbot reste aussi autorise.

User-agent: GPTBot Disallow: /User-agent: OAI-SearchBot Allow: /User-agent: ChatGPT-User Allow: /User-agent: Bingbot Allow: /

Erreur fréquente observée en audit

Cas réel. En audit GEO, l’erreur fréquente consiste à bloquer tous les User-Agents OpenAI en pensant viser uniquement l’entraînement. Le site bloque GPTBot, mais bloque aussi OAI-SearchBot et ChatGPT-User, ce qui coupe la recherche et les consultations à la demande. La correction consiste à séparer les usages : GPTBot pour l’entraînement, OAI-SearchBot pour ChatGPT Search, ChatGPT-User pour les actions initiées par l’utilisateur, puis à vérifier les codes retour dans les logs serveur.

Trois idées reçues sur GPTBot

Bloquer GPTBot passe pour un renoncement à ChatGPT, ce que la répartition des robots d’OpenAI dément.

Mythe

Bloquer GPTBot retire le site de ChatGPT. GPTBot ne sert qu’à l’entraînement. Les réponses citées reposent sur l’index Bing et sur OAI-SearchBot.

Mythe

Bloquer GPTBot efface les données déjà collectées. La directive vaut pour les collectes futures. OpenAI ne propose aucune procédure de retrait rétroactif.

Mythe

GPTBot ignore le fichier robots.txt. OpenAI déclare le respecter et publie ses plages d’adresses. Les logs serveur permettent de le vérifier.

Questions fréquentes

Bloquer GPTBot retire-t-il un site de ChatGPT ?−

Non, GPTBot ne sert qu’à l’entraînement. Les réponses de ChatGPT Search reposent sur l’index Bing et sur OAI-SearchBot. Bloquer GPTBot laisse donc la visibilité intacte dans le produit.

Bloquer GPTBot efface-t-il les contenus déjà collectés ?+

Non, la directive vaut pour les collectes futures. Les modèles déjà entraînés conservent ce qu’ils ont appris. OpenAI ne propose aucune procédure de retrait rétroactif des données d’entraînement.

Comment vérifier que GPTBot respecte le blocage ?+

Les logs serveur montrent les requêtes portant ce User-Agent après la mise en place. Une décrue jusqu’à zéro confirme la prise en compte. Le délai dépend du cycle de relecture du robots.txt.

Damien Hernandez, consultant SEO senior
Auteur

Damien Hernandez

Consultant SEO senior, 17 ans d’expérience (Accor, Louvre Hotels, Infopro Digital). Spécialiste SEO technique, analyse de logs et optimisation pour les moteurs génératifs (GEO).

Sources

  1. 1Cloudflare, « From Googlebot to GPTBot: Who’s crawling your site in 2025 » · août 2025 consulter la source
  2. 2Cloudflare Radar, « 2025 Year in Review » · décembre 2025, part de GPTBot dans le crawl IA consulter la source
  3. 3Ahrefs, « The AI Bots That ~140 Million Websites Block the Most » · août 2025 consulter la source
Aller plus loin

Faire expliquer ce terme par une IA

Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.