GPTBot
Ce que le robot d’OpenAI collecte pour l’entraînement, et ce que l’autoriser ou le bloquer implique.
GPTBot est le robot d’exploration d’OpenAI dédié à l’entraînement des modèles. Il collecte le contenu web public pour améliorer les futurs modèles GPT qui alimentent ChatGPT. GPTBot respecte le robots.txt et s’identifie par un User-Agent declare. En SEO, l’autoriser ou le bloquer n’affecte que l’entraînement, pas la visibilité dans ChatGPT Search.
Comment fonctionne GPTBot ?
GPTBot fonctionne comme un crawler classique à grande échelle. Il explore les pages web publiques, en extrait le texte et alimente les jeux de données d’entraînement des modèles d’OpenAI. GPTBot s’identifie dans les logs serveur par la chaîne User-Agent GPTBot/1.0, avec un lien vers sa documentation. OpenAI publie les plages d’adresses IP du robot, ce qui permet de vérifier l’authenticité des visites. GPTBot respecte les directives du fichier robots.txt et declare exclure les contenus payants ainsi que les données personnelles identifiables. GPTBot ne travaille pas seul : OpenAI opere aussi OAI-SearchBot, qui construit l’index de ChatGPT Search, et ChatGPT-User, l’agent des consultations à la demande. Quand GPTBot et OAI-SearchBot sont tous deux autorises, OpenAI mutualise le crawl pour éviter les visites redondantes.
Pourquoi GPTBot est important pour le SEO ?
GPTBot cristallise la décision stratégique du GEO : accepter ou non que ses contenus entraînent les modèles d’OpenAI. Autoriser GPTBot augmente la probabilité que la marque soit connue du modèle lui-même, hors de toute recherche web. Le bloquer protege les contenus de l’entraînement, choix fait par de nombreux médias depuis août 2023. L’erreur classique consiste à confondre les rôles : bloquer GPTBot ne retire pas un site des réponses de ChatGPT Search, et l’autoriser ne garantit aucune citation. La visibilité dans la recherche conversationnelle dépend d’OAI-SearchBot et de l’index Bing. Second enjeu, la charge serveur. Le crawl d’entraînement represente en pic jusqu’à 8 fois le volume du crawl de recherche et 32 fois celui des actions utilisateurs. Cette domination est largement portée par GPTBot (Cloudflare Radar, décembre 2025).
| Critère | GPTBot | OAI-SearchBot |
|---|---|---|
| Rôle | Collecte de contenus pour l’entraînement des modèles GPT | Construction de l’index de ChatGPT Search |
| Effet d’un blocage | Exclusion des données d’entraînement futures | Disparition des résultats de ChatGPT Search |
| Lancement | Août 2023 | Fin 2024, avec SearchGPT puis ChatGPT Search |
Faut-il bloquer GPTBot sur son site ?
Bloquer GPTBot se justifie pour protéger des contenus à forte valeur éditoriale de l’entraînement. C’est un choix répandu : GPTBot est le bot IA le plus bloque du web, par 5,89 % des sites analyses (Ahrefs, août 2025, 140 millions de sites). Pour un site qui vit de sa visibilité, l’autoriser reste le bon calcul : un modèle entraine sur vos contenus connaît votre marque. Dans les deux cas, la présence dans ChatGPT Search ne change pas, car elle dépend d’OAI-SearchBot.
Comment bloquer GPTBot dans le robots.txt ?
Pour bloquer GPTBot, ajoutez deux lignes au fichier robots.txt à la racine du site. Première ligne : User-agent: GPTBot. Seconde ligne : Disallow: /. Le blocage peut aussi être partiel, en limitant le Disallow a un répertoire précis. GPTBot respecte ces directives selon la documentation OpenAI. Le blocage ne vaut que pour l’avenir : les contenus déjà collectes restent dans les jeux d’entraînement existants.
Exemple concret de configuration GPTBot
GPTBot se configure separement d’OAI-SearchBot dans le robots.txt. Exemple : un site peut refuser que ses contenus servent à l’entraînement des futurs modèles OpenAI en bloquant GPTBot, tout en autorisant OAI-SearchBot pour rester visible dans ChatGPT Search. Cette configuration protege l’usage d’entraînement sans couper la citation dans les réponses de recherche, à condition que Bingbot reste aussi autorise.
User-agent: GPTBot
Disallow: /User-agent: OAI-SearchBot
Allow: /User-agent: ChatGPT-User
Allow: /User-agent: Bingbot
Allow: /Erreur fréquente observée en audit
Cas réel. En audit GEO, l’erreur fréquente consiste à bloquer tous les User-Agents OpenAI en pensant viser uniquement l’entraînement. Le site bloque GPTBot, mais bloque aussi OAI-SearchBot et ChatGPT-User, ce qui coupe la recherche et les consultations à la demande. La correction consiste à séparer les usages : GPTBot pour l’entraînement, OAI-SearchBot pour ChatGPT Search, ChatGPT-User pour les actions initiées par l’utilisateur, puis à vérifier les codes retour dans les logs serveur.
Trois idées reçues sur GPTBot
Bloquer GPTBot passe pour un renoncement à ChatGPT, ce que la répartition des robots d’OpenAI dément.
Bloquer GPTBot retire le site de ChatGPT. GPTBot ne sert qu’à l’entraînement. Les réponses citées reposent sur l’index Bing et sur OAI-SearchBot.
Bloquer GPTBot efface les données déjà collectées. La directive vaut pour les collectes futures. OpenAI ne propose aucune procédure de retrait rétroactif.
GPTBot ignore le fichier robots.txt. OpenAI déclare le respecter et publie ses plages d’adresses. Les logs serveur permettent de le vérifier.
Questions fréquentes
Bloquer GPTBot retire-t-il un site de ChatGPT ?−
Non, GPTBot ne sert qu’à l’entraînement. Les réponses de ChatGPT Search reposent sur l’index Bing et sur OAI-SearchBot. Bloquer GPTBot laisse donc la visibilité intacte dans le produit.
Bloquer GPTBot efface-t-il les contenus déjà collectés ?+
Non, la directive vaut pour les collectes futures. Les modèles déjà entraînés conservent ce qu’ils ont appris. OpenAI ne propose aucune procédure de retrait rétroactif des données d’entraînement.
Comment vérifier que GPTBot respecte le blocage ?+
Les logs serveur montrent les requêtes portant ce User-Agent après la mise en place. Une décrue jusqu’à zéro confirme la prise en compte. Le délai dépend du cycle de relecture du robots.txt.
Sources
- 1Cloudflare, « From Googlebot to GPTBot: Who’s crawling your site in 2025 » · août 2025 consulter la source
- 2Cloudflare Radar, « 2025 Year in Review » · décembre 2025, part de GPTBot dans le crawl IA consulter la source
- 3Ahrefs, « The AI Bots That ~140 Million Websites Block the Most » · août 2025 consulter la source
Faire expliquer ce terme par une IA
Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.
