Google-Extended
Un token du robots.txt qui n’est pas un crawler : ce qu’il refuse vraiment, et ce qu’il ne bloque pas.
Google-Extended est un token de controle du robots.txt propose par Google depuis septembre 2023. Il permet de refuser l’usage des contenus d’un site pour l’entrainement et le grounding des modeles Gemini et de Vertex AI. Ce n’est pas un crawler : l’exploration reste assuree par Googlebot. En SEO, le bloquer ne change ni le classement ni la presence dans les AI Overviews.
Comment fonctionne Google-Extended ?
Google-Extended fonctionne comme un signal declaratif dans le robots.txt, pas comme un robot autonome. Le site ajoute une regle User-agent: Google-Extended suivie d’un Disallow, total ou limite a un repertoire. Google lit cette regle lors du crawl effectue par ses agents habituels, Googlebot en tete, et exclut alors les contenus concernes de l’entrainement des futurs modeles Gemini et du grounding dans les applications Gemini et Vertex AI. Consequence directe de cette architecture : Google-Extended ne possede aucune chaine User-Agent propre et ne laisse aucune trace dans les logs serveur. Chercher ses visites est un non-sens technique, le trafic observe reste celui de Googlebot. Autre limite documentee : le token n’agit que pour l’avenir. Les contenus deja integres aux modeles Gemini existants ne sont pas retires.
Pourquoi Google-Extended est important pour le SEO ?
Google-Extended cristallise une asymetrie propre a Google. Chez OpenAI ou Anthropic, le bot d’entrainement se bloque sans toucher a la recherche. Chez Google, l’IA integree a Search (AI Overviews, Mode IA) est alimentee par le crawl de Googlebot : refuser cette exploitation supposerait de bloquer Googlebot, donc de sortir de la recherche. Google-Extended n’offre qu’un opt-out partiel, limite a Gemini et Vertex AI, et les editeurs le savent. Trois erreurs reviennent en audit. Croire que bloquer Google-Extended retire un site des AI Overviews : faux, les controles sont nosnippet, data-nosnippet, max-snippet et noindex (Google Search Central). Chercher Google-Extended dans les logs : impossible, c’est un token. Bloquer Googlebot en croyant ne viser que l’IA : le site disparait de Google Search.
| Critere | Google-Extended | Googlebot |
|---|---|---|
| Nature | Token de controle dans le robots.txt, sans crawl propre | Robot d’exploration avec User-Agent et visites reelles |
| Perimetre | Entrainement et grounding de Gemini et Vertex AI | Index Google Search, y compris AI Overviews et Mode IA |
| Traces dans les logs | Aucune, le token n’emet pas de requete | Visites identifiables et verifiables par DNS inverse |
Faut-il bloquer Google-Extended ?
Bloquer Google-Extended se justifie pour les contenus premium ou exclusifs dont l’exploitation par Gemini n’apporte rien en retour. Pour un site qui vise la visibilite, l’autoriser reste le calcul dominant : les contenus nourrissent Gemini, donc les reponses ou la marque peut etre citee. Le blocage est sans risque pour le SEO classique : il n’affecte ni l’inclusion ni le classement dans Google Search (documentation Google).
Comment bloquer les AI Overviews de Google ?
Pas avec Google-Extended : les AI Overviews font partie de Google Search et echappent au token. Les controles reels sont les balises nosnippet, data-nosnippet et max-snippet, qui limitent les extraits exploitables, ou noindex pour retirer la page entierement (Google Search Central). Le cout est a mesurer : ces balises reduisent aussi les extraits dans la recherche classique. Il n’existe aucun moyen d’apparaitre dans Search tout en refusant les AI Overviews.
Exemple concret d’utilisation de Google-Extended
Google-Extended se configure dans le robots.txt pour refuser l’usage futur de certains contenus par Gemini et Vertex AI, sans bloquer Google Search. Exemple : un site peut interdire Google-Extended sur un repertoire premium, tout en laissant Googlebot explorer les pages publiques. Cette configuration limite l’exploitation par Gemini, mais ne retire pas les pages de Google, ne bloque pas les AI Overviews et ne produit aucune ligne Google-Extended dans les logs serveur.
User-agent: Google-Extended
Disallow: /contenus-premium/User-agent: Googlebot
Allow: /Erreur frequente observee en audit
Cas reel. En audit GEO, l’erreur frequente consiste a chercher Google-Extended dans les logs serveur ou a croire que son blocage supprime la presence dans les AI Overviews. Google-Extended n’est pas un crawler, mais un token de controle lu par Google. Les visites restent celles de Googlebot. La correction consiste a separer les objectifs : Google-Extended pour Gemini et Vertex AI, nosnippet ou noindex pour les extraits Search, et surtout jamais de blocage Googlebot si l’objectif SEO reste la visibilite dans Google.
Trois idées reçues sur Google-Extended
Google-Extended porte un nom de robot sans en être un, ce qui produit deux erreurs de configuration.
Google-Extended est un robot d’exploration. C’est un token de contrôle lu dans le robots.txt. Le crawl reste assuré par Googlebot.
Bloquer Google-Extended retire le site des AI Overviews. Le token vise l’entraînement et le grounding de Gemini. L’affichage dans les aperçus se contrôle par les directives d’extrait.
Bloquer Google-Extended dégrade le classement. Google indique que le token n’affecte pas la recherche. Le classement reste inchangé.
Questions fréquentes
Google-Extended apparaît-il dans les logs serveur ?−
Non, Google-Extended n’émet aucune requête. C’est un token de contrôle lu dans le robots.txt, pas un robot d’exploration. Les passages restent attribués à Googlebot dans les logs.
Bloquer Google-Extended change-t-il le classement ?+
Non, Google confirme que le token n’affecte pas la recherche. L’exploration reste assurée par Googlebot. Le blocage porte sur l’entraînement et le grounding des modèles Gemini et Vertex AI.
Google-Extended couvre-t-il Gemini et Vertex AI ?+
Oui, le token vise ces deux usages. Il ne couvre pas l’affichage dans les AI Overviews, géré par les directives d’extrait. Un éditeur qui veut sortir des aperçus utilise nosnippet.
Sources
- 1Google, « An update on web publisher controls » · 28 septembre 2023 (lancement de Google-Extended) consulter la source
- 2Google, « Robots d’exploration courants de Google » (Google-Extended n’est pas un crawler) consulter la source
Faire expliquer ce terme par une IA
Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.
