PerplexityBot
Le robot derrière les réponses citées de Perplexity : respect du robots.txt, arbitrage du blocage.
PerplexityBot est le robot d’exploration de Perplexity, le moteur de réponse IA. Il indexe les contenus web pour alimenter les réponses citées de Perplexity, sans usage d’entraînement : Perplexity declare ne pas entraîner de modèles de fondation. En SEO, bloquer PerplexityBot retire un site des réponses de Perplexity, à l’inverse du blocage d’un bot d’entraînement.
Comment fonctionne PerplexityBot ?
PerplexityBot explore le web pour construire l’index qui nourrit les réponses citées de Perplexity. Le robot s’identifie par la chaîne User-Agent PerplexityBot/1.0 et Perplexity publie ses plages d’adresses IP dans un fichier JSON dédié, ce qui permet de vérifier l’authenticité des visites. Selon la documentation Perplexity, PerplexityBot respecte le robots.txt, avec une limite notable : même bloque, le domaine, le titre et un court resume factuel d’une page peuvent rester indexes. Perplexity opere un second agent, Perplexity-User, declenche quand un utilisateur demande la lecture d’une URL precise. La documentation assume que le robots.txt ne s’applique généralement pas a Perplexity-User, la requête étant traitée comme une action utilisateur. Point de vigilance : les pare-feu applicatifs (WAF) classent parfois ces agents comme scrapers malveillants et les bloquent silencieusement.
Pourquoi PerplexityBot est important pour le SEO ?
PerplexityBot pose une équation différente des bots d’entraînement. D’un cote, Perplexity affiche l’économie la plus favorable aux éditeurs : son ratio crawl/trafic renvoyé est le plus bas des grandes plateformes IA, sous 200 pages explorées par visite référée depuis septembre 2025 (Cloudflare, décembre 2025). Perplexity récompense aussi le SEO classique : près d’une citation sur trois provient de pages du top 10 Google, la proportion la plus élevée des assistants IA etudies (Ahrefs, août 2025). De l’autre cote, la confiance est entamée. L’investigation Cloudflare d’août 2025 a observe des requêtes hors plages IP declarees, sous User-Agent generique imitant Chrome, sur des dizaines de milliers de domaines. Conséquence pratique : pour Perplexity plus que pour tout autre acteur, un blocage fiable passe par le serveur ou le WAF, pas seulement par le robots.txt.
| Critère | PerplexityBot | Perplexity-User |
|---|---|---|
| Rôle | Indexation du web pour les réponses citées de Perplexity | Lecture d’une URL à la demande d’un utilisateur |
| Robots.txt | Respecte selon la documentation Perplexity | Ne s’applique généralement pas, requête traitée comme humaine |
| Effet d’un blocage | Disparition des réponses citées de Perplexity | Page illisible lors des demandes directes d’utilisateurs |
PerplexityBot respecte-t-il le robots.txt ?
Officiellement oui : la documentation Perplexity declare que PerplexityBot honore les directives du robots.txt. Dans les faits, l’investigation Cloudflare d’août 2025 a documente des crawlers furtifs non déclarés accédant a des contenus bloques, via des IP hors plages officielles et des User-Agents generiques. Perplexity a conteste ces conclusions. La position prudente : considérer le robots.txt comme un signal d’intention et doubler tout blocage critique d’une regle serveur ou WAF.
Faut-il bloquer PerplexityBot sur son site ?
Pour la plupart des sites, non. PerplexityBot n’alimente aucun entraînement de modèle et conditionne la présence dans les réponses citées de Perplexity, un canal de visibilité qui renvoie du trafic. Le blocage se justifie pour les contenus payants ou exclusifs. Dans ce cas, ajoutez User-agent: PerplexityBot puis Disallow: / au robots.txt, et complétez par une regle serveur, le robots.txt seul ne garantissant pas l’etancheite.
Exemple concret de configuration PerplexityBot
PerplexityBot doit être autorise quand l’objectif est d’apparaître dans les réponses citées de Perplexity. Exemple : un site de conseil peut laisser PerplexityBot crawler ses pages publiques de lexique, d’expertise et de services, tout en bloquant ses contenus premium ou confidentiels au niveau serveur. Cette configuration garde la visibilité GEO sur les contenus ouverts, sans exposer les espaces qui ne doivent pas servir de sources.
User-agent: PerplexityBot
Allow: /lexique-seo/
Allow: /consultant-seo/
Disallow: /contenus-premium/
Disallow: /espace-client/Erreur fréquente observée en audit
Cas réel. En audit GEO, l’erreur fréquente consiste à traiter PerplexityBot comme un bot d’entraînement classique. Le site bloque PerplexityBot dans le robots.txt pour “se protéger de l’IA”, puis s’etonne de ne jamais apparaître dans Perplexity. PerplexityBot alimente l’index de réponse, pas l’entraînement de modèles. La correction consiste à autoriser PerplexityBot sur les contenus publics à citer, puis à protéger les contenus sensibles avec des règles serveur, WAF ou authentification.
Questions fréquentes
Quelle différence entre PerplexityBot et Perplexity-User ?−
PerplexityBot construit l’index de réponse. Perplexity-User visite une page à la demande d’un utilisateur. Les directives du robots.txt s’appliquent au premier, le second répond à une action humaine.
Bloquer PerplexityBot supprime-t-il les citations existantes ?+
Les pages déjà indexées sortent au fil des recrawls. Le blocage arrête la collecte, sans vider l’index immédiatement. Le délai dépend du cycle de rafraîchissement.
Comment repérer PerplexityBot dans les logs ?+
Une recherche sur la chaîne PerplexityBot dans le User-Agent suffit. Perplexity publie ses plages d’adresses IP pour l’authentification. Un User-Agent seul ne prouve rien.
Sources
- 1Cloudflare Radar, « 2025 Year in Review » · décembre 2025 consulter la source
- 2Ahrefs, « The AI Bots That ~140 Million Websites Block the Most » · août 2025 consulter la source
Faire expliquer ce terme par une IA
Ouvre le moteur de ton choix avec un prompt pré-rempli sur ce terme.
