Aller au contenu
SK:VR
Technique#robots.txt#GEO#crawlers IA

Robots.txt et bots IA en 2026 : qui bloquer, qui autoriser (GPTBot, ClaudeBot, PerplexityBot...)

Un robots.txt mal configuré peut soit vous rendre invisible aux IA génératives, soit laisser aspirer tout votre contenu sans contrepartie. La bonne réponse dépend du bot, pas d'une règle unique.

John Houzi8 min de lecture

Chaque moteur IA envoie son propre robot d'exploration, avec son propre user-agent, et respecte (en théorie) les directives robots.txt qui le concernent spécifiquement. Le problème : beaucoup de sites copient un robots.txt générique trouvé en ligne, qui bloque ou autorise ces bots au hasard, sans lien avec leur objectif réel de visibilité.

§ Les principaux bots IA et à quoi ils servent

User-agentÉditeurRôle
GPTBotOpenAICollecte de contenu pour l'entraînement des modèles
OAI-SearchBotOpenAIAlimente les citations de ChatGPT en mode recherche web
ClaudeBotAnthropicCollecte de contenu pour l'entraînement des modèles Claude
PerplexityBotPerplexityIndexe le contenu pour les réponses citées de Perplexity
Google-ExtendedGoogleContrôle l'usage du contenu par Gemini et les AI Overviews, indépendamment de Googlebot

§ Bloquer l'entraînement n'est pas bloquer les citations

C'est la confusion la plus fréquente. GPTBot sert à collecter du contenu pour entraîner de futurs modèles, un usage que beaucoup d'éditeurs veulent limiter. OAI-SearchBot, lui, sert aux réponses en temps réel de ChatGPT avec citation de la source, un usage que la plupart des sites ont plutôt intérêt à autoriser. Bloquer GPTBot sans distinction bloque les deux, et fait disparaître le site des réponses citées de ChatGPT.

§ Comment décider, en pratique

  • Contenu éditorial que vous voulez voir cité par les IA : autorisez OAI-SearchBot, PerplexityBot et ClaudeBot
  • Contenu que vous ne voulez pas voir servir à l'entraînement de modèles : bloquez GPTBot et ClaudeBot spécifiquement, sans toucher aux bots de citation
  • Pages à faible valeur (panier, compte, recherche interne) : bloquez tous les bots IA comme vous le feriez pour Googlebot
  • Contenu premium ou sous paywall : bloquez systématiquement, un bot IA respecte le robots.txt mais ne respecte pas un paywall visuel

§ Exemple de configuration équilibrée

text
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

Cette configuration autorise les citations en temps réel tout en limitant l'usage du contenu pour l'entraînement de modèles génériques. Elle doit être ajustée selon votre modèle économique : un site qui vit de son trafic organique n'a pas les mêmes arbitrages qu'un site qui vend un accès payant à son contenu.

§ Le robots.txt suffit-il à se protéger vraiment ?

Non. Le robots.txt repose sur le respect volontaire du protocole par le crawler : un acteur peu scrupuleux peut l'ignorer. C'est une directive, pas un mur technique. Pour un contrôle plus strict, il faut combiner robots.txt, en-têtes HTTP dédiés et, si nécessaire, un blocage par adresse IP côté serveur pour les user-agents qui ne respectent pas la directive.

faq :

Questions fréquentes

Bloquer GPTBot fait-il disparaître mon site de ChatGPT ?

Pas entièrement. GPTBot sert surtout à l'entraînement des modèles. Les réponses de ChatGPT avec recherche web s'appuient sur OAI-SearchBot, un user-agent distinct. Bloquer l'un ne bloque pas automatiquement l'autre.

Google-Extended et Googlebot, quelle différence ?

Googlebot explore votre site pour l'indexation classique dans la recherche Google. Google-Extended est un user-agent séparé qui contrôle spécifiquement si votre contenu peut alimenter Gemini et les AI Overviews. Bloquer l'un n'affecte pas l'autre.

Faut-il bloquer tous les bots IA par précaution ?

Cela dépend de votre objectif. Si vous cherchez à être cité par ChatGPT ou Perplexity, bloquer leurs bots de citation est contre-productif. Le blocage total a plus de sens pour du contenu premium ou des pages sans valeur SEO.

Les bots IA respectent-ils toujours le robots.txt ?

Les acteurs majeurs (OpenAI, Anthropic, Perplexity, Google) déclarent respecter le protocole. Mais rien ne garantit qu'un acteur moins connu s'y conforme : le robots.txt reste une directive de bonne volonté, pas une barrière technique.

passez à la pratique

Découvrez votre score SEO + GEO en 30 secondes

Cet article a été utile ? Voyez maintenant ce que vaut votre site sur les onze critères évalués par SK : VR.

à lire ensuite :