Robots.txt et bots IA en 2026 : qui bloquer, qui autoriser (GPTBot, ClaudeBot, PerplexityBot...)
Un robots.txt mal configuré peut soit vous rendre invisible aux IA génératives, soit laisser aspirer tout votre contenu sans contrepartie. La bonne réponse dépend du bot, pas d'une règle unique.
Chaque moteur IA envoie son propre robot d'exploration, avec son propre user-agent, et respecte (en théorie) les directives robots.txt qui le concernent spécifiquement. Le problème : beaucoup de sites copient un robots.txt générique trouvé en ligne, qui bloque ou autorise ces bots au hasard, sans lien avec leur objectif réel de visibilité.
§ Les principaux bots IA et à quoi ils servent
§ Bloquer l'entraînement n'est pas bloquer les citations
C'est la confusion la plus fréquente. GPTBot sert à collecter du contenu pour entraîner de futurs modèles, un usage que beaucoup d'éditeurs veulent limiter. OAI-SearchBot, lui, sert aux réponses en temps réel de ChatGPT avec citation de la source, un usage que la plupart des sites ont plutôt intérêt à autoriser. Bloquer GPTBot sans distinction bloque les deux, et fait disparaître le site des réponses citées de ChatGPT.
§ Comment décider, en pratique
- ›Contenu éditorial que vous voulez voir cité par les IA : autorisez OAI-SearchBot, PerplexityBot et ClaudeBot
- ›Contenu que vous ne voulez pas voir servir à l'entraînement de modèles : bloquez GPTBot et ClaudeBot spécifiquement, sans toucher aux bots de citation
- ›Pages à faible valeur (panier, compte, recherche interne) : bloquez tous les bots IA comme vous le feriez pour Googlebot
- ›Contenu premium ou sous paywall : bloquez systématiquement, un bot IA respecte le robots.txt mais ne respecte pas un paywall visuel
§ Exemple de configuration équilibrée
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /Cette configuration autorise les citations en temps réel tout en limitant l'usage du contenu pour l'entraînement de modèles génériques. Elle doit être ajustée selon votre modèle économique : un site qui vit de son trafic organique n'a pas les mêmes arbitrages qu'un site qui vend un accès payant à son contenu.
§ Le robots.txt suffit-il à se protéger vraiment ?
Non. Le robots.txt repose sur le respect volontaire du protocole par le crawler : un acteur peu scrupuleux peut l'ignorer. C'est une directive, pas un mur technique. Pour un contrôle plus strict, il faut combiner robots.txt, en-têtes HTTP dédiés et, si nécessaire, un blocage par adresse IP côté serveur pour les user-agents qui ne respectent pas la directive.
Questions fréquentes
Pas entièrement. GPTBot sert surtout à l'entraînement des modèles. Les réponses de ChatGPT avec recherche web s'appuient sur OAI-SearchBot, un user-agent distinct. Bloquer l'un ne bloque pas automatiquement l'autre.
Googlebot explore votre site pour l'indexation classique dans la recherche Google. Google-Extended est un user-agent séparé qui contrôle spécifiquement si votre contenu peut alimenter Gemini et les AI Overviews. Bloquer l'un n'affecte pas l'autre.
Cela dépend de votre objectif. Si vous cherchez à être cité par ChatGPT ou Perplexity, bloquer leurs bots de citation est contre-productif. Le blocage total a plus de sens pour du contenu premium ou des pages sans valeur SEO.
Les acteurs majeurs (OpenAI, Anthropic, Perplexity, Google) déclarent respecter le protocole. Mais rien ne garantit qu'un acteur moins connu s'y conforme : le robots.txt reste une directive de bonne volonté, pas une barrière technique.
Découvrez votre score SEO + GEO en 30 secondes
Cet article a été utile ? Voyez maintenant ce que vaut votre site sur les onze critères évalués par SK : VR.
Comment créer un fichier llms.txt efficace pour son site
Le llms.txt est devenu en 2026 l'équivalent du robots.txt pour les IA. Voici comment en créer un qui fonctionne vraiment.
Un outil SEO qui lit le web pour vous : faut-il s'inquiéter de sa sécurité en 2026 ?
Un outil d'audit SEO moderne va chercher vos pages, parfois des pages tierces, et les passe à un modèle d'IA. Cette lecture automatisée ouvre une surface d'attaque nouvelle. Décryptage, et les garde-fous à exiger.
Les 10 erreurs GEO les plus fréquentes en 2026
Un audit de 200 sites en 2026 a permis d'identifier les dix erreurs GEO qui reviennent le plus. Vérifiez la vôtre.