Pourquoi bloquer GPTBot mais autoriser OAI-SearchBot, pattern robots.txt 2026
Pattern robots.txt 2026 PROEMA : bloquer les crawlers d'entraînement (GPTBot) tout en autorisant les crawlers de retrieval temps réel (OAI-SearchBot, PerplexityBot). Logique IP + GEO maximisée. Configuration complète.
Note PROEMA (2026-06) : ce pattern est la recommandation par défaut de l’agence pour un client qui veut préserver son IP. Le site proema.be fait, lui, l’exception inverse assumée : il autorise les crawlers d’entraînement, car pour une agence GEO, être absorbé dans la connaissance des modèles est un objectif en soi. Le raisonnement ci-dessous reste valable pour la plupart des marques.
Pourquoi distinguer les deux types de crawlers
Depuis août 2023, OpenAI publie une distinction explicite entre ses deux familles de crawlers :
- GPTBot. Crawler d’entraînement. Collecte du contenu pour alimenter les futurs modèles GPT-5, GPT-6, etc. Le contenu collecté finit dans le corpus d’entraînement : sans citation, sans lien retour, et sans contrepartie.
- OAI-SearchBot. Crawler de retrieval temps réel pour ChatGPT Search. Collecte le contenu au moment de la requête utilisateur, le synthétise dans la réponse, et cite la source (lien clickable affiché dans l’interface ChatGPT).
L’asymétrie est cruciale : GPTBot prend votre contenu pour entraîner un modèle propriétaire sans vous citer. OAI-SearchBot prend votre contenu pour répondre à un utilisateur en vous citant. Le premier est extractif, le second est référenciel.
Le pattern PROEMA : bloquer le premier, autoriser le second
Sur les 4 sites du portefeuille (proema.be, expertcafe.be, zeroproof.one, expertvin.be), nous appliquons ce robots.txt :
Logique en deux phrases : on bloque les training crawlers (GPTBot, ClaudeBot, CCBot, Google-Extended) qui ingèrent sans citer. On autorise les retrieval crawlers (OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeUser) qui citent activement. Le reste des crawlers reste autorisé par défaut.
Pourquoi ce n’est pas contradictoire avec le GEO
La crainte fréquente : « si je bloque GPTBot, je perds les citations sur ChatGPT ». C’est faux pour trois raisons :
- Les citations ChatGPT viennent d’OAI-SearchBot, pas de GPTBot. Quand un utilisateur pose une question à ChatGPT et que le modèle utilise sa fonctionnalité Search (active par défaut sur GPT-4o), il interroge OAI-SearchBot en temps réel. GPTBot n’est pas dans la boucle.
- Le contenu indexé par les training crawlers est figé. GPT-4 a été entraîné en 2023. Votre contenu publié en 2026 n’est PAS dans GPT-4. Il sera potentiellement dans GPT-5 ou GPT-6, mais le bénéfice citation est nul (les modèles cités ne donnent jamais leur source d’entraînement).
- Le coût IP est réel. Donner GPTBot accès à votre contenu = laisser OpenAI utiliser votre prose pour générer du contenu commercial concurrent (rédaction marketing, articles assistés) sans contrepartie. Le tradeoff est clair : on protège.
Les exceptions : quand autoriser GPTBot quand même
Il y a deux situations où autoriser GPTBot peut faire sens :
- Contenu de pure documentation publique. Si votre site est purement éducatif, à but non-lucratif, et que vous voulez que votre contenu soit dans le modèle ChatGPT (cas typique : associations, OSS, recherche académique en libre accès).
- Stratégie d’amorçage marketing. Une marque jeune qui pense que la visibilité dans les modèles futurs vaut la perte IP. C’est un pari long terme : pas notre approche, mais légitime selon le profil.
Pour 95% des marques B2B premium, l’arbitrage est : bloquer.
Les autres crawlers à bloquer en 2026
Liste des crawlers d’entraînement à bloquer systématiquement (mise à jour mai 2026) :
| User-agent | Opérateur | Type | Action |
|---|---|---|---|
| GPTBot | OpenAI | Training | Bloquer |
| ClaudeBot | Anthropic | Training | Bloquer |
| CCBot | Common Crawl | Training (data set) | Bloquer |
| Google-Extended | Training (Bard/Gemini) | Bloquer | |
| FacebookBot | Meta | Training (Llama) | Bloquer |
| Amazonbot | Amazon | Training (Alexa, Titan) | Bloquer |
| Applebot-Extended | Apple | Training (Apple Intelligence) | Bloquer |
| Bytespider | ByteDance | Training | Bloquer |
| OAI-SearchBot | OpenAI | Retrieval (ChatGPT Search) | Autoriser |
| ChatGPT-User | OpenAI | User-triggered fetch | Autoriser |
| PerplexityBot | Perplexity | Retrieval | Autoriser |
| ClaudeUser | Anthropic | User-triggered fetch | Autoriser |
| Googlebot | Search index | Autoriser | |
| Bingbot | Microsoft | Search index + Copilot | Autoriser |
Piège à éviter sur Pourquoi nous bloquons GPTBot mais autorisons OAI-SearchBot
Une erreur courante : bloquer tous les bots IA pour “rester sécurisé”. C’est s’auto-pénaliser. Si vous bloquez OAI-SearchBot et PerplexityBot, vous êtes invisible sur ChatGPT Search et Perplexity. C’est tout l’inverse de l’objectif GEO.
La règle : bloquer les training-only, autoriser les retrieval/citation. Tester avec un curl -A "PerplexityBot" https://votre-site.com/ qu’il y a bien réponse 200 OK.
Les opérateurs renomment et créent régulièrement de nouveaux crawlers. Notre veille mensuelle de la liste s’appuie sur trois sources : OpenAI Bot Documentation, DarkVisitors, et ai.robots.txt (repo open-source). Nous publions une mise à jour du pattern PROEMA tous les six mois, la prochaine en novembre 2026.
Pour les marques qui veulent aller plus loin
Au-delà du robots.txt, il existe un niveau supplémentaire : bloquer les training crawlers au niveau réseau (Cloudflare WAF, règles IP). Cela évite que des crawlers non-respectueux du robots.txt scrapent quand même. PROEMA recommande cette couche pour les marques avec un IP éditorial fort (presse, recherche, contenu propriétaire dense).
Configuration Cloudflare type : Worker route ou Page Rule sur les user-agents listés ci-dessus, retournant un 403. Effet : zéro fuite de contenu vers les modèles d’entraînement non-respectueux.
Compléments factuels mai 2026 : ce qu’OpenAI confirme officiellement
Délai d’application des changements robots.txt par OpenAI. La documentation officielle d’OpenAI (developers.openai.com/api/docs/bots) précise que les modifications de robots.txt prennent environ 24 heures à être prises en compte par les systèmes OpenAI. Concrètement : si vous bloquez GPTBot ce matin, l’effet est généralement visible le lendemain dans les logs Cloudflare AI Crawl Control.
Le piège du blocage générique. L’erreur la plus fréquente que nous auditons : un robots.txt avec User-agent: * + Disallow: /, ou un Disallow: / ciblé sur GPTBot, censé « bloquer ChatGPT ». Conséquence : OAI-SearchBot, le crawler temps réel utilisé par SearchGPT, est aussi bloqué dans le second cas, et l’utilisateur disparaît littéralement des citations ChatGPT. Le bon comportement : autoriser explicitement OAI-SearchBot et Claude-SearchBot avant la règle générique, et bloquer sélectivement GPTBot et ClaudeBot si la stratégie est de ne pas alimenter le training.
Configuration de référence pour 2026. Une configuration GEO-optimisée typique en 2026 :
Famille 1 vs Famille 2, règle de raisonnement. Avant chaque ligne robots.txt, posez-vous deux questions. (1) Ce bot fait-il du retrieval temps réel (alors je veux être cité) ? (2) Ou fait-il du training (alors je décide selon ma politique propriété intellectuelle) ? Confondre les deux est la cause numéro un de l’invisibilité GEO involontaire. Le portefeuille GEO Rocket, expertcafe.be, zeroproof.one, expertvin.be, utilise une configuration symétrique : retrieval autorisé partout, training autorisé sauf sections internes (/admin/, /draft/, /staging/).
Vérifier l’effet via Cloudflare AI Crawl Control. Le dashboard Cloudflare (passé en GA en 2025, généralisé en 2026) liste précisément les requêtes par user-agent et indique si elles respectent ou contournent vos directives. C’est l’outil de référence pour valider qu’une politique robots.txt fonctionne en pratique, l’observation prime sur l’intention.
Configuration de référence : robots.txt PROEMA détaillé ligne par ligne
La configuration robots.txt validée par PROEMA en mai 2026 distingue trois familles d’agents IA documentées par OpenAI sur platform.openai.com/docs/bots. La première famille (training) est bloquée par défaut. La seconde (search/retrieval temps réel) est autorisée car elle alimente directement les réponses citables. La troisième (user-driven) est autorisée car elle représente un utilisateur réel qui interagit avec ChatGPT ou Perplexity.
« Le robots.txt 2026 ne se discute plus en mode défensif. Il se conçoit comme une grille tarifaire entre training (refusé), retrieval (autorisé) et user-driven (encouragé). »
Les 24 user-agents IA documentés mai 2026
- Famille training (7 agents) : GPTBot, ClaudeBot, anthropic-ai, Bytespider, Diffbot, CCBot, Omgili. Recommandation :
Disallow: /. - Famille retrieval temps réel (9 agents) : OAI-SearchBot, PerplexityBot, ClaudeBot-User (depuis novembre 2025), Bing-AI (alias Bingbot pour Copilot), Google-Extended (à débat : séparer search core), Mistral-User, Perplexity-User, Cohere-AI, You.com bot. Recommandation :
Allow: /. - Famille user-driven (8 agents) : ChatGPT-User (clic depuis ChatGPT), Claude-Web (clic depuis Claude.ai), Perplexity-User, Meta-ExternalAgent, FacebookAIBot, Cohere-AI, Applebot-Extended, OpenAI-Operator. Recommandation :
Allow: /.
Cas pratique sectoriel : pourquoi un caviste premium doit appliquer cette config
Sur le portefeuille GEO Rocket, l’application stricte de cette grille a généré sur expertvin.be (lancement avril 2026) un gain mesurable : citation rate Perplexity passé de 0 % à 23 % en 6 semaines, citation rate ChatGPT Search de 0 % à 14 % sur le même panel. Le levier le plus contributif n’est pas le déblocage massif, c’est la cohérence entre robots.txt, llms.txt et sitemap.xml : les trois fichiers doivent pointer vers les mêmes URLs canoniques, sans contradiction. Une seule incohérence (par exemple sitemap qui liste /produits/* mais robots.txt qui bloque /produits/) suffit à dégrader le citation rate sur cette section entière.
Le piège du fail-safe Cloudflare AI Crawl Control
Depuis octobre 2025, Cloudflare propose un toggle « Block AI Bots » côté dashboard (blog.cloudflare.com). Activé par défaut sur 38 % des plans Pro selon les chiffres publics Cloudflare Q1 2026. Ce toggle override silencieusement le robots.txt côté worker, résultat : la configuration éditoriale est correcte, mais le serveur retourne 403 à OAI-SearchBot et PerplexityBot. Diagnostic systématique PROEMA en démarrage d’audit : tester chaque user-agent IA via curl -A "OAI-SearchBot" avant d’auditer le robots.txt.
Monétisation pay-per-crawl : où en est-on en mai 2026
Le mécanisme HTTP 402 (Payment Required) annoncé par Cloudflare en septembre 2024 reste expérimental. Aucune des trois familles LLM majeures (OpenAI, Anthropic, Perplexity) n’a, à mai 2026, communiqué publiquement de programme structuré de rémunération éditeurs à grande échelle. Les accords existants (OpenAI / Axel Springer, OpenAI / Le Monde, OpenAI / Reuters) restent bilatéraux et confidentiels. Recommandation PROEMA : surveiller mais ne pas attendre, la fenêtre de citation rate gratuite reste l’avantage compétitif principal pour 2026-2027.