Le pattern 2026 robots.txt : Allow search, Disallow training, expliqué pas à pas

Le pattern robots.txt qui s'est installé en 2026 dissocie deux usages des bots IA : la recherche live (search) qu'on autorise, l'entraînement (training) qu'on bloque. Mode d'emploi.

Note PROEMA (2026-06) : ce pattern est la recommandation par défaut de l’agence pour un client qui veut préserver son IP. Le site proema.be fait, lui, l’exception inverse assumée : il autorise les crawlers d’entraînement, car pour une agence GEO, être absorbé dans la connaissance des modèles est un objectif en soi. Le raisonnement ci-dessous reste valable pour la plupart des marques.

1. L’enjeu : deux usages, deux régimes

Un même domaine peut être lu par les bots IA de deux manières radicalement différentes. Le premier usage est l’entraînement, où le contenu est aspiré pour nourrir le modèle de fond d’un LLM, sans citation, sans lien, sans revenu pour la marque source. Le deuxième usage est la recherche live, où le bot va chercher du contenu en temps réel pour répondre à une question utilisateur, avec citation explicite et lien retour.

Le pattern 2026 consiste à autoriser la recherche, qui rapporte de la visibilité, et à bloquer l’entraînement, qui n’en rapporte aucune. C’est l’arbitrage que portent les portefeuilles GEO Rocket depuis avril 2026 et que recommande le standard PGSM v1.0.

Allow search, disallow training. Cette grammaire en deux temps est devenue le standard implicite des marques B2B en juin 2026.

2. Les bots à connaître nommément

Le RFC 9309 régit la grammaire robots.txt depuis 2022. Les principaux bots à autoriser pour le search sont : OAI-SearchBot (OpenAI live search), PerplexityBot (Perplexity), ClaudeBot (Anthropic) en mode citation, Google-Extended (Google AI Overviews et Gemini live), Bingbot (Bing Copilot). Les bots à bloquer pour le training sont : GPTBot (entraînement OpenAI), CCBot (Common Crawl, source de training tierce), anthropic-ai (entraînement Anthropic).

Trois bots sont ambigus et méritent une décision marque par marque : Applebot-Extended (Apple Intelligence training), facebookexternalhit (Meta training), bytespider (ByteDance). Le standard PROEMA recommande de les bloquer par défaut sauf intention commerciale explicite vers ces écosystèmes.

3. Le template robots.txt 2026

Voici le template que portent les trois sites du portefeuille GEO Rocket. Il est public, vérifiable sur expertcafe.be/robots.txt, zeroproof.one/robots.txt, expertvin.be/robots.txt.

BotPolitiqueJustification
OAI-SearchBotAllowSearch live ChatGPT, source de citations
PerplexityBotAllowCitations Perplexity directes
Google-ExtendedAllowAI Overviews et Gemini search
BingbotAllowCopilot et Bing AI Performance
ClaudeBotAllowCitations Claude 3.5+
GPTBotDisallowEntraînement OpenAI, zéro revenu
CCBotDisallowTraining tiers, zéro contrôle
anthropic-aiDisallowEntraînement Anthropic distinct de ClaudeBot

4. Le piège des wildcards

L’erreur la plus fréquente, observée sur près de quarante pour cent des sites BtoB francophones audités au premier trimestre 2026, est l’usage d’un User-agent: * Disallow: /. Cette ligne bloque tout, search et training confondus. Résultat : le site disparaît à la fois des LLMs et de Google.

Le standard est d’écrire explicitement chaque bot autorisé et de ne pas s’appuyer sur des wildcards. Le RFC 9309 précise que les bots évaluent les règles dans l’ordre, en s’arrêtant à la première qui matche. Une politique mal ordonnée bloque silencieusement les bons bots.

5. Comment vérifier que la politique fonctionne

Trois outils permettent de vérifier en moins de dix minutes. Le testeur robots.txt de Google Search Console, qui simule l’évaluation par Googlebot. Le rapport Cloudflare AI Crawl Control, qui logge en temps réel chaque visite des bots IA et leur traitement. La commande curl avec l’en-tête User-Agent du bot ciblé, qui valide la réponse HTTP attendue.

La règle d’or : tester chaque déploiement robots.txt sur ces trois outils avant publication, et conserver les logs Cloudflare sur trois mois pour vérifier qu’aucun bot ne change de comportement à l’insu de la marque.

robots.txt en 2026 n’est plus un fichier technique caché. C’est la première ligne de la politique GEO d’une marque, lue par les bots et auditable par les concurrents.

source: Standard PGSM v1.0 · section robots.txt

Le diagnostic GEO PROEMA inclut un audit complet du fichier robots.txt en quinze points. Lecture en cinq minutes, recommandations directement copiables dans le fichier.

Commencer

Votre marque est-elle citable par l'IA ?

Recevez gratuitement votre score GEO et demandez ensuite un diagnostic GEO complet : ce que ChatGPT, Perplexity et Gemini voient (ou ne voient pas) de vous aujourd'hui.