Qu'est-ce qu'un crawler IA et pourquoi je devrais m'en soucier ?
Un crawler IA est un programme automatique qui parcourt le web pour alimenter les LLMs. GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot, GoogleBot Gemini sont les principaux. Si vous bloquez ces crawlers via robots.txt, vous devenez invisible aux IA. Si vous les laissez passer, votre contenu nourrit les modeles.
Qu'est-ce qu'un crawler IA et pourquoi je devrais m'en soucier, côté chiffres ?
Un crawler IA est un robot logiciel qui explore le web pour le compte d'un fournisseur d'intelligence artificielle. Il existe au moins 24 user-agents identifiables en 2026, répartis en trois familles fonctionnelles distinctes, et c'est cette distinction qui change tout pour votre stratégie d'autorisation.
Famille 1, Crawlers d'entraînement. Ces robots collectent du contenu pour entraîner les futurs modèles. Les principaux : GPTBot (OpenAI, documentation officielle depuis août 2023), ClaudeBot (Anthropic), Google-Extended (Google Gemini), CCBot (Common Crawl, qui alimente une partie des datasets d'entraînement open-source), Bytespider (TikTok/ByteDance). Bloquer ces crawlers ne retire pas votre site des réponses générées, ça empêche seulement votre contenu d'entrer dans le prochain corpus d'entraînement. Beaucoup d'éditeurs presse (NYT, Reuters, AFP) ont opt-out de cette famille après l'affaire NYT v. OpenAI.
Famille 2, Crawlers de retrieval temps réel. Ces robots crawlent à la demande quand un utilisateur pose une question dans ChatGPT, Perplexity ou Claude. Les principaux : OAI-SearchBot (OpenAI, mode browsing et SearchGPT), Claude-SearchBot (Anthropic), PerplexityBot (Perplexity). Si vous bloquez cette famille, vous disparaissez littéralement des citations LLM. « Bloquer GPTBot ne bloque pas OAI-SearchBot, les deux demandent des directives séparées dans le robots.txt, et c'est une erreur que je vois souvent », précise Lorenzo Eeman, fondateur de PROEMA.
Famille 3, Crawlers utilisateur. Ces robots fetch une URL à la demande explicite d'un utilisateur (qui copie-colle un lien dans le chat). Le principal : Claude-User. Ils ne crawlent jamais en masse.
Pourquoi vous en soucier ? Selon les données Cloudflare AI Crawl Control, le trafic crawler IA peut atteindre 5 à 15 % du trafic total d'un site éditorial premium en 2026. Trois enjeux concrets pour un dirigeant : visibilité dans les réponses LLM (autoriser le retrieval temps réel est un prérequis non négociable), monétisation potentielle (Cloudflare a lancé en 2025 le pay-per-crawl qui retourne un HTTP 402 aux crawlers IA et permet la facturation), maîtrise du brand (vous décidez quel angle de votre marque entre dans les corpus). Le diagnostic minimum : auditer son robots.txt et activer le dashboard Cloudflare AI Crawl Control pour cartographier qui crawle aujourd'hui sans qu'on le sache.
| Crawler | Editeur | Lance | A autoriser ? |
|---|---|---|---|
| GPTBot | OpenAI | aout 2023 | Oui (visibilite ChatGPT) |
| ClaudeBot | Anthropic | 2023 | Oui (Claude) |
| PerplexityBot | Perplexity | 2024 | Oui (Perplexity) |
| Applebot-Extended | Apple | 2024 | Oui si EU |
| GoogleBot (Gemini) | 2024 | Oui (AI Overviews) |