robots d'IA

Bloquez celui qui entraîne, pas la source de vos citations.

GPTBot entraîne. OAI-SearchBot cite. ChatGPT-User récupère la page parce qu'un visiteur vient de le demander. Mettez-les tous dans le même sac dans robots.txt et vous perdez en visibilité sans rien protéger.

Commencer gratuitement

Définition

Robot d'exploration IA

Un crawler IA est un bot automatisé qui récupère des pages web pour le compte d'un système d'IA. Il en existe trois types, aux conséquences très différentes : les crawlers d'entraînement qui collectent du contenu pour entraîner les modèles (GPTBot, ClaudeBot, CCBot), les crawlers de recherche et de grounding qui construisent l'index d'où les réponses IA tirent leurs citations (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot), et les récupérateurs déclenchés par l'utilisateur qui vont chercher une seule page parce qu'une personne vient de la demander (ChatGPT-User, Claude-User, Perplexity-User). Vous les orientez avec robots.txt, mais c'est votre pare-feu qui a le dernier mot.

Voir aussi : Être cité par ChatGPTllms.txtSEO IAOptimisation des moteurs génératifs

Pourquoi la différence entre ces bots compte

La plupart des conseils de blocage jettent tout ce qui a « AI » dans le nom dans une seule liste avec un Disallow en dessous. C'est exactement la mauvaise manœuvre. Bloquer un crawler d'entraînement protège votre contenu d'une réutilisation dans un modèle. Bloquer un crawler de recherche ou un récupérateur déclenché par l'utilisateur signifie que vous n'apparaîtrez plus jamais comme source dans une réponse. Même directive, résultat inverse.

1. Formation

OpenAI décrit GPTBot comme le crawler qui collecte du contenu susceptible d'entraîner ses modèles de fondation. Anthropic dit la même chose de ClaudeBot : il collecte du contenu web qui peut contribuer à l'entraînement. CCBot appartient à Common Crawl, qui n'est pas une entreprise d'IA, mais l'archive publique qu'elle construit est depuis des années l'une des plus grandes sources d'entraînement. Google-Extended et Applebot-Extended entrent aussi dans cette catégorie, à une différence près : ce sont des jetons de contrôle, pas des crawlers. Bloquez ce groupe et vous ne perdez aucune visibilité.

2. Mise à la terre et récupération

C'est ce groupe qui vous rapporte des citations. OpenAI indique qu'OAI-SearchBot fait remonter des sites web dans les résultats de recherche de ChatGPT et n'est pas utilisé pour l'entraînement. Anthropic dit que Claude-SearchBot parcourt le web pour améliorer la qualité des résultats de recherche. Perplexity décrit PerplexityBot comme conçu pour faire apparaître et lier des sites web dans les résultats de Perplexity, explicitement pas pour les modèles de fondation. Bloquez ce groupe et vous disparaissez des réponses.

3. Récupérations initiées par l'utilisateur

ChatGPT-User, Claude-User et Perplexity-User récupèrent une page parce qu'un humain vient de poser une question ou de coller un lien. Pas d'index, pas d'entraînement : c'est un visiteur avec un intermédiaire. Bloquer ceux-là revient à refouler un client parce que quelqu'un d'autre l'a conduit à votre porte.

Qui est qui, et combien coûte le blocage ?

Le tableau ci-dessous résume la documentation officielle d'OpenAI, Anthropic, Perplexity, Google et Apple. Lisez chaque ligne ainsi : ce bot me rapporte-t-il des citations, et produit-il des données d'entraînement ?

Référence

Les robots d'exploration IA qui comptent en 2026.

Source : la documentation des bots d'OpenAI, Anthropic, Perplexity, Google Search Central et Apple.

  Gagne des citations Produit des données d’entraînement
GPTBot (OpenAI) Ne produit aucune citation Crawle du contenu qui peut entraîner les modèles de base
OAI-SearchBot (OpenAI) Fait apparaître et lie votre site dans la recherche ChatGPT Non utilisé pour la formation
ChatGPT-Utilisateur (OpenAI) Récupère une page parce qu'un utilisateur vient de la demander Non utilisé pour la formation
ClaudeBot (Anthropic) Ne produit aucune citation Collecte du contenu web qui peut servir à l'entraînement
Claude-SearchBot (Anthropic) Construit l'index de recherche derrière les réponses de Claude Nee
Claude-Utilisateur (Anthropic) Visite une page à la demande de l’utilisateur Nee
PerplexityBot Fait apparaître et lie votre site dans les résultats Perplexity Non utilisé pour les modèles de fondation
Perplexity-Utilisateur Visite une page à la demande de l’utilisateur Nee
Google-Étendu Pas de user agent propre, seulement un token robots.txt L'entraînement et l'ancrage de Gemini dans Gemini Apps et Vertex AI
Bingbot (Microsoft) L'index de Bing, historiquement la base de la recherche ChatGPT Nee
CCBot (Common Crawl) Archive publique, pas un moteur de recherche Une source d'entraînement de longue date pour beaucoup de modèles
Applebot-Étendu Ne parcourt pas les pages lui-même Détermine si les données d'Applebot entraînent les modèles de base d'Apple

Google-Extended et Applebot-Extended sont des jetons robots.txt sans user agent propre : ils régissent la façon dont des données déjà explorées peuvent être utilisées. Google documente explicitement que Google-Extended n'affecte pas votre présence dans Google Search et n'est pas un signal de classement.

Quel robots.txt te convient ?

Il existe trois positions réalistes. Choisissez-en une en connaissance de cause, et rappelez-vous que robots.txt est une demande, pas un verrou : les crawlers corrects le respectent, les autres non.

A. Tout autoriser (le choix par défaut pour presque toute petite entreprise)

Si vous voulez des clients venus de la recherche IA et que votre contenu n'a pas de valeur d'archive payante, c'est le bon choix. Un robots.txt absent ou vide signifie déjà que tout est autorisé ; écrivez-le quand même, avec votre sitemap à côté.

Agent-utilisateur : *

Autoriser : /

Sitemap : https://yourdomain.com/sitemap.xml

B. Autoriser la récupération et la citation, bloquer l'entraînement

Le compromis défendable pour les éditeurs et les entreprises riches en savoir : être cité dans les réponses sans offrir sa matière d'entraînement. Chaque user agent a besoin de sa propre règle.

# Formation : non

Agent-utilisateur : GPTBot

Interdire : /

User-agent: ClaudeBot

Interdire : /

Agent-utilisateur : CCBot

Interdire : /

User-agent: Google-Extended

Interdire : /

User-agent: Applebot-Extended

Interdire : /

# Citer et récupérer : oui

User-agent: OAI-SearchBot

Autoriser : /

User-agent: ChatGPT-User

Autoriser : /

Agent-utilisateur : Claude-SearchBot

Autoriser : /

Agent-utilisateur : Claude-User

Autoriser : /

User-agent: PerplexityBot

Autoriser : /

User-agent: Perplexity-User

Autoriser : /

User-agent: Bingbot

Autoriser : /

Agent-utilisateur : *

Autoriser : /

Sitemap : https://yourdomain.com/sitemap.xml

C. Bloquer tout

Uniquement sensé quand votre contenu est le produit et que chaque référence faite par une IA vous coûte du chiffre d'affaires. Le prix à payer : vous disparaissez comme source de ChatGPT, Claude et Perplexity, y compris quand un client existant se renseigne explicitement sur vous.

Agent-utilisateur : GPTBot

User-agent: OAI-SearchBot

User-agent: ChatGPT-User

User-agent: ClaudeBot

Agent-utilisateur : Claude-SearchBot

Agent-utilisateur : Claude-User

User-agent: PerplexityBot

User-agent: Perplexity-User

Agent-utilisateur : CCBot

User-agent: Google-Extended

User-agent: Applebot-Extended

Interdire : /

Le bloc que vous ne voyez jamais

C'est l'avertissement le plus important de cette page. Le blocage est rarement une décision volontaire dans robots.txt ; il arrive par accident, une couche plus bas, dans votre WAF ou votre gestion des bots.

En juillet 2025, Cloudflare a activé par défaut le blocage des crawlers IA pour les nouveaux domaines. Il fournit aussi un robots.txt géré avec une option Enforce robots.txt rules qui déploie une règle WAF, et cette règle bloque au niveau réseau, quoi que dise votre propre robots.txt. Bot Fight Mode soumet en plus à un défi le trafic qui ne ressemble pas à un navigateur, ce qui est précisément l'allure d'un crawler.

Le plus cruel, c'est que rien ne vous le dit. Search Console ne rapporte que sur Googlebot, donc un 403 servi à GPTBot ou PerplexityBot n'y apparaît jamais. Votre robots.txt dit Allow, vos statistiques ne disent rien, et pendant ce temps aucun récupérateur IA ne passe. Vérifiez au niveau du edge, pas dans le fichier.

Vérifier

Comment vérifier que les crawlers IA peuvent vraiment entrer.

Demandez votre robots.txt comme le fait un bot. curl -A "GPTBot" https://yourdomain.com/robots.txt. Si vous obtenez autre chose que ce que voit votre navigateur, quelque chose intercepte entre le bot et le fichier.

Demandez une vraie page avec un user agent IA. curl -sI -A "OAI-SearchBot" https://yourdomain.com/. Un 200, c'est bon. Un 403, un 503 ou une page de challenge veut dire que votre pare-feu bloque ce que robots.txt autorise.

Parcourez vos paramètres Cloudflare. Vérifiez Bot Fight Mode, AI Crawl Control et le robots.txt managé. Ces trois-là peuvent passer outre votre robots.txt sans que vous ayez activé quoi que ce soit.

Lisez les logs de votre serveur, pas Search Console. Filtrez sur GPTBot, OAI-SearchBot, ClaudeBot et PerplexityBot et regardez les codes de statut. C'est le seul endroit où se trouve la vérité.

Alors devrais-je publier un llms.txt ?

Vous pouvez, cela prend cinq minutes, et il n'y a aucun retour mesuré aujourd'hui. En mai 2026, Ahrefs a étudié 137 000 domaines et constaté que 97 % des fichiers llms.txt n'avaient reçu aucune requête. Parmi les requêtes qui sont bien arrivées, les bots de récupération IA représentaient 1,1 %.

Les fournisseurs disent la même chose. John Mueller a déclaré en juin 2025 qu'aucun système d'IA n'utilise actuellement llms.txt, et la documentation de Google est explicite : « Vous n'avez pas besoin de créer de nouveaux fichiers lisibles par machine, fichiers texte pour l'IA, balisages ou Markdown pour apparaître dans Google Search (y compris ses fonctionnalités d'IA génératives). » Un coût de mise en place quasi nul, un retour mesuré quasi nul. Quiconque promet des résultats avec llms.txt vend quelque chose que personne ne peut démontrer.

Ne pas oublier Bing

La recherche de ChatGPT s'est longtemps appuyée sur l'index de Bing ; OpenAI explore en plus avec son propre OAI-SearchBot. Soumettre votre sitemap à Bing Webmaster Tools prend dix minutes et c'est l'un des rares leviers que vous contrôlez vraiment ici. Ne bloquez donc pas Bingbot par précaution en faisant le tri dans les bots IA.

Comment FWRD gère cela

Chaque site FWRD est ouvert par défaut aux crawlers de recherche et de récupération et soumet son sitemap automatiquement. Il n'y a pas de gestion de bots devant lui qui arrête accidentellement les récupérateurs IA, et les pages sont du HTML statique : ce qu'un crawler récupère est ce qu'un visiteur voit.

Ouvert aux robots qui attirer des clients.

Commencer gratuitement
question 1 of 4

Where are you now?

One choice. We'll match the right plan.