Blokkeer de trainer, niet de bron van je citaties.
GPTBot traint. OAI-SearchBot citeert. ChatGPT-User haalt op omdat een bezoeker er nu om vraagt. Wie ze op een hoop gooit in robots.txt, verliest zichtbaarheid zonder er iets voor terug te krijgen.
Definitie
AI-crawler
Een AI-crawler is een geautomatiseerde bot die webpagina’s ophaalt voor een AI-systeem. Er zijn drie soorten, met heel verschillende gevolgen: trainingscrawlers die content verzamelen om modellen mee te trainen (GPTBot, ClaudeBot, CCBot), zoek- of groundingcrawlers die een index opbouwen waaruit AI-antwoorden citeren (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot), en user-initiated fetchers die een enkele pagina ophalen omdat een gebruiker er op dat moment naar vraagt (ChatGPT-User, Claude-User, Perplexity-User). Je stuurt ze met robots.txt, maar je firewall heeft het laatste woord.
Zie ook: Zichtbaar in ChatGPTllms.txtAI-SEOGenerative engine optimization
Waarom het verschil tussen deze bots ertoe doet
De meeste blokkeeradviezen gooien alles wat AI heet in een lijst met Disallow eronder. Dat is precies de verkeerde beweging. Een trainingscrawler blokkeren beschermt je content tegen hergebruik in een model. Een zoekcrawler of user-initiated fetcher blokkeren zorgt ervoor dat je nooit meer als bron in een antwoord verschijnt. Dezelfde regel, tegenovergestelde uitkomst.
1. Training
OpenAI beschrijft GPTBot als de crawler die content ophaalt die hun foundation models kan trainen. Anthropic zegt hetzelfde over ClaudeBot: die verzamelt webcontent die aan training kan bijdragen. CCBot van Common Crawl is geen AI-bedrijf, maar het publieke archief dat het aanlegt is jarenlang een van de grootste trainingsbronnen geweest. Google-Extended en Applebot-Extended horen hier ook thuis, met een verschil: dat zijn geen crawlers maar besturingstokens. Blokkeer je deze groep, dan verlies je geen zichtbaarheid.
2. Grounding en retrieval
Dit is de groep die je citaties oplevert. OpenAI schrijft dat OAI-SearchBot websites toont in de zoekresultaten binnen ChatGPT en niet voor training wordt gebruikt. Anthropic zegt dat Claude-SearchBot het web doorloopt om de kwaliteit van zoekresultaten te verbeteren. Perplexity beschrijft PerplexityBot als bedoeld om websites te tonen en te linken in Perplexity-resultaten, expliciet niet voor foundation models. Blokkeer je deze groep, dan verdwijn je uit de antwoorden.
3. User-initiated fetches
ChatGPT-User, Claude-User en Perplexity-User halen een pagina op omdat een mens net een vraag stelde of een link plakte. Geen index, geen training: het is een bezoeker met een tussenpersoon. Deze blokkeren is hetzelfde als een klant de deur wijzen omdat iemand anders hem heeft gebracht.
Wie is wie, en wat kost blokkeren?
De tabel hieronder vat de officiele documentatie van OpenAI, Anthropic, Perplexity, Google en Apple samen. Lees hem als: levert deze bot je citaties op, en levert hij trainingsdata op?
De AI-crawlers die er in 2026 toe doen.
Bron: de bot-documentatie van OpenAI, Anthropic, Perplexity, Google Search Central en Apple.
| Levert citaties op | Levert trainingsdata op | |
|---|---|---|
| GPTBot (OpenAI) | Levert geen citaties op | Crawlt content die de foundation models kan trainen |
| OAI-SearchBot (OpenAI) | Toont en linkt je site in de zoekfunctie van ChatGPT | Niet gebruikt voor training |
| ChatGPT-User (OpenAI) | Haalt een pagina op omdat een gebruiker er nu om vraagt | Niet gebruikt voor training |
| ClaudeBot (Anthropic) | Levert geen citaties op | Verzamelt content die aan training kan bijdragen |
| Claude-SearchBot (Anthropic) | Bouwt de zoekindex achter Claude-antwoorden | Nee |
| Claude-User (Anthropic) | Bezoekt een pagina op verzoek van de gebruiker | Nee |
| PerplexityBot | Toont en linkt je site in Perplexity-resultaten | Niet gebruikt voor foundation models |
| Perplexity-User | Bezoekt een pagina op verzoek van de gebruiker | Nee |
| Google-Extended | Geen eigen user-agent, alleen een robots.txt-token | Gemini-training en grounding in Gemini Apps en Vertex AI |
| Bingbot (Microsoft) | Bing-index, historisch de basis onder ChatGPT-zoeken | Nee |
| CCBot (Common Crawl) | Publiek archief, geen zoekmachine | Veelgebruikte trainingsbron voor talloze modellen |
| Applebot-Extended | Crawlt zelf geen pagina’s | Bepaalt of Applebot-data Apple’s foundation models traint |
Google-Extended en Applebot-Extended zijn robots.txt-tokens zonder eigen user-agent: ze sturen hoe al gecrawlde data gebruikt mag worden. Google documenteert expliciet dat Google-Extended geen invloed heeft op je opname in Google Search en geen rankingsignaal is.
Welke robots.txt past bij jou?
Er zijn drie realistische houdingen. Kies er een bewust, en onthoud dat robots.txt een verzoek is en geen slot: nette crawlers houden zich eraan, kwaadwillende partijen niet.
A. Alles toestaan (de standaard voor vrijwel elk MKB-bedrijf)
Wil je klanten uit AI-zoeken en heeft je content geen betaalde archiefwaarde, dan is dit de juiste keuze. Een ontbrekende of lege robots.txt betekent al alles toegestaan; schrijf het toch uit, met je sitemap erbij.
User-agent: *
Allow: /
Sitemap: https://jouwdomein.nl/sitemap.xml
B. Ophalen en citeren toestaan, trainen blokkeren
De verdedigbare middenweg voor uitgevers en kennisintensieve bedrijven: genoemd worden in antwoorden, zonder gratis het trainingsmateriaal te leveren. Elke user-agent krijgt zijn eigen blok.
# Trainen: nee
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
# Citeren en ophalen: ja
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Bingbot
Allow: /
User-agent: *
Allow: /
Sitemap: https://jouwdomein.nl/sitemap.xml
C. Alles blokkeren
Alleen zinnig als je content zelf het product is en elke AI-verwijzing je omzet kost. De prijs: je verdwijnt als bron uit ChatGPT, Claude en Perplexity, ook wanneer een bestaande klant er expliciet naar vraagt.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /
De blokkade die je nooit ziet
Dit is de belangrijkste waarschuwing op deze pagina. Blokkeren gebeurt zelden bewust in robots.txt; het gebeurt per ongeluk, een laag lager, in je WAF of bot-management.
Cloudflare zette in juli 2025 het blokkeren van AI-crawlers standaard aan voor nieuwe domeinen. Daarnaast bestaat er een managed robots.txt met een knop Enforce robots.txt rules, die een WAF-regel plaatst: die regel blokkeert op netwerkniveau, ongeacht wat er in jouw eigen robots.txt staat. Bot Fight Mode challenget bovendien verkeer dat niet op een browser lijkt, en dat is precies hoe een crawler eruitziet.
Het gemene is dat je hier niets van merkt. Search Console rapporteert alleen over Googlebot. Een 403 voor GPTBot of PerplexityBot verschijnt daar nooit. Je robots.txt zegt netjes Allow, je analytics zegt niets, en ondertussen komt er geen enkele AI-fetcher binnen. Verifieer dus aan de rand, niet in het bestand.
Zo controleer je of AI-crawlers er echt in kunnen.
Haal je robots.txt op zoals een bot dat doet. curl -A "GPTBot" https://jouwdomein.nl/robots.txt. Krijg je iets anders terug dan in je browser, dan grijpt er iets in tussen bot en bestand.
Vraag een echte pagina op met een AI-user-agent. curl -sI -A "OAI-SearchBot" https://jouwdomein.nl/. Een 200 is goed. Een 403, 503 of een challenge-pagina betekent dat je firewall blokkeert terwijl robots.txt toestaat.
Loop je Cloudflare-instellingen langs. Kijk bij Bot Fight Mode, AI Crawl Control en managed robots.txt. Deze drie kunnen je robots.txt overrulen zonder dat je iets hebt aangezet.
Lees je serverlogs, niet Search Console. Filter op GPTBot, OAI-SearchBot, ClaudeBot en PerplexityBot en kijk naar de statuscodes. Dit is de enige plek waar de waarheid staat.
Moet ik dan een llms.txt aanmaken?
Het mag, het kost vijf minuten en er is vandaag geen gemeten opbrengst. Ahrefs onderzocht in mei 2026 137.000 domeinen en vond dat 97% van de llms.txt-bestanden nul verzoeken kreeg. Van de verzoeken die wel binnenkwamen, was 1,1% afkomstig van AI-ophaalbots.
De leveranciers zeggen hetzelfde. John Mueller stelde in juni 2025 dat geen enkel AI-systeem llms.txt op dat moment gebruikte, en Google’s eigen documentatie is expliciet: "You don't need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search (including its generative AI capabilities)." Bijna nul kosten, bijna nul gemeten rendement. Wie je resultaat belooft op basis van llms.txt, verkoopt iets wat niemand kan aantonen.
Vergeet Bing niet
De zoekfunctie van ChatGPT leunde lang op de index van Bing; OpenAI crawlt daarnaast zelf met OAI-SearchBot. Je sitemap indienen bij Bing Webmaster Tools kost tien minuten en is een van de weinige knoppen die je hier echt in handen hebt. Blokkeer Bingbot dus niet voor de zekerheid bij het opruimen van AI-bots.
Hoe FWRD hiermee omgaat
Elke FWRD-site staat standaard open voor zoek- en retrieval-crawlers en dient zijn sitemap automatisch in. Er zit geen bot-management voor dat per ongeluk AI-fetchers tegenhoudt, en de pagina’s zijn statische HTML: wat een crawler ophaalt, is wat een bezoeker ziet.
Bij dit onderwerp
- Zichtbaar in ChatGPT Wat wel bepaalt of je geciteerd wordt.
- llms.txt Het bestand waarvan 97% van de kopieen nul verzoeken kreeg.
- AI-SEO uitgelegd Hoe AI het SEO-vak in twee richtingen verandert.
- Generative Engine Optimization Optimaliseren voor gegenereerde antwoorden.
- Voor developers De techniek onder een FWRD-site.
- SEO bij FWRD Wat er automatisch geregeld wordt.
Open voor de bots die klanten opleveren.