---
title: "AI-Crawler: in robots.txt blockieren oder erlauben | FWRD"
description: "GPTBot, ClaudeBot, PerplexityBot und Google-Extended: wer trainiert, wer zitiert, wer abruft. robots.txt zum Kopieren, plus die Blockade, die Sie nie sehen."
url: "https://fwrd.digital/de/glossary/ai-crawlers"
published: "2026-07-24T15:40:08Z"
modified: "2026-08-06T16:15:58Z"
---

# AI-Crawler: in robots.txt blockieren oder erlauben | FWRD

_KI-Crawler_

## Blockieren Sie den Trainer, nicht die Quelle Ihrer Zitate.

GPTBot trainiert. OAI-SearchBot zitiert. ChatGPT-User ruft ab, weil ein Besucher gerade gefragt hat. Wer sie in robots.txt in einen Topf wirft, verliert Sichtbarkeit, ohne etwas zu schützen.

## KI-Crawler

Ein AI-Crawler ist ein automatisierter Bot, der Webseiten im Auftrag eines AI-Systems abruft. Es gibt drei Arten mit sehr unterschiedlichen Folgen: Trainings-Crawler, die Inhalte sammeln, um Modelle zu trainieren (GPTBot, ClaudeBot, CCBot), Such- und Grounding-Crawler, die den Index aufbauen, aus dem AI-Antworten zitieren (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot), und nutzerinitiierte Fetcher, die eine einzelne Seite abrufen, weil jemand gerade jetzt danach gefragt hat (ChatGPT-User, Claude-User, Perplexity-User). Steuern lassen sie sich über robots.txt, aber das letzte Wort hat Ihre Firewall.

### Gerelateerde begrippen

- [Von ChatGPT zitiert werden](/de/get-cited-by-chatgpt/)
- [llms.txt](/de/glossary/llms-txt/)
- [KI-SEO](/de/glossary/ai-seo/)
- [Generative engine optimization](/de/glossary/generative-engine-optimization/)

## Warum der Unterschied zwischen diesen Bots zählt

Die meisten Blocking-Ratschläge werfen alles mit AI im Namen in eine Liste und setzen ein Disallow darunter. Das ist genau der falsche Schritt. Einen Trainings-Crawler zu sperren, schützt Ihre Inhalte davor, in einem Modell wiederverwendet zu werden. Einen Such-Crawler oder nutzerinitiierten Fetcher zu sperren, heißt, dass Sie nie wieder als Quelle in einer Antwort auftauchen. Dieselbe Direktive, das umgekehrte Ergebnis.

### 1. Ausbildung

OpenAI beschreibt GPTBot als den Crawler, der Inhalte sammelt, die seine Foundation Models trainieren können. Anthropic sagt dasselbe über ClaudeBot: er sammelt Webinhalte, die zum Training beitragen könnten. CCBot gehört zu Common Crawl, das kein AI-Unternehmen ist, aber das öffentliche Archiv, das dort entsteht, ist seit Jahren eine der größten Trainingsquellen. Google-Extended und Applebot-Extended gehören ebenfalls hierher, mit einem Unterschied: Sie sind Steuer-Tokens und keine Crawler. Sperren Sie diese Gruppe, verlieren Sie keine Sichtbarkeit.

### 2. Grounding und Abruf

Das ist die Gruppe, die Ihnen Zitierungen bringt. OpenAI erklärt, dass OAI-SearchBot Websites in den Suchergebnissen in ChatGPT anzeigt und nicht für Training genutzt wird. Anthropic sagt, Claude-SearchBot durchsucht das Web, um die Qualität der Suchergebnisse zu verbessern. Perplexity beschreibt PerplexityBot als darauf ausgelegt, Websites in Perplexity-Ergebnissen zu zeigen und zu verlinken, ausdrücklich nicht für Foundation Models. Sperren Sie diese Gruppe, verschwinden Sie aus den Antworten.

### 3. Vom Nutzer ausgelöste Abrufe

ChatGPT-User, Claude-User und Perplexity-User rufen eine Seite ab, weil ein Mensch gerade eine Frage gestellt oder einen Link eingefügt hat. Kein Index, kein Training: Das ist ein Besucher mit einem Vermittler. Diese zu sperren, ist dasselbe wie einen Kunden abzuweisen, weil ihn jemand anders zu Ihrer Tür gefahren hat.

## Wer ist wer, und was kostet Blockieren?

Die Tabelle unten fasst die offizielle Dokumentation von OpenAI, Anthropic, Perplexity, Google und Apple zusammen. Lesen Sie jede Zeile so: Bringt mir dieser Bot Zitierungen, und erzeugt er Trainingsdaten?

_Referenz_

## Die AI-Crawler, die 2026 zählen.

Quelle: Bot-Dokumentation von OpenAI, Anthropic, Perplexity, Google Search Central und Apple.

| Kenmerk | Verdient Zitate | Erzeugt Trainingsdaten |
| --- | --- | --- |
| GPTBot (OpenAI) | Nee — Bringt keine Zitate | Ja — Crawlt Inhalte, die die Foundation-Modelle trainieren können |
| OAI-SearchBot (OpenAI) | Ja — Zeigt und verlinkt Ihre Website in der ChatGPT-Suche | Nee — Nicht für Training genutzt |
| ChatGPT-User (OpenAI) | Ja — Holt eine Seite, weil ein Nutzer gerade danach gefragt hat | Nee — Nicht für Training genutzt |
| ClaudeBot (Anthropic) | Nee — Bringt keine Zitate | Ja — Sammelt Webinhalte, die zum Training beitragen können |
| Claude-SearchBot (Anthropic) | Ja — Baut den Suchindex hinter Claude-Antworten | Nee |
| Claude-User (Anthropic) | Ja — Besucht eine Seite auf Wunsch des Nutzers | Nee |
| PerplexityBot | Ja — Zeigt und verlinkt Ihre Website in Perplexity-Ergebnissen | Nee — Nicht für Foundation-Modelle genutzt |
| Perplexity-Benutzer | Ja — Besucht eine Seite auf Wunsch des Nutzers | Nee |
| Google-Erweitert | Nee — Kein eigener User Agent, nur ein robots.txt-Token | Ja — Gemini-Training und Grounding in Gemini Apps und Vertex AI |
| Bingbot (Microsoft) | Ja — Bing-Index, historisch die Basis unter der ChatGPT-Suche | Nee |
| CCBot (Common Crawl) | Nee — Öffentliches Archiv, keine Suchmaschine | Ja — Eine langjährige Trainingsquelle für viele Modelle |
| Applebot-Extended | Nee — Crawlt selbst keine Seiten | Ja — Bestimmt, ob Applebot-Daten Apples Foundation-Modelle trainieren |

_Google-Extended und Applebot-Extended sind robots.txt-Tokens ohne eigenen User Agent: Sie regeln, wie bereits gecrawlte Daten genutzt werden dürfen. Google dokumentiert ausdrücklich, dass Google-Extended Ihre Aufnahme in die Google Suche nicht beeinflusst und kein Ranking-Signal ist._

## Welche robots.txt passt zu Ihnen?

Es gibt drei realistische Haltungen. Wählen Sie bewusst eine, und denken Sie daran, dass robots.txt eine Bitte ist und kein Schloss: Anständige Crawler halten sich daran, unseriöse nicht.

### A. Alles erlauben (der Standard für fast jedes kleine Unternehmen)

Wenn Sie Kunden aus der AI-Suche wollen und Ihre Inhalte keinen bezahlten Archivwert haben, ist das die richtige Entscheidung. Eine fehlende oder leere robots.txt bedeutet schon, dass alles erlaubt ist; schreiben Sie sie trotzdem aus, mit Ihrer Sitemap daneben.

`Benutzer-Agent: *`

`Erlaubt: /`

 

`Sitemap: https://yourdomain.com/sitemap.xml`

### B. Abruf und Zitieren erlauben, Training blockieren

Der vertretbare Mittelweg für Publisher und wissensintensive Unternehmen: in Antworten genannt werden, ohne das Trainingsmaterial zu verschenken. Jeder User Agent braucht seinen eigenen Eintrag.

`# Training: nein`

`User-agent: GPTBot`

`Nicht erlauben: /`

`User-agent: ClaudeBot`

`Nicht erlauben: /`

`User-agent: CCBot`

`Nicht erlauben: /`

`User-agent: Google-Extended`

`Nicht erlauben: /`

`User-agent: Applebot-Extended`

`Nicht erlauben: /`

 

`# Zitieren und Abrufen: ja`

`User-agent: OAI-SearchBot`

`Erlaubt: /`

`User-agent: ChatGPT-User`

`Erlaubt: /`

`User-agent: Claude-SearchBot`

`Erlaubt: /`

`User-agent: Claude-User`

`Erlaubt: /`

`User-agent: PerplexityBot`

`Erlaubt: /`

`User-agent: Perplexity-User`

`Erlaubt: /`

`User-agent: Bingbot`

`Erlaubt: /`

 

`Benutzer-Agent: *`

`Erlaubt: /`

 

`Sitemap: https://yourdomain.com/sitemap.xml`

### C. Alles blockieren

Nur sinnvoll, wenn Ihre Inhalte das Produkt sind und jede AI-Referenz Sie Umsatz kostet. Der Preis: Sie verschwinden als Quelle aus ChatGPT, Claude und Perplexity, auch dann, wenn ein bestehender Kunde ausdrücklich nach Ihnen fragt.

`User-agent: GPTBot`

`User-agent: OAI-SearchBot`

`User-agent: ChatGPT-User`

`User-agent: ClaudeBot`

`User-agent: Claude-SearchBot`

`User-agent: Claude-User`

`User-agent: PerplexityBot`

`User-agent: Perplexity-User`

`User-agent: CCBot`

`User-agent: Google-Extended`

`User-agent: Applebot-Extended`

`Nicht erlauben: /`

## Die Blockade, die Sie nie sehen

Das ist die wichtigste Warnung auf dieser Seite. Blockieren ist selten eine bewusste robots.txt-Entscheidung; es passiert versehentlich, eine Ebene tiefer, in Ihrer WAF oder im Bot-Management.

Im Juli 2025 hat Cloudflare das Blockieren von AI-Crawlern für neue Domains standardmäßig aktiviert. Außerdem liefert Cloudflare eine managed robots.txt mit einer Option "Enforce robots.txt rules", die eine WAF-Regel ausrollt, und diese Regel blockiert auf Netzwerkebene, egal was in Ihrer eigenen robots.txt steht. Bot Fight Mode stellt zusätzlich Traffic auf die Probe, der nicht wie ein Browser aussieht, und genau so sieht ein Crawler aus.

Das Gemeine daran ist, dass es Ihnen niemand sagt. Die Search Console berichtet nur über Googlebot, ein 403 an GPTBot oder PerplexityBot erscheint dort also nie. Ihre robots.txt sagt Allow, Ihre Statistiken sagen nichts, und in der Zwischenzeit kommt kein AI-Fetcher durch. Prüfen Sie am Edge, nicht in der Datei.

_Überprüfen_

## So prüfen Sie, ob AI-Crawler wirklich hereinkommen.

1. **Rufen Sie Ihre robots.txt so ab, wie ein Bot es tut** — curl -A "GPTBot" https://yourdomain.com/robots.txt. Wenn dabei etwas anderes herauskommt als in Ihrem Browser, greift zwischen Bot und Datei etwas ein.
2. **Eine echte Seite mit einem AI-User-Agent abrufen** — curl -sI -A "OAI-SearchBot" https://yourdomain.com/. Eine 200 ist in Ordnung. Eine 403, eine 503 oder eine Challenge-Seite heißt: Ihre Firewall blockiert, was robots.txt erlaubt.
3. **Ihre Cloudflare-Einstellungen durchgehen** — Prüfen Sie Bot Fight Mode, AI Crawl Control und managed robots.txt. Alle drei können Ihre robots.txt überstimmen, ohne dass Sie je etwas aktiviert haben.
4. **Lesen Sie Ihre Server-Logs, nicht die Search Console** — Filtern Sie auf GPTBot, OAI-SearchBot, ClaudeBot und PerplexityBot und schauen Sie auf die Statuscodes. Nur hier steht die Wahrheit.

## Soll ich also eine llms.txt veröffentlichen?

Sie dürfen, es dauert fünf Minuten, und es gibt heute keinen messbaren Nutzen. Im Mai 2026 hat Ahrefs 137,000 Domains untersucht und festgestellt, dass 97 % der llms.txt-Dateien null Anfragen erhielten. Von den Anfragen, die ankamen, machten AI-Retrieval-Bots 1.1 % aus.

Die Anbieter sagen dasselbe. John Mueller erklärte im Juni 2025, dass derzeit kein AI-System llms.txt nutzt, und Googles eigene Dokumentation ist eindeutig: "Sie müssen keine neuen maschinenlesbaren Dateien, AI-Textdateien, kein Markup und kein Markdown erstellen, um in der Google Suche (einschließlich ihrer generativen AI-Funktionen) zu erscheinen." Nahezu keine Kosten für die Umsetzung, nahezu kein messbarer Nutzen. Wer Ergebnisse durch llms.txt verspricht, verkauft etwas, das niemand nachweisen kann.

## Bing nicht vergessen

Die Suche in ChatGPT stützte sich lange auf den Bing-Index; zusätzlich crawlt OpenAI mit dem eigenen OAI-SearchBot. Ihre Sitemap in den Bing Webmaster Tools einzureichen, dauert zehn Minuten und ist einer der wenigen Hebel, die Sie hier wirklich in der Hand haben. Sperren Sie also nicht vorsichtshalber Bingbot, wenn Sie bei AI-Bots aufräumen.

## So löst FWRD das

Jede FWRD-Website ist standardmäßig für Such- und Retrieval-Crawler offen und reicht ihre Sitemap automatisch ein. Davor sitzt kein Bot-Management, das versehentlich AI-Fetcher aufhält, und die Seiten sind statisches HTML: Was ein Crawler abruft, ist das, was ein Besucher sieht.

_Weiterlesen_

## Rund um dieses Thema

- [Von ChatGPT zitiert werden](/de/get-cited-by-chatgpt/) — Was wirklich darüber entscheidet, ob Sie zitiert werden.
- [llms.txt](/de/glossary/llms-txt/) — Die Datei, von der 97% der Kopien null Anfragen bekamen.
- [AI-SEO erklärt](/de/glossary/ai-seo/) — Wie AI das SEO in zwei Richtungen verändert.
- [Generative Engine Optimization](/de/glossary/generative-engine-optimization/) — Für generierte Antworten optimieren.
- [Für Entwickler](/de/for-developers/) — Die Technik unter einer FWRD-Website.
- [SEO bei FWRD](/de/produkt/seo/) — Was automatisch erledigt wird.

## Offen für die Bots, die ==Kunden bringen==.

Kostenlos starten. Sitemap, Indexierung und Search Console stimmen ab Tag eins.
