---
title: "Crawlers de IA: bloquéalos o permítelos en robots.txt | FWRD"
description: "GPTBot, ClaudeBot, PerplexityBot y Google-Extended: cuál entrena, cuál cita, cuál consulta. robots.txt para copiar y pegar, más el bloqueo que nunca ves."
url: "https://fwrd.digital/es/glossary/ai-crawlers"
published: "2026-07-24T15:40:12Z"
modified: "2026-08-06T16:16:48Z"
---

# Crawlers de IA: bloquéalos o permítelos en robots.txt | FWRD

_Rastreadores de IA_

## Bloquea al que entrena, no a la fuente de tus citas.

GPTBot entrena. OAI-SearchBot cita. ChatGPT-User consulta porque un visitante lo acaba de pedir. Si los metes en el mismo saco en robots.txt, pierdes visibilidad sin proteger nada.

## Rastreador de IA

Un crawler de IA es un bot automatizado que descarga páginas web en nombre de un sistema de IA. Hay tres tipos, con consecuencias muy distintas: crawlers de entrenamiento que recogen contenido para entrenar modelos (GPTBot, ClaudeBot, CCBot), crawlers de búsqueda y grounding que construyen el índice del que citan las respuestas de IA (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot) y fetchers iniciados por el usuario que descargan una sola página porque alguien la ha pedido en ese momento (ChatGPT-User, Claude-User, Perplexity-User). Los diriges con robots.txt, pero la última palabra la tiene tu firewall.

### Gerelateerde begrippen

- [Que ChatGPT te cite](/es/get-cited-by-chatgpt/)
- [llms.txt](/es/glossary/llms-txt/)
- [SEO de IA](/es/glossary/ai-seo/)
- [Generative engine optimization](/es/glossary/generative-engine-optimization/)

## Por qué importa la diferencia entre estos bots

La mayoría de los consejos sobre bloqueo meten todo lo que lleve IA en el nombre en una sola lista con un Disallow debajo. Eso es exactamente lo contrario de lo que hay que hacer. Bloquear un crawler de entrenamiento protege tu contenido de ser reutilizado dentro de un modelo. Bloquear un crawler de búsqueda o un fetcher iniciado por el usuario significa que no vuelves a aparecer como fuente en una respuesta. Misma directiva, resultado opuesto.

### 1. Entrenamiento

OpenAI describe GPTBot como el crawler que recoge contenido que puede entrenar sus modelos fundacionales. Anthropic dice lo mismo de ClaudeBot: recoge contenido web que podría contribuir al entrenamiento. CCBot es de Common Crawl, que no es una empresa de IA, pero el archivo público que construye ha sido durante años una de las mayores fuentes de entrenamiento. Google-Extended y Applebot-Extended también entran aquí, con una diferencia: son tokens de control, no crawlers. Bloquea este grupo y no pierdes visibilidad.

### 2. Grounding y recuperación

Este es el grupo que te consigue citas. OpenAI dice que OAI-SearchBot muestra webs en los resultados de búsqueda de ChatGPT y no se usa para entrenar. Anthropic dice que Claude-SearchBot navega la web para mejorar la calidad de los resultados de búsqueda. Perplexity describe PerplexityBot como diseñado para mostrar y enlazar webs en los resultados de Perplexity, explícitamente no para modelos fundacionales. Bloquea este grupo y desapareces de las respuestas.

### 3. Consultas iniciadas por el usuario

ChatGPT-User, Claude-User y Perplexity-User descargan una página porque una persona acaba de hacer una pregunta o de pegar un enlace. Sin índice, sin entrenamiento: es un visitante con intermediario. Bloquear estos es lo mismo que echar a un cliente porque le trajo otro hasta tu puerta.

## Quién es quién y qué cuesta bloquearlos.

La tabla de abajo resume la documentación oficial de OpenAI, Anthropic, Perplexity, Google y Apple. Lee cada fila así: ¿este bot me consigue citas, y produce datos de entrenamiento?

_Referencia_

## Los crawlers de IA que importan en 2026.

Fuente: la documentación de bots de OpenAI, Anthropic, Perplexity, Google Search Central y Apple.

| Kenmerk | Gana citas | Produce datos de entrenamiento |
| --- | --- | --- |
| GPTBot (OpenAI) | Nee — No produce ninguna cita | Ja — Rastrea contenido que puede entrenar los modelos base |
| OAI-SearchBot (OpenAI) | Ja — Muestra y enlaza tu web en la búsqueda de ChatGPT | Nee — No se usa para entrenar |
| ChatGPT-User (OpenAI) | Ja — Pide una página porque un usuario la acaba de solicitar | Nee — No se usa para entrenar |
| ClaudeBot (Anthropic) | Nee — No produce ninguna cita | Ja — Recoge contenido web que puede contribuir al entrenamiento |
| Claude-SearchBot (Anthropic) | Ja — Construye el índice de búsqueda detrás de las respuestas de Claude | Nee |
| Claude-User (Anthropic) | Ja — Visita una página a petición del usuario | Nee |
| PerplexityBot | Ja — Muestra y enlaza tu web en los resultados de Perplexity | Nee — No se usa para los modelos base |
| Perplexity-Usuario | Ja — Visita una página a petición del usuario | Nee |
| Google-Extendido | Nee — Sin user agent propio, solo un token en robots.txt | Ja — Entrenamiento y grounding de Gemini en Gemini Apps y Vertex AI |
| Bingbot (Microsoft) | Ja — El índice de Bing, históricamente la base de la búsqueda de ChatGPT | Nee |
| CCBot (Common Crawl) | Nee — Archivo público, no un buscador | Ja — Una fuente de entrenamiento de siempre para muchos modelos |
| Applebot-Extended | Nee — No rastrea páginas por sí mismo | Ja — Decide si los datos de Applebot entrenan los modelos base de Apple |

_Google-Extended y Applebot-Extended son tokens de robots.txt sin user agent propio: regulan cómo se pueden usar los datos ya rastreados. Google documenta explícitamente que Google-Extended no afecta a tu inclusión en Google Search y no es un factor de posicionamiento._

## ¿Qué robots.txt te encaja?

Hay tres posturas realistas. Elige una a conciencia y recuerda que robots.txt es una petición, no un candado: los crawlers que se portan bien lo respetan, los malos no.

### A. Permitirlo todo (la opción por defecto para casi cualquier pequeña empresa)

Si quieres clientes de la búsqueda con IA y tu contenido no tiene valor de archivo de pago, esta es la decisión correcta. Un robots.txt que falte o esté vacío ya significa que todo está permitido; escríbelo de todas formas, con tu sitemap al lado.

`Agente-usuario: *`

`Permitir: /`

 

`Sitemap: https://tudominio.com/sitemap.xml`

### B. Permitir la recuperación y la cita, bloquear el entrenamiento

El término medio defendible para editores y negocios con mucho conocimiento propio: que te mencionen en las respuestas sin regalar el material de entrenamiento. Cada user agent necesita su propio bloque.

`# Entrenamiento: no`

`User-agent: GPTBot`

`Disallow: /`

`User-agent: ClaudeBot`

`Disallow: /`

`User-agent: CCBot`

`Disallow: /`

`User-agent: Google-Extended`

`Disallow: /`

`User-agent: Applebot-Extended`

`Disallow: /`

 

`# Citar y consultar: sí`

`User-agent: OAI-SearchBot`

`Permitir: /`

`User-agent: ChatGPT-User`

`Permitir: /`

`User-agent: Claude-SearchBot`

`Permitir: /`

`User-agent: Claude-User`

`Permitir: /`

`User-agent: PerplexityBot`

`Permitir: /`

`User-agent: Perplexity-User`

`Permitir: /`

`User-agent: Bingbot`

`Permitir: /`

 

`Agente-usuario: *`

`Permitir: /`

 

`Sitemap: https://tudominio.com/sitemap.xml`

### C. Bloquearlo todo

Solo tiene sentido cuando tu contenido es el producto y cada referencia de una IA te cuesta ingresos. El precio: desapareces como fuente de ChatGPT, Claude y Perplexity, también cuando un cliente actual pregunta explícitamente por ti.

`User-agent: GPTBot`

`User-agent: OAI-SearchBot`

`User-agent: ChatGPT-User`

`User-agent: ClaudeBot`

`User-agent: Claude-SearchBot`

`User-agent: Claude-User`

`User-agent: PerplexityBot`

`User-agent: Perplexity-User`

`User-agent: CCBot`

`User-agent: Google-Extended`

`User-agent: Applebot-Extended`

`Disallow: /`

## El bloqueo que nunca ves

Esta es la advertencia más importante de la página. Bloquear casi nunca es una decisión consciente en robots.txt; pasa por accidente, una capa más abajo, en tu WAF o en la gestión de bots.

En julio de 2025 Cloudflare activó por defecto el bloqueo de crawlers de IA en los dominios nuevos. También ofrece un robots.txt gestionado con una opción de aplicar las reglas de robots.txt que despliega una regla de WAF, y esa regla bloquea a nivel de red independientemente de lo que diga tu propio robots.txt. Bot Fight Mode además desafía al tráfico que no parece un navegador, que es exactamente el aspecto que tiene un crawler.

Lo cruel es que nada te avisa. Search Console solo informa sobre Googlebot, así que un 403 servido a GPTBot o PerplexityBot nunca aparece ahí. Tu robots.txt dice Allow, tu analítica no dice nada y, mientras, ningún fetcher de IA consigue pasar. Verifícalo en el edge, no en el archivo.

_Verificar_

## Cómo comprobar que los crawlers de IA pueden entrar de verdad.

1. **Pide tu robots.txt como lo hace un bot** — curl -A "GPTBot" https://tudominio.com/robots.txt. Si obtienes algo distinto de lo que ve tu navegador, hay algo interceptando entre el bot y el archivo.
2. **Pide una página real con un user agent de IA** — curl -sI -A "OAI-SearchBot" https://tudominio.com/. Un 200 está bien. Un 403, un 503 o una página de verificación significa que tu firewall bloquea lo que robots.txt permite.
3. **Repasa tus ajustes de Cloudflare** — Revisa Bot Fight Mode, AI Crawl Control y el robots.txt gestionado. Los tres pueden pasar por encima de tu robots.txt sin que tú hayas activado nada.
4. **Lee los logs de tu servidor, no Search Console** — Filtra por GPTBot, OAI-SearchBot, ClaudeBot y PerplexityBot y mira los códigos de estado. Este es el único sitio donde vive la verdad.

## ¿Entonces publico un llms.txt?

Puedes, cuesta cinco minutos y hoy no tiene retorno medido. En mayo de 2026 Ahrefs estudió 137,000 dominios y encontró que el 97% de los archivos llms.txt no recibieron ninguna petición. De las peticiones que sí llegaron, los bots de recuperación de IA fueron el 1.1%.

Los propios proveedores dicen lo mismo. John Mueller afirmó en junio de 2025 que ningún sistema de IA usa hoy llms.txt, y la documentación de Google es explícita: «No necesitas crear nuevos archivos legibles por máquina, archivos de texto para IA, marcado ni Markdown para aparecer en Google Search (incluidas sus funciones de IA generativa)». Coste de implementación casi cero, retorno medido casi cero. Quien te prometa resultados con llms.txt te está vendiendo algo que nadie puede demostrar.

## No olvides Bing

La búsqueda de ChatGPT se apoyó mucho tiempo en el índice de Bing; OpenAI además rastrea con su propio OAI-SearchBot. Enviar tu sitemap a Bing Webmaster Tools cuesta diez minutos y es una de las pocas palancas que de verdad controlas aquí. Así que no bloquees a Bingbot por si acaso mientras ordenas los bots de IA.

## Cómo lo resuelve FWRD

Cada web de FWRD está abierta por defecto a los crawlers de búsqueda y recuperación y envía su sitemap automáticamente. No hay una gestión de bots por delante que frene a los fetchers de IA sin querer, y las páginas son HTML estático: lo que descarga un crawler es lo que ve un visitante.

_Sigue leyendo_

## Sobre este tema

- [Que ChatGPT te cite](/es/get-cited-by-chatgpt/) — Lo que decide de verdad si te citan.
- [llms.txt](/es/glossary/llms-txt/) — El archivo del que el 97% de las copias no recibió ninguna petición.
- [AI SEO explicado](/es/glossary/ai-seo/) — Cómo está cambiando la IA el SEO en dos direcciones.
- [Generative Engine Optimization](/es/glossary/generative-engine-optimization/) — Optimizar para respuestas generadas.
- [Para desarrolladores](/es/for-developers/) — La tecnología que hay debajo de una web de FWRD.
- [SEO en FWRD](/es/producto/seo/) — Lo que se resuelve automáticamente.

## Abierto a los bots que ==atraer clientes==.

Empieza gratis. El sitemap, la indexación y Search Console están bien desde el primer día.
