---
title: "Crawlers de IA: bloquear ou permitir no robots.txt | FWRD"
description: "GPTBot, ClaudeBot, PerplexityBot e Google-Extended: qual treina, qual cita, qual vai buscar. Um robots.txt para copiar e colar, mais o bloqueio que nunca vê."
url: "https://fwrd.digital/pt/glossary/ai-crawlers"
published: "2026-07-24T15:40:15Z"
modified: "2026-08-06T16:18:36Z"
---

# Crawlers de IA: bloquear ou permitir no robots.txt | FWRD

_rastreadores de IA_

## Bloqueie quem treina, não a fonte das suas citações.

O GPTBot treina. O OAI-SearchBot cita. O ChatGPT-User vai buscar porque um visitante acabou de perguntar. Junte-os todos no robots.txt e perde visibilidade sem proteger nada.

## Rastreador de IA

Um crawler de IA é um bot automatizado que vai buscar páginas web em nome de um sistema de IA. Há três tipos, com consequências muito diferentes: crawlers de treino que recolhem conteúdo para treinar modelos (GPTBot, ClaudeBot, CCBot), crawlers de pesquisa e grounding que constroem o índice a partir do qual as respostas de IA citam (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot) e fetchers iniciados pelo utilizador, que vão buscar uma única página porque alguém a pediu naquele momento (ChatGPT-User, Claude-User, Perplexity-User). Orienta-os com o robots.txt, mas a última palavra é do seu firewall.

### Gerelateerde begrippen

- [Ser citado por ChatGPT](/pt/get-cited-by-chatgpt/)
- [llms.txt](/pt/glossary/llms-txt/)
- [SEO com IA](/pt/glossary/ai-seo/)
- [Otimização de motor generativo](/pt/glossary/generative-engine-optimization/)

## Porque importa a diferença entre estes bots

A maior parte dos conselhos sobre bloqueios despeja tudo o que tem IA no nome numa só lista com um Disallow por baixo. É exatamente a jogada errada. Bloquear um crawler de treino protege o seu conteúdo de ser reutilizado dentro de um modelo. Bloquear um crawler de pesquisa ou um fetcher iniciado pelo utilizador significa que nunca mais aparece como fonte numa resposta. Mesma diretiva, resultado oposto.

### 1. Formação

A OpenAI descreve o GPTBot como o crawler que recolhe conteúdo que pode treinar os seus modelos de base. A Anthropic diz o mesmo do ClaudeBot: recolhe conteúdo web que pode contribuir para o treino. O CCBot pertence ao Common Crawl, que não é uma empresa de IA, mas o arquivo público que constrói é há anos uma das maiores fontes de treino. O Google-Extended e o Applebot-Extended também entram aqui, com uma diferença: são tokens de controlo e não crawlers. Bloqueie este grupo e não perde visibilidade nenhuma.

### 2. Aterramento e recuperação

É este o grupo que lhe dá citações. A OpenAI afirma que o OAI-SearchBot mostra websites nos resultados de pesquisa dentro do ChatGPT e não é usado para treino. A Anthropic diz que o Claude-SearchBot navega na web para melhorar a qualidade dos resultados de pesquisa. A Perplexity descreve o PerplexityBot como concebido para mostrar e ligar websites nos resultados da Perplexity, explicitamente não para modelos de base. Bloqueie este grupo e desaparece das respostas.

### 3. Buscas iniciadas pelo utilizador

O ChatGPT-User, o Claude-User e o Perplexity-User vão buscar uma página porque uma pessoa acabou de fazer uma pergunta ou colar um link. Não há índice, não há treino: é um visitante com um intermediário. Bloquear estes é o mesmo que recusar um cliente porque foi outra pessoa que o levou à sua porta.

## Quem é quem, e quanto custa bloquear?

A tabela abaixo resume a documentação oficial da OpenAI, Anthropic, Perplexity, Google e Apple. Leia cada linha assim: este bot dá-me citações, e produz dados de treino?

_Referência_

## Os crawlers de IA que contam em 2026.

Fonte: documentação de bots da OpenAI, Anthropic, Perplexity, Google Search Central e Apple.

| Kenmerk | Vale citações | Produz dados de treino |
| --- | --- | --- |
| GPTBot (OpenAI) | Nee — Não produz citações | Ja — Rastreia conteúdo que pode treinar os modelos base |
| OAI-SearchBot (OpenAI) | Ja — Mostra e liga o seu site na pesquisa do ChatGPT | Nee — Não usado para treino |
| ChatGPT-Utilizador (OpenAI) | Ja — Vai buscar uma página porque um utilizador acabou de a pedir | Nee — Não usado para treino |
| ClaudeBot (Anthropic) | Nee — Não produz citações | Ja — Recolhe conteúdo web que pode contribuir para treino |
| Claude-BotDePesquisa (Anthropic) | Ja — Constrói o índice de pesquisa por trás das respostas do Claude | Nee |
| Claude-Utilizador (Anthropic) | Ja — Visita uma página a pedido do utilizador | Nee |
| PerplexityBot | Ja — Mostra e liga o seu site nos resultados do Perplexity | Nee — Não utilizado para modelos de base |
| Perplexity-Utilizador | Ja — Visita uma página a pedido do utilizador | Nee |
| Google-Estendido | Nee — Sem user agent próprio, apenas token no robots.txt | Ja — Treino do Gemini e grounding nas Gemini Apps e no Vertex AI |
| Bingbot (Microsoft) | Ja — Índice do Bing, historicamente a base da pesquisa do ChatGPT | Nee |
| CCBot (Common Crawl) | Nee — Arquivo público, não um motor de busca | Ja — Uma fonte de treino de longa data para muitos modelos |
| Applebot-Extendido | Nee — Não rastreia páginas por si próprio | Ja — Determina se os dados do Applebot treinam os modelos base da Apple |

_Google-Extended e Applebot-Extended são tokens de robots.txt sem user agent próprio: regulam como podem ser usados dados já rastreados. A Google documenta explicitamente que o Google-Extended não afeta a sua inclusão na Pesquisa Google e não é um sinal de ranking._

## Qual robots.txt te convém?

Existem três posturas realistas. Escolha uma de forma consciente e lembre-se de que o robots.txt é um pedido, não uma fechadura: os crawlers bem comportados respeitam-no, os mal-intencionados não.

### A. Permitir tudo (a predefinição para quase todas as pequenas empresas)

Se quer clientes vindos da pesquisa com IA e o seu conteúdo não tem valor de arquivo pago, esta é a escolha certa. Um robots.txt em falta ou vazio já significa que tudo é permitido; escreva-o mesmo assim, com o seu sitemap ao lado.

`Agente-utilizador: *`

`Permita: /`

 

`Sitemap: https://yourdomain.com/sitemap.xml`

### B. Permitir recolha e citação, bloquear treino

O meio-termo defensável para editores e negócios com muito conhecimento: ser mencionado nas respostas sem doar o material de treino. Cada user agent precisa do seu próprio bloco.

`# Treino: não`

`Agente-utilizador: GPTBot`

`Não permitir: /`

`User-agent: ClaudeBot`

`Não permitir: /`

`Agente-utilizador: CCBot`

`Não permitir: /`

`User-agent: Google-Extended`

`Não permitir: /`

`User-agent: Applebot-Extended`

`Não permitir: /`

 

`# Citação e obtenção: sim`

`User-agent: OAI-SearchBot`

`Permita: /`

`User-agent: ChatGPT-User`

`Permita: /`

`User-agent: Claude-SearchBot`

`Permita: /`

`User-agent: Claude-User`

`Permita: /`

`User-agent: PerplexityBot`

`Permita: /`

`User-agent: Perplexity-User`

`Permita: /`

`User-agent: Bingbot`

`Permita: /`

 

`Agente-utilizador: *`

`Permita: /`

 

`Sitemap: https://yourdomain.com/sitemap.xml`

### C. Bloquear tudo

Só faz sentido quando o seu conteúdo é o produto e cada referência de IA lhe custa receita. O preço: desaparece como fonte do ChatGPT, do Claude e da Perplexity, mesmo quando um cliente existente pergunta explicitamente por si.

`Agente-utilizador: GPTBot`

`User-agent: OAI-SearchBot`

`User-agent: ChatGPT-User`

`User-agent: ClaudeBot`

`User-agent: Claude-SearchBot`

`User-agent: Claude-User`

`User-agent: PerplexityBot`

`User-agent: Perplexity-User`

`Agente-utilizador: CCBot`

`User-agent: Google-Extended`

`User-agent: Applebot-Extended`

`Não permitir: /`

## O bloco que nunca se vê

Este é o aviso mais importante desta página. O bloqueio raramente é uma decisão consciente no robots.txt; acontece por acidente, uma camada abaixo, no seu WAF ou na gestão de bots.

Em julho de 2025 a Cloudflare ativou por predefinição o bloqueio de crawlers de IA em novos domínios. Também disponibiliza um robots.txt gerido com uma opção Enforce robots.txt rules que instala uma regra WAF, e essa regra bloqueia ao nível da rede independentemente do que diga o seu próprio robots.txt. O Bot Fight Mode desafia adicionalmente o tráfego que não parece um browser, que é exatamente o aspeto que um crawler tem.

O cruel é que nada o avisa. A Search Console só reporta sobre o Googlebot, por isso um 403 devolvido ao GPTBot ou ao PerplexityBot nunca aparece lá. O seu robots.txt diz Allow, a sua analítica não diz nada, e entretanto nenhum fetcher de IA passa. Verifique no edge, não no ficheiro.

_Verificar_

## Como verificar se os crawlers de IA conseguem mesmo entrar.

1. **Peça o seu robots.txt como um bot o faz** — curl -A "GPTBot" https://yourdomain.com/robots.txt. Se receber algo diferente do que o seu browser vê, há algo a interceptar entre o bot e o ficheiro.
2. **Peça uma página real com um user agent de IA** — curl -sI -A "OAI-SearchBot" https://yourdomain.com/. Um 200 está bem. Um 403, um 503 ou uma página de desafio significa que a sua firewall bloqueia o que o robots.txt permite.
3. **Percorra as suas configurações da Cloudflare** — Verifique o Modo de Combate do Bot, o Controlo de Rastreamento AI e o robots.txt gerido. Todos os três podem sobrepor o seu robots.txt sem que nunca ative nada.
4. **Leia os logs do seu servidor, não a Search Console** — Filtre por GPTBot, OAI-SearchBot, ClaudeBot e PerplexityBot e olhe para os códigos de estado. Este é o único lugar onde vive a verdade.

## Então devo publicar um llms.txt?

Pode, leva cinco minutos, e hoje não tem retorno medido. Em maio de 2026 a Ahrefs estudou 137,000 domínios e descobriu que 97% dos ficheiros llms.txt não receberam nenhum pedido. Dos pedidos que chegaram, os bots de recuperação de IA representaram 1.1%.

Os próprios fornecedores dizem o mesmo. John Mueller afirmou em junho de 2025 que nenhum sistema de IA usa atualmente o llms.txt, e a documentação da Google é explícita: "Não precisa de criar novos ficheiros legíveis por máquina, ficheiros de texto para IA, marcação ou Markdown para aparecer na Pesquisa Google (incluindo as suas capacidades de IA generativa)." Custo quase nulo para o pôr no ar, retorno medido quase nulo. Quem lhe promete resultados a partir do llms.txt está a vender algo que ninguém consegue demonstrar.

## Não te esqueças do Bing

A pesquisa do ChatGPT apoiou-se durante muito tempo no índice da Bing; a OpenAI também rastreia com o seu próprio OAI-SearchBot. Submeter o seu sitemap ao Bing Webmaster Tools leva dez minutos e é uma das poucas alavancas que aqui controla de facto. Por isso não bloqueie o Bingbot por precaução enquanto arruma os bots de IA.

## Como FWRD lida com isto

Todos os sites FWRD estão abertos por defeito aos crawlers de pesquisa e de recuperação e submetem o sitemap automaticamente. Não há gestão de bots à frente que bloqueie sem querer os fetchers de IA, e as páginas são HTML estático: o que um crawler recebe é o que um visitante vê.

_Continue a ler_

## À volta deste tema

- [Ser citado por ChatGPT](/pt/get-cited-by-chatgpt/) — O que decide, de facto, se é citado.
- [llms.txt](/pt/glossary/llms-txt/) — O ficheiro em que 97% das cópias não receberam nenhum pedido.
- [SEO com IA explicado](/pt/glossary/ai-seo/) — Como a IA está a mudar o SEO em duas direções.
- [Otimização de Motores Generativos](/pt/glossary/generative-engine-optimization/) — Otimizar para respostas geradas.
- [Para desenvolvedores](/pt/for-developers/) — A tecnologia por baixo de um site FWRD.
- [SEO na FWRD](/pt/produto/seo/) — O que é tratado automaticamente.

## Aberto aos bots que ==atrair clientes==.

Comece gratuitamente. Sitemap, indexação e Search Console corretos desde o primeiro dia.
