rastreadores de IA

Bloqueie quem treina, não a fonte das suas citações.

O GPTBot treina. O OAI-SearchBot cita. O ChatGPT-User vai buscar porque um visitante acabou de perguntar. Junte-os todos no robots.txt e perde visibilidade sem proteger nada.

Começar gratuitamente

Definição

Rastreador de IA

Um crawler de IA é um bot automatizado que vai buscar páginas web em nome de um sistema de IA. Há três tipos, com consequências muito diferentes: crawlers de treino que recolhem conteúdo para treinar modelos (GPTBot, ClaudeBot, CCBot), crawlers de pesquisa e grounding que constroem o índice a partir do qual as respostas de IA citam (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot) e fetchers iniciados pelo utilizador, que vão buscar uma única página porque alguém a pediu naquele momento (ChatGPT-User, Claude-User, Perplexity-User). Orienta-os com o robots.txt, mas a última palavra é do seu firewall.

Ver também: Ser citado por ChatGPTllms.txtSEO com IAOtimização de motor generativo

Porque importa a diferença entre estes bots

A maior parte dos conselhos sobre bloqueios despeja tudo o que tem IA no nome numa só lista com um Disallow por baixo. É exatamente a jogada errada. Bloquear um crawler de treino protege o seu conteúdo de ser reutilizado dentro de um modelo. Bloquear um crawler de pesquisa ou um fetcher iniciado pelo utilizador significa que nunca mais aparece como fonte numa resposta. Mesma diretiva, resultado oposto.

1. Formação

A OpenAI descreve o GPTBot como o crawler que recolhe conteúdo que pode treinar os seus modelos de base. A Anthropic diz o mesmo do ClaudeBot: recolhe conteúdo web que pode contribuir para o treino. O CCBot pertence ao Common Crawl, que não é uma empresa de IA, mas o arquivo público que constrói é há anos uma das maiores fontes de treino. O Google-Extended e o Applebot-Extended também entram aqui, com uma diferença: são tokens de controlo e não crawlers. Bloqueie este grupo e não perde visibilidade nenhuma.

2. Aterramento e recuperação

É este o grupo que lhe dá citações. A OpenAI afirma que o OAI-SearchBot mostra websites nos resultados de pesquisa dentro do ChatGPT e não é usado para treino. A Anthropic diz que o Claude-SearchBot navega na web para melhorar a qualidade dos resultados de pesquisa. A Perplexity descreve o PerplexityBot como concebido para mostrar e ligar websites nos resultados da Perplexity, explicitamente não para modelos de base. Bloqueie este grupo e desaparece das respostas.

3. Buscas iniciadas pelo utilizador

O ChatGPT-User, o Claude-User e o Perplexity-User vão buscar uma página porque uma pessoa acabou de fazer uma pergunta ou colar um link. Não há índice, não há treino: é um visitante com um intermediário. Bloquear estes é o mesmo que recusar um cliente porque foi outra pessoa que o levou à sua porta.

Quem é quem, e quanto custa bloquear?

A tabela abaixo resume a documentação oficial da OpenAI, Anthropic, Perplexity, Google e Apple. Leia cada linha assim: este bot dá-me citações, e produz dados de treino?

Referência

Os crawlers de IA que contam em 2026.

Fonte: documentação de bots da OpenAI, Anthropic, Perplexity, Google Search Central e Apple.

  Vale citações Produz dados de treino
GPTBot (OpenAI) Não produz citações Rastreia conteúdo que pode treinar os modelos base
OAI-SearchBot (OpenAI) Mostra e liga o seu site na pesquisa do ChatGPT Não usado para treino
ChatGPT-Utilizador (OpenAI) Vai buscar uma página porque um utilizador acabou de a pedir Não usado para treino
ClaudeBot (Anthropic) Não produz citações Recolhe conteúdo web que pode contribuir para treino
Claude-BotDePesquisa (Anthropic) Constrói o índice de pesquisa por trás das respostas do Claude Nee
Claude-Utilizador (Anthropic) Visita uma página a pedido do utilizador Nee
PerplexityBot Mostra e liga o seu site nos resultados do Perplexity Não utilizado para modelos de base
Perplexity-Utilizador Visita uma página a pedido do utilizador Nee
Google-Estendido Sem user agent próprio, apenas token no robots.txt Treino do Gemini e grounding nas Gemini Apps e no Vertex AI
Bingbot (Microsoft) Índice do Bing, historicamente a base da pesquisa do ChatGPT Nee
CCBot (Common Crawl) Arquivo público, não um motor de busca Uma fonte de treino de longa data para muitos modelos
Applebot-Extendido Não rastreia páginas por si próprio Determina se os dados do Applebot treinam os modelos base da Apple

Google-Extended e Applebot-Extended são tokens de robots.txt sem user agent próprio: regulam como podem ser usados dados já rastreados. A Google documenta explicitamente que o Google-Extended não afeta a sua inclusão na Pesquisa Google e não é um sinal de ranking.

Qual robots.txt te convém?

Existem três posturas realistas. Escolha uma de forma consciente e lembre-se de que o robots.txt é um pedido, não uma fechadura: os crawlers bem comportados respeitam-no, os mal-intencionados não.

A. Permitir tudo (a predefinição para quase todas as pequenas empresas)

Se quer clientes vindos da pesquisa com IA e o seu conteúdo não tem valor de arquivo pago, esta é a escolha certa. Um robots.txt em falta ou vazio já significa que tudo é permitido; escreva-o mesmo assim, com o seu sitemap ao lado.

Agente-utilizador: *

Permita: /

Sitemap: https://yourdomain.com/sitemap.xml

B. Permitir recolha e citação, bloquear treino

O meio-termo defensável para editores e negócios com muito conhecimento: ser mencionado nas respostas sem doar o material de treino. Cada user agent precisa do seu próprio bloco.

# Treino: não

Agente-utilizador: GPTBot

Não permitir: /

User-agent: ClaudeBot

Não permitir: /

Agente-utilizador: CCBot

Não permitir: /

User-agent: Google-Extended

Não permitir: /

User-agent: Applebot-Extended

Não permitir: /

# Citação e obtenção: sim

User-agent: OAI-SearchBot

Permita: /

User-agent: ChatGPT-User

Permita: /

User-agent: Claude-SearchBot

Permita: /

User-agent: Claude-User

Permita: /

User-agent: PerplexityBot

Permita: /

User-agent: Perplexity-User

Permita: /

User-agent: Bingbot

Permita: /

Agente-utilizador: *

Permita: /

Sitemap: https://yourdomain.com/sitemap.xml

C. Bloquear tudo

Só faz sentido quando o seu conteúdo é o produto e cada referência de IA lhe custa receita. O preço: desaparece como fonte do ChatGPT, do Claude e da Perplexity, mesmo quando um cliente existente pergunta explicitamente por si.

Agente-utilizador: GPTBot

User-agent: OAI-SearchBot

User-agent: ChatGPT-User

User-agent: ClaudeBot

User-agent: Claude-SearchBot

User-agent: Claude-User

User-agent: PerplexityBot

User-agent: Perplexity-User

Agente-utilizador: CCBot

User-agent: Google-Extended

User-agent: Applebot-Extended

Não permitir: /

O bloco que nunca se vê

Este é o aviso mais importante desta página. O bloqueio raramente é uma decisão consciente no robots.txt; acontece por acidente, uma camada abaixo, no seu WAF ou na gestão de bots.

Em julho de 2025 a Cloudflare ativou por predefinição o bloqueio de crawlers de IA em novos domínios. Também disponibiliza um robots.txt gerido com uma opção Enforce robots.txt rules que instala uma regra WAF, e essa regra bloqueia ao nível da rede independentemente do que diga o seu próprio robots.txt. O Bot Fight Mode desafia adicionalmente o tráfego que não parece um browser, que é exatamente o aspeto que um crawler tem.

O cruel é que nada o avisa. A Search Console só reporta sobre o Googlebot, por isso um 403 devolvido ao GPTBot ou ao PerplexityBot nunca aparece lá. O seu robots.txt diz Allow, a sua analítica não diz nada, e entretanto nenhum fetcher de IA passa. Verifique no edge, não no ficheiro.

Verificar

Como verificar se os crawlers de IA conseguem mesmo entrar.

Peça o seu robots.txt como um bot o faz. curl -A "GPTBot" https://yourdomain.com/robots.txt. Se receber algo diferente do que o seu browser vê, há algo a interceptar entre o bot e o ficheiro.

Peça uma página real com um user agent de IA. curl -sI -A "OAI-SearchBot" https://yourdomain.com/. Um 200 está bem. Um 403, um 503 ou uma página de desafio significa que a sua firewall bloqueia o que o robots.txt permite.

Percorra as suas configurações da Cloudflare. Verifique o Modo de Combate do Bot, o Controlo de Rastreamento AI e o robots.txt gerido. Todos os três podem sobrepor o seu robots.txt sem que nunca ative nada.

Leia os logs do seu servidor, não a Search Console. Filtre por GPTBot, OAI-SearchBot, ClaudeBot e PerplexityBot e olhe para os códigos de estado. Este é o único lugar onde vive a verdade.

Então devo publicar um llms.txt?

Pode, leva cinco minutos, e hoje não tem retorno medido. Em maio de 2026 a Ahrefs estudou 137,000 domínios e descobriu que 97% dos ficheiros llms.txt não receberam nenhum pedido. Dos pedidos que chegaram, os bots de recuperação de IA representaram 1.1%.

Os próprios fornecedores dizem o mesmo. John Mueller afirmou em junho de 2025 que nenhum sistema de IA usa atualmente o llms.txt, e a documentação da Google é explícita: "Não precisa de criar novos ficheiros legíveis por máquina, ficheiros de texto para IA, marcação ou Markdown para aparecer na Pesquisa Google (incluindo as suas capacidades de IA generativa)." Custo quase nulo para o pôr no ar, retorno medido quase nulo. Quem lhe promete resultados a partir do llms.txt está a vender algo que ninguém consegue demonstrar.

Não te esqueças do Bing

A pesquisa do ChatGPT apoiou-se durante muito tempo no índice da Bing; a OpenAI também rastreia com o seu próprio OAI-SearchBot. Submeter o seu sitemap ao Bing Webmaster Tools leva dez minutos e é uma das poucas alavancas que aqui controla de facto. Por isso não bloqueie o Bingbot por precaução enquanto arruma os bots de IA.

Como FWRD lida com isto

Todos os sites FWRD estão abertos por defeito aos crawlers de pesquisa e de recuperação e submetem o sitemap automaticamente. Não há gestão de bots à frente que bloqueie sem querer os fetchers de IA, e as páginas são HTML estático: o que um crawler recebe é o que um visitante vê.

Aberto aos bots que atrair clientes.

Começar gratuitamente
question 1 of 4

Where are you now?

One choice. We'll match the right plan.