Configurando o robots.txt para Crawlers de IA
Um passo a passo prático sobre GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended e o resto: o que cada um faz, e um robots.txt que você pode realmente usar.
A maioria dos sites bloqueia crawlers de IA por acidente — através de uma regra de WAF herdada ou um template de robots.txt copiado — ou permite tudo sem pensar para que serve cada bot. Este guia resolve os dois casos.
Verificar Meu Acesso de CrawlersDois Tipos de Crawler de IA, Não Um
As empresas de IA operam pelo menos dois tipos diferentes de crawler, e tratá-los como uma coisa só é o erro de robots.txt mais comum. Crawlers de treinamento, como GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) e CCBot (Common Crawl, usado indiretamente por muitos modelos), visitam seu site no próprio cronograma para coletar dados para uma futura versão do modelo. Bloquear um deles não remove nada já aprendido em um rastreamento passado; apenas te exclui do próximo.
Crawlers de busca em tempo real funcionam diferente: OAI-SearchBot e ChatGPT-User (OpenAI), PerplexityBot (Perplexity), e as buscas conectadas que Claude e Gemini fazem, todos rodam no momento em que um usuário faz uma pergunta que precisa da sua página agora. Bloqueá-los tem efeito imediato: o motor não consegue ler sua página para aquela resposta, ponto final, mesmo que seu conteúdo fosse exatamente o que ele precisava.
É por isso que uma regra genérica de 'bloquear todos os bots' costuma ser um erro, assim como uma regra genérica de 'permitir tudo' sem nenhuma reflexão. Um robots.txt bem feito trata cada crawler pelo que ele faz: permita os que geram citações e respostas em tempo real, e tome uma decisão deliberada e informada — não um padrão — sobre os que servem apenas para treinamento.
O Que Decidir Antes de Editar o robots.txt
Saiba Qual Tipo Você Está Bloqueando
Antes de bloquear qualquer coisa, verifique se é um crawler de treinamento, que afeta apenas futuras versões do modelo, ou um buscador em tempo real, que afeta se você é citado em uma resposta agora mesmo. Os dois têm consequências completamente diferentes.
Verifique Se o Bot É Real
Uma string de user-agent é só texto — qualquer um pode enviar 'GPTBot' em um cabeçalho de requisição. Para qualquer coisa além de uma regra básica de robots.txt, como um bloqueio de WAF, verifique pelos intervalos de IP publicados ou por uma lista de bots verificados de uma CDN, não só pela string.
Verifique os Logs do Servidor, Não Só o robots.txt
robots.txt é um pedido, não um cadeado — bots bem-comportados o respeitam, mas a única forma de saber se suas regras estão realmente funcionando é amostrar os logs do servidor periodicamente em busca de respostas 200 (não bloqueios silenciosos ou desafios de WAF) dos bots que você quis permitir.
Por Que Vale a Pena Acertar Isso
Bloqueio Acidental É a Regra, Não a Exceção
Uma pesquisa independente da Originality.ai descobriu que o GPTBot é bloqueado por mais de um terço dos 1.000 principais sites — e entrevistas com donos de sites mostraram que muitos desses bloqueios foram herdados de regras padrão de WAF ou templates copiados, não de uma decisão deliberada.
Normalmente um Ajuste de Cinco Minutos
Assim que você sabe quais bots quer permitir, a mudança real no robots.txt é um punhado de linhas. A parte difícil é saber o que escrever, não escrever.
Bloquear Tem um Custo Mensurável
Estudos de caso analisados pela Hack/Hackers descobriram que sites que bloquearam crawlers de IA viram depois uma queda significativa no tráfego de referência vindo de motores de resposta de IA. O crawler que você bloqueia hoje é a citação que você não ganha amanhã.
Configure o Acesso de Crawlers de IA em 3 Passos
Decida Bot a Bot, Não Tudo ou Nada
Liste quais crawlers você quer permitir. A maioria dos sites deveria permitir por padrão os buscadores em tempo real — OAI-SearchBot, ChatGPT-User e PerplexityBot — já que bloqueá-los te remove imediatamente de respostas ao vivo.
Escreva Regras Allow Explícitas
Adicione um bloco User-agent por bot em vez de depender de uma regra genérica curinga herdada de um template. Regras explícitas sobrepõem os padrões e tornam sua intenção auditável depois.
Confirme com os Logs do Servidor
Depois de publicar, amostre seus logs em busca dos bots que você permitiu. Procure respostas 200, não 403 ou desafios de WAF. Um bot que respeita o robots.txt mas ainda é bloqueado em outro lugar da sua stack precisa de um ajuste separado.
Perguntas Frequentes sobre AI Crawler Access
Qual é a diferença entre um crawler de treinamento e um crawler de busca em tempo real?
Um crawler de treinamento como GPTBot, ClaudeBot ou Google-Extended coleta dados no próprio cronograma para melhorar uma futura versão do modelo — bloqueá-lo não tem efeito nas citações que acontecem hoje. Um crawler de busca em tempo real como OAI-SearchBot, ChatGPT-User ou PerplexityBot roda no momento em que a pergunta de um usuário precisa da sua página — bloqueá-lo significa que aquela resposta específica não pode usar seu conteúdo de jeito nenhum.
Como é um robots.txt funcional para crawlers de IA?
Um exemplo mínimo que permite os principais bots relevantes para citação: User-agent: GPTBot, Allow: /; User-agent: OAI-SearchBot, Allow: /; User-agent: ChatGPT-User, Allow: /; User-agent: ClaudeBot, Allow: /; User-agent: PerplexityBot, Allow: /; User-agent: Google-Extended, Allow: /; seguido de uma linha Sitemap apontando para o seu sitemap.xml. Ajuste quais bots recebem Allow ou Disallow de acordo com sua própria decisão sobre dados de treinamento.
Devo bloquear o GPTBot para manter a IA longe do meu conteúdo?
Para a maioria dos sites, não. GPTBot é o crawler de treinamento da OpenAI — bloqueá-lo impede que futuros modelos treinem com conteúdo novo, mas não remove nada já aprendido, e não afeta as citações em tempo real do ChatGPT, que vêm do OAI-SearchBot e do ChatGPT-User. Bloqueá-lo é uma decisão deliberada de opt-out, não uma medida de segurança, e dados de estudos de caso sugerem que pode custar tráfego de referência real sem uma vantagem clara para a maioria dos publishers.
Bloquear crawlers de IA afeta meu ranqueamento no Google?
Bloquear GPTBot, ClaudeBot ou PerplexityBot não tem efeito direto no ranqueamento do Google Search — o Googlebot é um crawler totalmente separado. Bloquear especificamente o Google-Extended é diferente: impede que seu conteúdo seja usado nos próprios recursos de IA do Google, como AI Overviews e Gemini, sem afetar seu ranqueamento de busca normal, que é governado pelo Googlebot.
Como sei se uma requisição que se diz GPTBot é realmente o GPTBot?
Nunca confie só na string de user-agent — é trivial falsificá-la. Para qualquer coisa além de uma regra básica de robots.txt, verifique pelos intervalos de IP publicados do crawler (OpenAI, Anthropic e outros publicam isso) ou use uma lista de bots verificados de uma CDN, como o AI Crawl Control da Cloudflare, que checa mais do que só o cabeçalho.
Eu também preciso de um arquivo llms.txt?
llms.txt é uma convenção emergente e não oficial que alguns sites usam para direcionar crawlers de IA a um resumo curado do seu conteúdo. Não é um padrão que nenhuma grande empresa de IA confirmou que lê, e não substitui o robots.txt, que é o mecanismo real de controle de acesso que os crawlers respeitam. Vale a pena acompanhar, mas ainda não vale priorizar acima de acertar seu robots.txt.
Verifique Se os Crawlers de IA Conseguem Realmente Ler Seu Site
O GEO-Score inspeciona seu robots.txt, respostas do servidor e conteúdo renderizado em JavaScript para mostrar exatamente quais bots de IA têm acesso. Cinco verificações de página por domínio são grátis a cada 30 dias.
Verificar Meu Acesso de Crawlers