Ir para o conteúdo

IA e GEO

Crawlers de IA: liberar ou bloquear?

O que são GPTBot, ClaudeBot e PerplexityBot, como o robots.txt trata cada um e como decidir entre proteger conteúdo e aparecer nas respostas de IA.

5 min de leitura ← Todos os artigos

Se você examinar os registros de acesso do seu site, vai encontrar visitantes que não são pessoas: Googlebot, Bingbot e, cada vez mais, nomes como GPTBot, ClaudeBot e PerplexityBot. São crawlers, programas que percorrem a web lendo páginas. Os primeiros alimentam os buscadores tradicionais há décadas. Os mais novos alimentam sistemas de IA, e é sobre eles que você precisa tomar uma decisão.

A decisão é simples de enunciar: liberar ou bloquear. Não existe resposta única para todo negócio. Existe uma troca honesta entre proteger o conteúdo que você produziu e estar presente nas respostas que os assistentes dão aos seus potenciais clientes. Este artigo apresenta os dois lados, o mecanismo técnico e o caminho para mudar de ideia depois.

O que são os crawlers de IA e o que cada um faz

Cada empresa de IA documenta publicamente seus robôs e o nome com que eles se identificam, o chamado user-agent. Os propósitos variam, e a diferença importa:

  • GPTBot, da OpenAI, coleta conteúdo que pode ser usado no treinamento dos modelos.
  • OAI-SearchBot, também da OpenAI, indexa páginas para os recursos de busca do ChatGPT, que respondem citando fontes com link.
  • ChatGPT-User acessa uma página específica quando um usuário pede isso durante uma conversa.
  • ClaudeBot, da Anthropic, coleta conteúdo para os modelos Claude.
  • PerplexityBot indexa páginas para o buscador Perplexity, que responde com citações.
  • Google-Extended não é um robô separado: é um controle que define se o conteúdo coletado pelo Google pode ser usado no treinamento da IA da empresa. Bloqueá-lo não tira seu site da busca tradicional.

A distinção mais importante é entre treinamento e busca. Robôs de treinamento absorvem seu conteúdo para dentro dos modelos, sem citação garantida e sem visita de volta. Robôs de busca indexam páginas para responder perguntas citando a fonte, o que pode gerar tráfego.

Como o robots.txt trata cada um

O robots.txt é um arquivo de texto público que fica na raiz do site, acessível em seudominio.com.br/robots.txt. Ele declara regras por user-agent: quais áreas do site cada robô pode ou não visitar. Para bloquear um robô específico bastam duas linhas: uma linha User-agent com o nome dele e uma linha Disallow com uma barra, que significa o site inteiro.

Três fatos técnicos importam nessa decisão:

  1. O robots.txt é uma convenção, não uma barreira física. Robôs de empresas estabelecidas declaram respeitá-lo; um robô mal-intencionado pode ignorá-lo.
  2. A regra vale para visitas futuras. Bloquear hoje não apaga o que já foi coletado no passado.
  3. As regras são individuais por robô. Você pode bloquear os de treinamento e liberar os de busca no mesmo arquivo, porque são user-agents diferentes.

O argumento para bloquear

Seu conteúdo é um ativo. Quem produz material proprietário de valor, como metodologia detalhada, pesquisa própria ou material didático pago, pode preferir que ele não seja absorvido por modelos de terceiros sem atribuição nem contrapartida. Para esse perfil, bloquear os robôs de treinamento é uma posição legítima, e o robots.txt é o mecanismo documentado para declará-la.

Veículos de imprensa e plataformas de conteúdo tomaram caminhos variados: alguns bloqueiam, outros negociam licenças, outros liberam tudo. Não há consenso, e isso é um sinal honesto de que a decisão depende do modelo de negócio de cada um. A pergunta certa não é o que todo mundo faz, e sim de onde vem o seu cliente.

O argumento para liberar

Agora considere um negócio local que vive de ser encontrado. Quando alguém pergunta a um assistente qual empresa contratar em Brasília, a resposta é montada a partir do que os sistemas conseguiram ler. Se os concorrentes estão nesse material e você não está, a resposta tende a recomendá-los. Para esse perfil, aparecer na resposta é um canal de aquisição, e bloquear tudo equivale a sair da prateleira de uma loja que seus clientes frequentam.

Existe um caminho intermediário adotado por muitos sites: bloquear os robôs de treinamento e liberar os de busca, que citam a fonte e podem trazer visitas. Em nenhum cenário há garantia de citação. Liberar o acesso é pré-condição para aparecer, não promessa de aparecer.

Como conferir sua situação e mudar de ideia depois

  1. Digite seudominio.com.br/robots.txt no navegador e leia o que está lá. Se houver linhas com nomes como GPTBot, seu site já tem uma política, definida por você ou por algum plugin.
  2. No WordPress, o robots.txt costuma ser virtual, gerado pelo sistema, e os principais plugins de SEO permitem editá-lo pelo painel, sem acesso técnico ao servidor.
  3. Defina a política por tipo de robô: treinamento e busca são decisões separadas, e tratá-las em bloco desperdiça o meio-termo.
  4. Reavalie de tempos em tempos. A decisão é reversível: editado o arquivo, os robôs seguem as novas regras nas próximas visitas.

Para ir além do robots.txt, o artigo sobre llms.txt apresenta uma proposta de arquivo pensada para sistemas de IA, e o guia sobre como aparecer no ChatGPT mostra o outro lado da decisão: o que fazer para ser encontrado.

Perguntas frequentes

Bloquear crawlers de IA prejudica meu Google?

Não, desde que o bloqueio seja específico. O Googlebot, que alimenta a busca tradicional, é um robô próprio, e bloquear GPTBot ou ClaudeBot não interfere nele. O cuidado é não publicar um bloqueio geral, válido para todos os user-agents, que derrubaria também os robôs de busca.

Se eu liberar tudo, minha empresa passa a aparecer nas respostas de IA?

Não necessariamente. Liberar o acesso permite que os sistemas leiam seu site, mas a citação depende de fatores que ninguém controla: relevância do conteúdo, reputação da empresa e critérios internos que mudam sem aviso. Acesso é pré-condição, não garantia.

Como descubro se esses robôs já visitam meu site?

Os registros de acesso do servidor, disponíveis no painel da sua hospedagem, mostram o user-agent de cada visita. Procure pelos nomes documentados, como GPTBot, ClaudeBot e PerplexityBot. Se eles aparecem, seu conteúdo já está sendo lido sob as regras atuais do seu robots.txt, sejam elas intencionais ou não.

A Azimute Comunicação configura essa camada nos sites que constrói e opera: robots.txt alinhado à estratégia de cada negócio, com a decisão registrada e revisável a qualquer momento. Se você quer definir uma política de crawlers com critério, veja os serviços com escopo, prazo e preço publicados ou peça uma proposta pela página de contato.

Pedir proposta →

ou chamar no WhatsApp: (61) 99154-9571