Permitir ou bloquear os rastreadores de IA? A ponderação

A decisão é normalmente conduzida como uma questão de princípio e é uma questão de negócio: quem ganha dinheiro com conteúdos perde ao permitir. Quem ganha encomendas através dos conteúdos perde ao bloquear – e perde mais.

Uma fila de aberturas estreitas, por três delas entra luz no espaço atrás, as restantes ficam escuras

O essencial

  • Há dois tipos de acesso: os recoletores antecipados e os acessos em tempo de execução. Controlam-se em separado – e é precisamente aí que está a solução mais útil.
  • Quem vende encomendas deve permitir em qualquer caso os acessos em tempo de execução: geram menções junto de pessoas em plena procura de solução.
  • Quem vende conteúdos ou ganha com publicidade tem boas razões para bloquear os recoletores.
  • O robots.txt é um pedido, não um bloqueio. Quem quiser impor tecnicamente precisa de um bloqueio ao nível do servidor.

Os dois tipos de acesso

Recoletores antecipados

Vão buscar conteúdos independentemente de uma pergunta concreta – para treino ou para um índice de pesquisa próprio. Exemplos: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.

Benefício para vocês: indireto – os conteúdos ficam disponíveis num índice. Custo: os conteúdos são usados sem que ninguém visite a vossa página.

Acessos em tempo de execução

Vão buscar uma página no momento em que alguém fez uma pergunta adequada. Exemplos: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.

Benefício para vocês: direto – daí nascem menções e ligações em respostas concretas. Custo: praticamente nenhum.

Sabia que…?

Quem bloqueia em bloco «todos os bots de IA» bloqueia os dois tipos – e perde assim precisamente a parte que lhe é útil. A menção como fonte numa resposta pressupõe que a página possa ser obtida em tempo de execução.

Para uma empresa que vende encomendas, é a pior troca imaginável: impede-se uma recomendação a alguém em plena procura de solução, para impedir que um modelo aprenda a partir de um artigo técnico publicamente acessível.

Três estratégias

EstratégiaRecoletoresAcessos em execuçãoAdequa-se a
Abertapermitirpermitirprestadores de serviços, B2B, consultoria
Mistabloquearpermitireditoras, formadores, imprensa especializada
Fechadabloquearbloquearconteúdos pagos, áreas protegidas

Para a maioria das pequenas e médias empresas, «aberta» é a escolha certa. A estratégia mista é o meio-termo sensato para todos aqueles cujo conteúdo é, ele próprio, o produto.

O robots.txt

Para a estratégia aberta com menção expressa – não é obrigatório, mas torna a decisão visível e documenta-a:

robots.txt – aberto
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Na estratégia mista, os recoletores são bloqueados e os acessos em tempo de execução permitidos:

robots.txt – misto
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml
Atenção O Google-Extended controla apenas o uso para os produtos de IA da Google – não a indexação normal de pesquisa. Quem bloquear por engano o Googlebot desaparece da pesquisa. Estes dois nomes são coisas diferentes e são confundidos com regularidade.

O que o robots.txt não faz

Três limitações que se devem conhecer antes de confiar no ficheiro:

  • É um pedido. Os fornecedores sérios respeitam-no, outros não. Quem quiser impor tecnicamente precisa de um bloqueio ao nível do servidor ou da firewall, com base no identificador.
  • Não atua retroativamente. O que já foi recolhido não desaparece com isso.
  • Não protege contra a reprodução a partir de outras fontes. Se os vossos conteúdos forem citados noutro lado, o vosso ficheiro não ajuda.
Da prática

Antes de tomar a decisão, compensa olhar para o registo do servidor: quais destes identificadores aparecem sequer, com que frequência, e que páginas vão buscar?

Nos sites pequenos o resultado é muitas vezes desanimador – poucos acessos, poucas páginas. Aí a questão é praticamente secundária, e a verdadeira tarefa é outra: ser encontrado, para começar. Um bloqueio para rastreadores que nem sequer aparecem não resolve nenhum problema e apenas impede que isso venha a mudar.

O enquadramento jurídico

Na UE existe uma reserva quanto à prospeção de textos e dados: os titulares de direitos podem proibir expressamente o uso dos seus conteúdos para análise automatizada, e essa reserva tem de ser declarada de forma legível por máquinas. O robots.txt é a forma corrente para isso, por vezes complementada por uma menção nos termos de utilização.

Para a Suíça isso não se aplica diretamente; quem dirige conteúdos também a utilizadores da UE deve, ainda assim, declarar a reserva se a desejar. É um ponto que deve ser avaliado por um profissional – este artigo não substitui aconselhamento jurídico.

Conclusão

A questão não é de princípio, depende do modelo de negócio. Quem vende conteúdos bloqueia os recoletores. Quem vende encomendas permite ambos – e ganha assim menções junto de pessoas que estão precisamente à procura de uma solução.

Em qualquer caso vale: considerar os acessos em tempo de execução em separado. Bloqueá-los em bloco é o erro mais frequente e mais caro desta decisão.

Perguntas frequentes

Devem bloquear-se os rastreadores de IA?

Depende do modelo de negócio. Quem ganha dinheiro com os próprios conteúdos – editoras, formadores, imprensa especializada – tem boas razões para bloquear os recoletores antecipados. Quem vende encomendas ou serviços perde mais com o bloqueio do que ganha.

Qual é a diferença entre recoletores e acessos em tempo de execução?

Os recoletores, como o GPTBot, o ClaudeBot ou o PerplexityBot, vão buscar conteúdos independentemente de uma pergunta concreta, para treino ou para um índice próprio. Os acessos em tempo de execução, como o ChatGPT-User, o Perplexity-User ou o OAI-SearchBot, vão buscar uma página exatamente quando alguém fez uma pergunta adequada – daí nascem menções e ligações.

O que é o Google-Extended?

Um identificador com o qual se controla o uso de conteúdos para os produtos de IA da Google – não a indexação normal de pesquisa. É diferente do Googlebot; quem bloquear este por engano desaparece da pesquisa.

Todos os rastreadores respeitam o robots.txt?

Não. É um pedido, não um bloqueio técnico. Os fornecedores sérios respeitam-no, outros não. Quem quiser impor um bloqueio precisa de uma regra ao nível do servidor ou da firewall com base no identificador – e mesmo assim ela não atua retroativamente sobre os conteúdos já recolhidos.

Como se verifica que rastreadores aparecem de facto?

Pelo registo do servidor, filtrado pelos identificadores conhecidos. Mostra que rastreadores vão buscar que páginas e com que frequência. Nos sites pequenos o resultado é muitas vezes modesto – aí a questão do bloqueio é secundária face à tarefa de ser encontrado, para começar.

Marketing que se configura sozinho

A beta do Studio Engine está aberta. Reserve o seu lugar e participe desde o início.

Participar na beta →
← Voltar à lista