Como o Bot Preference Sync mantém o robots.txt atualizado

A Cloudflare anunciou o Bot Preference Sync no seu blogue oficial a 22 de agosto de 2026, uma funcionalidade que mantém automaticamente o ficheiro robots.txt de um site alinhado com as políticas de bots de IA que um proprietário já configurou no painel da Cloudflare. A ferramenta abrange três categorias de bots - Pesquisa, Agente e Treino - pelo que uma única escolha no painel atualiza as regras dos três tipos de crawler ao mesmo tempo. A Cloudflare gera ou atualiza o robots.txt com base na configuração ao nível da zona do site, pelo que as definições já guardadas para esse domínio controlam automaticamente o ficheiro de texto resultante.

As novas diretivas são colocadas antes do ficheiro robots.txt existente, o que preserva qualquer regra Disallow que o proprietário já tivesse escrito à mão. A Cloudflare mantém também o ficheiro atualizado através da sua própria lista de classificação de bots, a BotBase, pelo que as entradas se atualizam automaticamente à medida que novos bots são adicionados às categorias bloqueadas ou recusadas. A funcionalidade pode ser ativada ou desativada a qualquer momento e está disponível para todos os clientes da Cloudflare, do plano Free ao Enterprise, com lançamento previsto dentro da semana seguinte ao anúncio.

O que acontece automaticamente em sites novos e financiados por publicidade

Os novos clientes da Cloudflare começam sem qualquer bloqueio de bots neste sistema, deixando toda a escolha de política ao critério do proprietário do site. Os sites que se identificam como financiados por publicidade, ou seja, que indicam monetizar páginas com anúncios, podem em vez disso escolher uma predefinição que coloca a categoria Treino em Disallow por defeito. Esta única distinção já mostra como o modelo de negócio declarado de um site, e não uma decisão técnica deliberada, pode determinar a sua exposição ao treino de IA antes de o proprietário sequer escrever uma regra.

A categoria Treino tem quatro opções de configuração distintas: Allow, Block on pages that serve ads, Block everywhere e Disallow, sendo que esta última escreve uma preferência de não-treino diretamente no robots.txt. O tráfego de Pesquisa e de Agente pode ser controlado separadamente do Treino, pelo que um proprietário pode manter um site totalmente aberto à indexação nos motores de pesquisa enquanto restringe ou bloqueia os crawlers que recolhem conteúdo para conjuntos de dados de treino de IA. Como estas escolhas residem num painel e não num ficheiro mantido à mão, uma alteração de política entra em vigor na sincronização seguinte do robots.txt.

Do interruptor manual no painel à aplicação automática

A Cloudflare deu pela primeira vez aos proprietários de sites um controlo granular sobre o tráfego de bots de IA a 1 de julho de 2026, permitindo-lhes permitir ou bloquear separadamente os crawlers nas mesmas três categorias, Pesquisa, Agente e Treino, a partir do painel. O Bot Preference Sync, anunciado sete semanas depois, a 22 de agosto, é a camada de automatização que mantém o robots.txt resultante alinhado com essas escolhas do painel. Os proprietários já não precisam de manter o ficheiro de texto estático à mão sempre que uma preferência muda; a Cloudflare trata desse passo automaticamente.

Esta mudança retira o controlo das permissões de crawling de IA de um site de um documento que a maioria dos proprietários nunca abre, e coloca-o num produto que a Cloudflare continua a construir ativamente ao longo de lançamentos sucessivos. Assim que o comportamento predefinido do robots.txt passa a ser gerado pelas definições do painel e não por quem editou o ficheiro pela última vez, a política prática de treino de IA de uma grande parte da web passa a depender dos valores predefinidos que a Cloudflare decide entregar. Um crawler de uso misto, que faz tanto indexação para pesquisa como treino de IA, tem de cumprir quatro critérios específicos, incluindo respeitar as preferências do robots.txt e fornecer visibilidade ao nível do URL sobre o que foi rastreado e com que finalidade, para evitar ser bloqueado quando um proprietário coloca Treino em Disallow.

A nova decisão de caixa de verificação para proprietários de sites na UE e no Reino Unido

Qualquer empresa da UE ou do Reino Unido que administre um site enfrenta agora uma decisão de treino de IA que se resume a uma caixa de verificação num painel. A maioria dos proprietários de sites nunca abre a página de definições de bots da Cloudflare, o que significa que os valores predefinidos escolhidos pela plataforma, como a predefinição para sites financiados por publicidade que desativa o Treino, acabarão por fixar a política real de muitos sites, quer o proprietário alguma vez tenha feito uma escolha ativa quer não. Pela primeira vez, o silêncio produz um resultado concreto e aplicado automaticamente.

Os proprietários que queiram uma política deliberada, seja permitir os crawlers de treino de IA, bloqueá-los em todo o lado ou restringi-los apenas em páginas financiadas por publicidade, podem agora definir essa política em minutos através do mesmo painel já utilizado para o tráfego de Pesquisa e de Agente. As quatro opções de Treino oferecem margem suficiente para refletir a maioria das posições editoriais ou comerciais sem tocar diretamente num ficheiro de texto. As empresas que ignoram a página de definições não estão a evitar uma decisão; estão simplesmente a aceitar o valor predefinido que a Cloudflare ou o próprio perfil do site lhes atribui.