Hoe Bot Preference Sync robots.txt actueel houdt

Cloudflare kondigde Bot Preference Sync op 22 augustus 2026 aan op zijn officiële blog, een functie die het robots.txt-bestand van een site automatisch afstemt op het AI-bot-beleid dat een eigenaar al heeft ingesteld in het Cloudflare-dashboard. De tool bestrijkt drie botcategorieën - Search, Agent en Training - zodat een enkele keuze in het dashboard de regels voor alle drie de crawlertypes tegelijk bijwerkt. Cloudflare genereert of werkt robots.txt bij op basis van de zone-configuratie van de site, zodat de al opgeslagen instellingen voor dat domein automatisch het resulterende tekstbestand sturen.

Nieuwe richtlijnen worden voor het bestaande robots.txt-bestand geplaatst, waardoor elke Disallow-regel die de eigenaar al met de hand had geschreven behouden blijft. Cloudflare houdt het bestand ook actueel via zijn eigen botclassificatielijst, BotBase, zodat vermeldingen automatisch worden bijgewerkt zodra nieuwe bots aan geblokkeerde of geweigerde categorieën worden toegevoegd. De functie kan op elk moment aan of uit worden gezet en is beschikbaar voor elke Cloudflare-klant, van het Free-plan tot Enterprise, met een uitrol binnen de week na de aankondiging.

Wat er automatisch gebeurt bij nieuwe en advertentie-gefinancierde sites

Nieuwe Cloudflare-klanten starten in dit systeem zonder enige botblokkade, waardoor de volledige beleidskeuze bij de site-eigenaar ligt. Sites die zichzelf identificeren als advertentie-gefinancierd, dus aangeven dat ze pagina's met advertenties monetariseren, kunnen in plaats daarvan een preset kiezen die de categorie Training standaard op Disallow zet. Dat ene onderscheid laat al zien hoe het opgegeven bedrijfsmodel van een site, en niet een bewuste technische keuze, de AI-trainingsblootstelling kan bepalen voordat de eigenaar ook maar één regel schrijft.

De categorie Training biedt vier afzonderlijke configuratie-opties: Allow, Block on pages that serve ads, Block everywhere en Disallow, waarbij die laatste een no-training-voorkeur direct in robots.txt schrijft. Search- en Agent-verkeer blijven los van Training te regelen, zodat een eigenaar een site volledig open kan houden voor zoekindexering terwijl crawlers die content verzamelen voor AI-trainingsdatasets worden beperkt of geblokkeerd. Omdat deze keuzes in een dashboard staan en niet in een handmatig bijgehouden bestand, gaat een beleidswijziging in bij de volgende synchronisatie van robots.txt.

Van handmatige dashboardschakelaar naar automatische handhaving

Cloudflare gaf site-eigenaren op 1 juli 2026 voor het eerst gedetailleerde controle over AI-botverkeer, waarmee ze crawlers apart konden toestaan of blokkeren binnen dezelfde drie categorieën, Search, Agent en Training, vanuit het dashboard. Bot Preference Sync, zeven weken later aangekondigd op 22 augustus, is de automatiseringslaag die het resulterende robots.txt-bestand afstemt op die dashboardkeuzes. Eigenaren hoeven het statische tekstbestand niet langer zelf bij te werken telkens als een voorkeur verandert; Cloudflare regelt die stap automatisch.

Deze verschuiving haalt de controle over de AI-crawlrechten van een site weg uit een document dat de meeste eigenaren nooit openen, en verplaatst die naar een product dat Cloudflare actief blijft uitbouwen via opeenvolgende releases. Zodra het standaardgedrag van robots.txt wordt gegenereerd door dashboardinstellingen in plaats van door wie het bestand het laatst bewerkte, gaat het praktische AI-trainingsbeleid van een groot deel van het web afhangen van de standaardwaarden die Cloudflare kiest te leveren. Een gemengd gebruikte crawler, die zowel zoekindexering als AI-training doet, moet aan vier specifieke criteria voldoen, waaronder het respecteren van robots.txt-voorkeuren en het bieden van inzicht op URL-niveau in wat er is gecrawld en met welk doel, om niet geblokkeerd te worden zodra een eigenaar Training op Disallow zet.

De nieuwe vinkje-beslissing voor site-eigenaren in de EU en het VK

Elk bedrijf in de EU of het VK dat een website runt, staat nu voor een AI-trainingsbeslissing die neerkomt op een vinkje in een dashboard. De meeste site-eigenaren openen hun Cloudflare-botinstellingen nooit, wat betekent dat de standaardwaarden die het platform kiest, zoals de preset voor advertentie-gefinancierde sites die Training uitschakelt, uiteindelijk voor veel sites het feitelijke beleid bepalen, ongeacht of de eigenaar ooit actief heeft gekozen. Voor het eerst levert stilzwijgen een concreet, automatisch afgedwongen resultaat op.

Eigenaren die een bewust beleid willen, of dat nu betekent dat ze AI-trainingscrawlers toestaan, ze overal blokkeren of ze alleen beperken op advertentie-gefinancierde pagina's, kunnen dat beleid nu in enkele minuten instellen via hetzelfde dashboard dat ook voor Search- en Agent-verkeer wordt gebruikt. De vier Training-opties bieden voldoende bandbreedte om de meeste redactionele of commerciële posities te weerspiegelen zonder een tekstbestand direct aan te raken. Bedrijven die de instellingenpagina overslaan, ontlopen geen beslissing; ze accepteren simpelweg de standaardwaarde die Cloudflare of het eigen siteprofiel hun toewijst.