Sådan holder Bot Preference Sync robots.txt opdateret

Cloudflare annoncerede Bot Preference Sync på sin officielle blog den 22. august 2026, en funktion der automatisk holder en hjemmesides robots.txt-fil på linje med de AI-bot-politikker, en ejer allerede har indstillet i Cloudflare-dashboardet. Værktøjet dækker tre botkategorier - Søgning, Agent og Træning - så et enkelt valg i dashboardet opdaterer reglerne for alle tre crawlertyper på én gang. Cloudflare genererer eller opdaterer robots.txt ud fra sidens zonekonfiguration, så de allerede gemte indstillinger for det domæne automatisk styrer den resulterende tekstfil.

Nye direktiver sættes foran den eksisterende robots.txt-fil, hvilket bevarer enhver Disallow-regel, ejeren allerede havde skrevet i hånden. Cloudflare holder også filen opdateret ved hjælp af sin egen botklassifikationsliste, BotBase, så posterne opdateres automatisk, efterhånden som nye bots føjes til blokerede eller afviste kategorier. Funktionen kan slås til eller fra når som helst og er tilgængelig for alle Cloudflare-kunder, fra Free til Enterprise, med udrulning inden for ugen efter annonceringen.

Hvad der sker automatisk for nye og annoncefinansierede sider

Nye Cloudflare-kunder starter uden nogen botblokeringer i dette system, så hele politikvalget ligger hos hjemmesidens ejer. Sider, der identificerer sig som annoncefinansierede, altså angiver, at de tjener penge på sider med annoncer, kan i stedet vælge en preset, der sætter kategorien Træning til Disallow som standard. Den ene forskel viser allerede, hvordan en sides erklærede forretningsmodel, og ikke et bevidst teknisk valg, kan afgøre dens AI-træningseksponering, før ejeren overhovedet skriver en regel.

Kategorien Træning har fire selvstændige konfigurationsmuligheder: Allow, Block on pages that serve ads, Block everywhere og Disallow, som skriver en no-training-præference direkte ind i robots.txt. Søgning- og Agent-trafik kan styres separat fra Træning, så en ejer kan holde en side helt åben for søgeindeksering, mens crawlere, der indsamler indhold til AI-træningsdatasæt, begrænses eller blokeres. Fordi disse valg ligger i et dashboard og ikke i en manuelt vedligeholdt fil, træder en politikændring i kraft ved næste synkronisering af robots.txt.

Fra manuel dashboard-kontakt til automatisk håndhævelse

Cloudflare gav for første gang hjemmesideejere granuleret kontrol over AI-bottrafik den 1. juli 2026, så de separat kunne tillade eller blokere crawlere i de samme tre kategorier, Søgning, Agent og Træning, fra dashboardet. Bot Preference Sync, annonceret syv uger senere den 22. august, er automatiseringslaget, der holder den resulterende robots.txt tilpasset de dashboardvalg. Ejere behøver ikke længere selv vedligeholde den statiske tekstfil, hver gang en præference ændres; Cloudflare klarer det trin automatisk.

Dette skift flytter kontrollen over en sides AI-crawltilladelser væk fra et dokument, de fleste ejere aldrig åbner, og ind i et produkt, som Cloudflare fortsat bygger aktivt videre på gennem successive udgivelser. Så snart robots.txt's standardadfærd genereres af dashboardindstillinger og ikke af den, der sidst redigerede filen, kommer den praktiske AI-træningspolitik for en stor del af nettet til at afhænge af de standardværdier, Cloudflare vælger at levere. En crawler med blandet brug, der både laver søgeindeksering og AI-træning, skal opfylde fire specifikke kriterier, herunder at respektere robots.txt-præferencer og give URL-niveau-indsigt i, hvad der blev crawlet og til hvilket formål, for at undgå at blive blokeret, når en ejer sætter Træning til Disallow.

Den nye afkrydsningsbeslutning for EU- og UK-ejere

Enhver virksomhed i EU eller UK, der driver en hjemmeside, står nu over for en AI-træningsbeslutning, der ender som en afkrydsningsboks i et dashboard. De fleste sideejere åbner aldrig deres Cloudflare-botindstillinger, hvilket betyder, at platformens valgte standardværdier, som presetten for annoncefinansierede sider, der slår Træning fra, ender med at fastsætte den faktiske politik for mange sider, uanset om ejeren nogensinde har truffet et aktivt valg. For første gang giver tavshed et konkret, automatisk håndhævet resultat.

Ejere, der ønsker en bevidst politik, uanset om det betyder at tillade AI-træningscrawlere, blokere dem overalt eller kun begrænse dem på annoncefinansierede sider, kan nu fastsætte den politik på få minutter via det samme dashboard, der allerede bruges til Søgning- og Agent-trafik. De fire Træning-muligheder giver rigelig plads til at afspejle de fleste redaktionelle eller kommercielle holdninger uden at røre en tekstfil direkte. Virksomheder, der springer indstillingssiden over, undgår ikke en beslutning; de accepterer blot den standardværdi, som Cloudflare eller sidens egen profil tildeler dem.