Wie Bot Preference Sync die robots.txt aktuell hält

Cloudflare hat Bot Preference Sync am 22. August 2026 im eigenen Blog angekündigt, eine Funktion, die die robots.txt-Datei einer Website automatisch mit den KI-Bot-Richtlinien abgleicht, die ein Inhaber bereits im Cloudflare-Dashboard eingestellt hat. Das Werkzeug deckt drei Bot-Kategorien ab - Search, Agent und Training - sodass eine einzige Dashboard-Entscheidung die Regeln für alle drei Crawler-Typen gleichzeitig aktualisiert. Cloudflare erzeugt oder aktualisiert die robots.txt auf Basis der Zonen-Konfiguration der jeweiligen Website, sodass die bereits gespeicherten Einstellungen die resultierende Textdatei automatisch steuern.

Neue Anweisungen werden der bestehenden robots.txt-Datei vorangestellt, wodurch alle bereits von Hand eingetragenen Disallow-Regeln erhalten bleiben. Cloudflare hält die Datei zusätzlich mit der eigenen BotBase-Klassifizierungsliste aktuell, sodass sich die Einträge automatisch aktualisieren, sobald neue Bots in blockierte oder ausgeschlossene Kategorien aufgenommen werden. Die Funktion lässt sich jederzeit ein- oder ausschalten und steht jedem Cloudflare-Kunden zur Verfügung, vom Free-Tarif bis Enterprise, mit einem Rollout innerhalb der Woche nach der Ankündigung.

Was bei neuen und werbefinanzierten Websites automatisch passiert

Neukunden von Cloudflare starten in diesem System zunächst ganz ohne Bot-Sperren, sodass die gesamte Richtlinienentscheidung beim Website-Inhaber liegt. Websites, die sich als werbefinanziert einstufen, also angeben, dass sie Seiten mit Werbung monetarisieren, können stattdessen ein Preset wählen, das die Kategorie Training standardmäßig auf Disallow setzt. Schon dieser eine Unterschied zeigt, wie das angegebene Geschäftsmodell einer Website, und nicht eine bewusste technische Entscheidung, die KI-Trainingsexposition bestimmen kann, bevor der Inhaber auch nur eine Regel schreibt.

Für die Kategorie Training stehen vier eigenständige Konfigurationsoptionen zur Verfügung: Allow, Block on pages that serve ads, Block everywhere und Disallow, wobei Letzteres eine No-Training-Präferenz direkt in die robots.txt schreibt. Search- und Agent-Traffic lassen sich getrennt von Training steuern, sodass ein Inhaber eine Website vollständig für die Suchindexierung offen halten und gleichzeitig Crawler einschränken oder blockieren kann, die Inhalte für KI-Trainingsdatensätze sammeln. Da diese Entscheidungen im Dashboard und nicht in einer manuell gepflegten Datei liegen, greift eine Änderung beim nächsten Sync der robots.txt-Ausgabe.

Vom manuellen Dashboard-Schalter zur automatischen Durchsetzung

Cloudflare hat Website-Inhabern am 1. Juli 2026 erstmals eine feingliedrige Kontrolle über KI-Bot-Traffic gegeben und ihnen erlaubt, Crawler in denselben drei Kategorien, Search, Agent und Training, getrennt im Dashboard zu erlauben oder zu blockieren. Bot Preference Sync, sieben Wochen später am 22. August angekündigt, ist die Automatisierungsebene, die die resultierende robots.txt-Datei mit diesen Dashboard-Entscheidungen abgleicht. Inhaber müssen die statische Textdatei nicht mehr bei jeder Änderung von Hand pflegen, Cloudflare übernimmt diesen Schritt automatisch.

Die Verschiebung nimmt die Kontrolle über die KI-Crawling-Berechtigungen einer Website aus einem Dokument, das die meisten Inhaber nie öffnen, und verlagert sie in ein Produkt, das Cloudflare über aufeinanderfolgende Releases aktiv weiterentwickelt. Sobald das Standardverhalten der robots.txt durch Dashboard-Einstellungen erzeugt wird und nicht durch denjenigen, der die Datei zuletzt bearbeitet hat, hängt die praktische KI-Trainingspolitik eines großen Teils des Webs davon ab, welche Standardwerte Cloudflare ausliefert. Ein Crawler mit gemischter Nutzung, der sowohl für die Suchindexierung als auch für KI-Training arbeitet, muss vier konkrete Kriterien erfüllen, darunter die Beachtung der robots.txt-Präferenzen und eine URL-genaue Transparenz darüber, was zu welchem Zweck gecrawlt wurde, um nicht blockiert zu werden, sobald ein Inhaber Training auf Disallow stellt.

Die neue Checkbox-Entscheidung für Website-Betreiber in der EU und im UK

Jedes Unternehmen aus der EU oder dem UK, das eine Website betreibt, steht nun vor einer KI-Trainingsentscheidung, die sich auf eine Checkbox im Dashboard reduziert. Die meisten Website-Inhaber öffnen ihre Cloudflare-Bot-Einstellungen nie, was bedeutet, dass die von der Plattform gewählten Standardwerte, etwa das werbefinanzierte Preset, das Training auf Disallow setzt, für viele Websites die tatsächliche Politik festlegen, unabhängig davon, ob der Inhaber jemals aktiv entscheidet. Schweigen erzeugt damit zum ersten Mal ein konkretes, automatisch durchgesetztes Ergebnis.

Inhaber, die eine bewusste Politik wollen, sei es KI-Trainings-Crawler zu erlauben, sie überall zu blockieren oder sie nur auf werbefinanzierten Seiten einzuschränken, können diese Politik jetzt in wenigen Minuten über dasselbe Dashboard festlegen, das auch für Search- und Agent-Traffic genutzt wird. Die vier Optionen für Training decken genug Bandbreite ab, um die meisten redaktionellen oder kommerziellen Positionen abzubilden, ohne eine Textdatei direkt anzufassen. Unternehmen, die die Einstellungsseite überspringen, treffen damit keine Nicht-Entscheidung, sie akzeptieren lediglich den Standardwert, den Cloudflare oder das eigene Website-Profil ihnen zuweist.