Jak Bot Preference Sync utrzymuje aktualny plik robots.txt
Cloudflare ogłosił Bot Preference Sync na swoim oficjalnym blogu 22 sierpnia 2026 roku, czyli funkcję, która automatycznie utrzymuje plik robots.txt witryny zgodny z politykami dotyczącymi botów AI, jakie właściciel już skonfigurował w panelu Cloudflare. Narzędzie obejmuje trzy kategorie botów - Wyszukiwanie, Agent i Trening - dzięki czemu jeden wybór w panelu aktualizuje reguły dla wszystkich trzech typów robotów naraz. Cloudflare generuje lub aktualizuje plik robots.txt na podstawie konfiguracji strefy danej witryny, więc już zapisane ustawienia dla tej domeny automatycznie sterują powstałym plikiem tekstowym.
Nowe dyrektywy są dodawane przed istniejącym plikiem robots.txt, co zachowuje wszystkie reguły Disallow, jakie właściciel wcześniej wpisał ręcznie. Cloudflare utrzymuje plik aktualny również dzięki własnej liście klasyfikacji botów, BotBase, dzięki czemu wpisy aktualizują się automatycznie, gdy nowe boty trafiają do kategorii zablokowanych lub odrzuconych. Funkcję można w każdej chwili włączyć lub wyłączyć, a jest ona dostępna dla wszystkich klientów Cloudflare, od planu Free po Enterprise, z wdrożeniem w ciągu tygodnia od ogłoszenia.
Co dzieje się automatycznie w nowych witrynach i witrynach finansowanych z reklam
Nowi klienci Cloudflare zaczynają w tym systemie bez żadnych blokad botów, dzięki czemu cała decyzja o polityce należy do właściciela witryny. Witryny, które określają się jako finansowane z reklam, czyli deklarują, że zarabiają na stronach z reklamami, mogą zamiast tego wybrać ustawienie domyślne, które ustawia kategorię Trening na Disallow domyślnie. Ta jedna różnica już pokazuje, jak zadeklarowany model biznesowy witryny, a nie świadoma decyzja techniczna, może określać jej ekspozycję na trening AI, zanim właściciel napisze choćby jedną regułę.
Kategoria Trening ma cztery odrębne opcje konfiguracji: Allow, Block on pages that serve ads, Block everywhere oraz Disallow, która zapisuje preferencję braku treningu bezpośrednio w pliku robots.txt. Ruch Wyszukiwania i Agenta można kontrolować osobno od Treningu, dzięki czemu właściciel może utrzymać witrynę w pełni otwartą na indeksowanie w wyszukiwarkach, jednocześnie ograniczając lub blokując roboty, które zbierają treści do zbiorów danych treningowych AI. Ponieważ te wybory znajdują się w panelu, a nie w ręcznie utrzymywanym pliku, zmiana polityki zaczyna obowiązywać przy kolejnej synchronizacji pliku robots.txt.
Od ręcznego przełącznika w panelu do automatycznego egzekwowania
Cloudflare po raz pierwszy dał właścicielom witryn szczegółową kontrolę nad ruchem botów AI 1 lipca 2026 roku, pozwalając im osobno zezwalać lub blokować roboty w tych samych trzech kategoriach, Wyszukiwanie, Agent i Trening, z poziomu panelu. Bot Preference Sync, ogłoszony siedem tygodni później, 22 sierpnia, jest warstwą automatyzacji, która utrzymuje powstały plik robots.txt zgodny z tymi wyborami w panelu. Właściciele nie muszą już ręcznie utrzymywać statycznego pliku tekstowego przy każdej zmianie preferencji; Cloudflare wykonuje ten krok automatycznie.
Ta zmiana przenosi kontrolę nad uprawnieniami do crawlowania AI danej witryny z dokumentu, którego większość właścicieli nigdy nie otwiera, do produktu, który Cloudflare aktywnie rozbudowuje w kolejnych wydaniach. Gdy tylko domyślne zachowanie pliku robots.txt zaczyna być generowane przez ustawienia panelu, a nie przez osobę, która ostatnio edytowała plik, praktyczna polityka treningu AI dla dużej części sieci zaczyna zależeć od wartości domyślnych, jakie zdecyduje się dostarczyć Cloudflare. Robot o mieszanym zastosowaniu, wykonujący zarówno indeksowanie do wyszukiwarek, jak i trening AI, musi spełnić cztery konkretne kryteria, w tym respektowanie preferencji z pliku robots.txt oraz zapewnienie widoczności na poziomie adresu URL tego, co zostało przeskanowane i w jakim celu, aby uniknąć zablokowania, gdy właściciel ustawi Trening na Disallow.
Nowa decyzja w formie checkboxa dla właścicieli witryn w UE i Wielkiej Brytanii
Każda firma z UE lub Wielkiej Brytanii prowadząca witrynę internetową staje teraz przed decyzją dotyczącą treningu AI, która sprowadza się do checkboxa w panelu. Większość właścicieli witryn nigdy nie otwiera strony ustawień botów Cloudflare, co oznacza, że domyślne wartości wybrane przez platformę, takie jak ustawienie domyślne dla witryn finansowanych z reklam, wyłączające Trening, ostatecznie ustalą faktyczną politykę wielu witryn, niezależnie od tego, czy właściciel kiedykolwiek dokonał świadomego wyboru. Po raz pierwszy milczenie daje konkretny, automatycznie egzekwowany rezultat.
Właściciele, którzy chcą świadomej polityki, niezależnie od tego, czy oznacza to zezwolenie na roboty treningowe AI, zablokowanie ich wszędzie, czy ograniczenie ich tylko do stron finansowanych z reklam, mogą teraz ustalić tę politykę w kilka minut za pomocą tego samego panelu, który jest już używany dla ruchu Wyszukiwania i Agenta. Cztery opcje Treningu dają wystarczający zakres, aby odzwierciedlić większość stanowisk redakcyjnych lub komercyjnych bez bezpośredniej ingerencji w plik tekstowy. Firmy, które pomijają stronę ustawień, nie unikają decyzji; po prostu akceptują wartość domyślną, jaką przypisze im Cloudflare albo profil ich własnej witryny.
Czytaj dalej: Nowa przeglądarka Cloudflare obniża koszty, nie czas | Specyfikacja wyprzedza produkt o trzy rewizje



