Cómo mantiene Bot Preference Sync actualizado el robots.txt

Cloudflare anunció Bot Preference Sync en su blog oficial el 22 de agosto de 2026, una función que mantiene automáticamente el archivo robots.txt de un sitio alineado con las políticas de bots de IA que un propietario ya configuró en el panel de Cloudflare. La herramienta abarca tres categorías de bots - Búsqueda, Agente y Entrenamiento - de modo que una sola decisión en el panel actualiza las reglas de los tres tipos de rastreador a la vez. Cloudflare genera o actualiza el robots.txt a partir de la configuración a nivel de zona del sitio, de modo que los ajustes ya guardados para ese dominio controlan automáticamente el archivo de texto resultante.

Las nuevas directivas se anteponen al archivo robots.txt existente, lo que conserva cualquier regla Disallow que el propietario ya hubiera escrito a mano. Cloudflare también mantiene el archivo al día apoyándose en su propia lista de clasificación de bots, BotBase, de modo que las entradas se actualizan automáticamente a medida que se añaden nuevos bots a las categorías bloqueadas o prohibidas. La función puede activarse o desactivarse en cualquier momento y está disponible para todos los clientes de Cloudflare, desde el plan gratuito hasta Enterprise, con un despliegue dentro de la semana posterior al anuncio.

Qué ocurre automáticamente en sitios nuevos y sitios financiados por publicidad

Los clientes nuevos de Cloudflare empiezan sin ningún bloqueo de bots en este sistema, dejando toda la decisión de política en manos del propietario del sitio. Los sitios que se identifican como financiados por publicidad, es decir, que declaran que monetizan páginas con anuncios, pueden elegir en cambio un preset que pone la categoría Entrenamiento en Disallow por defecto. Esa sola distinción ya muestra cómo el modelo de negocio declarado de un sitio, y no una decisión técnica deliberada, puede definir su exposición al entrenamiento de IA antes de que el propietario escriba una sola regla.

La categoría Entrenamiento tiene cuatro opciones de configuración distintas: Allow, Block on pages that serve ads, Block everywhere y Disallow, que escribe una preferencia de no entrenamiento directamente en el robots.txt. El tráfico de Búsqueda y de Agente se controla por separado del de Entrenamiento, de modo que un propietario puede mantener un sitio totalmente abierto a la indexación de búsqueda mientras restringe o bloquea los rastreadores que recopilan contenido para conjuntos de datos de entrenamiento de IA. Como estas decisiones viven en un panel y no en un archivo mantenido a mano, un cambio de política surte efecto en la siguiente sincronización del robots.txt.

Del interruptor manual del panel a la aplicación automática

Cloudflare dio a los propietarios de sitios un control granular sobre el tráfico de bots de IA por primera vez el 1 de julio de 2026, permitiéndoles permitir o bloquear por separado los rastreadores en las mismas tres categorías, Búsqueda, Agente y Entrenamiento, desde el panel. Bot Preference Sync, anunciado siete semanas después, el 22 de agosto, es la capa de automatización que mantiene el robots.txt resultante alineado con esas decisiones del panel. Los propietarios ya no necesitan mantener a mano el archivo de texto estático cada vez que cambia una preferencia; Cloudflare se encarga de ese paso automáticamente.

Este cambio saca el control de los permisos de rastreo de IA de un sitio de un documento que la mayoría de los propietarios nunca abre y lo traslada a un producto que Cloudflare sigue construyendo activamente a través de lanzamientos sucesivos. En cuanto el comportamiento predeterminado del robots.txt lo genera la configuración del panel y no quien editó el archivo por última vez, la política práctica de entrenamiento de IA de una gran parte de la web pasa a depender de los valores predeterminados que Cloudflare decida enviar. Un rastreador de uso mixto, que hace tanto indexación de búsqueda como entrenamiento de IA, debe cumplir cuatro criterios concretos, entre ellos respetar las preferencias del robots.txt y ofrecer visibilidad a nivel de URL sobre qué se rastreó y con qué fin, para evitar quedar bloqueado cuando un propietario pone Entrenamiento en Disallow.

La nueva decisión de casilla para propietarios de sitios en la UE y el Reino Unido

Cualquier empresa de la UE o el Reino Unido que gestione un sitio web afronta ahora una decisión de entrenamiento de IA que se reduce a una casilla en un panel. La mayoría de los propietarios de sitios nunca abren su página de ajustes de bots de Cloudflare, lo que significa que los valores predeterminados elegidos por la plataforma, como el preset financiado por publicidad que pone Entrenamiento en Disallow, acabarán fijando la política real de muchos sitios, hayan decidido o no de forma activa. Por primera vez, el silencio produce un resultado concreto y aplicado automáticamente.

Los propietarios que quieran una política deliberada, ya sea permitir los rastreadores de entrenamiento de IA, bloquearlos por completo o restringirlos solo en páginas financiadas por publicidad, pueden fijar ahora esa política en minutos desde el mismo panel que ya usan para el tráfico de Búsqueda y de Agente. Las cuatro opciones de Entrenamiento ofrecen margen suficiente para reflejar la mayoría de las posturas editoriales o comerciales sin tocar un archivo de texto directamente. Las empresas que se saltan la página de ajustes no están evitando una decisión, simplemente aceptan el valor predeterminado que Cloudflare o el propio perfil del sitio les asigna.