Comment Bot Preference Sync maintient le robots.txt à jour
Cloudflare a annoncé Bot Preference Sync sur son blog officiel le 22 août 2026, une fonction qui maintient automatiquement le fichier robots.txt d'un site aligné sur les règles de bots IA qu'un propriétaire a déjà configurées dans le tableau de bord Cloudflare. L'outil couvre trois catégories de bots - Recherche, Agent et Entraînement - de sorte qu'un seul choix dans le tableau de bord met à jour les règles des trois types de robots d'indexation à la fois. Cloudflare génère ou met à jour le robots.txt à partir de la configuration au niveau de la zone du site, si bien que les réglages déjà enregistrés pour ce domaine pilotent automatiquement le fichier texte obtenu.
Les nouvelles directives sont placées avant le fichier robots.txt existant, ce qui préserve toute règle Disallow que le propriétaire avait déjà écrite à la main. Cloudflare garde aussi le fichier à jour grâce à sa propre liste de classification des bots, BotBase, de sorte que les entrées se mettent à jour automatiquement à mesure que de nouveaux bots rejoignent les catégories bloquées ou interdites. La fonction peut être activée ou désactivée à tout moment et elle est proposée à tous les clients Cloudflare, du plan gratuit à Enterprise, avec un déploiement prévu dans la semaine suivant l'annonce.
Ce qui se passe automatiquement pour les sites neufs et les sites monétisés par la publicité
Les nouveaux clients de Cloudflare démarrent sans aucun blocage de bots dans ce système, laissant tout le choix de politique au propriétaire du site. Les sites qui se déclarent monétisés par la publicité, c'est-à-dire qui indiquent monétiser des pages avec des annonces, peuvent au contraire choisir un préréglage qui place la catégorie Entraînement sur Disallow par défaut. Cette seule distinction montre déjà comment le modèle économique déclaré d'un site, et non un choix technique délibéré, peut déterminer son exposition à l'entraînement de l'IA avant même que le propriétaire n'écrive une seule règle.
La catégorie Entraînement propose quatre options de configuration distinctes: Allow, Block on pages that serve ads, Block everywhere et Disallow, cette dernière écrivant une préférence de non-entraînement directement dans le robots.txt. Le trafic de Recherche et celui d'Agent restent contrôlables séparément de celui d'Entraînement, si bien qu'un propriétaire peut garder un site totalement ouvert à l'indexation par les moteurs de recherche tout en restreignant ou en bloquant les robots qui collectent du contenu pour des jeux de données d'entraînement de l'IA. Comme ces choix résident dans un tableau de bord et non dans un fichier maintenu à la main, un changement de politique prend effet à la prochaine synchronisation du robots.txt.
Du bouton manuel du tableau de bord à l'application automatique
Cloudflare a donné aux propriétaires de sites un contrôle granulaire sur le trafic des bots IA pour la première fois le 1er juillet 2026, en leur permettant d'autoriser ou de bloquer séparément les robots dans les trois mêmes catégories, Recherche, Agent et Entraînement, depuis le tableau de bord. Bot Preference Sync, annoncé sept semaines plus tard, le 22 août, est la couche d'automatisation qui garde le robots.txt obtenu aligné sur ces choix du tableau de bord. Les propriétaires n'ont plus besoin de tenir à jour à la main le fichier texte statique à chaque changement de préférence; Cloudflare s'en charge automatiquement.
Ce changement retire le contrôle des autorisations de crawl IA d'un site d'un document que la plupart des propriétaires n'ouvrent jamais, et le place dans un produit que Cloudflare continue de construire activement à travers des versions successives. Dès que le comportement par défaut du robots.txt est généré par les réglages du tableau de bord et non par la dernière personne à avoir modifié le fichier, la politique pratique d'entraînement IA d'une grande partie du web finit par dépendre des valeurs par défaut que Cloudflare choisit de livrer. Un robot à usage mixte, qui fait à la fois de l'indexation pour la recherche et de l'entraînement IA, doit remplir quatre critères précis, dont le respect des préférences du robots.txt et une visibilité au niveau de l'URL sur ce qui a été exploré et dans quel but, pour éviter d'être bloqué quand un propriétaire place Entraînement sur Disallow.
La nouvelle décision en une case à cocher pour les sites de l'UE et du Royaume-Uni
Toute entreprise de l'UE ou du Royaume-Uni qui exploite un site web fait désormais face à une décision d'entraînement IA qui se résume à une case à cocher dans un tableau de bord. La plupart des propriétaires de sites n'ouvrent jamais leur page de réglages de bots Cloudflare, ce qui signifie que les valeurs par défaut choisies par la plateforme, comme le préréglage pour sites monétisés par la publicité qui désactive Entraînement, finiront par fixer la politique réelle de nombreux sites, que le propriétaire ait ou non fait un choix actif. Pour la première fois, le silence produit un résultat concret et appliqué automatiquement.
Les propriétaires qui veulent une politique délibérée, qu'il s'agisse d'autoriser les robots d'entraînement IA, de les bloquer partout ou de les restreindre uniquement sur les pages monétisées par la publicité, peuvent désormais fixer cette politique en quelques minutes depuis le même tableau de bord déjà utilisé pour le trafic de Recherche et d'Agent. Les quatre options d'Entraînement offrent assez de marge pour refléter la plupart des positions éditoriales ou commerciales sans toucher directement à un fichier texte. Les entreprises qui sautent la page de réglages n'évitent pas une décision: elles acceptent simplement la valeur par défaut que Cloudflare ou le profil de leur propre site leur attribue.
À lire ensuite: Le nouveau navigateur de Cloudflare réduit les coûts | La spécification a trois révisions d'avance sur le produit



