Cloudflare, fournisseur de services de sécurité et de diffusion de contenus web, a annoncé le 15 septembre l’option « Disallow AI Training ». Elle rejoint le contrôle « Training », aux côtés des réglages « Search » pour la recherche et « Agent » pour les visites effectuées à la demande d’un utilisateur.
Deux réglages aux effets différents sur le crawl
« Disallow AI Training » publie une préférence dans le robots.txt pour refuser l’entraînement. Les robots à usage mixte reconnus par Cloudflare restent autorisés à explorer le site pour la recherche. Il s’agit de Googlebot, Applebot et Bingbot.
Les autres robots d’entraînement IA sont bloqués. Cela comprend les robots spécialisés d’Amazon, d’Anthropic, de Meta et d’OpenAI, dont les fonctions de recherche et d’entraînement reposent sur des crawlers distincts.
Le réglage « Block » impose désormais un blocage complet des crawlers concernés, y compris les trois robots mixtes. « Block on pages with ads » applique ce blocage aux pages où Cloudflare détecte des publicités. Jusqu’ici, ces deux options épargnaient les robots mixtes afin de préserver leur accès pour la recherche.
Les anciens choix migrent automatiquement
Cloudflare prévoit de transférer les réglages « Block » et « Block on pages with ads » du contrôle Training vers la nouvelle option de refus. L’entreprise indique que la plupart des clients n’ont aucune intervention à effectuer.
Pour les sites qui utilisaient seulement l’ancien bouton « Block AI Bots », avec l’une de ces deux options, la migration prévoit trois choix.
| Contrôle | Réglage après migration |
|---|---|
| Search | Allow |
| Training | Disallow AI Training |
| Agent | Block on pages with ads |
« Block AI Bots » doit disparaître au profit de ces contrôles séparés. La gestion automatique du fichier robots.txt, appelée « Managed Robots.txt », sera remplacée par le service Bot Preference Sync.
Google et Apple disposent déjà de directives, Bing doit les compléter
Chez Google, le refus repose sur une règle Disallow destinée à Google-Extended. Ce mécanisme contrôle notamment l’usage des contenus pour entraîner les modèles Gemini. Google précise qu’il ne modifie pas le classement ni l’inclusion du site dans Search.
Le retrait des fonctionnalités IA de la recherche passe par un autre réglage, dans Search Console. Il couvre AI Overviews, AI Mode et les fonctions génératives de Discover, sans agir sur l’entraînement.
Chez Apple, Cloudflare utilise Applebot-Extended. Cette directive ne bloque pas Applebot et n’entre pas dans le classement des résultats. Apple distingue également l’entraînement des réponses génératives, pour lesquelles la balise nosnippet permet d’exprimer un refus.
Pour Bing, la prise en charge reste attendue. « Disallow AI Training » ne transmet pas encore de refus exploitable par Microsoft dans robots.txt. Le mécanisme actuel repose sur la balise NOARCHIVE, qui exclut aussi les liens vers le contenu dans Chat et Copilot. Cloudflare annonce un objectif de prise en charge via robots.txt début 2027.
Des engagements de transparence pour les robots mixtes
Cloudflare attribue le statut « Accountable » aux opérateurs qui proposent, ou s’engagent à proposer, un refus de l’entraînement, un retrait des résumés IA et un suivi à l’échelle des URL. Ils doivent aussi garantir que le refus d’entraînement n’affecte pas la recherche traditionnelle.
Ce dispositif prévoit des informations sur les pages mises à disposition pour l’entraînement et des mesures de leur présence dans les résultats. Le suivi de l’utilisation des contenus doit ainsi être complété par des outils propres aux opérateurs. Selon Cloudflare, Google prépare un outil de transparence lié à Google-Extended pour les prochaines semaines et Apple pour l’année prochaine.
Cloudflare vise enfin un contrôle commun des résumés début 2027, afin de régler depuis son interface la quantité de contenu reprise par les différents services. Il s’agit d’un objectif annoncé, pas d’une fonction déjà disponible.




