Cloudflare permet de refuser l’entraînement IA sans bloquer Googlebot

Cloudflare ajoute un réglage pour refuser l’entraînement IA tout en conservant l’accès des robots de recherche.L’option « Block » bloque désormais aussi Googlebot, Applebot et Bingbot, tandis que la prise en charge du refus reste incomplète chez Bing.

Cloudflare
Illustration générée par IA — Position Zéro
Partager
Dans cet articleSommaire
  1. Deux réglages aux effets différents sur le crawl
  2. Les anciens choix migrent automatiquement
  3. Google et Apple disposent déjà de directives, Bing doit les compléter
  4. Des engagements de transparence pour les robots mixtes

Cloudflare, fournisseur de services de sécurité et de diffusion de contenus web, a annoncé le 15 septembre l’option « Disallow AI Training ». Elle rejoint le contrôle « Training », aux côtés des réglages « Search » pour la recherche et « Agent » pour les visites effectuées à la demande d’un utilisateur.

Deux réglages aux effets différents sur le crawl

« Disallow AI Training » publie une préférence dans le robots.txt pour refuser l’entraînement. Les robots à usage mixte reconnus par Cloudflare restent autorisés à explorer le site pour la recherche. Il s’agit de Googlebot, Applebot et Bingbot.

Les autres robots d’entraînement IA sont bloqués. Cela comprend les robots spécialisés d’Amazon, d’Anthropic, de Meta et d’OpenAI, dont les fonctions de recherche et d’entraînement reposent sur des crawlers distincts.

Le réglage « Block » impose désormais un blocage complet des crawlers concernés, y compris les trois robots mixtes. « Block on pages with ads » applique ce blocage aux pages où Cloudflare détecte des publicités. Jusqu’ici, ces deux options épargnaient les robots mixtes afin de préserver leur accès pour la recherche.

Les anciens choix migrent automatiquement

Cloudflare prévoit de transférer les réglages « Block » et « Block on pages with ads » du contrôle Training vers la nouvelle option de refus. L’entreprise indique que la plupart des clients n’ont aucune intervention à effectuer.

Pour les sites qui utilisaient seulement l’ancien bouton « Block AI Bots », avec l’une de ces deux options, la migration prévoit trois choix.

ContrôleRéglage après migration
SearchAllow
TrainingDisallow AI Training
AgentBlock on pages with ads

« Block AI Bots » doit disparaître au profit de ces contrôles séparés. La gestion automatique du fichier robots.txt, appelée « Managed Robots.txt », sera remplacée par le service Bot Preference Sync.

Publicité

Google et Apple disposent déjà de directives, Bing doit les compléter

Chez Google, le refus repose sur une règle Disallow destinée à Google-Extended. Ce mécanisme contrôle notamment l’usage des contenus pour entraîner les modèles Gemini. Google précise qu’il ne modifie pas le classement ni l’inclusion du site dans Search.

Le retrait des fonctionnalités IA de la recherche passe par un autre réglage, dans Search Console. Il couvre AI Overviews, AI Mode et les fonctions génératives de Discover, sans agir sur l’entraînement.

Chez Apple, Cloudflare utilise Applebot-Extended. Cette directive ne bloque pas Applebot et n’entre pas dans le classement des résultats. Apple distingue également l’entraînement des réponses génératives, pour lesquelles la balise nosnippet permet d’exprimer un refus.

Pour Bing, la prise en charge reste attendue. « Disallow AI Training » ne transmet pas encore de refus exploitable par Microsoft dans robots.txt. Le mécanisme actuel repose sur la balise NOARCHIVE, qui exclut aussi les liens vers le contenu dans Chat et Copilot. Cloudflare annonce un objectif de prise en charge via robots.txt début 2027.

Des engagements de transparence pour les robots mixtes

Cloudflare attribue le statut « Accountable » aux opérateurs qui proposent, ou s’engagent à proposer, un refus de l’entraînement, un retrait des résumés IA et un suivi à l’échelle des URL. Ils doivent aussi garantir que le refus d’entraînement n’affecte pas la recherche traditionnelle.

Ce dispositif prévoit des informations sur les pages mises à disposition pour l’entraînement et des mesures de leur présence dans les résultats. Le suivi de l’utilisation des contenus doit ainsi être complété par des outils propres aux opérateurs. Selon Cloudflare, Google prépare un outil de transparence lié à Google-Extended pour les prochaines semaines et Apple pour l’année prochaine.

Cloudflare vise enfin un contrôle commun des résumés début 2027, afin de régler depuis son interface la quantité de contenu reprise par les différents services. Il s’agit d’un objectif annoncé, pas d’une fonction déjà disponible.

Jordan Belly
Auteur

Jordan Belly

Rédacteur web SEO à Toulouse, j’interviens depuis plus de vingt ans sur le contenu éditorial, dont plus de douze ans dédiés au référencement naturel. J’accompagne les entreprises dans la construction de leur visibilité en ligne, en m’appuyant sur une veille continue des évolutions de Google et des moteurs basés sur l’IA. Je continue par ailleurs à écrire pour la presse spécialisée (Système D, Le Particulier, UFC Que Choisir…) et suis l’auteur du Guide du rédacteur web (Edi.Pro).

Voir ses publications
À lire aussi

À lire ensuite