Même les grands sites se trompent sur leurs sitemaps XML

Des sitemaps censés guider les moteurs contiennent pourtant des URL en erreur, redirigées, noindex ou déclarées non canoniques. Joost de Valk a contrôlé six sites connus et relevé des incohérences parfois massives entre leurs fichiers XML et les pages listées.

Robot agent IA
Illustration générée par IA — Position Zéro
Partager
Dans cet articleSommaire
  1. Un sitemap doit lister les URL à indexer
  2. Adobe et Anthropic envoient des signaux contradictoires
  3. Manchester City et GOV.UK conservent des URL à écarter
  4. X et Semrush présentent des erreurs de structure
  5. Des outils différents peuvent créer ces incohérences

Dans une analyse publiée le 27 septembre 2026, Joost de Valk examine les sitemaps d’Adobe, Anthropic, Manchester City, GOV.UK, X et Semrush. Fondateur de Yoast et créateur de l’extension Sitemap Inspector, il a vérifié les statuts HTTP, les redirections, les directives d’indexation et les balises canonical des URL répertoriées.

Un sitemap doit lister les URL à indexer

Un sitemap XML doit contenir les URL réellement indexables qu’un site souhaite voir apparaître dans les résultats de recherche. Ces adresses doivent répondre correctement et correspondre à la version canonique des pages.

L’absence de lastmod, une date sans heure ou plusieurs pages partageant la même date restent autorisées, même si ces configurations manquent parfois de précision. Une URL qui redirige, renvoie une erreur, porte un noindex ou désigne une autre URL canonique crée en revanche une contradiction directe.

La documentation de Google citée par Joost de Valk précise que le moteur tente d’explorer les adresses telles qu’elles sont inscrites. Une entrée incorrecte peut donc mobiliser inutilement du budget de crawl.

Adobe et Anthropic envoient des signaux contradictoires

Le sitemap UK Learn d’Adobe contient 978 URL. Sur les 100 premières contrôlées, 98 des 100 pages déclarent une autre adresse comme canonique. Elles renvoient vers une adresse de modèle contenant __template__, qui semble avoir remplacé par erreur la destination attendue.

Publicité

Joost de Valk relève aussi 43 valeurs lastmod utilisées chacune par plus de dix URL. Il ne présente pas cette répétition comme une erreur certaine, contrairement aux balises canonical qui demandent explicitement aux moteurs de retenir une autre page.

Le sitemap d’Anthropic répertorie 537 URL. Les vérifications ont trouvé 21 pages avec noindex, une page en erreur 404 et quatre redirections. Les pages exclues concernent principalement les conditions d’utilisation et les politiques de confidentialité. Leur non-indexation peut être volontaire, mais leur présence dans le sitemap transmet l’instruction inverse.

Manchester City et GOV.UK conservent des URL à écarter

Le sitemap de Manchester City contient 1 964 pages. Joost de Valk y a identifié douze adresses présentes deux fois, avec une date de modification différente pour chaque occurrence.

Parmi les 100 premières URL vérifiées, il a relevé 17 réponses HTTP en erreur et 16 redirections. Plusieurs concernent d’anciens joueurs. Les pages de Riyad Mahrez et Cole Palmer redirigent vers l’effectif masculin, tandis que celles d’Oleksandr Zinchenko et Liam Delap répondent en 404.

Le premier fichier de GOV.UK réunit 25 000 URL. Sur les 500 entrées contrôlées, 118 comportaient une directive noindex. La plupart correspondent à des décisions de tribunaux du travail ou de la propriété résidentielle qui mentionnent des particuliers. Joost de Valk estime leur exclusion probablement volontaire. Leur maintien dans le sitemap reste incompatible avec cette décision.

Toutes les entrées utilisent aussi les attributs priority et changefreq. Google ne les prend pas en compte, mais leur présence n’entraîne pas d’autre conséquence que l’ajout de données inutiles au fichier.

Publicité

X et Semrush présentent des erreurs de structure

Le fichier robots.txt de X indique l’adresse https://x.com/sitemap.xml aux moteurs de recherche. Cette URL ne renvoie pourtant aucun sitemap à cette adresse, malgré un commentaire consacré au format des pages censées y figurer.

L’index de Semrush répertorie 23 fichiers de sitemap, sans valeur lastmod. Le sitemap consacré aux actualités répond en 404 et un autre redirige vers une page produit.

Joost de Valk a également trouvé deux index de sitemaps imbriqués dans l’index principal. La documentation de Search Console précise qu’un index peut répertorier des sitemaps, mais pas d’autres index de sitemaps.

Des outils différents peuvent créer ces incohérences

Joost de Valk avance une explication fondée sur des systèmes techniques séparés. Le sitemap peut être généré par un outil, tandis que les redirections, les canonical et les directives noindex sont administrées ailleurs. Le fichier XML reste valide, mais aucun contrôle de cohérence ne vérifie ensuite les pages qu’il contient.

Il cite comme contre-exemple les sitemaps produits par Yoast SEO, le plugin qu’il a créé. Parmi ceux qu’il dit avoir testés, aucun ne présentait ces anomalies. Il l’explique par le fait qu’un même système gère le sitemap, les canonical et les directives d’indexation.

L’auteur recommande donc un audit technique qui contrôle les réponses réelles des URL, au-delà de la seule validation du fichier XML.

Jordan Belly
Auteur

Jordan Belly

Rédacteur web SEO à Toulouse, j’interviens depuis plus de vingt ans sur le contenu éditorial, dont plus de douze ans dédiés au référencement naturel. J’accompagne les entreprises dans la construction de leur visibilité en ligne, en m’appuyant sur une veille continue des évolutions de Google et des moteurs basés sur l’IA. Je continue par ailleurs à écrire pour la presse spécialisée (Système D, Le Particulier, UFC Que Choisir…) et suis l’auteur du Guide du rédacteur web (Edi.Pro).

Voir ses publications
À lire aussi

À lire ensuite

Gérer mes choix de confidentialité