Dans une analyse publiée le 27 septembre 2026, Joost de Valk examine les sitemaps d’Adobe, Anthropic, Manchester City, GOV.UK, X et Semrush. Fondateur de Yoast et créateur de l’extension Sitemap Inspector, il a vérifié les statuts HTTP, les redirections, les directives d’indexation et les balises canonical des URL répertoriées.
Un sitemap doit lister les URL à indexer
Un sitemap XML doit contenir les URL réellement indexables qu’un site souhaite voir apparaître dans les résultats de recherche. Ces adresses doivent répondre correctement et correspondre à la version canonique des pages.
L’absence de lastmod, une date sans heure ou plusieurs pages partageant la même date restent autorisées, même si ces configurations manquent parfois de précision. Une URL qui redirige, renvoie une erreur, porte un noindex ou désigne une autre URL canonique crée en revanche une contradiction directe.
La documentation de Google citée par Joost de Valk précise que le moteur tente d’explorer les adresses telles qu’elles sont inscrites. Une entrée incorrecte peut donc mobiliser inutilement du budget de crawl.
Adobe et Anthropic envoient des signaux contradictoires
Le sitemap UK Learn d’Adobe contient 978 URL. Sur les 100 premières contrôlées, 98 des 100 pages déclarent une autre adresse comme canonique. Elles renvoient vers une adresse de modèle contenant __template__, qui semble avoir remplacé par erreur la destination attendue.
Joost de Valk relève aussi 43 valeurs lastmod utilisées chacune par plus de dix URL. Il ne présente pas cette répétition comme une erreur certaine, contrairement aux balises canonical qui demandent explicitement aux moteurs de retenir une autre page.
Le sitemap d’Anthropic répertorie 537 URL. Les vérifications ont trouvé 21 pages avec noindex, une page en erreur 404 et quatre redirections. Les pages exclues concernent principalement les conditions d’utilisation et les politiques de confidentialité. Leur non-indexation peut être volontaire, mais leur présence dans le sitemap transmet l’instruction inverse.
Manchester City et GOV.UK conservent des URL à écarter
Le sitemap de Manchester City contient 1 964 pages. Joost de Valk y a identifié douze adresses présentes deux fois, avec une date de modification différente pour chaque occurrence.
Parmi les 100 premières URL vérifiées, il a relevé 17 réponses HTTP en erreur et 16 redirections. Plusieurs concernent d’anciens joueurs. Les pages de Riyad Mahrez et Cole Palmer redirigent vers l’effectif masculin, tandis que celles d’Oleksandr Zinchenko et Liam Delap répondent en 404.
Le premier fichier de GOV.UK réunit 25 000 URL. Sur les 500 entrées contrôlées, 118 comportaient une directive noindex. La plupart correspondent à des décisions de tribunaux du travail ou de la propriété résidentielle qui mentionnent des particuliers. Joost de Valk estime leur exclusion probablement volontaire. Leur maintien dans le sitemap reste incompatible avec cette décision.
Toutes les entrées utilisent aussi les attributs priority et changefreq. Google ne les prend pas en compte, mais leur présence n’entraîne pas d’autre conséquence que l’ajout de données inutiles au fichier.
X et Semrush présentent des erreurs de structure
Le fichier robots.txt de X indique l’adresse https://x.com/sitemap.xml aux moteurs de recherche. Cette URL ne renvoie pourtant aucun sitemap à cette adresse, malgré un commentaire consacré au format des pages censées y figurer.
L’index de Semrush répertorie 23 fichiers de sitemap, sans valeur lastmod. Le sitemap consacré aux actualités répond en 404 et un autre redirige vers une page produit.
Joost de Valk a également trouvé deux index de sitemaps imbriqués dans l’index principal. La documentation de Search Console précise qu’un index peut répertorier des sitemaps, mais pas d’autres index de sitemaps.
Des outils différents peuvent créer ces incohérences
Joost de Valk avance une explication fondée sur des systèmes techniques séparés. Le sitemap peut être généré par un outil, tandis que les redirections, les canonical et les directives noindex sont administrées ailleurs. Le fichier XML reste valide, mais aucun contrôle de cohérence ne vérifie ensuite les pages qu’il contient.
Il cite comme contre-exemple les sitemaps produits par Yoast SEO, le plugin qu’il a créé. Parmi ceux qu’il dit avoir testés, aucun ne présentait ces anomalies. Il l’explique par le fait qu’un même système gère le sitemap, les canonical et les directives d’indexation.
L’auteur recommande donc un audit technique qui contrôle les réponses réelles des URL, au-delà de la seule validation du fichier XML.




