Étiquette : Crawl

Exploration, logs, budget crawl, priorisation et gestion des paramètres d’URL.

Cloudflare
SEO technique

Cloudflare permet de refuser l’entraînement IA sans bloquer Googlebot

Cloudflare ajoute un réglage pour refuser l’entraînement IA tout en conservant l’accès des robots de recherche.L’option « Block » bloque désormais aussi Googlebot, Applebot et Bingbot, tandis que la prise en charge du refus reste incomplète chez Bing.

Wikipédia
GEO & visibilité dans l’IA

Quels effets les AI Overviews ont-ils sur Wikipédia ?

Une étude estime à environ 5 % la baisse des visites issues des moteurs vers Wikipédia en anglais après les AI Overviews.Wikimedia constate aussi un recul des pages vues humaines et une pression accrue des robots sur ses serveurs.

Eclairage Google
SEO technique

Sitemap : Google déconseille de changer son URL chaque jour

Ajouter quotidiennement un horodatage à l’URL d’un sitemap vise à provoquer un nouveau passage des moteurs de recherche. Google déconseille cette méthode et recommande de conserver des URL stables, associées à des dates de modification exactes.

Agent IA
SEO technique

Pages Markdown pour les agents IA : ce que montrent les logs

Le Markdown promet des pages plus légères et plus simples à traiter pour les agents IA. Les observations de John Mueller montrent toutefois que les principaux robots ne semblent pas encore demander ce format.

Code
SEO technique

Google modifie les URL de clic dans ses résultats de recherche

Google déploie une redirection intermédiaire sur les liens de ses résultats de recherche afin de renforcer ses protections contre les abus. Les clics peuvent désormais passer par une URL google.com/goto avant d’atteindre la page de destination.

Recherche Google
Veille Google & SERP

Google corrige deux bugs dans Search et Search Console

Google a corrigé deux bugs apparus en août, l’un faisant disparaître les favicons de nombreux résultats de recherche et l’autre supprimant deux jours de données dans les statistiques de crawl de Search Console. Les deux incidents semblent désormais résolus.

Crawlers
SEO technique

JavaScript peut rendre des pages invisibles aux crawlers IA

Pendant 41 jours, une expérience a comparé des pages reliées en HTML à d’autres accessibles uniquement par des liens injectés en JavaScript. GPTBot, ClaudeBot et plusieurs autres crawlers IA n’ont découvert aucune page via ces liens, tandis que Googlebot n’en a atteint que 2 %.

Code php
SEO technique

Google Search supportera la nouvelle méthode HTTP QUERY

Google Search prendra à terme en charge la nouvelle méthode HTTP QUERY, conçue pour combiner certaines propriétés de GET et POST. Gary Illyes estime qu’elle pourrait notamment simplifier les navigations à facettes et les systèmes de filtres complexes.

Code IA
Veille Google & SERP

Meta crawlerait le web pour construire son propre index de recherche

Des traces de crawl attribuées à Meta ont été observées sur plusieurs sites, alimentant l’hypothèse d’un index web développé en interne. L’objectif évoqué serait notamment de permettre aux services d’IA du groupe de s’appuyer sur leurs propres données de recherche plutôt que sur celles d’un partenaire.

Llms.txt
SEO technique

GEO : un faux fichier cats.txt passe les mêmes “tests” que llms.txt

Mark Williams-Cook a créé un faux standard baptisé cats.txt pour tester les arguments habituellement avancés en faveur de llms.txt. Le fichier a été crawlé, indexé, repris par des IA et même recommandé par ChatGPT, sans que cela démontre qu’il soit utilisé comme un signal spécifique.