Comment utiliser cet outil

Recherche de Sitemap XML et Extracteur d’URL

Comment utiliser le chercheur de sitemaps XML

Retour à l’outil

Un domaine entre ; ce qui ressort, c’est chaque fichier sitemap que le site déclare, et les URL contenues dans le fichier que vous ouvrez.

  1. 01

    Saisissez un domaine ou l’adresse d’un sitemap

    Un domaine est l’entrée habituelle : nous lisons robots.txt, puis les emplacements standard à la racine de l’hôte. Collez plutôt une adresse finissant par .xml ou .xml.gz et ce fichier précis devient la racine de l’arbre, utile quand le sitemap se trouve là où robots.txt ne le mentionne jamais. Le chemin d’une page ordinaire est ignoré ; seul son hôte est utilisé.

  2. 02

    Lisez l’arbre des fichiers

    La recherche lit robots.txt puis télécharge les fichiers qu’il nomme — le niveau supérieur, et lui seul. Les fichiers qu’un index de sitemaps déclare sont listés directement depuis le corps de l’index, adresse et Dernière modification comprises, mais rien n’est encore téléchargé pour eux — c’est à cela que sert le bouton Vérifier sur leur ligne. Dix requêtes répondent à la question que presque tout le monde vient poser.

  3. 03

    Vérifiez un fichier pour lire son contenu

    Vérifier récupère ce seul fichier : un clic, une requête. Un ensemble d’URL ouvre ses URL de page avec leurs dates de Dernière modification. Un index ajoute ses enfants à l’arbre comme nouvelles lignes. Un fichier illisible dit pourquoi, et son bouton devient Réessayer. Tout vérifier lance la même vérification sur chaque ligne en attente et s’arrête dès que la limite de débit répond.

  4. 04

    Exportez la liste

    Copier le tableau et Exporter en CSV prennent le tableau tel quel : chaque ligne de fichier, plus les URL de page de tout fichier ouvert. Cinq colonnes portent l’arbre dans un tableur : Niveau dit si la ligne est un sitemap ou une URL de page ; puis l’adresse ; puis Sitemap parent, le fichier qui l’a déclarée ; puis Dernière modification ; puis Résultat, la réponse du fichier lui-même — vide sur les lignes de page, que cet outil ne va jamais chercher.

Comment lire le rapport de l’arbre des sitemaps

Chaque ligne est un fichier sitemap, ou une URL de page dans l’un d’eux. Une ligne reste muette tant que rien ne cloche : tout ce qui est écrit à côté d’une adresse mérite lecture. Les plafonds sont annoncés dans le tableau, jamais appliqués en silence : cent fichiers par analyse, trois cents lignes, 5 000 URL affichées par fichier, 10 Mo par fichier.

Notes d’état des lignes

Aucune note, à côté de Vérifier
Pas encore récupéré. Un index a déclaré ce fichier, mais l’analyse s’arrête volontairement au niveau supérieur : récupérer chaque enfant de chaque index coûte une requête par fichier et répond à une question que vous n’avez peut-être pas posée.
Aucune note, à côté de Voir
Le fichier a été lu et rien n’y clochait. Appuyez sur Voir pour savoir ce qu’il contient : les URL de pages s’il s’agit d’un urlset, ou de nouvelles lignes enfants s’il se révèle être un autre index.
404, 503, Timeout
Le fichier n’a pas pu être lu. Un fichier qu’un index déclare mais que le site ne sert pas est un vrai constat — les moteurs de recherche reçoivent la même réponse que vous. Le bouton devient Réessayer, qui redemande.
Pas un sitemap (html)
Le serveur a répondu 200 mais a envoyé une page web. Le plus souvent un soft 404, parfois une page de blocage. À corriger dans les deux cas — depuis un navigateur, tout a l’air normal.
Plus de 10 Mo — non analysé
Au-delà de notre plafond de taille, mesuré après décompression. Nous n’analysons pas ce que nous n’avons pu lire qu’à moitié : un fichier XML tronqué est un fichier XML cassé, et une liste d’URL partielle qui a l’air complète est pire que rien.

Colonnes de l’arbre

Index Lv1, Sitemap Lv2, URL
La colonne Niveau contient l’arbre : le retrait, la flèche ↳ d’un fichier déclaré par une ligne au-dessus, et le niveau. Index liste d’autres sitemaps ; Sitemap est un fichier pas encore lu ; URL est une page dans le fichier au-dessus.
Une date dans Dernière modification
Le lastmod que l’index parent déclare pour ce fichier. Il ne coûte rien à lire et c’est souvent la raison d’être ici : il dit quelle branche du site a changé récemment. C’est l’affirmation du site lui-même, pas une mesure.
Un tiret dans Dernière modification
Rien n’a déclaré de date pour ce fichier. Les fichiers du niveau supérieur sont généralement dans ce cas — rien au-dessus d’eux ne déclare quoi que ce soit à leur sujet. Cela ne dit rien sur l’ancienneté du fichier.
Une ligne sans bouton
Un index dont les enfants sont déjà dans l’arbre. Il n’y a plus rien à télécharger pour lui ; lisez plutôt ses enfants.