Comment utiliser cet outil

Testeur et Validateur de Règles Robots.txt

Comment utiliser le testeur de robots.txt

Retour à l’outil

Une URL et un robot entrent ; la réponse dit si ce robot a le droit d’explorer cette adresse, et quelle ligne du robots.txt en décide.

  1. 01

    Saisissez l’URL à tester

    Collez la page elle-même, pas le robots.txt — l’outil en déduit l’origine et va y chercher /robots.txt. Normaliser l’URL compte toujours : réglé sur Domaine uniquement, vous posez la question pour la page d’accueil, car c’est le chemin qui est confronté aux règles.

  2. 02

    Sélectionnez le robot à tester

    Les règles sont propres à chaque robot : la même URL peut être autorisée pour l’un et bloquée pour l’autre. Le bouton reste verrouillé tant qu’aucun robot n’est choisi — aucune valeur par défaut n’aurait de sens, et une mauvaise répondrait à une question que vous n’avez pas posée. Tous les autres robots, c’est le groupe *.

  3. 03

    Lancez le test et lisez la ligne décisive

    Un passage, une requête : le serveur ne fait que récupérer le fichier, la confrontation se fait dans votre navigateur. Le fichier entier revient numéroté, la règle gagnante surlignée et son numéro remplacé par une icône. Copier et Télécharger, sur la ligne juste au-dessus, vous remettent le fichier lui-même, pas un résumé : le téléchargement est un vrai robots.txt, déposable tel quel sur un site.

  4. 04

    Lisez le verdict sous le fichier

    Sous le fichier : quel robots.txt a été lu et ce qu’il a répondu, le chemin confronté, le verdict avec la ligne gagnante rappelée à côté, et toutes les lignes Sitemap: déclarées. Le rappel est volontaire : le fichier peut être assez long pour que la ligne surlignée soit hors champ quand vous arrivez au verdict.

Comment lire le verdict des règles d’exploration

Le verdict tient en un mot ; tout le reste de la page sert à montrer d’où vient ce mot.

Valeurs du verdict

Autorisé
Aucune règle ne correspond à ce chemin, ou la règle gagnante est un Allow. Un hôte sans robots.txt donne le même résultat : pas de fichier, donc rien d’interdit.
Bloqué
La règle gagnante est un Disallow, nommée juste à côté du verdict. Bloqué à l’exploration n’est pas retiré de l’index : une URL bloquée peut encore être listée, et c’est pourquoi noindex se met dans une balise meta, pas ici.
Indéterminé
Le fichier n’a pas pu être lu, ou il a répondu 200 avec une page au lieu de règles. Google traite un robots.txt illisible comme un blocage total pendant environ douze heures, donc répondre Autorisé ici serait la seule mauvaise réponse.
Chemin de l’URL
La partie de l’adresse réellement confrontée : chemin plus chaîne de requête, sans le fragment. Elle est sensible à la casse, contrairement au nom du robot.
Sitemaps déclarés
Toutes les lignes Sitemap: du fichier, doublons retirés. Ces lignes sont globales : elles appartiennent au fichier et non à un groupe de robots, donc elles valent quel que soit le robot choisi.

Priorité des règles

Le motif le plus long gagne
Entre deux règles qui correspondent, c’est le motif le plus long qui tranche, en comptant * et $ comme des caractères. D’où : Disallow: /shop perd face à Allow: /shop/public sur /shop/public, et gagne sur /shop.
À égalité, Allow gagne
Même longueur, Allow l’emporte sur Disallow — la lecture la moins restrictive, et celle de l’analyseur de référence.
Seulement le groupe de votre robot
Tous les groupes qui nomment votre robot sont fusionnés, même si le fichier les sépare. Le groupe * ne sert que si aucun groupe ne le nomme : un fichier avec une section Googlebot ne lui applique pas en plus sa section *.
* et $
* remplace n’importe quelle suite de caractères. $ ancre le motif à la fin de l’URL, mais uniquement à la fin du motif ; ailleurs, c’est un caractère ordinaire.
Disallow suivi de rien
N’interdit rien. C’est ainsi qu’un fichier dit « aucune restriction pour ce groupe », et ce n’est pas la même chose que Disallow: /.

Quand le fichier ne peut pas être lu

Pas de robots.txt (404)
Rien n’est interdit : le verdict est Autorisé et il n’y a pas de fichier à montrer. Une chaîne de plus de cinq redirections compte aussi comme absence de fichier — c’est là que le robot de référence abandonne.
Illisible
Un 5xx, un 429, un délai dépassé ou une connexion refusée. Le verdict est Indéterminé et aucun fichier n’est affiché : le corps d’une page d’erreur n’est pas vos règles.
200 avec du HTML
Un soft 404 : le serveur répond comme si le fichier existait mais envoie une page. Les robots lisent cela comme du bruit, d’où le verdict Indéterminé — et celui-là mérite correction, car depuis un navigateur rien ne se voit.
Seuls les 500 premiers Kio
Le fichier est coupé à cette taille avant la confrontation, la limite que lit l’analyseur de référence. Les règles au-delà n’existent pour aucun robot non plus.
Le fichier existe mais ne pose aucune règle
Un fichier vide, ou ne contenant que des commentaires et des lignes Sitemap:. Valide, et n’interdisant rien.