Comment utiliser cet outil

Vérificateur d’Accès des Bots IA et LLM

Comment utiliser le vérificateur d’accès des bots IA

Retour à l’outil

Une page entre ; chaque robot d’IA que nous suivons est mesuré contre elle deux fois, de deux manières indépendantes.

  1. 01

    Saisissez la page que les robots d’IA doivent atteindre

    Une page par exécution : la comparaison se fait ici entre robots, pas entre URL. Choisissez la page exacte qui vous importe, car les règles de robots.txt sont confrontées à son chemin. Une règle qui bloque /blog/ n’apparaîtra pas si vous testez la page d’accueil, et une règle CDN liée à un chemin se comporte de même.

  2. 02

    Lancez la vérification sur les 22 robots

    Il n’y a pas de sélecteur de robots, et c’est voulu. La colonne Contenu mesure chaque robot par rapport aux 21 autres de la même exécution ; une exécution partielle retirerait l’étalon qui donne son sens à la colonne. Chaque robot est interrogé à son tour, si bien qu’une ligne qui n’a jamais eu son tour peut être relancée seule.

  3. 03

    Lisez les deux verdicts côte à côte

    robots.txt est ce que vous avez déclaré ; Statut HTTP est ce que votre serveur a réellement fait. Les lignes où les deux concordent sont la routine. Celles qui méritent attention sont celles où ils divergent, et elles portent une icône d’avertissement : autorisé par le fichier mais refusé par le serveur, ou bloqué par le fichier et pourtant servi en entier.

Comment lire le rapport d’accès des robots d’IA

Une ligne se lit de gauche à droite : quel robot, ce que robots.txt en dit, et ce que le serveur a réellement fait. Chaque requête est la nôtre, envoyée avec la chaîne User-Agent de ce robot ; le vrai crawler de l’éditeur peut encore se comporter autrement.

Colonnes du tableau de résultats

URL résolue
Au-dessus du tableau, pas dedans. C’est l’adresse que nous avons mesurée, récupérée une fois avec notre propre User-Agent identifié — le groupe témoin auquel chaque ligne de bot est comparée.
Éditeur
Qui exploite le robot. Les lignes sont regroupées par éditeur, de sorte qu’un éditeur se lit comme un bloc.
Bot
Le jeton que vous écririez après User-agent: dans robots.txt. Un bot marqué UA non vérifié n’a aucune chaîne publiée ; un bot marqué token comme UA n’a que ce jeton, et c’est lui que nous envoyons.
Usage
Ce que le robot collecte — entraîner un modèle, construire un index de recherche, charger une page qu’une personne vient de demander, ou vérifier une page de destination publicitaire.
robots.txt
Couche un, calculée à partir de votre fichier : votre robots.txt autorise-t-il ce jeton sur ce chemin ? Survolez le verdict pour voir quelle règle a correspondu. La colonne disparaît quand le site n’a pas de robots.txt, et la ligne au-dessus du tableau le dit.
Statut HTTP
Deuxième couche, mesurée pour de vrai : ce que votre serveur a renvoyé à une requête portant ce User-Agent. C’est la couche sur laquelle robots.txt ne peut rien vous dire.
Contenu
Combien de caractères visibles ce bot a reçus. L’étalon, ce sont les autres bots de la même exécution : un nombre nettement sous les autres signale une page amputée, pas une différence de langue.
Résultat
Si la mesure elle-même est allée au bout. C’est une étiquette, pas un bouton : la relance d’une ligne en échec se trouve dans la colonne suivante.
Actions
Un bouton par ligne qui en a besoin : un bot en dépassement de délai, ou qui n’a jamais eu son tour, reçoit une relance qui ne remesure que cette ligne. Les lignes terminées proprement n’ont rien ici.

Référence des icônes d’avertissement

Autorisé, mais 4xx ou 5xx
Votre robots.txt invite le bot et quelque chose devant votre serveur le refoule — le plus souvent une règle anti-bot du CDN ou du WAF que vous n’avez pas écrite. C’est la découverte pour laquelle cet outil existe.
Bloqué, mais 2xx
L’écart inverse : robots.txt dit non et la page est servie quand même. Rien n’impose le respect de robots.txt, donc tout robot qui l’ignore repart avec la page entière.
Bien moins de contenu
Le statut paraît sain mais le corps ne fait qu’une fraction de ce que les autres ont reçu. C’est en général une page de défi ou une variante allégée, et la colonne de statut seule ne le montre jamais.
UA non vérifié
L’éditeur ne publie aucune chaîne User-Agent ; la nôtre vient de journaux d’accès et peut être périmée. Lisez cette ligne avec moins de confiance que les autres.
token comme UA
L’éditeur publie le token robots.txt mais pas l’en-tête User-Agent ; la requête que nous envoyons porte donc le token lui-même. Le trafic réel de ce crawler peut différer : lisez la ligne comme un indice, pas comme une mesure exacte.

Référence des codes de statut

200 OK
Le bot a eu la page. Regardez la colonne Contenu avant d’y voir une victoire.
403 Forbidden
Refusé. Presque toujours une règle anti-bot plutôt qu’une page cassée — la même URL s’ouvre en général normalement dans votre navigateur.
404 Not Found
Rien à cette adresse pour ce visiteur. Si d’autres bots ont eu 200 sur la même URL, la différence est délibérée.
429 Too Many Requests
Limitation de débit. Votre site freine, il ne bloque pas — relancez cette ligne au lieu d’y lire une politique.