Cómo usar esta herramienta

Comprobador y Validador de Reglas Robots.txt

Cómo usar el probador de robots.txt

Volver a la herramienta

Entran una URL y un rastreador; la respuesta es si ese rastreador puede descargar esa dirección, y qué línea del robots.txt lo decide.

  1. 01

    Introduce la URL a probar

    Pega la propia página, no el robots.txt — la herramienta deduce el origen y descarga /robots.txt de allí. Normalizar URL sigue importando: si lo dejas en Solo dominio estás preguntando por la portada, porque la ruta es la mitad de la dirección que se contrasta.

  2. 02

    Selecciona el rastreador a probar

    Las reglas son por rastreador, así que la misma URL puede estar permitida para un bot y bloqueada para otro. El botón queda bloqueado hasta elegir uno: no hay un valor por defecto sensato, y uno equivocado respondería a una pregunta que no hiciste. Todos los demás rastreadores es el grupo *.

  3. 03

    Ejecuta la prueba y lee la línea decisiva

    Una pasada es una petición: el servidor solo descarga el archivo y el contraste ocurre en tu navegador. El archivo entero vuelve numerado, con la regla ganadora resaltada y su número sustituido por un icono. Copiar y Descargar, en la fila de arriba, te dan el archivo en sí, no un resumen: la descarga es un robots.txt real que puedes soltar tal cual en un sitio.

  4. 04

    Lee el veredicto bajo el archivo

    Bajo el archivo: qué robots.txt se leyó y qué respondió, la ruta contrastada, el veredicto con la línea ganadora repetida al lado, y todas las líneas Sitemap: que declara. La repetición es intencionada: el archivo puede ser tan largo que la fila resaltada quede fuera de vista cuando llegas al veredicto.

Cómo leer el veredicto de reglas de rastreo

El veredicto es una palabra; todo lo demás en la página existe para mostrarte cómo se llegó a ella.

Valores del veredicto

Permitido
Ninguna regla contrasta con esta ruta, o la que gana es un Allow. Un host sin robots.txt informa igual: sin archivo no hay nada prohibido.
Bloqueado
La regla ganadora es un Disallow, nombrada justo al lado del veredicto. Bloqueado para el rastreo no es eliminado del índice: una URL bloqueada aún puede listarse, por eso noindex va en una etiqueta meta, no aquí.
Sin determinar
El archivo no se pudo leer, o respondió 200 con una página en lugar de reglas. Google trata un robots.txt ilegible como bloqueo total durante unas doce horas, así que responder Permitido aquí sería la única respuesta equivocada.
Ruta de la URL
La parte de la dirección que realmente se contrasta: ruta más cadena de consulta, sin el fragmento. Distingue mayúsculas y minúsculas, a diferencia del nombre del rastreador.
Sitemaps declarados
Todas las líneas Sitemap: del archivo, sin duplicados. Son globales: pertenecen al archivo y no a ningún grupo de rastreadores, así que valen elijas el bot que elijas.

Precedencia de reglas

Gana el patrón más largo
Entre dos reglas que contrastan, decide la de patrón más largo, contando * y $ como caracteres. Por eso Disallow: /shop pierde ante Allow: /shop/public en /shop/public y gana en /shop.
En empate gana Allow
A igual longitud, Allow vence a Disallow: la lectura menos restrictiva, y lo que hace el analizador de referencia.
Solo el grupo de tu rastreador
Todos los grupos que nombran tu rastreador se fusionan, aunque el archivo los separe. El grupo * solo se usa cuando ninguno lo nombra: un archivo con sección Googlebot no le aplica además su sección *.
* y $
* representa cualquier secuencia de caracteres. $ ancla el patrón al final de la URL, pero solo al final del propio patrón; en cualquier otro sitio es un carácter corriente.
Disallow sin nada detrás
No prohíbe nada. Es como un archivo dice "sin restricciones para este grupo", y no es lo mismo que Disallow: /.

Cuando el archivo no se puede leer

Sin robots.txt (404)
No hay nada prohibido, así que el veredicto es Permitido y no hay archivo que mostrar. Una cadena de más de cinco redirecciones también cuenta como sin archivo: ahí es donde el rastreador de referencia se rinde.
No se pudo leer
Un 5xx, un 429, un tiempo agotado o una conexión rechazada. El veredicto es Sin determinar y no se muestra archivo: el cuerpo de una página de error no son tus reglas.
200 con HTML
Un soft 404: el servidor responde como si el archivo existiera pero envía una página. Los rastreadores lo leen como basura, así que el veredicto es Sin determinar — y este conviene arreglarlo, porque desde un navegador no se nota.
Solo los primeros 500 KiB
El archivo se corta a ese tamaño antes de contrastar, que es el límite que lee el analizador de referencia. Las reglas posteriores tampoco existen para ningún rastreador.
El archivo existe pero no fija reglas
Un archivo vacío, o con solo comentarios y líneas Sitemap:. Es válido, y no prohíbe nada.