Cómo usar esta herramienta

Buscador de Sitemaps XML y Extractor de URL

Cómo usar el buscador de sitemaps XML

Volver a la herramienta

Entra un dominio; sale cada archivo de sitemap que el sitio declara, y las URLs dentro de cualquier archivo que abras.

  1. 01

    Introduce un dominio o la dirección de un sitemap

    Un dominio es la vía habitual: leemos robots.txt y luego las ubicaciones estándar en la raíz del host. Pega en su lugar una dirección que termine en .xml o .xml.gz y ese archivo exacto se convierte en la raíz del árbol, útil cuando el sitemap está en un sitio que robots.txt nunca menciona. La ruta de una página normal se ignora; solo se usa su host.

  2. 02

    Lee el árbol de archivos

    El rastreo lee robots.txt y descarga los archivos que nombra — el nivel superior, y solo ese. Los archivos que declara un índice de sitemaps se listan directamente desde el cuerpo del índice, con dirección y Última modificación incluidas, pero todavía no se descarga nada de ellos — para eso está el botón Comprobar en su fila. Diez peticiones responden la pregunta con la que llega casi todo el mundo.

  3. 03

    Comprueba un archivo para leer su contenido

    Comprobar obtiene ese único archivo: un clic, una petición. Un conjunto de URL abre sus URL de página con sus fechas de Última modificación. Un índice añade sus hijos al árbol como filas nuevas. Un archivo ilegible dice por qué, y su botón pasa a Reintentar. Comprobar todo ejecuta la misma comprobación en cada fila pendiente y se detiene en cuanto responde el límite de peticiones.

  4. 04

    Exporta la lista

    Copiar tabla y Exportar CSV toman la tabla tal como está: cada fila de archivo, más las URL de página de cualquier archivo que hayas abierto. Cinco columnas llevan el árbol a una hoja de cálculo: Nivel dice si la fila es un sitemap o una URL de página; luego la dirección; luego Sitemap padre, el archivo que la declaró; luego Última modificación; luego Resultado, cómo respondió el propio archivo — vacío en las filas de página, que esta herramienta nunca solicita.

Cómo leer el informe del árbol de sitemaps

Cada fila es un archivo de sitemap, o una URL de página dentro de uno. Una fila calla mientras nada está mal, así que todo lo escrito junto a una dirección merece leerse. Los topes se anuncian en la tabla, nunca se aplican en silencio: cien archivos por escaneo, trescientas filas, 5.000 URL mostradas por archivo, 10 MB por archivo.

Notas de estado de la fila

Sin nota, junto a Comprobar
Aún no obtenido. Un índice declaró este archivo, pero el escaneo se detiene a propósito en el nivel superior: obtener cada hijo de cada índice cuesta una petición por archivo y responde a una pregunta que quizá no hiciste.
Sin nota, junto a Ver
El archivo se leyó y no había nada mal. Pulsa Ver para ver qué hay dentro: URLs de página si es un urlset, o filas hijas nuevas si resulta ser otro índice.
404, 503, Timeout
No se pudo leer el archivo. Un archivo que un índice declara pero el sitio no sirve es un hallazgo real — los buscadores reciben la misma respuesta que tú. El botón pasa a Reintentar, que vuelve a preguntar.
No es un sitemap (html)
El servidor respondió 200 pero envió una página web. Suele ser un soft 404, a veces una página de bloqueo. Merece arreglarse igual — desde un navegador se ve bien.
Más de 10 MB — no analizado
Supera nuestro techo de tamaño, medido tras descomprimir. No analizamos lo que solo pudimos leer a medias: un XML truncado es un XML roto, y una lista de URLs incompleta que parece completa es peor que ninguna.

Columnas del árbol

Índice Lv1, Sitemap Lv2, URL
La columna Nivel contiene el árbol: la sangría, la flecha ↳ de un archivo declarado por una fila superior, y el nivel. Índice lista otros sitemaps; Sitemap es un archivo aún no leído; URL es una página dentro del archivo de arriba.
Una fecha en Última modificación
El lastmod que el índice padre declara para este archivo. No cuesta nada leerlo y suele ser el motivo de estar aquí: dice qué rama del sitio cambió hace poco. Es la afirmación del propio sitio, no una medición.
Un guion en Última modificación
Nada declaró una fecha para este archivo. Los archivos del nivel superior suelen quedar aquí — nada por encima declara nada sobre ellos. No dice si el archivo está desactualizado.
Una fila sin botón
Un índice cuyos hijos ya están en el árbol. No queda nada por descargar de él; lee sus hijos.