Verificador e Validador de Regras Robots.txt
Como usar o testador de robots.txt
Voltar para a ferramentaEntram uma URL e um rastreador; a resposta é se aquele rastreador pode baixar aquele endereço, e qual linha do robots.txt decide isso.
- 01
Informe a URL a testar
Cole a própria página, não o robots.txt — a ferramenta deduz a origem e busca /robots.txt lá. Normalizar URL continua importando: em Somente domínio você está perguntando pela página inicial, porque o caminho é a metade do endereço que entra na comparação.
- 02
Selecione o rastreador a testar
As regras são por rastreador, então a mesma URL pode estar liberada para um bot e bloqueada para outro. O botão fica travado até escolher um: não existe padrão sensato, e um padrão errado responderia a uma pergunta que você não fez. Todos os outros rastreadores é o grupo *.
- 03
Rode o teste e leia a linha decisiva
Uma rodada é uma requisição: o servidor apenas baixa o arquivo, e a comparação roda no seu navegador. O arquivo inteiro volta numerado, com a regra vencedora destacada e o número dela trocado por um ícone. Copiar e Baixar, na linha logo acima, entregam o arquivo em si, não um resumo: o download é um robots.txt de verdade, que você joga direto em um site.
- 04
Leia o veredito abaixo do arquivo
Abaixo do arquivo: qual robots.txt foi lido e o que ele respondeu, o caminho comparado, o veredito com a linha vencedora repetida ao lado, e todas as linhas Sitemap: que o arquivo declara. A repetição é proposital — o arquivo pode ser longo o bastante para a linha destacada já ter saído da tela quando você chega ao veredito.
Como ler o veredito das regras de rastreamento
O veredito é uma palavra; todo o resto da página existe para mostrar como se chegou a ela.
Valores do veredito
- Permitido
- Nenhuma regra bate com este caminho, ou a regra vencedora é um Allow. Um host sem robots.txt responde do mesmo jeito: sem arquivo, nada é proibido.
- Bloqueado
- A regra vencedora é um Disallow, nomeada logo ao lado do veredito. Bloqueado para rastreamento não é removido do índice: uma URL bloqueada ainda pode ser listada, e é por isso que noindex pertence a uma meta tag, não aqui.
- Indeterminado
- O arquivo não pôde ser lido, ou respondeu 200 com uma página em vez de regras. O Google trata um robots.txt ilegível como bloqueio total por cerca de doze horas, então responder Permitido aqui seria a única resposta errada.
- Caminho da URL
- A parte do endereço realmente comparada: caminho mais query string, sem o fragmento. Diferencia maiúsculas de minúsculas, ao contrário do nome do rastreador.
- Sitemaps declarados
- Todas as linhas Sitemap: do arquivo, sem duplicatas. Elas são globais — pertencem ao arquivo, não a um grupo de rastreadores, então valem para qualquer bot escolhido.
Precedência das regras
- O padrão mais longo vence
- Entre duas regras que batem, decide a de padrão mais longo, contando * e $ como caracteres. Por isso Disallow: /shop perde para Allow: /shop/public em /shop/public e ganha em /shop.
- Empate vai para Allow
- Mesmo comprimento, Allow ganha de Disallow — a leitura menos restritiva, e o que o analisador de referência faz.
- Só o grupo do seu rastreador
- Todos os grupos que nomeiam seu rastreador são unidos, mesmo que o arquivo os separe. O grupo * só entra quando nenhum grupo o nomeia: um arquivo com seção Googlebot não aplica também a seção * a ele.
- * e $
- * vale por qualquer sequência de caracteres. $ ancora o padrão no fim da URL, mas só no fim do próprio padrão; em outro lugar é um caractere comum.
- Disallow sem nada depois
- Não proíbe nada. É como um arquivo diz "sem restrições para este grupo", e não é a mesma coisa que Disallow: /.
Quando o arquivo não pode ser lido
- Sem robots.txt (404)
- Nada é proibido, então o veredito é Permitido e não há arquivo para mostrar. Uma cadeia de mais de cinco redirecionamentos também conta como sem arquivo — é onde o rastreador de referência desiste.
- Não pôde ser lido
- Um 5xx, um 429, um tempo esgotado ou uma conexão recusada. O veredito é Indeterminado e nenhum arquivo aparece: o corpo de uma página de erro não são as suas regras.
- 200 com HTML
- Um soft 404: o servidor responde como se o arquivo existisse, mas envia uma página. Rastreadores leem isso como lixo, então o veredito é Indeterminado — e vale corrigir, porque pelo navegador não dá para perceber.
- Só os primeiros 500 KiB
- O arquivo é cortado nesse tamanho antes da comparação, que é o limite lido pelo analisador de referência. Regras além desse ponto também não existem para nenhum rastreador.
- O arquivo existe mas não define regras
- Um arquivo vazio, ou só com comentários e linhas Sitemap:. É válido, e não proíbe nada.