Como usar esta ferramenta

Verificador de Acesso de Bots de IA e LLM

Como usar o verificador de acesso de bots de IA

Voltar para a ferramenta

Entra uma página; cada rastreador de IA que acompanhamos é medido contra ela duas vezes, de duas formas independentes.

  1. 01

    Informe a página que você quer que os rastreadores de IA alcancem

    Uma página por execução: a comparação aqui é entre bots, não entre URLs. Escolha a página exata que importa, porque as regras do robots.txt são comparadas com o caminho dela. Uma regra que bloqueia /blog/ não aparece se você testar a home, e uma regra de CDN presa a um caminho se comporta do mesmo jeito.

  2. 02

    Rode a verificação nos 22 bots

    Não há seletor de bots, de propósito. A coluna Conteúdo mede cada bot contra os outros 21 da mesma execução, então uma execução parcial tiraria a régua que dá sentido à coluna. Cada bot é buscado por vez, e uma linha que nunca chegou à sua vez pode ser repetida sozinha.

  3. 03

    Leia os dois veredictos lado a lado

    robots.txt é o que você declarou; Status HTTP é o que seu servidor fez de fato. Linhas em que os dois concordam são rotina. As linhas que merecem atenção são as em que discordam, e elas levam um ícone de aviso: permitida pelo arquivo mas recusada pelo servidor, ou bloqueada pelo arquivo e ainda assim servida inteira.

Como ler o relatório de acesso dos rastreadores de IA

Uma linha se lê da esquerda para a direita: qual bot, o que o robots.txt diz sobre ele, e o que o servidor de fato fez. Cada requisição é nossa, enviada com a string User-Agent daquele bot; o rastreador real do fornecedor ainda pode se comportar diferente.

Colunas da tabela de resultados

URL resolvida
Acima da tabela, não dentro dela. É o endereço que medimos, buscado uma vez com nosso próprio User-Agent identificado — o grupo de controle com que cada linha de bot é comparada.
Fornecedor
Quem opera o rastreador. As linhas são agrupadas por empresa, então cada uma se lê como um bloco.
Bot
O token que você escreveria depois de User-agent: no robots.txt. Um bot marcado como UA não verificado não tem nenhuma string publicada; um marcado como token como UA tem apenas este token, e é o que enviamos.
Finalidade
Para que o rastreador coleta — treinar um modelo, montar um índice de busca, buscar uma página que alguém acabou de pedir, ou conferir uma página de destino de anúncio.
robots.txt
Camada um, calculada a partir do seu arquivo: o seu robots.txt permite este token neste caminho? Passe o mouse sobre o veredito para ver qual regra casou. A coluna some quando o site não tem robots.txt, e a linha acima da tabela diz isso.
Status HTTP
Camada dois, medida de verdade: o que seu servidor devolveu a uma requisição com aquele User-Agent. É a camada sobre a qual o robots.txt não pode informar nada.
Conteúdo
Quantos caracteres visíveis aquele bot recebeu. A referência são os outros bots da mesma execução, então um número bem abaixo do resto indica página recortada, não diferença de idioma.
Resultado
Se a própria medição terminou. É um selo, não um botão: o repetir de uma linha com erro fica na coluna ao lado.
Ações
Um botão por linha que precise: um bot que estourou o tempo, ou que nunca chegou a sua vez, ganha um repetir que remede apenas aquela linha. Linhas que terminaram bem não têm nada aqui.

Referência de ícones de aviso

Permitido, mas 4xx ou 5xx
Seu robots.txt convida o bot e algo na frente do servidor o barra — geralmente uma regra de bots da CDN ou do WAF que você não escreveu. É a descoberta para a qual a ferramenta existe.
Bloqueado, mas 2xx
A lacuna inversa: o robots.txt diz não e a página é servida assim mesmo. Nada obriga o cumprimento do robots.txt, então qualquer rastreador que o ignore leva a página inteira.
Bem menos conteúdo
O status parece saudável mas o corpo é uma fração do que os outros receberam. Costuma ser uma página de desafio ou uma variante reduzida, e a coluna de status sozinha nunca mostra isso.
UA não verificado
O fornecedor não publica nenhuma string de User-Agent, então a nossa vem de logs de acesso e pode estar desatualizada. Leia essa linha com menos confiança que as demais.
token como UA
O fornecedor publica o token do robots.txt, mas não o cabeçalho User-Agent, então a requisição que enviamos carrega o próprio token. O tráfego real desse crawler pode ser diferente, então leia a linha como um indício, não como uma medida exata.

Referência de códigos de status

200 OK
O bot recebeu a página. Confira a coluna Conteúdo antes de considerar isso uma vitória.
403 Forbidden
Recusado. Quase sempre uma regra contra bots, não uma página quebrada — a mesma URL costuma abrir normalmente no seu navegador.
404 Not Found
Nada naquele endereço para este visitante. Se outros bots receberam 200 na mesma URL, a diferença é proposital.
429 Too Many Requests
Limite de taxa. Seu site está segurando, não bloqueando — repita aquela linha em vez de ler isso como política.