Verificador de Acesso de Bots de IA e LLM
Como usar o verificador de acesso de bots de IA
Voltar para a ferramentaEntra uma página; cada rastreador de IA que acompanhamos é medido contra ela duas vezes, de duas formas independentes.
- 01
Informe a página que você quer que os rastreadores de IA alcancem
Uma página por execução: a comparação aqui é entre bots, não entre URLs. Escolha a página exata que importa, porque as regras do robots.txt são comparadas com o caminho dela. Uma regra que bloqueia /blog/ não aparece se você testar a home, e uma regra de CDN presa a um caminho se comporta do mesmo jeito.
- 02
Rode a verificação nos 22 bots
Não há seletor de bots, de propósito. A coluna Conteúdo mede cada bot contra os outros 21 da mesma execução, então uma execução parcial tiraria a régua que dá sentido à coluna. Cada bot é buscado por vez, e uma linha que nunca chegou à sua vez pode ser repetida sozinha.
- 03
Leia os dois veredictos lado a lado
robots.txt é o que você declarou; Status HTTP é o que seu servidor fez de fato. Linhas em que os dois concordam são rotina. As linhas que merecem atenção são as em que discordam, e elas levam um ícone de aviso: permitida pelo arquivo mas recusada pelo servidor, ou bloqueada pelo arquivo e ainda assim servida inteira.
Como ler o relatório de acesso dos rastreadores de IA
Uma linha se lê da esquerda para a direita: qual bot, o que o robots.txt diz sobre ele, e o que o servidor de fato fez. Cada requisição é nossa, enviada com a string User-Agent daquele bot; o rastreador real do fornecedor ainda pode se comportar diferente.
Colunas da tabela de resultados
- URL resolvida
- Acima da tabela, não dentro dela. É o endereço que medimos, buscado uma vez com nosso próprio User-Agent identificado — o grupo de controle com que cada linha de bot é comparada.
- Fornecedor
- Quem opera o rastreador. As linhas são agrupadas por empresa, então cada uma se lê como um bloco.
- Bot
- O token que você escreveria depois de User-agent: no robots.txt. Um bot marcado como UA não verificado não tem nenhuma string publicada; um marcado como token como UA tem apenas este token, e é o que enviamos.
- Finalidade
- Para que o rastreador coleta — treinar um modelo, montar um índice de busca, buscar uma página que alguém acabou de pedir, ou conferir uma página de destino de anúncio.
- robots.txt
- Camada um, calculada a partir do seu arquivo: o seu robots.txt permite este token neste caminho? Passe o mouse sobre o veredito para ver qual regra casou. A coluna some quando o site não tem robots.txt, e a linha acima da tabela diz isso.
- Status HTTP
- Camada dois, medida de verdade: o que seu servidor devolveu a uma requisição com aquele User-Agent. É a camada sobre a qual o robots.txt não pode informar nada.
- Conteúdo
- Quantos caracteres visíveis aquele bot recebeu. A referência são os outros bots da mesma execução, então um número bem abaixo do resto indica página recortada, não diferença de idioma.
- Resultado
- Se a própria medição terminou. É um selo, não um botão: o repetir de uma linha com erro fica na coluna ao lado.
- Ações
- Um botão por linha que precise: um bot que estourou o tempo, ou que nunca chegou a sua vez, ganha um repetir que remede apenas aquela linha. Linhas que terminaram bem não têm nada aqui.
Referência de ícones de aviso
- Permitido, mas 4xx ou 5xx
- Seu robots.txt convida o bot e algo na frente do servidor o barra — geralmente uma regra de bots da CDN ou do WAF que você não escreveu. É a descoberta para a qual a ferramenta existe.
- Bloqueado, mas 2xx
- A lacuna inversa: o robots.txt diz não e a página é servida assim mesmo. Nada obriga o cumprimento do robots.txt, então qualquer rastreador que o ignore leva a página inteira.
- Bem menos conteúdo
- O status parece saudável mas o corpo é uma fração do que os outros receberam. Costuma ser uma página de desafio ou uma variante reduzida, e a coluna de status sozinha nunca mostra isso.
- UA não verificado
- O fornecedor não publica nenhuma string de User-Agent, então a nossa vem de logs de acesso e pode estar desatualizada. Leia essa linha com menos confiança que as demais.
- token como UA
- O fornecedor publica o token do robots.txt, mas não o cabeçalho User-Agent, então a requisição que enviamos carrega o próprio token. O tráfego real desse crawler pode ser diferente, então leia a linha como um indício, não como uma medida exata.
Referência de códigos de status
- 200 OK
- O bot recebeu a página. Confira a coluna Conteúdo antes de considerar isso uma vitória.
- 403 Forbidden
- Recusado. Quase sempre uma regra contra bots, não uma página quebrada — a mesma URL costuma abrir normalmente no seu navegador.
- 404 Not Found
- Nada naquele endereço para este visitante. Se outros bots receberam 200 na mesma URL, a diferença é proposital.
- 429 Too Many Requests
- Limite de taxa. Seu site está segurando, não bloqueando — repita aquela linha em vez de ler isso como política.