Comprobador de Acceso de Bots de IA y LLM
Cómo usar el comprobador de acceso de bots de IA
Volver a la herramientaEntra una página; cada rastreador de IA que seguimos se mide contra ella dos veces, de dos formas independientes.
- 01
Introduce la página que quieres que alcancen los rastreadores de IA
Una página por ejecución: la comparación aquí es entre bots, no entre URL. Elige la página exacta que te importa, porque las reglas de robots.txt se comparan con su ruta. Una regla que bloquea /blog/ no aparecerá si pruebas la portada, y una regla de CDN ligada a una ruta se comporta igual.
- 02
Ejecuta la comprobación en los 22 bots
No hay selector de bots a propósito. La columna Contenido mide cada bot frente a los otros 21 de la misma ejecución, así que una ejecución parcial quitaría la vara de medir que da sentido a la columna. Cada bot se consulta por turno, de modo que una fila que nunca tuvo su turno puede reintentarse sola.
- 03
Lee los dos veredictos uno junto al otro
robots.txt es lo que declaraste; Estado HTTP es lo que hizo tu servidor en realidad. Las filas donde ambos coinciden son rutina. Las filas que merecen atención son aquellas donde discrepan, y llevan un icono de aviso: permitida por el archivo pero rechazada por el servidor, o bloqueada por el archivo y aun así servida entera.
Cómo leer el informe de acceso de rastreadores de IA
Una fila se lee de izquierda a derecha: qué bot, qué dice robots.txt sobre él, y qué hizo realmente el servidor. Cada petición es nuestra, enviada con la cadena User-Agent de ese bot; el rastreador real del proveedor aún puede comportarse distinto.
Columnas de la tabla de resultados
- URL resuelta
- Encima de la tabla, no dentro. Es la dirección que medimos, descargada una vez con nuestro propio User-Agent identificado: el grupo de control con el que se compara cada fila.
- Proveedor
- Quién opera el rastreador. Las filas se agrupan por empresa, de modo que cada una se lee como un bloque.
- Bot
- El token que escribirías después de User-agent: en robots.txt. Un bot marcado como UA sin verificar no tiene ninguna cadena publicada; uno marcado como token como UA solo tiene este token, y es lo que enviamos.
- Finalidad
- Para qué recopila el rastreador: entrenar un modelo, construir un índice de búsqueda, cargar una página que alguien acaba de pedir o revisar una página de destino publicitaria.
- robots.txt
- Capa uno, calculada a partir de tu archivo: ¿tu robots.txt permite este token en esta ruta? Pasa el cursor sobre el veredicto para ver qué regla coincidió. La columna desaparece cuando el sitio no tiene robots.txt, y la línea sobre la tabla lo dice.
- Estado HTTP
- Capa dos, medida de verdad: qué devolvió tu servidor a una petición con ese User-Agent. Es la capa sobre la que robots.txt no puede decirte nada.
- Contenido
- Cuántos caracteres visibles recibió ese bot. La referencia son los demás bots de la misma ejecución, así que una cifra muy por debajo del resto indica una página recortada, no un idioma distinto.
- Resultado
- Si la medición en sí terminó. Es una etiqueta, no un botón: el reintento de una fila fallida vive en la columna siguiente.
- Acciones
- Un botón por fila que lo necesite: un bot con tiempo agotado, o que nunca llegó a su turno, recibe un reintento que vuelve a medir solo esa fila. Las filas que terminaron bien no tienen nada aquí.
Referencia de iconos de aviso
- Permitido, pero con 4xx o 5xx
- Tu robots.txt invita al bot y algo delante de tu servidor lo rechaza, normalmente una regla de bots de la CDN o el WAF que no escribiste tú. Este es el hallazgo para el que existe la herramienta.
- Bloqueado, pero con 2xx
- La brecha inversa: robots.txt dice que no y la página se sirve igualmente. Nada obliga a cumplir robots.txt, así que cualquier rastreador que lo ignore se lleva la página entera.
- Mucho menos contenido
- El estado parece sano pero el cuerpo es una fracción de lo que recibieron los demás. Suele ser una página de desafío o una variante recortada, y la columna de estado por sí sola nunca lo muestra.
- UA sin verificar
- El proveedor no publica ninguna cadena de User-Agent, así que la nuestra viene de registros de acceso y puede estar desactualizada. Lee esa fila con menos confianza que las demás.
- token como UA
- El proveedor publica el token de robots.txt pero no la cabecera User-Agent, así que la petición que enviamos lleva el propio token. El tráfico real de ese crawler puede ser distinto: lee la fila como un indicio, no como una medida exacta.
Referencia de códigos de estado
- 200 OK
- El bot obtuvo la página. Mira la columna Contenido antes de darlo por bueno.
- 403 Forbidden
- Rechazado. Casi siempre una regla contra bots y no una página rota: esa misma URL suele abrirse bien en tu navegador.
- 404 Not Found
- No hay nada en esa dirección para este visitante. Si otros bots recibieron 200 con la misma URL, la diferencia es deliberada.
- 429 Too Many Requests
- Límite de frecuencia. Tu sitio está frenando, no bloqueando: reintenta esa fila en lugar de leerla como una política.