इस टूल का उपयोग कैसे करें

AI बॉट और LLM क्रॉलर एक्सेस चेकर

AI बॉट एक्सेस चेकर का उपयोग कैसे करें

टूल पर वापस जाएँ

एक पेज अंदर जाता है; हम जिन भी AI क्रॉलर पर नज़र रखते हैं, हर एक को उसी पेज पर दो बार, दो स्वतंत्र तरीकों से मापा जाता है।

  1. 01

    वह पेज दर्ज करें जिस तक AI क्रॉलर पहुँचें

    प्रति रन एक पेज: यहाँ तुलना बॉट्स के बीच है, URL के बीच नहीं। ठीक वही पेज चुनें जिसकी आपको परवाह है, क्योंकि robots.txt नियम उसके पथ से मिलाए जाते हैं। /blog/ को रोकने वाला नियम होमपेज जाँचने पर दिखेगा नहीं, और पथ से बँधा CDN नियम भी वैसा ही व्यवहार करता है।

  2. 02

    सभी 22 बॉट्स पर जाँच चलाएँ

    जानबूझकर कोई बॉट चयनकर्ता नहीं है। सामग्री स्तंभ हर बॉट को उसी रन के बाकी 21 के मुकाबले मापता है, इसलिए आंशिक रन वह पैमाना छीन लेगा जो इस स्तंभ को अर्थ देता है। हर बॉट बारी-बारी से लाया जाता है, इसलिए जिस पंक्ति की बारी नहीं आई उसे अकेले फिर चलाया जा सकता है।

  3. 03

    दोनों नतीजे साथ-साथ पढ़ें

    robots.txt वह है जो आपने घोषित किया; HTTP स्थिति वह है जो आपके सर्वर ने वास्तव में किया। जहाँ दोनों सहमत हों वे पंक्तियाँ सामान्य हैं। ध्यान देने लायक पंक्तियाँ वे हैं जहाँ दोनों असहमत हों, और उन पर चेतावनी आइकन होता है: फ़ाइल ने अनुमति दी पर सर्वर ने मना किया, या फ़ाइल ने रोका फिर भी पूरा पेज परोसा गया।

AI क्रॉलर एक्सेस रिपोर्ट कैसे पढ़ें

पंक्ति बाएँ से दाएँ पढ़ी जाती है: कौन-सा बॉट, robots.txt उसके बारे में क्या कहता है, और सर्वर ने वास्तव में क्या किया। हर अनुरोध हमारा है, उस बॉट की User-Agent स्ट्रिंग के साथ भेजा गया; विक्रेता का असली क्रॉलर फिर भी अलग व्यवहार कर सकता है।

परिणाम तालिका के स्तंभ

हल की गई URL
तालिका के ऊपर, उसके भीतर नहीं। यही वह पता है जिसे हमने मापा, अपने पहचान वाले User-Agent से एक बार लाकर — वही नियंत्रण समूह जिससे हर बॉट पंक्ति की तुलना होती है।
कंपनी
क्रॉलर किसका है। पंक्तियाँ कंपनी के हिसाब से समूहित हैं, इसलिए एक कंपनी एक ब्लॉक की तरह पढ़ी जाती है।
बॉट
वह टोकन जिसे आप robots.txt में User-agent: के बाद लिखेंगे। असत्यापित UA चिह्नित बॉट की कोई घोषित स्ट्रिंग नहीं होती; token ही UA चिह्नित बॉट के पास केवल यही token होता है, और हम वही भेजते हैं।
उद्देश्य
क्रॉलर किसलिए इकट्ठा करता है — मॉडल प्रशिक्षण, सर्च इंडेक्स, किसी के अभी पूछे गए पेज को लाना, या विज्ञापन लैंडिंग पेज जाँचना।
robots.txt
परत एक, आपकी अपनी फ़ाइल से गणना: क्या आपका robots.txt इस पथ पर इस टोकन को अनुमति देता है? कौन-सा नियम मिला यह देखने के लिए निर्णय पर कर्सर रखें। साइट में robots.txt न हो तो यह स्तंभ गायब हो जाता है, और तालिका के ऊपर की पंक्ति यह बताती है।
HTTP स्थिति
दूसरी परत, सचमुच मापी गई: उस बॉट User-Agent वाली रिक्वेस्ट पर आपके सर्वर ने क्या लौटाया। यही वह परत है जिसके बारे में robots.txt कुछ नहीं बता सकता।
सामग्री
उस बॉट को कितने दृश्य अक्षर मिले। पैमाना उसी रन के बाकी बॉट हैं, इसलिए बाकियों से बहुत कम संख्या का मतलब कटा-छँटा पेज है, भाषा का अंतर नहीं।
परिणाम
माप स्वयं पूरा हुआ या नहीं। यह एक बैज है, बटन नहीं — विफल पंक्ति का दोबारा-चलाएँ बटन अगले कॉलम में है।
क्रियाएँ
जिस पंक्ति को ज़रूरत है उसके लिए एक बटन: जिस बॉट का समय समाप्त हुआ, या जिसकी बारी नहीं आई, उसे दोबारा-चलाएँ बटन मिलता है जो केवल उसी पंक्ति को फिर मापता है। साफ़ पूरी हुई पंक्तियों में यहाँ कुछ नहीं होता।

चेतावनी आइकन संदर्भ

अनुमति है, फिर भी 4xx या 5xx
आपका robots.txt बॉट को बुलाता है और सर्वर के आगे बैठी कोई चीज़ उसे लौटा देती है — आमतौर पर CDN या WAF का ऐसा बॉट नियम जो आपने नहीं लिखा। यही वह खोज है जिसके लिए यह टूल बना है।
रोक है, फिर भी 2xx
उलटी दिशा की खाई: robots.txt मना करता है और पेज फिर भी परोसा जाता है। robots.txt को कोई लागू नहीं करता, इसलिए उसे अनदेखा करने वाला क्रॉलर पूरा पेज ले जाता है।
बहुत कम सामग्री
स्टेटस ठीक लगता है पर सामग्री बाकियों को मिली सामग्री का एक अंश भर है। यह प्रायः चैलेंज पेज या कटा हुआ रूप होता है, और अकेला स्टेटस कॉलम इसे कभी नहीं दिखाता।
असत्यापित UA
कंपनी कोई User-Agent स्ट्रिंग प्रकाशित नहीं करती, इसलिए हमारी एक्सेस लॉग से आई है और पुरानी हो सकती है। उस पंक्ति को बाकियों से कम भरोसे के साथ पढ़ें।
token ही UA
कंपनी robots.txt का token प्रकाशित करती है पर User-Agent हेडर नहीं, इसलिए हम जो request भेजते हैं उसमें वही token जाता है। उस crawler का असली ट्रैफ़िक अलग दिख सकता है, इसलिए उस पंक्ति को संकेत मानें, ठीक माप नहीं।

स्टेटस कोड संदर्भ

200 OK
बॉट को पेज मिल गया। इसे जीत मानने से पहले सामग्री कॉलम देख लें।
403 Forbidden
मना कर दिया। लगभग हमेशा बॉट-रोधी नियम, टूटा पेज नहीं — वही URL आपके ब्राउज़र में सामान्य रूप से खुलता है।
404 Not Found
इस आगंतुक के लिए उस पते पर कुछ नहीं है। यदि उसी URL पर दूसरे बॉट को 200 मिला, तो यह अंतर जान-बूझकर बनाया गया है।
429 Too Many Requests
दर सीमित। आपकी साइट रोक नहीं रही, गति घटा रही है — उस पंक्ति को दोबारा चलाएँ, इसे नीति न मानें।