AI बॉट और LLM क्रॉलर एक्सेस चेकर
AI बॉट एक्सेस चेकर का उपयोग कैसे करें
टूल पर वापस जाएँएक पेज अंदर जाता है; हम जिन भी AI क्रॉलर पर नज़र रखते हैं, हर एक को उसी पेज पर दो बार, दो स्वतंत्र तरीकों से मापा जाता है।
- 01
वह पेज दर्ज करें जिस तक AI क्रॉलर पहुँचें
प्रति रन एक पेज: यहाँ तुलना बॉट्स के बीच है, URL के बीच नहीं। ठीक वही पेज चुनें जिसकी आपको परवाह है, क्योंकि robots.txt नियम उसके पथ से मिलाए जाते हैं। /blog/ को रोकने वाला नियम होमपेज जाँचने पर दिखेगा नहीं, और पथ से बँधा CDN नियम भी वैसा ही व्यवहार करता है।
- 02
सभी 22 बॉट्स पर जाँच चलाएँ
जानबूझकर कोई बॉट चयनकर्ता नहीं है। सामग्री स्तंभ हर बॉट को उसी रन के बाकी 21 के मुकाबले मापता है, इसलिए आंशिक रन वह पैमाना छीन लेगा जो इस स्तंभ को अर्थ देता है। हर बॉट बारी-बारी से लाया जाता है, इसलिए जिस पंक्ति की बारी नहीं आई उसे अकेले फिर चलाया जा सकता है।
- 03
दोनों नतीजे साथ-साथ पढ़ें
robots.txt वह है जो आपने घोषित किया; HTTP स्थिति वह है जो आपके सर्वर ने वास्तव में किया। जहाँ दोनों सहमत हों वे पंक्तियाँ सामान्य हैं। ध्यान देने लायक पंक्तियाँ वे हैं जहाँ दोनों असहमत हों, और उन पर चेतावनी आइकन होता है: फ़ाइल ने अनुमति दी पर सर्वर ने मना किया, या फ़ाइल ने रोका फिर भी पूरा पेज परोसा गया।
AI क्रॉलर एक्सेस रिपोर्ट कैसे पढ़ें
पंक्ति बाएँ से दाएँ पढ़ी जाती है: कौन-सा बॉट, robots.txt उसके बारे में क्या कहता है, और सर्वर ने वास्तव में क्या किया। हर अनुरोध हमारा है, उस बॉट की User-Agent स्ट्रिंग के साथ भेजा गया; विक्रेता का असली क्रॉलर फिर भी अलग व्यवहार कर सकता है।
परिणाम तालिका के स्तंभ
- हल की गई URL
- तालिका के ऊपर, उसके भीतर नहीं। यही वह पता है जिसे हमने मापा, अपने पहचान वाले User-Agent से एक बार लाकर — वही नियंत्रण समूह जिससे हर बॉट पंक्ति की तुलना होती है।
- कंपनी
- क्रॉलर किसका है। पंक्तियाँ कंपनी के हिसाब से समूहित हैं, इसलिए एक कंपनी एक ब्लॉक की तरह पढ़ी जाती है।
- बॉट
- वह टोकन जिसे आप robots.txt में User-agent: के बाद लिखेंगे। असत्यापित UA चिह्नित बॉट की कोई घोषित स्ट्रिंग नहीं होती; token ही UA चिह्नित बॉट के पास केवल यही token होता है, और हम वही भेजते हैं।
- उद्देश्य
- क्रॉलर किसलिए इकट्ठा करता है — मॉडल प्रशिक्षण, सर्च इंडेक्स, किसी के अभी पूछे गए पेज को लाना, या विज्ञापन लैंडिंग पेज जाँचना।
- robots.txt
- परत एक, आपकी अपनी फ़ाइल से गणना: क्या आपका robots.txt इस पथ पर इस टोकन को अनुमति देता है? कौन-सा नियम मिला यह देखने के लिए निर्णय पर कर्सर रखें। साइट में robots.txt न हो तो यह स्तंभ गायब हो जाता है, और तालिका के ऊपर की पंक्ति यह बताती है।
- HTTP स्थिति
- दूसरी परत, सचमुच मापी गई: उस बॉट User-Agent वाली रिक्वेस्ट पर आपके सर्वर ने क्या लौटाया। यही वह परत है जिसके बारे में robots.txt कुछ नहीं बता सकता।
- सामग्री
- उस बॉट को कितने दृश्य अक्षर मिले। पैमाना उसी रन के बाकी बॉट हैं, इसलिए बाकियों से बहुत कम संख्या का मतलब कटा-छँटा पेज है, भाषा का अंतर नहीं।
- परिणाम
- माप स्वयं पूरा हुआ या नहीं। यह एक बैज है, बटन नहीं — विफल पंक्ति का दोबारा-चलाएँ बटन अगले कॉलम में है।
- क्रियाएँ
- जिस पंक्ति को ज़रूरत है उसके लिए एक बटन: जिस बॉट का समय समाप्त हुआ, या जिसकी बारी नहीं आई, उसे दोबारा-चलाएँ बटन मिलता है जो केवल उसी पंक्ति को फिर मापता है। साफ़ पूरी हुई पंक्तियों में यहाँ कुछ नहीं होता।
चेतावनी आइकन संदर्भ
- अनुमति है, फिर भी 4xx या 5xx
- आपका robots.txt बॉट को बुलाता है और सर्वर के आगे बैठी कोई चीज़ उसे लौटा देती है — आमतौर पर CDN या WAF का ऐसा बॉट नियम जो आपने नहीं लिखा। यही वह खोज है जिसके लिए यह टूल बना है।
- रोक है, फिर भी 2xx
- उलटी दिशा की खाई: robots.txt मना करता है और पेज फिर भी परोसा जाता है। robots.txt को कोई लागू नहीं करता, इसलिए उसे अनदेखा करने वाला क्रॉलर पूरा पेज ले जाता है।
- बहुत कम सामग्री
- स्टेटस ठीक लगता है पर सामग्री बाकियों को मिली सामग्री का एक अंश भर है। यह प्रायः चैलेंज पेज या कटा हुआ रूप होता है, और अकेला स्टेटस कॉलम इसे कभी नहीं दिखाता।
- असत्यापित UA
- कंपनी कोई User-Agent स्ट्रिंग प्रकाशित नहीं करती, इसलिए हमारी एक्सेस लॉग से आई है और पुरानी हो सकती है। उस पंक्ति को बाकियों से कम भरोसे के साथ पढ़ें।
- token ही UA
- कंपनी robots.txt का token प्रकाशित करती है पर User-Agent हेडर नहीं, इसलिए हम जो request भेजते हैं उसमें वही token जाता है। उस crawler का असली ट्रैफ़िक अलग दिख सकता है, इसलिए उस पंक्ति को संकेत मानें, ठीक माप नहीं।
स्टेटस कोड संदर्भ
- 200 OK
- बॉट को पेज मिल गया। इसे जीत मानने से पहले सामग्री कॉलम देख लें।
- 403 Forbidden
- मना कर दिया। लगभग हमेशा बॉट-रोधी नियम, टूटा पेज नहीं — वही URL आपके ब्राउज़र में सामान्य रूप से खुलता है।
- 404 Not Found
- इस आगंतुक के लिए उस पते पर कुछ नहीं है। यदि उसी URL पर दूसरे बॉट को 200 मिला, तो यह अंतर जान-बूझकर बनाया गया है।
- 429 Too Many Requests
- दर सीमित। आपकी साइट रोक नहीं रही, गति घटा रही है — उस पंक्ति को दोबारा चलाएँ, इसे नीति न मानें।