Robots.txt टेस्टर और क्रॉल नियम वैलिडेटर
robots.txt टेस्टर का उपयोग कैसे करें
टूल पर वापस जाएँएक URL और एक क्रॉलर अंदर जाते हैं; जवाब यह है कि वह क्रॉलर उस पते को ला सकता है या नहीं, और robots.txt की कौन-सी पंक्ति यह तय करती है।
- 01
जाँचने के लिए URL दर्ज करें
robots.txt नहीं, खुद वह पेज चिपकाएँ — टूल उसी से origin निकालकर वहाँ का /robots.txt लाता है। URL सामान्यीकरण अब भी मायने रखता है: केवल डोमेन पर सेट करने का मतलब है आप होम पेज के बारे में पूछ रहे हैं, क्योंकि पते का जो आधा हिस्सा मिलान में जाता है वह path ही है।
- 02
जाँचने के लिए क्रॉलर चुनें
नियम हर क्रॉलर के अलग होते हैं, इसलिए एक ही URL किसी बॉट के लिए अनुमत और किसी के लिए अवरुद्ध हो सकता है। जब तक क्रॉलर न चुना जाए बटन बंद रहता है — कोई समझदार डिफ़ॉल्ट है ही नहीं, और गलत डिफ़ॉल्ट उस सवाल का जवाब देगा जो आपने पूछा ही नहीं। बाकी सभी क्रॉलर यानी * समूह।
- 03
टेस्ट चलाएँ और निर्णायक पंक्ति पढ़ें
एक बार चलाना यानी एक request: सर्वर सिर्फ़ फ़ाइल लाता है, मिलान आपके ब्राउज़र में होता है। पूरी फ़ाइल पंक्ति-संख्या के साथ लौटती है, जीतने वाला नियम रंगीन पृष्ठभूमि पाता है और उसकी संख्या की जगह एक आइकन आ जाता है। ठीक ऊपर की पंक्ति में Copy और Download आपको फ़ाइल ही देते हैं, उसका सारांश नहीं — डाउनलोड एक असली robots.txt है, जिसे सीधे किसी साइट पर रखा जा सकता है।
- 04
फ़ाइल के नीचे निर्णय पढ़ें
फ़ाइल के नीचे: कौन-सा robots.txt पढ़ा गया और उसने क्या लौटाया, कौन-सा path मिलाया गया, निष्कर्ष के साथ जीतने वाली पंक्ति उसी के बगल में दोहराई हुई, और फ़ाइल में घोषित हर Sitemap: पंक्ति। दोहराव जानबूझकर है — फ़ाइल इतनी लंबी हो सकती है कि निष्कर्ष तक पहुँचते-पहुँचते चिह्नित पंक्ति नज़र से बाहर जा चुकी हो।
क्रॉल नियम निर्णय कैसे पढ़ें
निष्कर्ष सिर्फ़ एक शब्द है; पेज पर बाकी सब कुछ यह दिखाने के लिए है कि वह शब्द कहाँ से आया।
निर्णय के मान
- अनुमति है
- इस path से कोई नियम मेल नहीं खाता, या जीतने वाला नियम Allow है। जिस होस्ट पर robots.txt है ही नहीं, वहाँ भी यही आता है: फ़ाइल नहीं तो कोई मनाही नहीं।
- रोका गया
- जीतने वाला नियम एक Disallow है, जिसका नाम निर्णय के ठीक बगल में है। क्रॉल से रोका जाना इंडेक्स से हटाया जाना नहीं है: रोका गया URL फिर भी सूचीबद्ध हो सकता है, इसीलिए noindex की जगह meta टैग में है, यहाँ नहीं।
- तय नहीं
- फ़ाइल पढ़ी नहीं जा सकी, या उसने नियमों की जगह पेज के साथ 200 दिया। Google न पढ़ी जा सकने वाली robots.txt को लगभग बारह घंटे तक पूर्ण रोक मानता है, इसलिए यहाँ अनुमति है उत्तर देना ही एकमात्र गलत उत्तर होता।
- URL पाथ
- पते का वही हिस्सा जो सचमुच मिलाया जाता है: path और query string, fragment को छोड़कर। यह छोटे-बड़े अक्षर में फ़र्क करता है, क्रॉलर के नाम के विपरीत।
- घोषित साइटमैप
- फ़ाइल की हर Sitemap: पंक्ति, दोहराव हटाकर। ये पंक्तियाँ वैश्विक हैं — वे फ़ाइल की हैं, किसी क्रॉलर समूह की नहीं, इसलिए आपने कोई भी बॉट चुना हो, लागू रहती हैं।
नियमों की वरीयता
- सबसे लंबा पैटर्न जीतता है
- दोनों मेल खाते नियमों में लंबा पैटर्न तय करता है, और * तथा $ भी अक्षर की तरह गिने जाते हैं। इसीलिए /shop/public पर Disallow: /shop हारता है Allow: /shop/public से, और /shop पर जीतता है।
- बराबरी पर Allow जीतता है
- लंबाई बराबर हो तो Allow, Disallow को हरा देता है — सबसे कम रोक वाली व्याख्या, और यही संदर्भ पार्सर करता है।
- सिर्फ़ आपके क्रॉलर का समूह
- आपके क्रॉलर का नाम लेने वाले सभी समूह जोड़ दिए जाते हैं, भले फ़ाइल उन्हें अलग-अलग जगह रखे। * समूह तभी काम आता है जब कोई समूह उसका नाम न ले: जिस फ़ाइल में Googlebot वाला हिस्सा है, उसका * हिस्सा Googlebot पर अतिरिक्त रूप से लागू नहीं होता।
- * और $
- * का मतलब कोई भी अक्षर-श्रृंखला। $ पैटर्न को URL के अंत से बाँधता है, पर तभी जब वह पैटर्न के बिल्कुल अंत में हो; और कहीं हो तो वह साधारण अक्षर भर है।
- खाली Disallow
- कुछ भी नहीं रोकता। यही तरीका है जिससे फ़ाइल कहती है "इस समूह पर कोई रोक नहीं", और यह Disallow: / जैसा बिल्कुल नहीं है।
जब फ़ाइल पढ़ी न जा सके
- robots.txt नहीं है (404)
- कुछ भी मना नहीं, इसलिए निष्कर्ष अनुमति है और दिखाने को फ़ाइल नहीं। पाँच से ज़्यादा रीडायरेक्ट की शृंखला भी "फ़ाइल नहीं" ही मानी जाती है — वहीं संदर्भ क्रॉलर हार मान लेता है।
- पढ़ी नहीं जा सकी
- कोई 5xx, 429, समय समाप्त, या ठुकराया गया कनेक्शन। निष्कर्ष तय नहीं होता है और कोई फ़ाइल नहीं दिखती — किसी त्रुटि पेज का शरीर आपके नियम नहीं है।
- 200 पर HTML
- सॉफ़्ट 404: सर्वर ऐसे जवाब देता है मानो फ़ाइल हो, पर भेजता है एक पेज। क्रॉलर उसे कचरा पढ़ते हैं, इसलिए निष्कर्ष तय नहीं — और यह सुधारने लायक है, क्योंकि ब्राउज़र से देखने पर कुछ गलत नहीं लगता।
- सिर्फ़ पहले 500 KiB
- मिलान से पहले फ़ाइल उसी आकार पर काट दी जाती है, यही सीमा संदर्भ पार्सर पढ़ता है। कटाव के बाद वाले नियम किसी भी क्रॉलर के लिए मौजूद ही नहीं हैं।
- फ़ाइल है पर कोई नियम नहीं
- खाली फ़ाइल, या सिर्फ़ टिप्पणियाँ और Sitemap: पंक्तियाँ। वैध है, और कुछ नहीं रोकती।