इस टूल का उपयोग कैसे करें

XML साइटमैप फाइंडर और URL एक्सट्रैक्टर

XML साइटमैप खोजक कैसे इस्तेमाल करें

टूल पर वापस जाएँ

एक डोमेन अंदर जाता है; बाहर आता है साइट द्वारा घोषित हर साइटमैप फ़ाइल, और आप जो फ़ाइल खोलें उसके अंदर के URL।

  1. 01

    डोमेन या साइटमैप पता दर्ज करें

    डोमेन सामान्य प्रवेश है: हम robots.txt पढ़ते हैं, फिर होस्ट रूट के मानक स्थान। इसके बजाय .xml या .xml.gz पर समाप्त होने वाला पता चिपकाएँ तो ठीक वही फ़ाइल पेड़ की जड़ बन जाती है, तब उपयोगी जब साइटमैप ऐसी जगह हो जिसका robots.txt कभी ज़िक्र नहीं करता। साधारण पेज का पथ अनदेखा होता है; केवल उसका होस्ट इस्तेमाल होता है।

  2. 02

    फ़ाइलों का पेड़ पढ़ें

    खोज पहले robots.txt पढ़ती है, फिर उसमें बताई फ़ाइलें लाती है — सबसे ऊपरी स्तर, और बस वही। साइटमैप इंडेक्स जिन फ़ाइलों को घोषित करता है, वे सीधे इंडेक्स के भीतर से सूचीबद्ध होती हैं, पता और अंतिम बदलाव समेत, पर उनके लिए अभी कुछ नहीं लाया जाता — उनकी पंक्ति का जाँचें बटन इसी काम के लिए है। दस अनुरोध ही उस सवाल का जवाब दे देते हैं जिसे लेकर ज़्यादातर लोग यहाँ आते हैं।

  3. 03

    किसी फ़ाइल की सामग्री पढ़ने के लिए उसे जाँचें

    जाँचें वही एक फ़ाइल लाता है: एक क्लिक, एक अनुरोध। URL सेट अपने पेज URL और उनकी Last modified तिथियाँ खोलता है। इंडेक्स अपने बच्चों को नई पंक्तियों के रूप में पेड़ में जोड़ता है। न पढ़ी जा सकने वाली फ़ाइल कारण बताती है, और उसका बटन फिर कोशिश करें बन जाता है। सभी जाँचें हर प्रतीक्षारत पंक्ति पर वही जाँच चलाता है और रेट लिमिट के जवाब देते ही रुक जाता है।

  4. 04

    सूची निर्यात करें

    टेबल कॉपी करें और CSV निर्यात करें तालिका को जैसी है वैसी लेते हैं: हर फ़ाइल पंक्ति, साथ ही आपके खोले किसी भी फ़ाइल के पेज URL। पाँच स्तंभ पेड़ को स्प्रेडशीट में ले जाते हैं: स्तर बताता है कि पंक्ति साइटमैप है या पेज URL; फिर पता; फिर मूल साइटमैप, वह फ़ाइल जिसने इसे घोषित किया; फिर अंतिम बदलाव; फिर परिणाम, यानी फ़ाइल ने खुद क्या जवाब दिया — पेज पंक्तियों में खाली, क्योंकि यह टूल उन्हें कभी नहीं माँगता।

साइटमैप ट्री रिपोर्ट कैसे पढ़ें

हर पंक्ति एक साइटमैप फ़ाइल है, या उसके भीतर का एक पेज URL। जब तक कुछ गलत न हो, पंक्ति चुप रहती है, इसलिए पते के बगल में लिखी हर बात पढ़ने लायक है। सीमाएँ तालिका में बताई जाती हैं, चुपचाप कभी लागू नहीं होतीं: प्रति स्कैन सौ फ़ाइलें, तीन सौ पंक्तियाँ, प्रति फ़ाइल 5,000 URL दिखाए जाते हैं, प्रति फ़ाइल 10 MB।

पंक्ति स्थिति टिप्पणियाँ

जाँचें के बगल में कोई टिप्पणी नहीं
अभी नहीं लाया गया। किसी इंडेक्स ने यह फ़ाइल घोषित की, पर स्कैन जानबूझकर शीर्ष स्तर पर रुकता है: हर इंडेक्स के हर बच्चे को लाने में प्रति फ़ाइल एक अनुरोध लगता है और यह ऐसे सवाल का जवाब देता है जो शायद आपने पूछा ही नहीं।
देखें के बगल में कोई टिप्पणी नहीं
फ़ाइल पढ़ी गई और उसमें कुछ ग़लत नहीं था। अंदर क्या है देखने के लिए देखें दबाएँ: urlset हो तो पेज URL, और वह दूसरा इंडेक्स निकले तो नई चाइल्ड पंक्तियाँ।
404, 503, Timeout
फ़ाइल पढ़ी नहीं जा सकी। जिस फ़ाइल को इंडेक्स घोषित करता है पर साइट देती नहीं, वह असली खोज है — सर्च इंजन को भी वही जवाब मिलता है जो आपको मिला। बटन फिर कोशिश करें बन जाता है, जो दोबारा पूछता है।
साइटमैप नहीं है (html)
सर्वर ने 200 दिया पर भेजा एक वेब पेज। आम तौर पर soft 404, कभी-कभी ब्लॉक पेज। दोनों ही हाल में ठीक करने लायक़ — ब्राउज़र से देखने पर सब ठीक लगता है।
10 MB से बड़ा — पढ़ा नहीं गया
हमारी आकार सीमा से बाहर, डीकम्प्रेस करने के बाद मापा गया। जो आधा ही पढ़ा जा सका उसे हम पार्स नहीं करते: कटी हुई XML फ़ाइल टूटी हुई XML फ़ाइल है, और अधूरी URL सूची जो पूरी दिखे, न होने से बदतर है।

ट्री के स्तंभ

इंडेक्स Lv1, Sitemap Lv2, URL
स्तर स्तंभ में पूरा पेड़ है: इंडेंट, ऊपर की पंक्ति द्वारा घोषित फ़ाइल के लिए ↳ तीर, और स्तर। इंडेक्स अन्य साइटमैप सूचीबद्ध करता है; Sitemap अभी न पढ़ी गई फ़ाइल है; URL ऊपर की फ़ाइल के भीतर का पेज है।
अंतिम बदलाव में कोई तारीख़
वह lastmod जो मूल इंडेक्स इस फ़ाइल के लिए घोषित करता है। इसे पढ़ने में कुछ नहीं लगता और अक्सर यही यहाँ आने का कारण है: यह बताता है साइट की कौन-सी शाखा हाल में बदली। यह साइट का अपना दावा है, माप नहीं।
अंतिम बदलाव में डैश
इस फ़ाइल के लिए किसी ने तारीख़ घोषित नहीं की। सबसे ऊपरी स्तर की फ़ाइलें आम तौर पर यहीं होती हैं — उनके ऊपर कुछ है ही नहीं जो उनके बारे में कुछ घोषित करे। इससे यह पता नहीं चलता कि फ़ाइल पुरानी है या नहीं।
बिना बटन वाली पंक्ति
ऐसा इंडेक्स जिसके बच्चे पहले से पेड़ में हैं। उसके लिए लाने को कुछ बचा नहीं; उसके बच्चों को पढ़ें।