كيفية استخدام هذه الأداة

فاحص Robots.txt ومدقّق قواعد الزحف

كيفية استخدام مختبِر robots.txt

العودة إلى الأداة

يدخل رابط واحد وزاحف واحد؛ والجواب هو هل يُسمح لذلك الزاحف بجلب هذا العنوان، وأي سطر من robots.txt يحسم ذلك.

  1. 01

    أدخل الرابط المراد اختباره

    الصق الصفحة نفسها لا ملف robots.txt — الأداة تستنتج الأصل منها ثم تجلب /robots.txt هناك. ما زال خيار توحيد الرابط مهمًا: عند ضبطه على النطاق فقط تكون سؤالك عن الصفحة الرئيسية، لأن المسار هو نصف العنوان الذي يُقارن بالقواعد.

  2. 02

    اختر الزاحف المراد اختباره

    القواعد لكل زاحف على حدة، فالرابط نفسه قد يكون مسموحًا لبوت ومحظورًا على آخر. يبقى زر الفحص مقفلًا حتى تختار زاحفًا — لا توجد قيمة افتراضية معقولة، والافتراضية الخاطئة تجيب عن سؤال لم تطرحه. وبند «كل الزواحف الأخرى» هو المجموعة *.

  3. 03

    شغّل الاختبار واقرأ السطر الحاسم

    الجولة الواحدة طلب واحد: الخادم يجلب الملف فقط، والمطابقة تجري داخل متصفحك. يعود الملف كاملًا مرقّم الأسطر، والقاعدة الفائزة مظللة ورقمها مستبدَل بأيقونة. زرّا النسخ والتنزيل في الصف الذي فوقه يعطيانك الملف نفسه لا ملخّصًا عنه — الملف المنزَّل هو robots.txt حقيقي يمكن وضعه في موقع كما هو.

  4. 04

    اقرأ الحكم أسفل الملف

    تحت الملف: أي robots.txt قُرئ وبماذا أجاب، والمسار الذي جرت مطابقته، والخلاصة ومعها السطر الفائز مكرَّرًا بجانبها، وكل سطر Sitemap: يعلنه الملف. التكرار مقصود — قد يطول الملف حتى يخرج السطر المظلَّل عن مجال النظر عند وصولك إلى الخلاصة.

كيفية قراءة حكم قواعد الزحف

الخلاصة كلمة واحدة؛ وكل ما بقي في الصفحة موجود ليريك من أين جاءت تلك الكلمة.

قيم الحكم

مسموح
لا قاعدة تطابق هذا المسار، أو أن القاعدة الفائزة هي Allow. والمضيف الذي لا robots.txt لديه أصلًا يعطي النتيجة ذاتها: لا ملف يعني لا منع.
محظور
القاعدة الفائزة Disallow، مذكورة بجانب الحكم مباشرة. الحجب عن الزحف ليس حذفًا من الفهرس: الرابط المحجوب قد يظل مدرجًا، ولذلك مكان noindex في وسم meta لا هنا.
غير محدَّد
تعذّرت قراءة الملف، أو أجاب بـ200 مع صفحة بدل القواعد. تعامل Google ملف robots.txt المتعذر قراءته كحجب كامل نحو اثنتي عشرة ساعة، فالإجابة بـمسموح هنا ستكون الجواب الخاطئ الوحيد.
مسار الرابط
الجزء الذي تجري مطابقته فعلًا من العنوان: المسار مع سلسلة الاستعلام، دون الجزء التالي للمِرساة. وهو حساس لحالة الأحرف، بخلاف اسم الزاحف.
خرائط الموقع المُعلَنة
كل سطر Sitemap: في الملف، بعد إزالة المكرر. وهذه الأسطر عامة — تخص الملف لا مجموعة زواحف بعينها، فتسري أيًّا كان البوت الذي اخترته.

أولوية القواعد

النمط الأطول يفوز
بين قاعدتين تطابقان معًا، يحسم النمط الأطول، مع عدّ * و$ حرفين عاديين. لذلك تخسر Disallow: /shop أمام Allow: /shop/public على ‎/shop/public وتفوز على ‎/shop.
عند التعادل تفوز Allow
بالطول نفسه تغلب Allow قاعدةَ Disallow — وهي القراءة الأقل تقييدًا، وما يفعله المحلّل المرجعي.
مجموعة زاحفك وحدها
تُدمَج كل مجموعة تذكر اسم زاحفك، ولو فرّقها الملف. ولا تُستخدَم المجموعة * إلا حين لا تذكره أي مجموعة: فالملف الذي فيه قسم Googlebot لا يطبّق عليه قسمه * أيضًا.
* و$
تنوب * عن أي سلسلة أحرف. و$ تربط النمط بنهاية الرابط، لكن فقط إذا جاءت في آخر النمط؛ وفي أي موضع آخر هي حرف عادي.
Disallow بلا شيء بعدها
لا تمنع شيئًا. هكذا يقول الملف «لا قيود على هذه المجموعة»، وهي ليست Disallow: / إطلاقًا.

حين يتعذر قراءة الملف

لا robots.txt (404)
لا شيء ممنوع، فالخلاصة مسموح ولا ملف يُعرَض. وسلسلة تزيد على خمس تحويلات تُعدّ كذلك «لا ملف» — وعندها يستسلم الزاحف المرجعي.
تعذّرت قراءته
رمز 5xx أو 429 أو انتهاء المهلة أو اتصال مرفوض. الخلاصة غير محدَّد ولا يُعرَض ملف — فجسد صفحة الخطأ ليس قواعدك.
200 مع HTML
خطأ 404 ناعم: يجيب الخادم كأن الملف موجود لكنه يرسل صفحة. يقرأ الزواحف ذلك حشوًا، فالخلاصة غير محدَّد — وهذه تستحق الإصلاح، لأنها لا تُرى من المتصفح.
أول 500 كيبي بايت فقط
يُقتطع الملف عند هذا الحجم قبل المطابقة، وهو الحد الذي يقرأه المحلّل المرجعي. والقواعد بعد ذلك الحد غير موجودة لأي زاحف أيضًا.
الملف موجود لكنه بلا قواعد
ملف فارغ، أو فيه تعليقات وأسطر Sitemap: فقط. صالح، ولا يمنع شيئًا.