فاحص وصول روبوتات الذكاء الاصطناعي وزواحف LLM
كيفية استخدام أداة فحص وصول روبوتات الذكاء الاصطناعي
العودة إلى الأداةتُدخل صفحة واحدة؛ ويُقاس عليها كل زاحف ذكاء اصطناعي نتابعه مرتين، بطريقتين مستقلتين.
- 01
أدخل الصفحة التي تريد أن تصل إليها زواحف الذكاء الاصطناعي
صفحة واحدة لكل تشغيل: المقارنة هنا بين البوتات لا بين الروابط. اختر الصفحة التي تهمك بعينها، لأن قواعد robots.txt تُطابَق مع مسارها. القاعدة التي تحجب /blog/ لن تظهر إن اختبرت الصفحة الرئيسية، وقاعدة CDN المربوطة بمسار تتصرف بالطريقة نفسها.
- 02
شغّل الفحص على البوتات الـ22 كلها
لا يوجد منتقي بوتات، وذلك مقصود. يقيس عمود المحتوى كل بوت مقابل البوتات الـ21 الأخرى في التشغيل نفسه، فالتشغيل الجزئي يُذهب المقياس الذي يمنح العمود معناه. يُجلب كل بوت بدوره، فالصف الذي لم يأتِ دوره يمكن إعادة محاولته وحده.
- 03
اقرأ الحكمين جنبًا إلى جنب
robots.txt هو ما أعلنته؛ وحالة HTTP هو ما فعله خادمك فعلًا. الصفوف التي يتفق فيها الاثنان روتينية. الصفوف الجديرة بانتباهك هي التي يختلفان فيها، وتحمل أيقونة تحذير: مسموح في الملف لكن الخادم رفض، أو محجوب في الملف ومع ذلك قُدِّم كاملًا.
كيفية قراءة تقرير وصول زواحف الذكاء الاصطناعي
يُقرأ الصف من اليسار إلى اليمين: أي بوت، وماذا يقول robots.txt عنه، وماذا فعل الخادم فعلًا. كل طلب هو طلبنا، مُرسَل بسلسلة User-Agent الخاصة بذلك البوت؛ وقد يتصرف زاحف المورّد الحقيقي بشكل مختلف.
أعمدة جدول النتائج
- الرابط الفعلي
- فوق الجدول لا داخله. هذا هو العنوان الذي قسناه، جُلب مرة واحدة بمعرّف User-Agent الخاص بنا — مجموعة الضبط التي يُقارن بها كل صف روبوت.
- الجهة
- من يشغّل الزاحف. الصفوف مجمّعة حسب الشركة، فتُقرأ كل شركة ككتلة واحدة.
- الروبوت
- الرمز الذي ستكتبه بعد User-agent: في robots.txt. الروبوت الموسوم وكيل غير مُتحقَّق لا تنشر جهته أي نص User-Agent؛ والموسوم الرمز كـ UA لا يملك سوى هذا الرمز، وهو ما نرسله.
- الغرض
- لماذا يجمع الزاحف — تدريب نموذج، أو بناء فهرس بحث، أو جلب صفحة سألت عنها للتو، أو فحص صفحة هبوط إعلانية.
- robots.txt
- الطبقة الأولى، محسوبة من ملفك: هل يسمح robots.txt لديك بهذا الرمز على هذا المسار؟ مرّر المؤشر فوق الحكم لترى أي قاعدة طابقت. يختفي العمود حين لا يملك الموقع robots.txt، والسطر فوق الجدول يقول ذلك.
- حالة HTTP
- الطبقة الثانية، مقيسة فعليًا: ماذا أعاد خادمك لطلب يحمل User-Agent ذلك الروبوت. هذه هي الطبقة التي لا يستطيع robots.txt إخبارك عنها.
- المحتوى
- كم حرفًا مرئيًا استلم ذلك الروبوت. المرجع هو بقية الروبوتات في التشغيل نفسه، فرقم أدنى بكثير من البقية يعني صفحة مبتورة لا اختلاف لغة.
- النتيجة
- هل اكتمل القياس نفسه. إنها شارة لا زر — زر إعادة المحاولة للصف الفاشل في العمود التالي.
- إجراءات
- زر واحد لكل صف يحتاجه: الروبوت الذي انتهت مهلته، أو لم يأت دوره، يحصل على زر إعادة يقيس ذلك الصف وحده. الصفوف التي اكتملت بسلام لا تحمل شيئًا هنا.
مرجع أيقونات التحذير
- مسموح، لكن 4xx أو 5xx
- ملف robots.txt يدعو الروبوت للدخول وشيء أمام خادمك يردّه — غالبًا قاعدة روبوتات في شبكة التوصيل أو جدار الحماية لم تكتبها أنت. هذا هو الاكتشاف الذي وُجدت الأداة من أجله.
- محجوب، لكن 2xx
- الفجوة المعاكسة: robots.txt يمنع والصفحة تُقدَّم رغم ذلك. لا شيء يفرض robots.txt، فأي زاحف يتجاهله يخرج بالصفحة كاملة.
- محتوى أقل بكثير
- الحالة تبدو سليمة لكن المحتوى جزء يسير مما استلمه الآخرون. غالبًا صفحة تحقّق أو نسخة مبتورة، وعمود الحالة وحده لا يُظهر ذلك أبدًا.
- وكيل غير مُتحقَّق
- الشركة لا تنشر أي نص User-Agent، فنصّنا من سجلات الوصول وقد يكون قديمًا. اقرأ ذلك الصف بثقة أقل من غيره.
- الرمز كـ UA
- تنشر هذه الجهة رمز robots.txt دون ترويسة User-Agent، لذا يحمل الطلب الذي نرسله الرمز نفسه. قد تبدو حركة الزاحف الحقيقية مختلفة، فاقرأ الصف كمؤشِّر لا كقياس دقيق.
مرجع رموز الحالة
- 200 OK
- حصل الروبوت على الصفحة. راجع عمود المحتوى قبل اعتبار ذلك نجاحًا.
- 403 Forbidden
- رُفض. غالبًا قاعدة ضد الروبوتات لا صفحة معطوبة — الرابط نفسه يفتح عادةً بلا مشكلة في متصفحك.
- 404 Not Found
- لا شيء على ذلك العنوان لهذا الزائر. وإن حصل روبوت آخر على 200 للرابط نفسه، فالفرق مقصود.
- 429 Too Many Requests
- تحديد للمعدل. موقعك يبطّئ ولا يحجب — أعد تشغيل ذلك الصف بدل قراءته كسياسة.