Alat Cek & Validasi Aturan Robots.txt
Cara memakai penguji robots.txt
Kembali ke alatSatu URL dan satu crawler masuk; jawabannya adalah apakah crawler itu boleh mengambil alamat tersebut, dan baris robots.txt mana yang menentukannya.
- 01
Masukkan URL yang akan diuji
Tempel halamannya sendiri, bukan file robots.txt — alat ini membaca origin darinya lalu mengambil /robots.txt di sana. Normalisasi URL tetap penting: jika disetel ke Hanya domain, yang Anda tanyakan adalah halaman depan, karena path-lah separuh alamat yang dicocokkan.
- 02
Pilih perayap yang akan diuji
Aturan berlaku per crawler, jadi URL yang sama bisa diizinkan untuk satu bot dan diblokir untuk bot lain. Tombol periksa terkunci sampai ada crawler dipilih — tidak ada nilai bawaan yang masuk akal, dan bawaan yang salah menjawab pertanyaan yang tak pernah Anda ajukan. Semua crawler lain adalah grup *.
- 03
Jalankan pengujian dan baca baris penentu
Satu putaran adalah satu request: server hanya mengambil file, pencocokan berjalan di browser Anda. Seluruh file kembali bernomor baris, aturan pemenang diberi latar dan nomornya diganti ikon. Salin dan Unduh di baris tepat di atasnya memberi Anda file itu sendiri, bukan ringkasannya — unduhannya adalah robots.txt sungguhan yang bisa langsung ditaruh di sebuah situs.
- 04
Baca vonis di bawah file
Di bawah file: robots.txt mana yang dibaca dan apa jawabannya, path yang dicocokkan, kesimpulan dengan baris pemenang diulang di sebelahnya, serta setiap baris Sitemap: yang dideklarasikan file. Pengulangan itu disengaja — file bisa cukup panjang sehingga baris bertanda sudah lepas dari pandangan saat Anda sampai ke kesimpulan.
Cara membaca vonis aturan perayapan
Kesimpulan hanya satu kata; segala hal lain di halaman ini ada untuk menunjukkan dari mana kata itu datang.
Nilai vonis
- Diizinkan
- Tidak ada aturan yang cocok dengan path ini, atau aturan yang menang adalah Allow. Host tanpa robots.txt sama sekali juga dilaporkan begini: tidak ada file berarti tidak ada larangan.
- Diblokir
- Aturan yang menang adalah Disallow, disebut tepat di samping vonis. Diblokir dari perayapan bukan berarti dihapus dari indeks: URL yang diblokir masih bisa tercantum, itulah sebabnya noindex tempatnya di tag meta, bukan di sini.
- Tidak dapat dipastikan
- File tidak bisa dibaca, atau menjawab 200 dengan halaman alih-alih aturan. Google memperlakukan robots.txt yang tak terbaca sebagai blokir penuh selama sekitar dua belas jam, jadi menjawab Diizinkan di sini akan menjadi satu-satunya jawaban yang salah.
- Jalur URL
- Bagian alamat yang benar-benar dicocokkan: path ditambah query string, tanpa fragmen. Bagian ini membedakan huruf besar-kecil, tidak seperti nama crawler.
- Sitemap yang dideklarasikan
- Setiap baris Sitemap: dalam file, duplikat dibuang. Baris itu bersifat global — miliknya file, bukan milik grup crawler mana pun, jadi berlaku apa pun bot yang Anda pilih.
Prioritas aturan
- Pola terpanjang menang
- Di antara dua aturan yang sama-sama cocok, pola yang lebih panjang menentukan, menghitung * dan $ sebagai karakter. Karena itu Disallow: /shop kalah dari Allow: /shop/public pada /shop/public dan menang pada /shop.
- Seri jatuh ke Allow
- Panjang sama, Allow mengalahkan Disallow — bacaan paling tidak membatasi, dan itulah yang dilakukan parser rujukan.
- Hanya grup crawler Anda
- Semua grup yang menyebut nama crawler Anda digabung, meski file memisahkannya. Grup * hanya dipakai bila tidak ada grup yang menyebutnya: file dengan bagian Googlebot tidak lantas menerapkan bagian * miliknya untuk Googlebot.
- * dan $
- * mewakili rangkaian karakter apa pun. $ mengaitkan pola ke ujung URL, tetapi hanya bila berada di ujung pola; di tempat lain ia hanya karakter biasa.
- Disallow tanpa isi
- Tidak melarang apa pun. Begitulah sebuah file berkata "grup ini tanpa batasan", dan itu berbeda dari Disallow: /.
Saat file tidak bisa dibaca
- Tidak ada robots.txt (404)
- Tidak ada yang dilarang, jadi kesimpulannya Diizinkan dan tidak ada file untuk ditampilkan. Rantai lebih dari lima pengalihan juga terhitung tidak ada file — di situlah crawler rujukan menyerah.
- Tidak terbaca
- Sebuah 5xx, 429, waktu habis, atau koneksi ditolak. Kesimpulannya Tidak dapat dipastikan dan tidak ada file yang ditampilkan — isi halaman error bukan aturan Anda.
- 200 dengan HTML
- Soft 404: server menjawab seolah file ada tetapi mengirim halaman. Crawler membacanya sebagai sampah, jadi kesimpulannya Tidak dapat dipastikan — dan yang ini layak diperbaiki, karena dari browser tampak baik-baik saja.
- Hanya 500 KiB pertama
- File dipotong pada ukuran itu sebelum dicocokkan, yaitu batas yang dibaca parser rujukan. Aturan setelah titik potong juga tidak ada bagi crawler mana pun.
- File ada tapi tak memuat aturan
- File kosong, atau hanya berisi komentar dan baris Sitemap:. Sah, dan tidak melarang apa pun.