Cara memakai alat ini

Alat Cek & Validasi Aturan Robots.txt

Cara memakai penguji robots.txt

Kembali ke alat

Satu URL dan satu crawler masuk; jawabannya adalah apakah crawler itu boleh mengambil alamat tersebut, dan baris robots.txt mana yang menentukannya.

  1. 01

    Masukkan URL yang akan diuji

    Tempel halamannya sendiri, bukan file robots.txt — alat ini membaca origin darinya lalu mengambil /robots.txt di sana. Normalisasi URL tetap penting: jika disetel ke Hanya domain, yang Anda tanyakan adalah halaman depan, karena path-lah separuh alamat yang dicocokkan.

  2. 02

    Pilih perayap yang akan diuji

    Aturan berlaku per crawler, jadi URL yang sama bisa diizinkan untuk satu bot dan diblokir untuk bot lain. Tombol periksa terkunci sampai ada crawler dipilih — tidak ada nilai bawaan yang masuk akal, dan bawaan yang salah menjawab pertanyaan yang tak pernah Anda ajukan. Semua crawler lain adalah grup *.

  3. 03

    Jalankan pengujian dan baca baris penentu

    Satu putaran adalah satu request: server hanya mengambil file, pencocokan berjalan di browser Anda. Seluruh file kembali bernomor baris, aturan pemenang diberi latar dan nomornya diganti ikon. Salin dan Unduh di baris tepat di atasnya memberi Anda file itu sendiri, bukan ringkasannya — unduhannya adalah robots.txt sungguhan yang bisa langsung ditaruh di sebuah situs.

  4. 04

    Baca vonis di bawah file

    Di bawah file: robots.txt mana yang dibaca dan apa jawabannya, path yang dicocokkan, kesimpulan dengan baris pemenang diulang di sebelahnya, serta setiap baris Sitemap: yang dideklarasikan file. Pengulangan itu disengaja — file bisa cukup panjang sehingga baris bertanda sudah lepas dari pandangan saat Anda sampai ke kesimpulan.

Cara membaca vonis aturan perayapan

Kesimpulan hanya satu kata; segala hal lain di halaman ini ada untuk menunjukkan dari mana kata itu datang.

Nilai vonis

Diizinkan
Tidak ada aturan yang cocok dengan path ini, atau aturan yang menang adalah Allow. Host tanpa robots.txt sama sekali juga dilaporkan begini: tidak ada file berarti tidak ada larangan.
Diblokir
Aturan yang menang adalah Disallow, disebut tepat di samping vonis. Diblokir dari perayapan bukan berarti dihapus dari indeks: URL yang diblokir masih bisa tercantum, itulah sebabnya noindex tempatnya di tag meta, bukan di sini.
Tidak dapat dipastikan
File tidak bisa dibaca, atau menjawab 200 dengan halaman alih-alih aturan. Google memperlakukan robots.txt yang tak terbaca sebagai blokir penuh selama sekitar dua belas jam, jadi menjawab Diizinkan di sini akan menjadi satu-satunya jawaban yang salah.
Jalur URL
Bagian alamat yang benar-benar dicocokkan: path ditambah query string, tanpa fragmen. Bagian ini membedakan huruf besar-kecil, tidak seperti nama crawler.
Sitemap yang dideklarasikan
Setiap baris Sitemap: dalam file, duplikat dibuang. Baris itu bersifat global — miliknya file, bukan milik grup crawler mana pun, jadi berlaku apa pun bot yang Anda pilih.

Prioritas aturan

Pola terpanjang menang
Di antara dua aturan yang sama-sama cocok, pola yang lebih panjang menentukan, menghitung * dan $ sebagai karakter. Karena itu Disallow: /shop kalah dari Allow: /shop/public pada /shop/public dan menang pada /shop.
Seri jatuh ke Allow
Panjang sama, Allow mengalahkan Disallow — bacaan paling tidak membatasi, dan itulah yang dilakukan parser rujukan.
Hanya grup crawler Anda
Semua grup yang menyebut nama crawler Anda digabung, meski file memisahkannya. Grup * hanya dipakai bila tidak ada grup yang menyebutnya: file dengan bagian Googlebot tidak lantas menerapkan bagian * miliknya untuk Googlebot.
* dan $
* mewakili rangkaian karakter apa pun. $ mengaitkan pola ke ujung URL, tetapi hanya bila berada di ujung pola; di tempat lain ia hanya karakter biasa.
Disallow tanpa isi
Tidak melarang apa pun. Begitulah sebuah file berkata "grup ini tanpa batasan", dan itu berbeda dari Disallow: /.

Saat file tidak bisa dibaca

Tidak ada robots.txt (404)
Tidak ada yang dilarang, jadi kesimpulannya Diizinkan dan tidak ada file untuk ditampilkan. Rantai lebih dari lima pengalihan juga terhitung tidak ada file — di situlah crawler rujukan menyerah.
Tidak terbaca
Sebuah 5xx, 429, waktu habis, atau koneksi ditolak. Kesimpulannya Tidak dapat dipastikan dan tidak ada file yang ditampilkan — isi halaman error bukan aturan Anda.
200 dengan HTML
Soft 404: server menjawab seolah file ada tetapi mengirim halaman. Crawler membacanya sebagai sampah, jadi kesimpulannya Tidak dapat dipastikan — dan yang ini layak diperbaiki, karena dari browser tampak baik-baik saja.
Hanya 500 KiB pertama
File dipotong pada ukuran itu sebelum dicocokkan, yaitu batas yang dibaca parser rujukan. Aturan setelah titik potong juga tidak ada bagi crawler mana pun.
File ada tapi tak memuat aturan
File kosong, atau hanya berisi komentar dan baris Sitemap:. Sah, dan tidak melarang apa pun.