Panduan robots.txt

Status HTTP robots.txt: 200, 404, 403, 429, dan 5xx

Pahami bagaimana respons HTTP robots.txt memengaruhi Googlebot, termasuk 2xx, redirect, 404, 403, 429, 5xx, cache, dan error jaringan.

Oleh Robots.txt Tools Editorial TeamTerakhir diverifikasi 2026-09-133 menit baca
Status HTTP robots.txt: 200, 404, 403, 429, dan 5xx

Respons HTTP /robots.txt adalah bagian dari kebijakan crawling. Aturan yang benar dapat menghasilkan perilaku berbeda jika endpoint mengembalikan status yang salah, redirect berulang, atau error saat deployment.

Ringkasan

ResponsPerilaku umum Google
2xxMemproses isi robots.txt
3xxMengikuti redirect sampai batas tertentu
Sebagian besar 4xx, kecuali 429Menganggap tidak ada pembatasan robots.txt yang valid
429Sinyal overload/rate limit
5xxMengurangi/berhenti crawling sementara dan mencoba lagi
Error DNS/jaringanPerlakuan mirip error server

200: kondisi normal

HTTP/1.1 200 OK
Content-Type: text/plain; charset=utf-8

Google mengharapkan UTF-8 dan memproses robots.txt hingga 500 KiB. Jadi 200 tidak berarti file yang sangat besar dibaca seluruhnya.

404: biasanya berarti “tanpa pembatasan”

robots.txt yang tidak ada tidak memblokir crawling. Google memperlakukan 4xx biasa — selain 429 — seperti tidak ada file yang valid.

Jangan gunakan 404 untuk melindungi staging atau data privat. Gunakan autentikasi.

403 dan 401 bukan Disallow

Jika WAF, CDN, atau middleware mengirim:

HTTP/1.1 403 Forbidden

Google tidak menganggapnya sebagai aturan pembatasan yang Anda tulis. Akibatnya, crawler justru dapat kehilangan akses ke kebijakan yang seharusnya dibaca.

429 berbeda

429 Too Many Requests memberi sinyal overload atau pembatasan sementara dan dapat mengurangi crawling. Ini bukan teknik konfigurasi robots.txt sehari-hari.

5xx dapat mengurangi crawling sementara

Pada 500, 502, atau 503, Google akan mencoba kembali dan dapat mengurangi aktivitas crawl. Versi robots.txt yang sebelumnya valid mungkin tetap berpengaruh untuk sementara.

Periksa fungsi edge, upstream, rewrite, dan migrasi yang mengubah file statis menjadi endpoint dinamis bermasalah.

Redirect harus berakhir dengan bersih

Masalah umum:

  • loop HTTP/HTTPS;
  • www dan apex saling redirect;
  • middleware bahasa mengarahkan /robots.txt ke route lokal;
  • autentikasi mengarahkan ke login;
  • CDN mengirim HTML dengan status 200.

Periksa respons sebenarnya

Tinjau URL akhir, status HTTP, Content-Type, ukuran, encoding, header cache, perilaku WAF berdasarkan User-agent, dan apakah body benar-benar teks robots.txt.

Urutan diagnosis

  1. Ambil /robots.txt dari produksi.
  2. Catat URL akhir dan status.
  3. Periksa redirect, CDN, dan WAF.
  4. Pastikan UTF-8 dan ukuran wajar.
  5. Validasi sintaks.
  6. Uji URL representatif.
  7. Periksa log error.
  8. Pertimbangkan cache kebijakan lama.
  9. Pantau setelah perbaikan.

Pengiriman HTTP adalah bagian dari kebenaran robots.txt. Teks yang sama dengan status 200, 403, 404, atau 5xx dapat menghasilkan dampak crawling yang berbeda.

Panduan terkait