Lokasi robots.txt
File biasanya tersedia di https://example.com/robots.txt. Aturan berlaku untuk host, protokol, dan port tempat file disajikan. robots.txt pada satu host tidak otomatis mengontrol semua subdomain.
Direktif utama
User-agent mengidentifikasi grup crawler. Disallow menjelaskan jalur yang sebaiknya tidak di-crawl oleh grup tersebut. Allow dapat mengizinkan jalur yang lebih spesifik di dalam area yang diblokir lebih luas. Sitemap mengarahkan crawler ke URL sitemap XML.
User-agent: *
Disallow: /private/
Allow: /private/help/
Sitemap: https://example.com/sitemap.xmlrobots.txt vs noindex
Kesalahan umum adalah menganggap Disallow sebagai direktif pasti “jangan indeks”. robots.txt terutama mengontrol crawling. Jika tujuannya meminta halaman yang dapat di-crawl agar tidak muncul di hasil pencarian, gunakan kontrol pengindeksan seperti noindex.
robots.txt bukan mekanisme keamanan
Jangan gunakan robots.txt untuk melindungi dokumen privat, area admin, data pelanggan, atau lingkungan staging. File ini publik, dan kepatuhan crawler tidak sama dengan autentikasi. Gunakan kontrol akses nyata untuk konten sensitif.
Cara aturan dipilih
Crawler memilih grup User-agent paling spesifik yang berlaku. Jika token produk yang sama muncul di beberapa grup, aturannya digabung. Setelah itu digunakan jalur Allow atau Disallow yang paling spesifik; bila tingkat spesifiknya sama dan bertentangan, Allow menang.