panduan
Robots.txt untuk crawler AI: pencarian, pelatihan, dan akses
Bagaimana mengizinkan pencarian AI tanpa membuka semua crawler untuk pelatihan?
Baca panduan →Alat gratis untuk mengontrol crawler
Buat file robots.txt, periksa kesalahan umum saat mengedit, lalu salin atau unduh hasilnya. Generator berjalan di browser dan tidak memerlukan akun.
Mode sederhana lebih aman untuk pengaturan cepat. Editor lanjutan menampilkan semua grup crawler dan aturan.
Mulai netral, lalu terapkan pembatasan crawler AI hanya bila sesuai dengan kebijakan Anda.
Default netral: biarkan crawler pencarian, pencarian AI, dan kontrol AI terbuka kecuali aturan jalur Anda memblokirnya secara eksplisit.
Mulai dari jalur yang disarankan atau tambahkan milik Anda. Blokir hanya jalur yang memang ingin Anda hindarkan dari crawler yang mematuhi robots.txt.
Jalur yang disarankan
Tambahkan jalur situs apa pun. Jalur tanpa slash awal akan ditambahkan otomatis; URL HTTP(S) lengkap disederhanakan menjadi path dan query.
Pencarian
Diizinkan secara default
Pencarian AI
Diizinkan secara default
Kontrol / pelatihan AI
Diizinkan secara default
Hasil langsung; pembuatan dan validasi tetap berjalan di browser Anda.
User-agent: * Tidak ada peringatan sintaks atau kompatibilitas yang terdeteksi.
Susun direktif User-agent, Allow, Disallow, dan Sitemap tanpa memformat setiap baris secara manual.
Dapatkan peringatan untuk pemblokiran seluruh situs, URL sitemap tidak valid, direktif non-standar, dan kesalahpahaman umum tentang pengindeksan.
Pindah dari pembuatan ke validasi, pemeriksaan file aktif, dan pengujian URL tanpa meninggalkan situs.
Mulai dari preset situs standar, WordPress, Blogger, atau staging, lalu tinjau setiap aturan untuk situs Anda sendiri.
Masukkan satu jalur Allow atau Disallow per baris dan tentukan grup User-agent utama yang menerima aturan tersebut.
Kontrol lanjutan memungkinkan grup terpisah untuk crawler yang perlu berperilaku berbeda dari aturan utama.
Gunakan URL sitemap HTTP(S) absolut seperti https://example.com/sitemap.xml.
File yang terlihat valid masih dapat berisi aturan berbahaya. Perbaiki error dan tinjau peringatan sebelum memublikasikan.
Lokasi standar adalah /robots.txt, misalnya https://example.com/robots.txt.
robots.txt mengontrol akses crawler. Ini bukan sistem autentikasi, dan memblokir URL agar tidak di-crawl tidak menjamin URL tersebut tidak dapat muncul di hasil penelusuran.
Bagian lanjutan memisahkan token crawler yang berbeda. Penyedia dapat mendokumentasikan satu crawler untuk penemuan pencarian dan token lain untuk pengembangan model atau kontrol produk AI. Gunakan aturan khusus hanya bila Anda sengaja ingin perilakunya berbeda dari grup User-agent utama.
Crawler pencarian tradisional seperti Googlebot dan Bingbot menemukan dan meng-crawl konten untuk produk pencarian.
Contohnya OAI-SearchBot, Claude-SearchBot, dan PerplexityBot. Periksa dokumentasi penyedia sebelum mengubah aksesnya.
Token seperti GPTBot, ClaudeBot, dan Google-Extended memiliki tujuan khusus menurut penyedia dan tidak boleh dianggap setara.
Preset platform adalah titik awal yang dapat diedit, bukan praktik terbaik universal. Tinjau jalur yang benar-benar digunakan situs Anda sebelum dipublikasikan.
Gunakan halaman khusus ketika tugas Anda berubah dari membuat file menjadi memvalidasi, memeriksa, atau mengujinya.
Basis pengetahuan
Panduan praktis tentang crawling, pengindeksan, cakupan host, sitemap, parameter URL, cache, dan troubleshooting robots.txt.
Lihat contoh robots.txt praktis untuk mengizinkan crawler, memblokir jalur, menambahkan sitemap, wildcard, dan aturan khusus crawler.
→Panduan crawler AI, noindex, sitemap, subdomain, parameter URL, cache, encoding, dan aturan robots.txt.
→Konfigurasi dan verifikasi robots.txt untuk Shopify, Next.js, Wix, Squarespace, Webflow, dan Magento / Adobe Commerce.
→panduan
Bagaimana mengizinkan pencarian AI tanpa membuka semua crawler untuk pelatihan?
Baca panduan →panduan
Apakah robots.txt bisa mencegah pengindeksan dan kapan sebaiknya memakai noindex?
Baca panduan →panduan
Di mana menambahkan Sitemap di robots.txt dan bagaimana memeriksa beberapa referensi?
Baca panduan →panduan
Aturan mana yang menang jika beberapa Allow dan Disallow cocok dengan URL yang sama?
Baca panduan →panduan
Apakah robots.txt domain utama berlaku untuk subdomain, HTTP, HTTPS, atau port lain?
Baca panduan →platform
Bagaimana mengatur robots.txt Next.js tanpa memblokir production atau memakai sitemap preview?
Baca panduan →Aturan dan panduan khusus crawler diperiksa terhadap standar utama dan dokumentasi penyedia, bukan disalin dari alat SEO lain.
Sintaks, pencocokan, pengelompokan, dan perilaku percent-encoding dalam Robots Exclusion Protocol.
Perilaku robots.txt khusus Google dan field yang didukung.
Tujuan dan kontrol crawler OAI-SearchBot serta GPTBot.
Perilaku ClaudeBot, Claude-SearchBot, dan Claude-User.
Perilaku pengindeksan PerplexityBot dan kepatuhan robots.txt.
Kontrol Google-Extended untuk pelatihan dan grounding Gemini.
Di root host yang dikontrolnya, biasanya /robots.txt.
Fungsi utamanya mengontrol crawling. Jika tujuan Anda mencegah pengindeksan, gunakan kontrol pengindeksan yang tepat, bukan hanya Disallow.
Googlebot tidak mendukung direktif Crawl-delay, sehingga validator menampilkan peringatan bila direktif ini ditemukan.
Tidak otomatis. Token crawler yang berbeda dapat digunakan untuk pencarian, pengambilan atas permintaan pengguna, pengembangan model, atau tujuan penyedia lainnya. Putuskan per crawler dan periksa dokumentasi terbaru penyedia.
Ya. Pembuatan dan validasi utama dilakukan di browser dan tidak memerlukan akun.