Panduan robots.txt

Robots.txt untuk crawler AI: pencarian, pelatihan, dan akses

Atur crawler AI di robots.txt tanpa mencampur penemuan pencarian, kontrol pelatihan, dan noindex. Termasuk contoh OAI-SearchBot dan GPTBot.

Oleh Robots.txt Tools Editorial TeamTerakhir diverifikasi 2026-09-133 menit baca
Robots.txt untuk crawler AI: pencarian, pelatihan, dan akses

Saat mengatur crawler AI, pisahkan tiga keputusan: bolehkah bot melakukan crawling ke URL, apakah halaman ingin tetap ditemukan melalui pencarian atau jawaban, dan apakah konten boleh masuk ke tujuan pelatihan tertentu milik penyedia? Satu aturan Disallow: / untuk semua bot AI sering kali terlalu kasar.

OpenAI saat ini membedakan OAI-SearchBot dan GPTBot. Jika publisher ingin konten tetap dapat ditemukan dan digunakan dalam ringkasan atau cuplikan ChatGPT Search, panduan OpenAI menyarankan agar OAI-SearchBot tidak diblokir. GPTBot dapat diblokir secara terpisah untuk halaman yang ingin dikeluarkan dari cakupan potensi pelatihan.

Tentukan hasil yang diinginkan terlebih dahulu

Tujuanrobots.txtKontrol tambahan
Mempertahankan pencarian biasa dan pencarian AIJangan blokir crawler pencarian terkaitPertahankan halaman tetap dapat diindeks bila ingin tampil
Izinkan pencarian AI, blokir crawler pelatihanPisahkan grup User-agentCek dokumentasi terbaru penyedia
Keluarkan halaman publik dari hasilJangan hanya mengandalkan robots.txtIzinkan crawling dan kirim noindex
Lindungi konten privatJangan gunakan robots.txt sebagai keamananGunakan autentikasi/otorisasi

robots.txt adalah petunjuk untuk crawler yang mematuhinya, bukan sistem kontrol akses.

Contoh: izinkan ChatGPT Search, blokir GPTBot

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Yang penting adalah memisahkan tujuan. Nama dan kebijakan crawler dapat berubah, jadi selalu cek sumber resmi sebelum memublikasikan.

Disallow bukan noindex

Disallow mengatur crawling. noindex mengatur pengindeksan pada sistem yang mendukungnya. Jika halaman diblokir lewat robots.txt, crawler mungkin tidak pernah membaca meta robots pada halaman tersebut.

User-agent: OAI-SearchBot
Disallow: /preview/

bersama:

<meta name="robots" content="noindex">

bisa bertentangan untuk halaman publik yang hanya ingin dikeluarkan dari hasil. Biasanya lebih tepat mengizinkan crawling dan menyajikan noindex. Konten yang benar-benar privat harus dilindungi autentikasi.

Hindari daftar bot raksasa tanpa konteks

Daftar panjang cepat kedaluwarsa dan mencampur fungsi pencarian, pelatihan, dan akses yang dipicu pengguna. Kebijakan kecil dengan alasan yang jelas lebih mudah diaudit.

# Izinkan penemuan melalui ChatGPT Search
User-agent: OAI-SearchBot
Allow: /

# Preferensi terpisah untuk GPTBot
User-agent: GPTBot
Disallow: /

Gabungkan dengan aturan normal situs

Mengizinkan crawler pencarian AI tidak berarti membuka area akun, keranjang, atau pencarian internal.

User-agent: OAI-SearchBot
Disallow: /account/
Disallow: /cart/
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /account/
Disallow: /cart/
Allow: /

Uji URL nyata karena aturan yang paling spesifik lebih penting daripada urutan visual.

Checklist sebelum publikasi

  • /robots.txt disajikan dari root host yang benar;
  • halaman penting tetap terbuka untuk Googlebot/Bingbot;
  • token crawler AI berasal dari dokumentasi terbaru;
  • pencarian dan pelatihan dipisahkan bila penyedia menyediakan crawler berbeda;
  • halaman noindex masih dapat dimuat crawler yang harus membacanya;
  • data sensitif dilindungi kontrol akses;
  • sitemap berisi URL publik kanonis;
  • aturan divalidasi dan diuji pada URL representatif.

robots.txt dapat di-cache. Setelah deploy, periksa file aktif, status HTTP, log, dan traffic referral. Kebijakan jangka panjang yang paling aman adalah menentukan fungsi tiap crawler, menulis aturan sesedikit mungkin, lalu meninjau dokumentasi resmi secara berkala.

Panduan terkait