Guide robots.txt

Robots.txt per crawler IA: ricerca, training e accesso

Configura i crawler IA in robots.txt senza confondere scoperta nella ricerca, controlli di training e noindex. Include esempi OAI-SearchBot e GPTBot.

Di Robots.txt Tools Editorial TeamUltima verifica 2026-09-133 min di lettura
Robots.txt per crawler IA: ricerca, training e accesso

Per gestire correttamente i crawler IA bisogna separare tre decisioni: il bot può scansionare l’URL, la pagina deve restare trovabile in una ricerca o risposta, e il contenuto può rientrare in una finalità di training specifica del provider? Una regola globale Disallow: / per tutti i bot IA mescola obiettivi diversi.

OpenAI distingue attualmente OAI-SearchBot e GPTBot. Se un publisher vuole che i contenuti possano essere scoperti e inclusi nei risultati di ChatGPT Search, la guida OpenAI indica di non bloccare OAI-SearchBot. GPTBot può invece essere bloccato separatamente per escludere pagine dal potenziale ambito di training.

Parti dal risultato desiderato

Obiettivorobots.txtControllo aggiuntivo
Mantenere ricerca tradizionale e ricerca IANon bloccare il crawler di ricerca rilevanteMantenere la pagina indicizzabile se deve apparire
Consentire ricerca IA ma bloccare crawler di trainingSeparare i gruppi User-agentVerificare la documentazione aggiornata
Tenere una pagina pubblica fuori dai risultatiNon affidarsi solo a robots.txtConsentire la scansione e servire noindex
Proteggere contenuti privatiNon usare robots.txt come sicurezzaAutenticazione/autorizzazione

robots.txt è un’indicazione per crawler compatibili, non un sistema di controllo accessi.

Esempio: consentire ChatGPT Search e bloccare GPTBot

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Conta la separazione degli scopi. Nomi e policy possono cambiare, quindi verifica sempre le fonti ufficiali prima di pubblicare.

Disallow non equivale a noindex

Disallow controlla la scansione. noindex controlla l’indicizzazione nei sistemi che lo supportano. Se una pagina viene bloccata in robots.txt, il crawler potrebbe non leggere la meta directive.

User-agent: OAI-SearchBot
Disallow: /preview/

insieme a:

<meta name="robots" content="noindex">

può essere una combinazione incoerente per una pagina pubblica che vuoi solo fuori dai risultati. In quel caso è normalmente più chiaro consentire la scansione e restituire noindex. I dati realmente privati richiedono autenticazione.

Evita liste enormi di bot copiate senza contesto

Liste lunghe invecchiano rapidamente e mescolano ricerca, training e recupero richiesto dall’utente. Una policy corta con una motivazione chiara per ogni gruppo è più facile da mantenere.

# Consenti la scoperta in ChatGPT Search
User-agent: OAI-SearchBot
Allow: /

# Preferenza separata per GPTBot
User-agent: GPTBot
Disallow: /

Mantieni le normali regole del sito

Consentire un crawler di ricerca IA non significa aprire account, carrello o ricerca interna.

User-agent: OAI-SearchBot
Disallow: /account/
Disallow: /cart/
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /account/
Disallow: /cart/
Allow: /

Testa URL reali: con regole sovrapposte conta più la specificità che l’ordine visivo.

Checklist prima della pubblicazione

  • /robots.txt è servito dalla root dell’host corretto;
  • Googlebot e Bingbot accedono ancora alle pagine importanti;
  • i token IA provengono dalla documentazione attuale;
  • ricerca e training sono separati quando il provider lo consente;
  • le pagine con noindex possono essere lette dal crawler interessato;
  • i dati sensibili usano veri controlli di accesso;
  • la sitemap contiene URL pubblici canonici;
  • le regole sono state validate e testate con URL rappresentativi.

robots.txt può essere memorizzato in cache. Dopo il deploy controlla file live, stato HTTP, log e referral. La strategia più stabile è definire lo scopo di ogni crawler, scrivere il minimo di regole e ricontrollare periodicamente la documentazione del provider.

Guide correlate