Guida robots.txt

Cos'è robots.txt?

robots.txt è un file di testo semplice collocato nella radice di un host per comunicare regole di scansione ai crawler web compatibili. Fa parte del Robots Exclusion Protocol e riguarda principalmente la scansione, non il controllo di accesso o una deindicizzazione garantita.

Dove si trova robots.txt

Il file è normalmente disponibile all'indirizzo https://example.com/robots.txt. Le regole si applicano all'host, al protocollo e alla porta da cui il file viene servito; un robots.txt su un host non controlla automaticamente tutti i sottodomini.

Direttive principali

User-agent identifica il gruppo di crawler. Disallow descrive i percorsi che il gruppo non dovrebbe scansionare. Allow può consentire un percorso più specifico dentro un'area bloccata più ampiamente. Sitemap indica ai crawler l'URL di una sitemap XML.

User-agent: *
Disallow: /private/
Allow: /private/help/

Sitemap: https://example.com/sitemap.xml

robots.txt e noindex

Un errore comune è trattare Disallow come una direttiva garantita di “non indicizzare”. robots.txt controlla principalmente la scansione. Se vuoi richiedere che una pagina scansionabile non appaia nei risultati, usa un controllo di indicizzazione come noindex.

robots.txt non è un meccanismo di sicurezza

Non usare robots.txt per proteggere documenti privati, aree amministrative, dati dei clienti o ambienti staging. Il file è pubblico e il rispetto da parte di un crawler non equivale ad autenticazione. Usa veri controlli di accesso per i contenuti sensibili.

Come vengono scelte le regole

I crawler selezionano il gruppo User-agent applicabile più specifico. Se lo stesso token prodotto compare in più gruppi, le regole vengono combinate. Poi si applica il percorso Allow o Disallow corrispondente più specifico; a parità di specificità, Allow prevale.

Passaggi successivi utili

Riferimenti tecnici

Regole e indicazioni specifiche dei crawler vengono controllate rispetto a standard primari e documentazione dei provider, non copiate da altri strumenti SEO.

Ultima verifica 2026-09-10
  • RFC 9309

    Sintassi, corrispondenza, raggruppamento e codifica percentuale del Robots Exclusion Protocol.

  • Specifica robots.txt di Google

    Comportamento robots.txt specifico di Google e campi supportati.