Dove si trova robots.txt
Il file è normalmente disponibile all'indirizzo https://example.com/robots.txt. Le regole si applicano all'host, al protocollo e alla porta da cui il file viene servito; un robots.txt su un host non controlla automaticamente tutti i sottodomini.
Direttive principali
User-agent identifica il gruppo di crawler. Disallow descrive i percorsi che il gruppo non dovrebbe scansionare. Allow può consentire un percorso più specifico dentro un'area bloccata più ampiamente. Sitemap indica ai crawler l'URL di una sitemap XML.
User-agent: *
Disallow: /private/
Allow: /private/help/
Sitemap: https://example.com/sitemap.xmlrobots.txt e noindex
Un errore comune è trattare Disallow come una direttiva garantita di “non indicizzare”. robots.txt controlla principalmente la scansione. Se vuoi richiedere che una pagina scansionabile non appaia nei risultati, usa un controllo di indicizzazione come noindex.
robots.txt non è un meccanismo di sicurezza
Non usare robots.txt per proteggere documenti privati, aree amministrative, dati dei clienti o ambienti staging. Il file è pubblico e il rispetto da parte di un crawler non equivale ad autenticazione. Usa veri controlli di accesso per i contenuti sensibili.
Come vengono scelte le regole
I crawler selezionano il gruppo User-agent applicabile più specifico. Se lo stesso token prodotto compare in più gruppi, le regole vengono combinate. Poi si applica il percorso Allow o Disallow corrispondente più specifico; a parità di specificità, Allow prevale.