Noi scegliamo il livello in base all’obiettivo: robots.txt per il crawling, noindex per l’indicizzazione, canonical per i duplicati, redirect per gli spostamenti e autenticazione per il privato.
Robots.txt risponde a un problema di crawl
Disallow non è un comando affidabile per rimuovere una URL dall’indice.
Meta robots deve essere leggibile
<meta name="robots" content="noindex">
Se robots.txt blocca la stessa pagina, il crawler può non leggere noindex.
X-Robots-Tag opera negli header HTTP
X-Robots-Tag: noindex
È utile anche per PDF e risorse non HTML.
Canonical non è sicurezza
canonical consolida segnali. Per informazioni private usiamo autenticazione o authorization reale.
La nostra sequenza di scelta
Privato → autenticazione. Pubblico fuori indice → noindex/X-Robots-Tag. Duplicato → canonical/redirect. Crawl waste → valutare robots.txt. Infine controlliamo la production con il checker.