Elegimos la capa según el objetivo. Robots.txt controla rastreo; noindex controla indexación; canonical consolida duplicados; redirects mueven URLs; autenticación protege contenido privado.
Robots.txt responde a una pregunta de rastreo
User-agent: *
Disallow: /internal-search/
No lo tratamos como una orden fiable para eliminar una URL del índice.
Meta robots necesita que el crawler entre
<meta name="robots" content="noindex">
Si robots.txt bloquea la página, el crawler puede no leer ese noindex.
X-Robots-Tag sirve a nivel HTTP
Para PDF u otros recursos podemos usar:
X-Robots-Tag: noindex
La misma condición aplica: el crawler necesita acceso a la respuesta.
Canonical y autenticación tienen funciones distintas
canonical es una señal de consolidación, no privacidad. Para información sensible usamos autenticación o autorización real.
Nuestra secuencia
Privado → autenticación. Público pero fuera de búsqueda → noindex/X-Robots-Tag. Duplicado → canonical o redirect. Desperdicio de crawl → considerar robots.txt. Después verificamos HTML, headers y archivo en producción con el checker.