Dónde se coloca robots.txt
El archivo suele estar disponible en https://example.com/robots.txt. Las reglas se aplican al host, protocolo y puerto desde los que se sirve el archivo, por lo que un robots.txt en un host no controla automáticamente todos los subdominios.
Directivas principales
User-agent identifica el grupo de rastreadores. Disallow describe las rutas que ese grupo no debería rastrear. Allow puede permitir una ruta más específica dentro de una zona bloqueada de forma más amplia. Sitemap indica a los rastreadores la URL de un sitemap XML.
User-agent: *
Disallow: /private/
Allow: /private/help/
Sitemap: https://example.com/sitemap.xmlrobots.txt frente a noindex
Un error habitual es tratar Disallow como una directiva garantizada de “no indexar”. robots.txt controla principalmente el rastreo. Si quieres solicitar que una página rastreable no aparezca en los resultados de búsqueda, el control relevante es una directiva de indexación como noindex.
robots.txt no es un mecanismo de seguridad
No uses robots.txt para proteger documentos privados, áreas de administración, datos de clientes o entornos de preproducción. El archivo es público y el comportamiento de un rastreador compatible no equivale a autenticación. Usa controles de acceso reales para contenido sensible.
Cómo se eligen las reglas
Los rastreadores seleccionan el grupo User-agent aplicable más específico. Cuando el mismo token de producto aparece en varios grupos, sus reglas se combinan. Después se utiliza la ruta Allow o Disallow coincidente más específica; si reglas Allow y Disallow igual de específicas entran en conflicto, gana Allow.