Guía de robots.txt

¿Qué es robots.txt?

robots.txt es un archivo de texto plano situado en la raíz de un host para comunicar reglas de rastreo a rastreadores web compatibles. Forma parte del Protocolo de Exclusión de Robots y su función principal es controlar el rastreo, no el acceso ni garantizar la desindexación.

Dónde se coloca robots.txt

El archivo suele estar disponible en https://example.com/robots.txt. Las reglas se aplican al host, protocolo y puerto desde los que se sirve el archivo, por lo que un robots.txt en un host no controla automáticamente todos los subdominios.

Directivas principales

User-agent identifica el grupo de rastreadores. Disallow describe las rutas que ese grupo no debería rastrear. Allow puede permitir una ruta más específica dentro de una zona bloqueada de forma más amplia. Sitemap indica a los rastreadores la URL de un sitemap XML.

User-agent: *
Disallow: /private/
Allow: /private/help/

Sitemap: https://example.com/sitemap.xml

robots.txt frente a noindex

Un error habitual es tratar Disallow como una directiva garantizada de “no indexar”. robots.txt controla principalmente el rastreo. Si quieres solicitar que una página rastreable no aparezca en los resultados de búsqueda, el control relevante es una directiva de indexación como noindex.

robots.txt no es un mecanismo de seguridad

No uses robots.txt para proteger documentos privados, áreas de administración, datos de clientes o entornos de preproducción. El archivo es público y el comportamiento de un rastreador compatible no equivale a autenticación. Usa controles de acceso reales para contenido sensible.

Cómo se eligen las reglas

Los rastreadores seleccionan el grupo User-agent aplicable más específico. Cuando el mismo token de producto aparece en varios grupos, sus reglas se combinan. Después se utiliza la ruta Allow o Disallow coincidente más específica; si reglas Allow y Disallow igual de específicas entran en conflicto, gana Allow.

Siguientes pasos útiles

Referencias técnicas

Las reglas y la orientación específica de cada rastreador se contrastan con estándares primarios y documentación de los proveedores, en lugar de copiarse de otras herramientas SEO.

Última verificación 2026-09-10
  • RFC 9309

    Sintaxis del Protocolo de Exclusión de Robots, coincidencia, agrupación y comportamiento de codificación porcentual.

  • Especificación de robots.txt de Google

    Comportamiento específico de robots.txt en Google y campos compatibles.