Onde o robots.txt fica
O arquivo normalmente fica disponível em https://example.com/robots.txt. As regras se aplicam ao host, protocolo e porta em que o arquivo é servido; um robots.txt em um host não controla automaticamente todos os subdomínios.
Diretivas principais
User-agent identifica o grupo de rastreadores. Disallow descreve caminhos que o grupo não deve rastrear. Allow pode liberar um caminho mais específico dentro de uma área bloqueada de forma ampla. Sitemap aponta os rastreadores para a URL de um sitemap XML.
User-agent: *
Disallow: /private/
Allow: /private/help/
Sitemap: https://example.com/sitemap.xmlrobots.txt x noindex
Um erro comum é tratar Disallow como uma diretiva garantida de “não indexar”. robots.txt controla principalmente o rastreamento. Se o objetivo é solicitar que uma página rastreável não apareça nos resultados de pesquisa, uma diretiva de indexação como noindex é o controle relevante.
robots.txt não é segurança
Não use robots.txt para proteger documentos privados, áreas administrativas, dados de clientes ou ambientes de homologação. O arquivo é público, e o comportamento de um rastreador compatível não equivale a autenticação. Use controles reais de acesso para conteúdo sensível.
Como as regras são escolhidas
Rastreadores selecionam o grupo User-agent aplicável mais específico. Quando o mesmo token aparece em vários grupos, as regras são combinadas. Em seguida é usado o caminho Allow ou Disallow correspondente mais específico; se regras Allow e Disallow igualmente específicas entrarem em conflito, Allow vence.