Controle de rastreamento no WordPress

Gerador de robots.txt para WordPress

Comece com um modelo conservador para WordPress e personalize caminhos, grupos de rastreadores e o sitemap do site que você realmente administra. O objetivo não é copiar um suposto “melhor robots.txt” universal, mas criar regras que você consiga explicar e testar.

Escolha o modo de edição

O modo simples é mais seguro para uma configuração rápida. O editor avançado mostra todos os grupos e regras de rastreadores.

Política por finalidade do rastreador

Comece neutro e aplique restrições a rastreadores de IA apenas quando elas fizerem sentido para sua política.

Padrão neutro: mantenha rastreadores de pesquisa, pesquisa com IA e controles de IA abertos, a menos que suas regras de caminho os bloqueiem explicitamente.

Caminhos a bloquear

Comece com um caminho sugerido ou adicione o seu. Bloqueie apenas caminhos que você realmente quer que rastreadores compatíveis evitem.

Caminhos sugeridos

Adicionar caminho personalizado

Adicione qualquer caminho do site. Caminhos sem barra inicial recebem uma automaticamente; URLs HTTP(S) completas são reduzidas ao caminho e à consulta.

Pesquisa

Permitido por padrão

Pesquisa com IA

Permitido por padrão

Controle / treinamento de IA

Permitido por padrão

Antes de publicar

  1. 1. Gerar
    Revise o resultado ao vivo.
  2. 2. Validar
    Verifique sintaxe e compatibilidade.
  3. 3. Testar URLs
    Verifique caminhos e rastreadores importantes.
  4. 4. Publicar
    Envie como /robots.txt na raiz do site.

robots.txt gerado

Resultado ao vivo; geração e validação permanecem no navegador.

User-agent: *Allow: /wp-admin/admin-ajax.phpDisallow: /wp-admin/ 
0 erro0 aviso0 nota

Nenhum aviso de sintaxe ou compatibilidade detectado.

O que o modelo do WordPress faz

O próprio núcleo do WordPress pode gerar robots.txt dinamicamente. A resposta inclui uma regra Disallow para o diretório administrativo e uma regra Allow para o endpoint AJAX administrativo. Este modelo segue esse padrão conservador e mantém o restante do site aberto, a menos que você adicione outras regras.

Disallow /wp-admin/

Mantém rastreadores compatíveis fora do diretório administrativo do WordPress. É uma orientação para rastreadores, não uma barreira de segurança; a área administrativa ainda precisa de autenticação e proteção normal.

Allow /wp-admin/admin-ajax.php

Mantém o acesso de rastreamento a um endpoint usado no front-end por temas e plugins. Uma regra ampla para /wp-admin/ não deve esconder acidentalmente um recurso necessário às páginas públicas.

Referência principal do WordPress: Documentação do WordPress Core sobre do_robots().

Decisões de robots.txt no WordPress que merecem revisão

Plugins, recursos de e-commerce, navegação facetada, pesquisa interna e tipos de conteúdo personalizados podem criar URLs que não existem em uma instalação básica do WordPress. Revise esses padrões antes de adicionar regras Disallow amplas.

Pesquisa interna

Se você bloquear URLs de resultados de pesquisa do WordPress, confirme que a regra atinge apenas os caminhos ou parâmetros desejados. Evite padrões amplos que também atinjam posts ou páginas de categoria normais.

WooCommerce e fluxos de conta

Carrinho, checkout, conta, lista de desejos e URLs de catálogo filtrado podem ser candidatos a controle de rastreamento, mas os caminhos exatos dependem da configuração e dos plugins. Teste URLs representativas de produtos e categorias antes de publicar.

URLs facetadas e com parâmetros

Filtros podem criar muitas combinações de URLs rastreáveis. robots.txt pode reduzir o rastreamento de padrões específicos, mas não substitui uma estratégia consciente de canonical e indexação.

Sitemaps XML

Use a URL de sitemap realmente servida pelo site em produção. O núcleo do WordPress ou um plugin de SEO pode fornecer o sitemap, então confira a URL publicada em vez de presumir que todos os sites WordPress usam o mesmo endpoint.

robots.txt virtual x físico no WordPress

O WordPress pode servir robots.txt dinamicamente quando a solicitação chega ao WordPress. Um robots.txt físico ou servido no nível do servidor pode alterar o que é realmente retornado. Plugins também podem modificar a resposta gerada.

Para SEO, o arquivo importante é o que os rastreadores recebem da URL de produção. Depois de publicar uma mudança, use o Verificador ao vivo em vez de presumir que o editor do WordPress, a configuração de um plugin ou um arquivo no disco representa a resposta final.

Verificar o robots.txt publicado do WordPress →

Antes de publicar uma mudança de robots.txt no WordPress

  1. 1

    Confirme os caminhos de produção

    Confira as URLs reais de administração, pesquisa, carrinho, conta, filtros e sitemap.

  2. 2

    Valide o arquivo completo

    Encontre grupos malformados, diretivas de sitemap incorretas e bloqueios perigosos do site inteiro.

  3. 3

    Teste URLs representativas

    Inclua a página inicial, um post, uma página, uma categoria, um produto quando aplicável e todos os caminhos que você pretende bloquear.

  4. 4

    Verifique a resposta publicada

    Depois do deploy, busque /robots.txt no host público e confirme que as regras esperadas estão sendo servidas.

Perguntas frequentes sobre robots.txt no WordPress

Todo site WordPress precisa de um robots.txt personalizado?

Não. O WordPress pode gerar robots.txt dinamicamente, e só faz sentido adicionar um arquivo personalizado quando existe uma política de rastreamento específica para implementar e testar.

Devo bloquear wp-admin?

O núcleo do WordPress inclui uma regra Disallow para o diretório administrativo e permite o endpoint AJAX administrativo. Isso é apenas uma orientação para rastreadores; não protege a área administrativa.

Devo bloquear páginas de pesquisa e filtros do WordPress?

Às vezes, mas não existe uma regra universal. Decida com base nos padrões de URL e objetivos de rastreamento do seu site e teste páginas importantes para evitar que um padrão amplo bloqueie conteúdo útil.

robots.txt pode aplicar noindex a páginas do WordPress?

Não. robots.txt controla principalmente o rastreamento. Se quiser manter uma URL rastreável fora dos resultados de pesquisa, use um controle de indexação adequado em vez de depender apenas de Disallow.