guias
Robots.txt para rastreadores de IA: busca, treinamento e acesso
Como permitir descoberta em busca com IA sem liberar todos os crawlers de treinamento?
Ler guia →Ferramenta gratuita de controle de rastreadores
Crie um arquivo robots.txt, valide erros comuns enquanto edita e depois copie ou baixe o resultado. O gerador funciona no navegador e não exige conta.
O modo simples é mais seguro para uma configuração rápida. O editor avançado mostra todos os grupos e regras de rastreadores.
Comece neutro e aplique restrições a rastreadores de IA apenas quando elas fizerem sentido para sua política.
Padrão neutro: mantenha rastreadores de pesquisa, pesquisa com IA e controles de IA abertos, a menos que suas regras de caminho os bloqueiem explicitamente.
Comece com um caminho sugerido ou adicione o seu. Bloqueie apenas caminhos que você realmente quer que rastreadores compatíveis evitem.
Caminhos sugeridos
Adicione qualquer caminho do site. Caminhos sem barra inicial recebem uma automaticamente; URLs HTTP(S) completas são reduzidas ao caminho e à consulta.
Pesquisa
Permitido por padrão
Pesquisa com IA
Permitido por padrão
Controle / treinamento de IA
Permitido por padrão
Resultado ao vivo; geração e validação permanecem no navegador.
User-agent: * Nenhum aviso de sintaxe ou compatibilidade detectado.
Crie diretivas User-agent, Allow, Disallow e Sitemap sem formatar cada linha manualmente.
Receba alertas sobre bloqueio do site inteiro, URLs de sitemap inválidas, diretivas não padronizadas e erros comuns sobre indexação.
Passe da geração para validação, verificação ao vivo e testes de URLs sem sair do site.
Comece com um modelo padrão, WordPress, Blogger ou de homologação e depois revise cada regra para o seu site.
Informe um caminho Allow ou Disallow por linha e defina o grupo User-agent principal ao qual as regras se aplicam.
Os controles avançados permitem criar grupos separados para rastreadores que devem se comportar de forma diferente das regras principais.
Use uma URL absoluta HTTP(S) para o sitemap, como https://example.com/sitemap.xml.
Um arquivo que parece válido ainda pode conter uma regra perigosa. Corrija erros e revise os avisos antes de publicar.
O local padrão é /robots.txt, por exemplo https://example.com/robots.txt.
robots.txt controla o acesso de rastreadores. Não é um sistema de autenticação, e bloquear o rastreamento de uma URL não garante que ela não possa aparecer nos resultados de pesquisa.
A seção avançada mantém tokens de rastreadores separados. Um provedor pode documentar um rastreador para descoberta em pesquisa e outro token para desenvolvimento de modelos ou controles de produtos de IA. Use uma regra específica apenas quando quiser que aquele rastreador tenha comportamento diferente do grupo User-agent principal.
Rastreadores tradicionais como Googlebot e Bingbot descobrem e rastreiam conteúdo para produtos de pesquisa.
Exemplos incluem OAI-SearchBot, Claude-SearchBot e PerplexityBot. Consulte a documentação do provedor antes de alterar o acesso.
Tokens como GPTBot, ClaudeBot e Google-Extended têm finalidades específicas de cada provedor e não devem ser tratados como equivalentes.
Os modelos são pontos de partida editáveis, não boas práticas universais. Revise os caminhos realmente usados pelo seu site antes de publicar.
Gere um ponto de partida para WordPress e revise wp-admin, admin-ajax, sitemap e regras de rastreamento.
Abrir ferramenta →Crie um arquivo voltado ao Blogger e revise pesquisa, marcadores e sitemap antes de ativar regras personalizadas.
Abrir ferramenta →Use uma página específica quando a tarefa mudar de criar o arquivo para validar, verificar ou testar suas regras.
Cole as regras e encontre erros de sintaxe ou avisos de compatibilidade.
Abrir ferramenta →Busque o robots.txt publicado de um site e analise HTTP e comportamento das regras.
Abrir ferramenta →Teste se uma URL está permitida ou bloqueada para um rastreador.
Abrir ferramenta →Base de conhecimento
Guias práticos sobre rastreamento, indexação, escopo por host, sitemaps, parâmetros de URL, cache e solução de problemas com robots.txt.
Veja exemplos práticos para permitir rastreadores, bloquear caminhos, adicionar sitemaps, usar curingas e regras específicas.
→Guias sobre rastreadores de IA, noindex, sitemaps, subdomínios, parâmetros de URL, cache, codificação e regras de robots.txt.
→Configuração e verificação de robots.txt no Shopify, Next.js, Wix, Squarespace, Webflow e Magento / Adobe Commerce.
→guias
Como permitir descoberta em busca com IA sem liberar todos os crawlers de treinamento?
Ler guia →guias
robots.txt impede indexação? Quando usar noindex no lugar de Disallow?
Ler guia →guias
Onde nós adiciono Sitemap no robots.txt e como verifico várias referências?
Ler guia →guias
Qual regra vence quando Allow e Disallow combinam com a mesma URL?
Ler guia →guias
O robots.txt do domínio principal se aplica a subdomínios, HTTP, HTTPS ou outra porta?
Ler guia →plataformas
Como configurar robots.txt no Next.js sem bloquear produção ou publicar sitemap de preview?
Ler guia →As regras e orientações específicas de rastreadores são conferidas com padrões primários e documentação dos provedores, em vez de copiadas de outras ferramentas de SEO.
Sintaxe, correspondência, agrupamento e comportamento de codificação percentual do Robots Exclusion Protocol.
Comportamento específico do Google para robots.txt e campos aceitos.
Finalidades e controles de OAI-SearchBot e GPTBot.
Comportamento de ClaudeBot, Claude-SearchBot e Claude-User.
Comportamento de indexação do PerplexityBot e conformidade com robots.txt.
Controles do Google-Extended para treinamento e fundamentação do Gemini.
Na raiz do host que ele controla, normalmente em /robots.txt.
Sua função principal é controlar o rastreamento. Para impedir indexação, use um controle de indexação adequado em vez de depender apenas de Disallow.
O Googlebot não aceita a diretiva Crawl-delay, por isso o validador exibe um aviso quando ela aparece.
Não automaticamente. Tokens diferentes podem servir a pesquisa, recuperação solicitada pelo usuário, desenvolvimento de modelos ou outras finalidades do provedor. Decida rastreador por rastreador e confira a documentação atual.
Sim. A geração e validação principais acontecem no navegador e não exigem conta.