Guias de robots.txt

Robots.txt para rastreadores de IA: busca, treinamento e acesso

Configure robots.txt para rastreadores de IA sem confundir descoberta em busca, controles de treinamento e noindex. Inclui OAI-SearchBot e GPTBot.

Por Robots.txt Tools Editorial TeamÚltima verificação em 2026-09-134 min de leitura
Robots.txt para rastreadores de IA: busca, treinamento e acesso

A maneira mais segura de configurar crawlers de IA é separar três decisões: o bot pode rastrear a URL, a página pode ser descoberta em busca ou respostas, e o conteúdo pode ser usado para uma finalidade de treinamento específica do provedor? Colocar todos os User-agent relacionados a IA sob um único Disallow: / mistura objetivos diferentes.

A OpenAI distingue atualmente OAI-SearchBot de GPTBot. Para conteúdo que o publisher quer tornar descobrível e elegível a resumos ou snippets em ChatGPT Search, a orientação é não bloquear OAI-SearchBot. Já GPTBot pode ser bloqueado em sites ou páginas que o publisher quer excluir do escopo potencial de treinamento.

Comece pelo resultado desejado

Objetivorobots.txtControle adicional
Manter busca tradicional e busca com IANão bloquear o crawler de busca relevanteManter a página indexável se quiser que apareça
Permitir busca com IA e bloquear crawler de treinamentoSeparar grupos User-agentConferir documentação atual do provedor
Tirar uma página pública dos resultadosNão depender só de robots.txtPermitir rastreamento e servir noindex
Proteger conteúdo privadoNão usar robots.txt como segurançaExigir autenticação/autorização

robots.txt é uma orientação para crawlers compatíveis, não uma barreira de acesso.

Exemplo: permitir ChatGPT Search e bloquear GPTBot

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

O importante é separar a finalidade de cada grupo. Nomes e políticas podem mudar, então valide os tokens na documentação oficial antes de publicar.

Disallow não é noindex

Disallow controla rastreamento. noindex controla indexação em sistemas que suportam a diretiva. Se uma página estiver bloqueada em robots.txt, o crawler pode não conseguir carregar o HTML e ler a meta tag.

User-agent: OAI-SearchBot
Disallow: /preview/

junto com:

<meta name="robots" content="noindex">

pode ser uma combinação ruim para uma página pública que você só quer fora dos resultados. Nesse caso, normalmente é melhor permitir a leitura e devolver noindex. Para conteúdo realmente privado, use autenticação.

Evite listas gigantes de bots copiadas da internet

Listas longas envelhecem rápido, misturam busca, treinamento e acesso iniciado pelo usuário e são difíceis de auditar. Uma política menor, com motivo claro para cada grupo, é mais segura.

# Permitir descoberta em ChatGPT Search
User-agent: OAI-SearchBot
Allow: /

# Preferência separada para GPTBot
User-agent: GPTBot
Disallow: /

Combine a política de IA com as regras normais do site

Você pode manter conta, carrinho e busca interna fora do rastreamento mesmo permitindo um crawler de busca com IA.

User-agent: OAI-SearchBot
Disallow: /account/
Disallow: /cart/
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /account/
Disallow: /cart/
Allow: /

Teste URLs reais, porque a regra mais específica é mais importante que a posição visual das linhas.

Checklist de publicação

  • /robots.txt é servido na raiz correta do host;
  • Googlebot e Bingbot continuam acessando páginas importantes;
  • os tokens de IA vêm de documentação atual;
  • descoberta em busca e treinamento são tratados separadamente quando possível;
  • páginas com noindex podem ser carregadas pelo crawler que precisa ler a diretiva;
  • dados sensíveis usam controle de acesso real;
  • o sitemap lista URLs públicas canônicas;
  • regras foram validadas e testadas com URLs representativas.

Mudanças de robots.txt podem ficar em cache. Depois do deploy, confira o arquivo ao vivo, status HTTP, logs e tráfego de referência. A política mais sustentável é decidir a finalidade de cada crawler, escrever o menor conjunto de regras possível e revisar periodicamente a documentação oficial.

Guias relacionados