A maneira mais segura de configurar crawlers de IA é separar três decisões: o bot pode rastrear a URL, a página pode ser descoberta em busca ou respostas, e o conteúdo pode ser usado para uma finalidade de treinamento específica do provedor? Colocar todos os User-agent relacionados a IA sob um único Disallow: / mistura objetivos diferentes.
A OpenAI distingue atualmente OAI-SearchBot de GPTBot. Para conteúdo que o publisher quer tornar descobrível e elegível a resumos ou snippets em ChatGPT Search, a orientação é não bloquear OAI-SearchBot. Já GPTBot pode ser bloqueado em sites ou páginas que o publisher quer excluir do escopo potencial de treinamento.
Comece pelo resultado desejado
| Objetivo | robots.txt | Controle adicional |
|---|---|---|
| Manter busca tradicional e busca com IA | Não bloquear o crawler de busca relevante | Manter a página indexável se quiser que apareça |
| Permitir busca com IA e bloquear crawler de treinamento | Separar grupos User-agent | Conferir documentação atual do provedor |
| Tirar uma página pública dos resultados | Não depender só de robots.txt | Permitir rastreamento e servir noindex |
| Proteger conteúdo privado | Não usar robots.txt como segurança | Exigir autenticação/autorização |
robots.txt é uma orientação para crawlers compatíveis, não uma barreira de acesso.
Exemplo: permitir ChatGPT Search e bloquear GPTBot
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
O importante é separar a finalidade de cada grupo. Nomes e políticas podem mudar, então valide os tokens na documentação oficial antes de publicar.
Disallow não é noindex
Disallow controla rastreamento. noindex controla indexação em sistemas que suportam a diretiva. Se uma página estiver bloqueada em robots.txt, o crawler pode não conseguir carregar o HTML e ler a meta tag.
User-agent: OAI-SearchBot
Disallow: /preview/
junto com:
<meta name="robots" content="noindex">
pode ser uma combinação ruim para uma página pública que você só quer fora dos resultados. Nesse caso, normalmente é melhor permitir a leitura e devolver noindex. Para conteúdo realmente privado, use autenticação.
Evite listas gigantes de bots copiadas da internet
Listas longas envelhecem rápido, misturam busca, treinamento e acesso iniciado pelo usuário e são difíceis de auditar. Uma política menor, com motivo claro para cada grupo, é mais segura.
# Permitir descoberta em ChatGPT Search
User-agent: OAI-SearchBot
Allow: /
# Preferência separada para GPTBot
User-agent: GPTBot
Disallow: /
Combine a política de IA com as regras normais do site
Você pode manter conta, carrinho e busca interna fora do rastreamento mesmo permitindo um crawler de busca com IA.
User-agent: OAI-SearchBot
Disallow: /account/
Disallow: /cart/
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /account/
Disallow: /cart/
Allow: /
Teste URLs reais, porque a regra mais específica é mais importante que a posição visual das linhas.
Checklist de publicação
/robots.txté servido na raiz correta do host;- Googlebot e Bingbot continuam acessando páginas importantes;
- os tokens de IA vêm de documentação atual;
- descoberta em busca e treinamento são tratados separadamente quando possível;
- páginas com
noindexpodem ser carregadas pelo crawler que precisa ler a diretiva; - dados sensíveis usam controle de acesso real;
- o sitemap lista URLs públicas canônicas;
- regras foram validadas e testadas com URLs representativas.
Mudanças de robots.txt podem ficar em cache. Depois do deploy, confira o arquivo ao vivo, status HTTP, logs e tráfego de referência. A política mais sustentável é decidir a finalidade de cada crawler, escrever o menor conjunto de regras possível e revisar periodicamente a documentação oficial.