Guias de robots.txt

Status HTTP do robots.txt: 200, 404, 403, 429 e 5xx

Veja como respostas HTTP de robots.txt afetam o Googlebot, incluindo 2xx, redirects, 404, 403, 429, 5xx, cache e falhas de rede.

Por Robots.txt Tools Editorial TeamÚltima verificação em 2026-09-133 min de leitura
Status HTTP do robots.txt: 200, 404, 403, 429 e 5xx

A resposta HTTP de /robots.txt faz parte da política de rastreamento. Um arquivo com regras corretas pode produzir outro resultado se retornar status errado, entrar em loop de redirect ou falhar durante um deploy.

Referência rápida

RespostaComportamento geral do Google
2xxProcessa o conteúdo de robots.txt
3xxSegue redirects até um limite
Maioria dos 4xx, exceto 429Age como se não houvesse restrições válidas
429Sinal de sobrecarga/rate limit
5xxReduz ou pausa temporariamente o rastreamento e tenta novamente
Falhas DNS/redeTratamento semelhante a erro de servidor

200: caso normal

HTTP/1.1 200 OK
Content-Type: text/plain; charset=utf-8

O Google espera UTF-8 e processa até 500 KiB do arquivo. Portanto, 200 sozinho não garante que um robots.txt enorme seja lido por completo.

404: normalmente significa “sem restrições”

Um robots.txt inexistente não bloqueia o site. O Google trata 4xx comuns — exceto 429 — como ausência de um arquivo válido.

Não use 404 para proteger staging ou conteúdo privado. Para isso, use autenticação.

403 e 401 não equivalem a Disallow

Se WAF, CDN ou middleware devolver:

HTTP/1.1 403 Forbidden

para /robots.txt, o Google não interpreta isso como a política que você escreveu. O resultado pode ser justamente perder as restrições que o crawler deveria ter lido.

429 é diferente

429 Too Many Requests representa sobrecarga ou limitação temporária e pode reduzir rastreamento. Não deve ser usado como técnica rotineira de configuração.

5xx pode reduzir rastreamento temporariamente

Erros 500, 502 e 503 fazem o Google tentar novamente e podem diminuir o ritmo de crawl. Uma versão válida anterior do robots.txt ainda pode influenciar o comportamento por algum tempo.

Investigue rapidamente problemas de funções edge, upstreams, roteamento e migrações que tenham transformado um arquivo estático em endpoint dinâmico com erro.

Redirects precisam terminar de forma limpa

Causas comuns:

  • loop HTTP/HTTPS;
  • www e domínio raiz redirecionando um para o outro;
  • middleware de idioma enviando /robots.txt para rota localizada;
  • autenticação enviando o crawler para login;
  • CDN servindo HTML com status 200.

Confira a resposta real

Verifique:

  • URL final;
  • status HTTP;
  • Content-Type;
  • tamanho e encoding;
  • cabeçalhos de cache;
  • comportamento de WAF por User-agent;
  • se o corpo é texto robots.txt ou uma página HTML.

Ordem de diagnóstico

  1. Busque /robots.txt no host de produção.
  2. Registre URL final e status.
  3. Revise redirects, CDN e WAF.
  4. Confirme UTF-8 e tamanho razoável.
  5. Valide a sintaxe.
  6. Teste URLs representativas.
  7. Examine logs de falha.
  8. Considere cache de uma política anterior.
  9. Monitore depois da correção.

A entrega HTTP faz parte da correção de robots.txt. O mesmo conteúdo servido com 200, 403, 404 ou 5xx pode gerar consequências completamente diferentes.

Guias relacionados