A resposta HTTP de /robots.txt faz parte da política de rastreamento. Um arquivo com regras corretas pode produzir outro resultado se retornar status errado, entrar em loop de redirect ou falhar durante um deploy.
Referência rápida
| Resposta | Comportamento geral do Google |
|---|---|
2xx | Processa o conteúdo de robots.txt |
3xx | Segue redirects até um limite |
Maioria dos 4xx, exceto 429 | Age como se não houvesse restrições válidas |
429 | Sinal de sobrecarga/rate limit |
5xx | Reduz ou pausa temporariamente o rastreamento e tenta novamente |
| Falhas DNS/rede | Tratamento semelhante a erro de servidor |
200: caso normal
HTTP/1.1 200 OK
Content-Type: text/plain; charset=utf-8
O Google espera UTF-8 e processa até 500 KiB do arquivo. Portanto, 200 sozinho não garante que um robots.txt enorme seja lido por completo.
404: normalmente significa “sem restrições”
Um robots.txt inexistente não bloqueia o site. O Google trata 4xx comuns — exceto 429 — como ausência de um arquivo válido.
Não use 404 para proteger staging ou conteúdo privado. Para isso, use autenticação.
403 e 401 não equivalem a Disallow
Se WAF, CDN ou middleware devolver:
HTTP/1.1 403 Forbidden
para /robots.txt, o Google não interpreta isso como a política que você escreveu. O resultado pode ser justamente perder as restrições que o crawler deveria ter lido.
429 é diferente
429 Too Many Requests representa sobrecarga ou limitação temporária e pode reduzir rastreamento. Não deve ser usado como técnica rotineira de configuração.
5xx pode reduzir rastreamento temporariamente
Erros 500, 502 e 503 fazem o Google tentar novamente e podem diminuir o ritmo de crawl. Uma versão válida anterior do robots.txt ainda pode influenciar o comportamento por algum tempo.
Investigue rapidamente problemas de funções edge, upstreams, roteamento e migrações que tenham transformado um arquivo estático em endpoint dinâmico com erro.
Redirects precisam terminar de forma limpa
Causas comuns:
- loop HTTP/HTTPS;
- www e domínio raiz redirecionando um para o outro;
- middleware de idioma enviando
/robots.txtpara rota localizada; - autenticação enviando o crawler para login;
- CDN servindo HTML com status 200.
Confira a resposta real
Verifique:
- URL final;
- status HTTP;
Content-Type;- tamanho e encoding;
- cabeçalhos de cache;
- comportamento de WAF por User-agent;
- se o corpo é texto robots.txt ou uma página HTML.
Ordem de diagnóstico
- Busque
/robots.txtno host de produção. - Registre URL final e status.
- Revise redirects, CDN e WAF.
- Confirme UTF-8 e tamanho razoável.
- Valide a sintaxe.
- Teste URLs representativas.
- Examine logs de falha.
- Considere cache de uma política anterior.
- Monitore depois da correção.
A entrega HTTP faz parte da correção de robots.txt. O mesmo conteúdo servido com 200, 403, 404 ou 5xx pode gerar consequências completamente diferentes.