Guides robots.txt

Codes HTTP de robots.txt : 200, 404, 403, 429 et 5xx

Comprenez comment les réponses HTTP de robots.txt influencent Googlebot : 2xx, redirections, 404, 403, 429, 5xx, cache et erreurs réseau.

Par Robots.txt Tools Editorial TeamDernière vérification le 2026-09-133 min de lecture
Codes HTTP de robots.txt : 200, 404, 403, 429 et 5xx

La réponse HTTP de /robots.txt fait partie de la politique d’exploration. Un fichier parfaitement écrit peut produire un comportement différent s’il renvoie le mauvais statut, boucle en redirection ou échoue pendant un déploiement.

Vue rapide

RéponseTraitement général par Google
2xxTraite le contenu robots.txt
3xxSuit les redirections jusqu’à une limite
La plupart des 4xx, sauf 429Considère qu’il n’y a pas de restrictions valides
429Signal de surcharge/rate limit
5xxRéduit ou arrête temporairement l’exploration puis réessaie
Erreurs DNS/réseauTraitement proche d’une erreur serveur

200 : le cas normal

HTTP/1.1 200 OK
Content-Type: text/plain; charset=utf-8

Google attend de l’UTF-8 et limite le traitement de robots.txt à 500 KiB. Un 200 ne garantit donc pas qu’un fichier énorme soit entièrement pris en compte.

404 : généralement « aucune restriction »

Un robots.txt absent ne bloque pas le site. Google traite les 4xx ordinaires — sauf 429 — comme l’absence d’un fichier valide.

N’utilisez pas 404 pour protéger un staging ou des informations privées : utilisez une authentification réelle.

403 et 401 ne sont pas des Disallow

Si WAF, CDN ou middleware renvoie :

HTTP/1.1 403 Forbidden

Google ne lit pas les règles prévues. Le résultat peut être de perdre les restrictions au lieu de renforcer le blocage.

429 est différent

429 Too Many Requests signale une surcharge ou limitation temporaire et peut réduire l’exploration. Ce n’est pas une technique habituelle de configuration robots.txt.

5xx peut ralentir temporairement l’exploration

Avec 500, 502 ou 503, Google retente le fichier et peut réduire le crawl. Une ancienne version valide de robots.txt peut continuer à influencer le comportement pendant un certain temps.

Examinez rapidement Edge Functions, upstreams, rewrites et migrations ayant transformé un fichier statique en endpoint dynamique défaillant.

Les redirections doivent aboutir proprement

Problèmes courants :

  • boucle HTTP/HTTPS ;
  • www et domaine nu se redirigent mutuellement ;
  • middleware de langue redirige /robots.txt ;
  • authentification envoie vers login ;
  • CDN renvoie une page HTML avec 200.

Vérifier la réponse réelle

Contrôlez :

  • URL finale ;
  • statut HTTP ;
  • Content-Type ;
  • taille et encodage ;
  • cache ;
  • comportement WAF par User-agent ;
  • contenu réellement textuel de robots.txt.

Ordre de diagnostic

  1. Récupérer /robots.txt en production.
  2. Noter URL finale et statut.
  3. Vérifier redirections, CDN, WAF.
  4. Confirmer UTF-8 et taille raisonnable.
  5. Valider la syntaxe.
  6. Tester des URL représentatives.
  7. Examiner les logs d’échec.
  8. Tenir compte d’un cache ancien.
  9. Continuer à surveiller après correction.

La livraison HTTP fait partie de la validité de robots.txt. Le même texte servi en 200, 403, 404 ou 5xx peut entraîner des effets de crawl très différents.

Guides associés