La réponse HTTP de /robots.txt fait partie de la politique d’exploration. Un fichier parfaitement écrit peut produire un comportement différent s’il renvoie le mauvais statut, boucle en redirection ou échoue pendant un déploiement.
Vue rapide
| Réponse | Traitement général par Google |
|---|---|
2xx | Traite le contenu robots.txt |
3xx | Suit les redirections jusqu’à une limite |
La plupart des 4xx, sauf 429 | Considère qu’il n’y a pas de restrictions valides |
429 | Signal de surcharge/rate limit |
5xx | Réduit ou arrête temporairement l’exploration puis réessaie |
| Erreurs DNS/réseau | Traitement proche d’une erreur serveur |
200 : le cas normal
HTTP/1.1 200 OK
Content-Type: text/plain; charset=utf-8
Google attend de l’UTF-8 et limite le traitement de robots.txt à 500 KiB. Un 200 ne garantit donc pas qu’un fichier énorme soit entièrement pris en compte.
404 : généralement « aucune restriction »
Un robots.txt absent ne bloque pas le site. Google traite les 4xx ordinaires — sauf 429 — comme l’absence d’un fichier valide.
N’utilisez pas 404 pour protéger un staging ou des informations privées : utilisez une authentification réelle.
403 et 401 ne sont pas des Disallow
Si WAF, CDN ou middleware renvoie :
HTTP/1.1 403 Forbidden
Google ne lit pas les règles prévues. Le résultat peut être de perdre les restrictions au lieu de renforcer le blocage.
429 est différent
429 Too Many Requests signale une surcharge ou limitation temporaire et peut réduire l’exploration. Ce n’est pas une technique habituelle de configuration robots.txt.
5xx peut ralentir temporairement l’exploration
Avec 500, 502 ou 503, Google retente le fichier et peut réduire le crawl. Une ancienne version valide de robots.txt peut continuer à influencer le comportement pendant un certain temps.
Examinez rapidement Edge Functions, upstreams, rewrites et migrations ayant transformé un fichier statique en endpoint dynamique défaillant.
Les redirections doivent aboutir proprement
Problèmes courants :
- boucle HTTP/HTTPS ;
- www et domaine nu se redirigent mutuellement ;
- middleware de langue redirige
/robots.txt; - authentification envoie vers login ;
- CDN renvoie une page HTML avec 200.
Vérifier la réponse réelle
Contrôlez :
- URL finale ;
- statut HTTP ;
Content-Type;- taille et encodage ;
- cache ;
- comportement WAF par User-agent ;
- contenu réellement textuel de robots.txt.
Ordre de diagnostic
- Récupérer
/robots.txten production. - Noter URL finale et statut.
- Vérifier redirections, CDN, WAF.
- Confirmer UTF-8 et taille raisonnable.
- Valider la syntaxe.
- Tester des URL représentatives.
- Examiner les logs d’échec.
- Tenir compte d’un cache ancien.
- Continuer à surveiller après correction.
La livraison HTTP fait partie de la validité de robots.txt. Le même texte servi en 200, 403, 404 ou 5xx peut entraîner des effets de crawl très différents.