Pour /products?sort=price ou /search?q=shoes, nous ne commençons pas par bloquer tous les ?. Nous classons tri, filtre, facette, tracking, session, pagination et recherche interne.
Nous testons la query string exacte
User-agent: *
Disallow: /*?sort=
Le tester reçoit des URL qui doivent matcher et des exceptions qui doivent rester accessibles.
Un doublon ne nécessite pas toujours robots.txt
Pour le tracking, canonical, redirection ou génération de liens plus propre peuvent mieux résoudre le problème. Pour une page publique hors index, nous évaluons noindex.
Les facettes demandent une sélection
Certaines combinaisons ont une valeur SEO, d’autres créent une explosion de crawl. Nous conservons les états utiles et limitons uniquement les combinaisons sans valeur démontrée.
Nous séparons exploration et indexation
Robots.txt contrôle l’accès du crawler ; noindex contrôle l’indexation si la page reste accessible. Voir robots.txt vs meta robots.
Nous vérifions après publication
Nous préparons une matrice d’URL, testons les règles, puis contrôlons le fichier live avec le checker.