Nós não começamos com Disallow: /*?. Primeiro classificamos o parâmetro: ordenação, filtro, faceta, tracking, sessão, paginação ou busca interna.
Testamos a query string exata
User-agent: *
Disallow: /*?sort=
Rodamos exemplos permitidos e bloqueados no tester porque um wildcard pode atingir muito mais URLs do que parece.
Duplicidade não significa bloqueio automático
Para tracking, canonical, redirects ou links limpos podem resolver melhor. Para uma página pública que não deve aparecer na busca, avaliamos noindex.
Facetas precisam de seleção
Alguns filtros de ecommerce têm valor de busca; combinações profundas podem gerar expansão quase infinita. Nós preservamos estados úteis e bloqueamos apenas o crawl sem valor comprovado.
Separamos crawling de indexação
Robots.txt controla acesso do crawler; noindex controla indexação quando a página pode ser lida. A comparação com meta robots ajuda a escolher a camada.
Confirmamos produção
Criamos uma matriz de URLs, validamos regras e repetimos os testes sobre o arquivo vivo com o checker.