Bei /products?sort=price oder /search?q=shoes starten wir nicht mit einem pauschalen Disallow. Wir klassifizieren zuerst Sortierung, Filter, Facet, Tracking, Session, Pagination oder interne Suche.
Wir testen den exakten Query-String
User-agent: *
Disallow: /*?sort=
Der Tester bekommt sowohl erwartete Treffer als auch erlaubte Ausnahmen. Eine Wildcard kann mehr URLs erfassen als beabsichtigt.
Duplicate Content bedeutet nicht automatisch Blockierung
Für Tracking-Varianten können canonical, Redirects oder saubere Links besser passen. Soll eine öffentliche URL nicht indexiert werden, prüfen wir noindex.
Facetten brauchen eine Auswahl
Einige Filterseiten haben Suchwert, tiefe Kombinationen erzeugen dagegen Crawl-Explosion. Wir erhalten wertvolle Zustände und blockieren nur nachgewiesen unnötiges Crawling.
Crawling und Indexierung bleiben getrennt
Robots.txt steuert Zugriff; noindex steuert Indexierung, wenn der Crawler die Seite lesen kann. Mehr dazu im Vergleich mit Meta Robots.
Wir verifizieren Production
Vor und nach dem Release testen wir eine URL-Matrix und rufen die Live-Datei mit dem Checker ab.