Wir wählen die Steuerung nach dem Problem: robots.txt für Crawling, noindex für Indexierung, canonical für Duplikate, Redirects für Umzüge und Authentifizierung für private Inhalte.
Robots.txt beantwortet eine Crawl-Frage
Disallow ist kein zuverlässiger Löschbefehl für den Index.
Meta Robots muss gelesen werden können
<meta name="robots" content="noindex">
Blockiert robots.txt dieselbe URL, kann der Crawler noindex nicht verarbeiten.
X-Robots-Tag arbeitet im HTTP-Header
X-Robots-Tag: noindex
Das ist besonders für PDFs und andere Nicht-HTML-Ressourcen nützlich.
Canonical ist keine Zugriffskontrolle
canonical konsolidiert Signale; private Inhalte schützen wir mit Authentifizierung oder Autorisierung.
Unser Entscheidungsweg
Privat → Authentifizierung. Öffentlich, aber nicht im Index → noindex/X-Robots-Tag. Duplikat → canonical oder Redirect. Crawl-Waste → robots.txt prüfen. Danach kontrollieren wir Production mit dem Checker.