Wo robots.txt liegt
Die Datei ist normalerweise erreichbar unter https://example.com/robots.txt. Die Regeln gelten für den Host, das Protokoll und den Port, über den die Datei ausgeliefert wird. Eine robots.txt auf einem Host steuert nicht automatisch alle Subdomains.
Wichtige Direktiven
User-agent legt die Crawler-Gruppe fest. Disallow beschreibt Pfade, die diese Gruppe nicht crawlen soll. Allow kann einen spezifischeren Pfad innerhalb eines breiter blockierten Bereichs freigeben. Sitemap verweist Crawler auf eine XML-Sitemap-URL.
User-agent: *
Disallow: /private/
Allow: /private/help/
Sitemap: https://example.com/sitemap.xmlrobots.txt und noindex
Ein häufiger Fehler ist, Disallow wie eine garantierte „nicht indexieren“-Direktive zu behandeln. robots.txt steuert primär Crawling. Wenn eine crawlbare Seite nicht in Suchergebnissen erscheinen soll, ist eine Indexierungsdirektive wie noindex das passende Mittel.
robots.txt ist kein Sicherheitsschutz
Nutze robots.txt nicht zum Schutz privater Dokumente, Admin-Bereiche, Kundendaten oder Staging-Umgebungen. Die Datei ist öffentlich und kompatibles Crawler-Verhalten ersetzt keine Authentifizierung. Für sensible Inhalte brauchst du echte Zugriffskontrollen.
Wie Regeln ausgewählt werden
Crawler wählen die spezifischste passende User-agent-Gruppe. Wenn derselbe Produkttoken in mehreren Gruppen vorkommt, werden ihre Regeln kombiniert. Danach gilt der spezifischste passende Allow- oder Disallow-Pfad; bei gleicher Spezifität gewinnt Allow.