ratgeber
Robots.txt für KI-Crawler: Suche, Training und Bot-Zugriff trennen
Wie lässt sich KI-Suche erlauben, ohne jeden Trainings-Crawler freizugeben?
Anleitung lesen →Kostenloses Online-Tool zur Crawler-Steuerung
Erstelle eine robots.txt-Datei, prüfe häufige Fehler bereits beim Bearbeiten und kopiere oder lade das Ergebnis anschließend herunter. Der Generator läuft im Browser und benötigt kein Konto.
Der einfache Modus ist für schnelle Konfiguration sicherer. Der erweiterte Editor zeigt alle Crawler-Gruppen und Regeln.
Starte neutral und aktiviere KI-Crawler-Einschränkungen nur, wenn sie zu deiner Richtlinie passen.
Neutraler Standard: Such-, KI-Such- und KI-Steuerungs-Crawler bleiben offen, sofern deine Pfadregeln sie nicht ausdrücklich blockieren.
Starte mit einem vorgeschlagenen Pfad oder füge einen eigenen hinzu. Blockiere nur Pfade, die kompatible Crawler bewusst meiden sollen.
Vorgeschlagene Pfade
Füge einen beliebigen Website-Pfad hinzu. Pfade ohne führenden Slash erhalten automatisch einen; vollständige HTTP(S)-URLs werden auf Pfad und Query reduziert.
Suche
Standardmäßig erlaubt
KI-Suche
Standardmäßig erlaubt
KI-Steuerung / Training
Standardmäßig erlaubt
Live-Ausgabe; Erstellung und Validierung bleiben im Browser.
User-agent: * Keine Syntax- oder Kompatibilitätswarnungen erkannt.
Erstelle User-agent-, Allow-, Disallow- und Sitemap-Direktiven, ohne jede Zeile manuell formatieren zu müssen.
Erhalte Warnungen bei siteweiten Sperren, ungültigen Sitemap-URLs, nicht standardisierten Direktiven und häufigen Missverständnissen zur Indexierung.
Wechsle direkt von der Erstellung zur Validierung, Live-Prüfung und URL-Regelprüfung.
Starte mit einer Standard-, WordPress-, Blogger- oder Staging-Vorlage und prüfe anschließend jede Regel für deine eigene Website.
Trage pro Zeile einen Allow- oder Disallow-Pfad ein und lege die zentrale User-agent-Gruppe fest, für die die Regeln gelten.
Im erweiterten Modus kannst du separate Gruppen für Crawler erstellen, die sich anders verhalten sollen als die Hauptregeln.
Verwende eine absolute HTTP(S)-Sitemap-URL wie https://example.com/sitemap.xml.
Auch eine formal gültig wirkende Datei kann gefährliche Regeln enthalten. Behebe Fehler und prüfe Warnungen vor der Veröffentlichung.
Der Standardpfad ist /robots.txt, zum Beispiel https://example.com/robots.txt.
robots.txt steuert den Zugriff von Crawlern. Die Datei ist keine Authentifizierung und eine Crawling-Sperre garantiert nicht, dass eine URL nicht in Suchergebnissen erscheinen kann.
Der erweiterte Bereich hält unterschiedliche Crawler-Tokens getrennt. Ein Anbieter kann zum Beispiel einen Crawler für Suchentdeckung und einen anderen Token für Modellentwicklung oder KI-Produktkontrollen dokumentieren. Verwende eine spezifische Regel nur dann, wenn sich dieser Crawler bewusst von den Hauptregeln unterscheiden soll.
Klassische Such-Crawler wie Googlebot und Bingbot entdecken und crawlen Inhalte für Suchprodukte.
Beispiele sind OAI-SearchBot, Claude-SearchBot und PerplexityBot. Prüfe die Dokumentation des Anbieters, bevor du den Zugriff änderst.
Tokens wie GPTBot, ClaudeBot und Google-Extended haben anbieterspezifische Zwecke und sollten nicht als gleichwertig behandelt werden.
Plattformvorlagen sind editierbare Ausgangspunkte, keine universellen Best Practices. Prüfe die tatsächlich verwendeten Pfade deiner Website vor der Veröffentlichung.
Erstelle eine WordPress-orientierte Ausgangskonfiguration und prüfe wp-admin, admin-ajax, Sitemap und Crawl-Regeln.
Tool öffnen →Erstelle eine Blogger-orientierte Datei und prüfe Such-, Label- und Sitemap-Verhalten vor dem Aktivieren eigener Regeln.
Tool öffnen →Nutze eine eigene Seite, wenn sich die Aufgabe vom Erstellen zum Validieren, Prüfen oder Testen ändert.
Wissensdatenbank
Praxisnahe Anleitungen zu Crawling, Indexierung, Host-Gültigkeitsbereich, Sitemaps, URL-Parametern, Cache und robots.txt-Fehlersuche.
Nutze praktische robots.txt Beispiele für freies Crawling, gesperrte Pfade, Sitemaps, Wildcards und crawler-spezifische Regeln.
→Praxiswissen zu KI-Crawlern, noindex, Sitemaps, Subdomains, URL-Parametern, Cache, Kodierung und robots.txt-Regeln.
→robots.txt-Konfiguration und Prüfung für Shopify, Next.js, Wix, Squarespace, Webflow und Magento / Adobe Commerce.
→ratgeber
Wie lässt sich KI-Suche erlauben, ohne jeden Trainings-Crawler freizugeben?
Anleitung lesen →ratgeber
Kann robots.txt eine Indexierung verhindern und wann ist noindex die richtige Wahl?
Anleitung lesen →ratgeber
Wo trage ich Sitemap in robots.txt ein und wie prüfe ich mehrere Referenzen?
Anleitung lesen →ratgeber
Welche Regel gewinnt, wenn mehrere Allow- und Disallow-Regeln auf dieselbe URL passen?
Anleitung lesen →ratgeber
Gilt robots.txt der Hauptdomain für Subdomains, HTTP, HTTPS oder andere Ports?
Anleitung lesen →plattformen
Wie konfiguriere ich robots.txt in Next.js, ohne Produktion oder Sitemap durch Preview-Einstellungen zu beschädigen?
Anleitung lesen →Regeln und Crawler-spezifische Hinweise werden anhand primärer Standards und Anbieterdokumentation geprüft, nicht von anderen SEO-Tools übernommen.
Syntax, Matching, Gruppierung und Prozentkodierung des Robots Exclusion Protocol.
Google-spezifisches robots.txt-Verhalten und unterstützte Felder.
Zwecke und Steuerung von OAI-SearchBot und GPTBot.
Verhalten von ClaudeBot, Claude-SearchBot und Claude-User.
Indexierungsverhalten von PerplexityBot und Einhaltung von robots.txt.
Google-Extended-Steuerung für Gemini-Training und Grounding.
Im Stamm des Hosts, den die Datei steuert, normalerweise unter /robots.txt.
robots.txt steuert in erster Linie Crawling. Wenn du die Indexierung verhindern möchtest, verwende die passende Indexierungssteuerung statt dich nur auf Disallow zu verlassen.
Googlebot unterstützt die Crawl-delay-Direktive nicht. Der Validator weist deshalb darauf hin.
Nicht automatisch. Unterschiedliche Crawler-Tokens können Suche, nutzerinitiierte Abrufe, Modellentwicklung oder andere anbieterspezifische Zwecke erfüllen. Entscheide pro Crawler und prüfe die aktuelle Dokumentation des Anbieters.
Ja. Die zentrale Erstellung und Validierung erfolgt im Browser und benötigt kein Konto.