guides
Robots.txt pour les crawlers IA : recherche, entraînement et accès
Comment autoriser la recherche avec IA sans ouvrir tous les crawlers d’entraînement ?
Lire le guide →Outil gratuit de contrôle de l’exploration
Créez un fichier robots.txt, détectez les erreurs courantes pendant la modification, puis copiez-le ou téléchargez-le. Le générateur fonctionne dans votre navigateur et ne nécessite aucun compte.
Le mode simple est plus sûr pour une configuration rapide. L’éditeur avancé affiche tous les groupes de robots et toutes les règles.
Commencez avec une configuration neutre, puis appliquez des restrictions aux robots liés à l’IA uniquement si elles correspondent à votre politique.
Valeur neutre : laissez ouverts les robots de recherche, de recherche avec IA et de contrôle IA sauf si vos règles de chemin les bloquent explicitement.
Commencez par un chemin suggéré ou ajoutez le vôtre. Bloquez uniquement les chemins que vous souhaitez volontairement faire éviter aux robots compatibles.
Chemins suggérés
Ajoutez n’importe quel chemin du site. Un chemin sans barre initiale en reçoit une automatiquement ; une URL HTTP(S) complète est réduite à son chemin et sa requête.
Recherche
Autorisé par défaut
Recherche avec IA
Autorisé par défaut
Contrôle / entraînement IA
Autorisé par défaut
Résultat en direct ; la génération et la validation restent dans votre navigateur.
User-agent: * Aucun avertissement de syntaxe ou de compatibilité détecté.
Créez des directives User-agent, Allow, Disallow et Sitemap sans mettre en forme chaque ligne manuellement.
Recevez des avertissements pour les blocages de tout le site, les URL de sitemap invalides, les directives non standard et les erreurs fréquentes concernant l’indexation.
Passez de la génération à la validation, à la vérification en ligne et au test d’URL sans quitter le site.
Commencez par un modèle standard, WordPress, Blogger ou de préproduction, puis vérifiez chaque règle pour votre propre site.
Saisissez un chemin Allow ou Disallow par ligne et indiquez le groupe User-agent principal auquel les règles s’appliquent.
Les contrôles avancés permettent de créer des groupes séparés pour les robots qui doivent se comporter différemment des règles principales.
Utilisez une URL HTTP(S) absolue pour le sitemap, par exemple https://example.com/sitemap.xml.
Un fichier qui semble valide peut encore contenir une règle dangereuse. Corrigez les erreurs et examinez les avertissements avant publication.
L’emplacement standard est /robots.txt, par exemple https://example.com/robots.txt.
robots.txt contrôle l’accès des robots d’exploration. Ce n’est pas un système d’authentification, et bloquer l’exploration d’une URL ne garantit pas qu’elle ne puisse pas apparaître dans les résultats de recherche.
La section avancée conserve séparément les différents tokens de robots. Un fournisseur peut par exemple documenter un robot pour la découverte en recherche et un autre token pour le développement de modèles ou les contrôles de produits d’IA. N’utilisez une règle spécifique que si vous souhaitez volontairement un comportement différent du groupe User-agent principal.
Les robots de recherche traditionnels comme Googlebot et Bingbot découvrent et explorent du contenu pour les produits de recherche.
OAI-SearchBot, Claude-SearchBot et PerplexityBot en sont des exemples. Consultez la documentation du fournisseur avant de modifier leur accès.
Des tokens comme GPTBot, ClaudeBot et Google-Extended ont des objectifs propres à chaque fournisseur et ne doivent pas être considérés comme équivalents.
Les modèles de plateforme sont des points de départ modifiables, pas des bonnes pratiques universelles. Vérifiez les chemins réellement utilisés par votre site avant publication.
Générez un point de départ adapté à WordPress et vérifiez wp-admin, admin-ajax, le sitemap et les règles d’exploration.
Ouvrir l’outil →Créez un fichier adapté à Blogger et vérifiez la recherche, les libellés et le sitemap avant d’activer des règles personnalisées.
Ouvrir l’outil →Utilisez une page dédiée lorsque votre tâche passe de la création du fichier à sa validation, sa vérification ou son test.
Collez des règles et repérez les erreurs de syntaxe ou les avertissements de compatibilité.
Ouvrir l’outil →Récupérez le robots.txt publié d’un site et examinez sa réponse HTTP et le comportement des règles.
Ouvrir l’outil →Testez si une URL est autorisée ou bloquée pour un robot.
Ouvrir l’outil →Base de connaissances
Guides pratiques sur l’exploration, l’indexation, la portée par hôte, les sitemaps, les paramètres d’URL, le cache et le dépannage de robots.txt.
Consultez des exemples pratiques pour autoriser les robots, bloquer des chemins, ajouter des sitemaps, utiliser des jokers et des règles ciblées.
→Guides sur les robots d’IA, noindex, sitemaps, sous-domaines, paramètres d’URL, cache, encodage et règles robots.txt.
→Configuration et vérification de robots.txt sur Shopify, Next.js, Wix, Squarespace, Webflow et Magento / Adobe Commerce.
→guides
Comment autoriser la recherche avec IA sans ouvrir tous les crawlers d’entraînement ?
Lire le guide →guides
robots.txt peut-il empêcher l’indexation et quand faut-il utiliser noindex ?
Lire le guide →guides
Où ajouter Sitemap dans robots.txt et comment vérifier plusieurs références ?
Lire le guide →guides
Quelle règle l’emporte lorsque plusieurs Allow et Disallow correspondent à la même URL ?
Lire le guide →guides
Le robots.txt du domaine principal s’applique-t-il aux sous-domaines, HTTP, HTTPS ou autres ports ?
Lire le guide →plateformes
Comment configurer robots.txt dans Next.js sans bloquer la production ni publier un sitemap de preview ?
Lire le guide →Les règles et conseils propres aux robots sont vérifiés à partir de normes primaires et de la documentation des fournisseurs, plutôt que copiés depuis d’autres outils SEO.
Syntaxe, correspondance, regroupement et encodage en pourcentage du Robots Exclusion Protocol.
Comportement robots.txt propre à Google et champs pris en charge.
Objectifs et contrôles de OAI-SearchBot et GPTBot.
Comportement de ClaudeBot, Claude-SearchBot et Claude-User.
Comportement d’indexation de PerplexityBot et respect de robots.txt.
Contrôles Google-Extended pour l’entraînement et l’ancrage de Gemini.
À la racine de l’hôte qu’il contrôle, généralement sous /robots.txt.
Il contrôle principalement l’exploration. Si votre objectif est d’empêcher l’indexation, utilisez le contrôle d’indexation approprié au lieu de compter uniquement sur Disallow.
Googlebot ne prend pas en charge la directive Crawl-delay ; le validateur affiche donc un avertissement lorsqu’elle apparaît.
Pas automatiquement. Les différents tokens peuvent servir à la recherche, à la récupération demandée par l’utilisateur, au développement de modèles ou à d’autres usages propres au fournisseur. Décidez robot par robot et vérifiez la documentation actuelle du fournisseur.
Oui. La génération et la validation principales s’effectuent dans le navigateur et ne nécessitent aucun compte.