Guides robots.txt

Robots.txt pour les crawlers IA : recherche, entraînement et accès

Configurez robots.txt pour les crawlers IA sans confondre découverte en recherche, contrôle de l’entraînement et noindex. Exemples OAI-SearchBot et GPTBot.

Par Robots.txt Tools Editorial TeamDernière vérification le 2026-09-134 min de lecture
Robots.txt pour les crawlers IA : recherche, entraînement et accès

Pour gérer correctement les crawlers liés à l’IA, il faut séparer trois décisions : le robot peut-il explorer cette URL, la page doit-elle rester découvrable dans une expérience de recherche ou de réponse, et le contenu peut-il entrer dans un usage d’entraînement propre au fournisseur ? Une seule règle globale Disallow: / mélange ces objectifs.

OpenAI distingue actuellement OAI-SearchBot et GPTBot. Pour qu’un contenu puisse être découvert et cité dans ChatGPT Search, OpenAI recommande de ne pas bloquer OAI-SearchBot. GPTBot peut être bloqué séparément lorsque l’éditeur souhaite exclure certaines pages d’un usage potentiel pour l’entraînement.

Commencer par l’objectif

Objectifrobots.txtContrôle complémentaire
Conserver recherche classique et recherche IANe pas bloquer le crawler de recherche concernéGarder la page indexable si elle doit apparaître
Autoriser la recherche IA mais refuser un crawler d’entraînementSéparer les groupes User-agentVérifier la documentation actuelle du fournisseur
Écarter une page publique des résultatsNe pas compter uniquement sur robots.txtAutoriser l’exploration et servir noindex
Protéger une donnée privéeNe pas utiliser robots.txt comme sécuritéAuthentification/autorisation

robots.txt est une instruction pour les crawlers compatibles, pas une barrière de contrôle d’accès.

Exemple : autoriser ChatGPT Search et bloquer GPTBot

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Le point important est la séparation des finalités. Les noms et politiques peuvent évoluer ; contrôlez toujours les sources officielles avant publication.

Disallow n’est pas noindex

Disallow agit sur l’exploration. noindex agit sur l’indexation pour les systèmes compatibles. Si une page est bloquée par robots.txt, le crawler peut ne jamais lire sa balise meta robots.

User-agent: OAI-SearchBot
Disallow: /preview/

avec :

<meta name="robots" content="noindex">

peut être contradictoire pour une page publique que l’on veut simplement retirer des résultats. Dans ce cas, autoriser l’exploration et renvoyer noindex est généralement plus cohérent. Les contenus réellement privés doivent être protégés par authentification.

Éviter les listes géantes copiées sans contexte

Les listes de dizaines de bots vieillissent vite et mélangent recherche, entraînement et accès déclenché par l’utilisateur. Une politique courte et documentée est plus facile à auditer.

# Autoriser la découverte dans ChatGPT Search
User-agent: OAI-SearchBot
Allow: /

# Préférence séparée pour GPTBot
User-agent: GPTBot
Disallow: /

Conserver les règles normales du site

Autoriser un crawler de recherche IA n’oblige pas à ouvrir les comptes, paniers ou recherches internes.

User-agent: OAI-SearchBot
Disallow: /account/
Disallow: /cart/
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /account/
Disallow: /cart/
Allow: /

Testez des URL réelles : lorsque plusieurs règles correspondent, la règle la plus spécifique est plus importante que l’ordre visuel.

Vérifications avant publication

  • /robots.txt est bien servi à la racine du bon hôte ;
  • Googlebot et Bingbot gardent accès aux pages essentielles ;
  • les User-agent IA proviennent d’une documentation actuelle ;
  • recherche et entraînement sont séparés lorsque le fournisseur le permet ;
  • les pages avec noindex restent accessibles au crawler qui doit lire la directive ;
  • les données sensibles utilisent de vrais contrôles d’accès ;
  • le sitemap référence des URL canoniques publiques ;
  • les règles ont été validées et testées sur des URL représentatives.

robots.txt peut être mis en cache. Après déploiement, vérifiez le fichier réel, le statut HTTP, les logs et le trafic de référence. La politique la plus robuste consiste à définir la finalité de chaque crawler, écrire le minimum de règles et revoir régulièrement la documentation du fournisseur.

Guides associés