Où placer robots.txt
Le fichier est généralement disponible à l’adresse https://example.com/robots.txt. Les règles s’appliquent à l’hôte, au protocole et au port qui servent le fichier ; un robots.txt sur un hôte ne contrôle donc pas automatiquement tous les sous-domaines.
Directives principales
User-agent identifie le groupe de robots. Disallow décrit les chemins que ce groupe ne doit pas explorer. Allow peut autoriser un chemin plus spécifique au sein d’une zone bloquée plus largement. Sitemap indique aux robots l’URL d’un sitemap XML.
User-agent: *
Disallow: /private/
Allow: /private/help/
Sitemap: https://example.com/sitemap.xmlrobots.txt et noindex
Une erreur fréquente consiste à considérer Disallow comme une directive garantie de « non-indexation ». robots.txt contrôle principalement l’exploration. Si l’objectif est de demander qu’une page explorable n’apparaisse pas dans les résultats, une directive d’indexation comme noindex est le contrôle adapté.
robots.txt n’est pas un mécanisme de sécurité
N’utilisez pas robots.txt pour protéger des documents privés, zones d’administration, données clients ou environnements de préproduction. Le fichier est public et le respect des règles par un robot n’équivaut pas à une authentification. Utilisez de véritables contrôles d’accès pour les contenus sensibles.
Comment les règles sont choisies
Les robots sélectionnent le groupe User-agent applicable le plus spécifique. Lorsque le même token apparaît dans plusieurs groupes, leurs règles sont combinées. Ensuite, le chemin Allow ou Disallow correspondant le plus spécifique s’applique ; en cas d’égalité de spécificité, Allow l’emporte.