Guides robots.txt

Robots.txt et noindex : bien distinguer exploration et indexation

Pourquoi robots.txt ne retire pas fiablement une page des résultats, quand utiliser noindex et comment éviter de bloquer le crawler avant qu’il lise la directive.

Par Robots.txt Tools Editorial TeamDernière vérification le 2026-09-133 min de lecture
Robots.txt et noindex : bien distinguer exploration et indexation

robots.txt et noindex ne répondent pas au même besoin. La règle simple à retenir : robots.txt détermine si un crawler peut demander une URL ; noindex indique à un système compatible que cette page ne doit pas rester dans son index.

Google précise que robots.txt n’est pas le mécanisme à utiliser pour empêcher de façon fiable une page web classique d’apparaître dans Google Search. Une URL bloquée peut être découverte par des liens, sitemaps, redirections ou données historiques.

Comparer les contrôles

ContrôleObjectifEmplacementLe crawler doit charger la page ?
DisallowLimiter l’exploration/robots.txtNon
meta robots noindexEmpêcher l’indexation HTML<head>Oui
X-Robots-Tag: noindexContrôler aussi des ressources non HTMLEn-tête HTTPOui
AuthentificationProtéger l’accèsServeur/applicationPas d’accès public

Un crawler ne peut pas lire noindex sur une page si robots.txt lui interdit de la récupérer.

Configuration souvent contre-productive

User-agent: *
Disallow: /members-preview/

avec :

<meta name="robots" content="noindex">

Googlebot peut ne jamais voir la balise. Si l’URL est découverte ailleurs, elle peut encore apparaître sans extrait.

Pour une page publique que l’on souhaite uniquement sortir de l’index, autoriser l’exploration et servir noindex est généralement plus clair.

Quand utiliser robots.txt

robots.txt convient au contrôle d’exploration : recherche interne, panier, sessions, certaines facettes ou zones applicatives de faible valeur.

User-agent: *
Disallow: /recherche-interne/
Disallow: /cart/
Allow: /

Sitemap: https://example.com/sitemap.xml

Testez les URL importantes avant de bloquer un répertoire large.

Quand utiliser noindex

Pour une URL publique et explorable qui ne doit pas apparaître dans les résultats :

<meta name="robots" content="noindex">

Pour un PDF ou une autre ressource :

X-Robots-Tag: noindex

Dans les deux cas, le crawler doit pouvoir récupérer la réponse.

« Indexée malgré le blocage robots.txt »

Ce n’est pas contradictoire. Exploration et indexation sont deux systèmes distincts. Un moteur peut connaître une URL sans avoir accès à son contenu actuel.

Si l’URL doit réellement disparaître, demandez d’abord si le crawler peut y accéder sans risque. Si oui, retirez le blocage et renvoyez noindex. Si le contenu est privé, utilisez l’authentification.

Ne pas mettre Noindex dans robots.txt

D’anciens exemples proposent :

Noindex: /exemple/

Google ne prend pas en charge noindex comme directive robots.txt. Utilisez meta robots ou X-Robots-Tag.

Même principe pour la recherche avec IA

OpenAI distingue également le blocage de OAI-SearchBot de noindex. Une URL connue par une autre source peut encore être affichée sous forme de lien/titre ; pour demander son exclusion, la directive d’indexation doit être lisible.

Ordre de décision

  1. Donnée privée ? Authentification.
  2. Page publique mais hors résultats ? Exploration autorisée + noindex.
  3. Page indexable mais coûteuse à explorer ? Examiner robots.txt.
  4. Un crawler seulement doit être traité différemment ? Groupe User-agent dédié.
  5. Problème de doublons ? Vérifier canonical, redirections et architecture.

robots.txt contrôle l’exploration, noindex contrôle l’indexation et l’authentification contrôle l’accès.

Guides associés