Par · · 3 min
Robots.txt vs balise noindex : lequel utiliser
Bloquer le crawl n'est pas la même chose qu'empêcher l'indexation — les combiner par erreur produit l'inverse de l'effet recherché. La distinction, avec un tableau pour savoir quand utiliser lequel.

Les deux servent à contrôler ce que Google fait d'une page, mais à deux étapes complètement différentes du processus — la confusion entre les deux est l'une des causes les plus fréquentes de pages qui restent indexées alors qu'on cherchait justement à les retirer.
La distinction fondamentale
- Robots.txt empêche le crawl : Googlebot ne va même pas chercher à récupérer le contenu de la page. Il ne saura jamais ce qu'elle contient.
- La balise noindex empêche l'indexation, mais suppose que la page ait été crawlée : Google doit d'abord récupérer la page et lire la balise pour savoir qu'il ne doit pas l'indexer.
Le piège classique : bloquer une page dans robots.txt ET lui ajouter une balise noindex, en pensant cumuler les protections. En réalité, Google ne verra jamais le noindex puisqu'il n'a pas le droit de crawler la page pour le lire — si l'URL est déjà connue (via un lien externe), elle peut même rester indexée sans description ("aucune information n'est disponible pour cette page") plutôt que d'être proprement retirée.
Quand utiliser lequel
| Besoin | Solution | Pourquoi |
|---|---|---|
| Retirer une page précise des résultats (page de remerciement, doublon, contenu fin) | Balise noindex | La page reste crawlable, donc le signal des liens internes/externes qui pointent vers elle continue de circuler dans le site |
| Économiser le budget de crawl sur toute une section peu utile (résultats de recherche interne, combinaisons de filtres infinies) | Robots.txt | Empêche Google de perdre du temps à explorer des milliers d'URLs à faible valeur, sans avoir à gérer une balise noindex sur chacune individuellement |
| Empêcher l'accès à une zone sensible (administration, fichiers internes) | Ni l'un ni l'autre seul | Robots.txt est une convention publique, pas une protection — une vraie zone sensible doit être protégée par une authentification, pas seulement masquée des moteurs |
noindex, follow vs noindex, nofollow
La balise noindex peut se combiner avec une directive sur les liens de la page : "noindex, follow" (par défaut si non précisé) indique à Google de ne pas indexer la page mais de continuer à suivre ses liens sortants pour découvrir d'autres pages ; "noindex, nofollow" bloque les deux à la fois. Le choix par défaut (follow) est presque toujours le bon — une page de résultats de recherche interne en noindex peut par exemple continuer à faire découvrir des pages produit via ses liens, sans être elle-même indexée.
Le cas des fichiers non-HTML : le header X-Robots-Tag
Un PDF, une image ou un autre fichier ne peut pas porter de balise <meta> puisqu'il n'a pas de <head> HTML. Pour ces cas, l'en-tête HTTP X-Robots-Tag reproduit exactement le même effet que la balise noindex, mais configuré au niveau du serveur plutôt que dans le code de la page — même logique, même piège avec robots.txt (le fichier doit rester crawlable pour que le serveur ait l'occasion d'envoyer cet en-tête).
Combien de temps prend un noindex pour agir
Ajouter un noindex ne retire pas la page immédiatement — Google doit d'abord la re-crawler pour découvrir la balise, ce qui peut prendre de quelques jours à plusieurs semaines selon la fréquence de crawl du site. Pour accélérer un retrait urgent, l'outil de suppression d'URL de Search Console masque temporairement la page le temps que le noindex soit pris en compte durablement.
Comment vérifier lequel est réellement en place
L'outil d'inspection d'URL de Search Console indique directement si une page est bloquée par robots.txt, et si elle porte une balise noindex — c'est la vérification la plus fiable, plus fiable que de relire le fichier robots.txt à l'œil, où une règle placée pour une autre section du site peut bloquer une URL sans que ce soit visible au premier coup d'œil.
Sitemap.xml et robots.txt : les deux fichiers que Google lit avant votre contenu
Ce que chaque fichier fait réellement, l'erreur de configuration qui peut désindexer un site entier, la syntaxe détaillée, les pièges liés aux robots d'IA, et comment les faire cohabiter correctement.
Indexabilité : pourquoi certaines de vos pages n'apparaissent jamais sur Google
La différence entre crawlable et indexable, les causes détaillées les plus fréquentes, une méthode de diagnostic étape par étape, et les cas particuliers les plus déroutants à connaître.
Seoditum vérifie ce point automatiquement, avec preuve à l'appui, sur l'ensemble de votre site.
À lire aussi
Ce point, et les autres, sont vérifiés automatiquement sur votre site.
Lancer mon audit