Balise meta robots : définition, directives et bonnes pratiques

Index, noindex, follow, nofollow et les autres directives : contrôler ce que Google fait de chaque page

L’essentiel à retenir

  • Définition : une balise placée dans le <head> d’une page qui donne des instructions aux robots des moteurs : indexer ou non, suivre les liens ou non, afficher un extrait ou non.
  • Syntaxe : <meta name="robots" content="noindex, follow">.
  • Différence avec robots.txt : le robots.txt bloque l’exploration, la meta robots contrôle l’indexation d’une page explorée.
  • Erreur classique : un noindex oublié après la mise en ligne d’un site en préproduction.

La balise meta robots est un élément HTML placé dans l’en-tête d’une page qui indique aux robots des moteurs de recherche comment traiter cette page : l’indexer ou non, suivre ses liens ou non, afficher un extrait, une image ou une version en cache. C’est l’outil le plus fin pour contrôler ce que Google fait d’une page précise, à distinguer du fichier robots.txt qui agit sur l’exploration de sections entières du site.

Syntaxe et directives

La balise s’écrit <meta name="robots" content="directive1, directive2">. On peut cibler un robot précis en remplaçant robots par son nom (googlebot, bingbot). L’équivalent pour les fichiers non HTML (PDF, images) est l’en-tête HTTP X-Robots-Tag.

DirectiveEffetUsage
index (défaut)La page peut être indexéeInutile de l’écrire
noindexLa page n’est pas indexée, ou est retirée de l’indexPages de remerciement, résultats de recherche interne, pages de test, contenus minces
follow (défaut)Les liens de la page sont suivis et transmettent de l’autoritéInutile de l’écrire
nofollowAucun lien de la page n’est suiviRare ; préférer rel="nofollow" lien par lien
noneÉquivaut à noindex, nofollowPages totalement privées
noarchivePas de version en cacheContenus qui changent souvent
nosnippetPas d’extrait ni de description dans les résultatsRare, réduit le taux de clic
max-snippet, max-image-preview, max-video-previewLimitent la taille des extraitsmax-image-preview:large est recommandé pour Discover
noimageindexLes images de la page ne sont pas indexéesImages protégées
unavailable_afterDésindexation après une dateOffres à durée limitée

Meta robots ou robots.txt ?

Meta robotsrobots.txt
Dans chaque pageUn fichier à la racine du site
Agit surL’indexation et l’affichage d’une page exploréeL’exploration (crawl) de chemins entiers
Pour retirer une page de l’indexOui : noindexNon : une page bloquée peut rester indexée sans contenu
Pour économiser du budget de crawlNon : la page doit être explorée pour lire la baliseOui

Le piège classique : bloquer une page dans le robots.txt et lui mettre un noindex. Google ne peut plus lire la balise puisqu’il n’explore plus la page ; elle reste indexée. Pour désindexer, laissez l’exploration ouverte et posez le noindex.

Les cas d’usage en pratique

  • Pages de remerciement après formulaire ou commande : noindex, sinon elles se positionnent et faussent les conversions.
  • Résultats de recherche interne et filtres : noindex, ou canonical selon le cas (voir duplicate content).
  • Pages d’archives, tags, auteurs sur WordPress : noindex quand elles n’apportent rien.
  • Espace client, panier, compte : noindex.
  • Préproduction : protection par mot de passe plutôt que noindex, qu’on oublie de retirer.
  • Pages paginées : index, avec canonical vers elles-mêmes ; ne pas les mettre en noindex.
Conseil : après toute mise en ligne ou refonte, explorez le site avec Screaming Frog et filtrez sur « noindex ». Un noindex global oublié sur un site en production est la cause la plus fréquente de disparition brutale de Google.

Vérifier ce que Google a compris

L’outil d’inspection d’URL de la Search Console indique, pour une page, si elle est indexée et quelle directive robots Google a lue. Le rapport Pages liste les URL « exclues par la balise noindex ». Les plugins SEO de WordPress (Yoast, Rank Math) gèrent ces balises page par page ; vérifiez leurs réglages par type de contenu. Ces contrôles font partie du volet technique de notre audit SEO complet.

Comment GreenRed vous aide

Plutôt que de jongler entre plusieurs outils, le module Santé du site de GreenRed réunit ces indicateurs dans un seul tableau de bord, les compare dans le temps et vous indique les actions prioritaires. Vous pouvez le tester gratuitement, sans carte bancaire, depuis la page Tarifs.

Questions fréquentes

Quelle est la différence entre meta robots noindex et robots.txt Disallow ?

Le noindex demande aux moteurs de ne pas indexer une page qu’ils ont explorée : elle disparaît des résultats. Le Disallow du robots.txt interdit l’exploration : les moteurs ne lisent pas la page, mais peuvent la garder dans l’index s’ils la connaissent par des liens. Pour retirer une page des résultats, utilisez noindex sans la bloquer dans le robots.txt.

Combien de temps faut-il pour qu’une page en noindex disparaisse de Google ?

De quelques jours à quelques semaines, selon la fréquence d’exploration de la page. Pour accélérer, utilisez l’outil de suppression temporaire de la Search Console puis laissez le noindex en place. Une page en noindex pendant longtemps finit aussi par voir ses liens ignorés.

Faut-il écrire « index, follow » sur ses pages ?

Non, c’est le comportement par défaut ; la balise est inutile. Elle ne nuit pas, mais elle encombre le code. N’utilisez la meta robots que pour restreindre : noindex, nofollow, noarchive, ou pour les limites d’extraits.

Comment appliquer noindex à un PDF ?

Un fichier PDF n’a pas de balise HTML ; utilisez l’en-tête HTTP X-Robots-Tag: noindex, configuré côté serveur (par exemple dans le fichier .htaccess pour les fichiers .pdf). La même méthode s’applique aux images et à tout fichier non HTML.

Passez de la théorie à la pratique

GreenRed mesure ces indicateurs sur votre propre site et vous dit quoi faire en priorité.

Essayer GreenRed gratuitement

Articles connexes