Noindex sur WordPress : comment éviter de bloquer Google et les IA (guide 2026)

TL;DR Le noindex est une directive d'indexation, pas de crawl : elle n'est lue que si la page reste accessible. Depuis WordPress 5.3, le réglage « Décourager les moteurs de recherche » ajoute un noindex,nofollow au lieu d'un Disallow: /. Les plugins SEO ont des valeurs par défaut hétérogènes : recherche interne, 404, archives, taxonomies et pièces jointes sont à vérifier une par une. Bloquer GPTBot ne bloque pas OAI-SearchBot, et Google-Extended ne bloque ni AI Overviews ni AI Mode. La vérification passe par Search Console et les logs serveur, pas par une impression. Un noindex involontaire prive la marque de ses citations IA, et ça se mesure.

Noindex WordPress : ce que c'est vraiment (et pourquoi ça bloque aussi les IA)

Un noindex WordPress, c'est une consigne donnée aux robots : « tu peux lire cette page, mais ne la mets pas dans ton index ». C'est une directive d'indexation. Elle ne dit rien sur le droit d'accéder à la page.

C'est là que tout se joue. Une directive d'indexation n'est lue que si le robot peut atteindre la page. Si vous bloquez l'accès en amont, le robot ne verra jamais votre noindex. Résultat : la page peut rester indexée malgré votre consigne.

Les deux méthodes pour poser un noindex

  • La balise <meta name="robots" content="noindex"> dans le <head> de la page. C'est la méthode la plus courante sur WordPress.
  • L'en-tête HTTP X-Robots-Tag: noindex. Utile pour les fichiers non HTML (PDF, images) et pour les réponses servies par le serveur.

Les deux fonctionnent. La différence est technique : la balise meta vit dans le code de la page, l'en-tête HTTP est envoyé par le serveur avant même le contenu.

Le cas WordPress 5.3

Avant la version 5.3, cocher « Décourager les moteurs de recherche » ajoutait un Disallow: / dans le robots.txt. Problème : ce réglage empêchait les robots de lire le site, mais ne désindexait rien. Un site « découragé » pouvait donc encore apparaître dans Google si des liens externes pointaient vers lui.

Depuis WordPress 5.3, ce réglage ajoute un noindex,nofollow. Le Disallow: / a été retiré du robots.txt pour les sites non publics. C'est plus propre, mais ça crée un nouveau piège : un site en développement qui oublie de décocher cette case reste invisible, même une fois en ligne.

Disallow ≠ noindex Disallow bloque le crawl : le robot ne lit pas la page. noindex bloque l'indexation : le robot lit la page mais ne l'inscrit pas dans son index. Les combiner annule l'effet du noindex, puisque le robot ne verra jamais la consigne.

Et les IA dans tout ça ?

Un crawler IA qui respecte le noindex ne pourra pas reprendre la page dans ses réponses. C'est une hypothèse prudente : le comportement varie selon les bots, et tous ne traitent pas les directives de la même façon. Ce qui est sûr, c'est qu'une page inaccessible ou non indexable a beaucoup moins de chances d'être citée.

C'est exactement ce que Semly mesure : la plateforme suit la visibilité d'une marque dans ChatGPT, Gemini, Claude, Google AI et Grok, et permet de voir si une page disparaît des réponses après un changement technique. Le noindex n'est pas un levier d'optimisation, c'est un blocage à repérer et à corriger.

Qui est concerné : Googlebot, crawlers IA et la distinction entraînement / citation

Tous les robots ne jouent pas le même rôle. Certains indexent, d'autres entraînent des modèles, d'autres vont chercher une page en direct pour répondre à un utilisateur. Bloquer l'un ne bloque pas forcément l'autre.

User-agent Rôle principal Respecte le noindex ?
Googlebot Indexation et classement dans Search Oui
Google-Extended Entraînement Gemini et grounding Oui, mais sans effet sur Search
GPTBot Entraînement des modèles OpenAI Oui
OAI-SearchBot Recherche et citations dans ChatGPT Oui
ChatGPT-User Requête en temps réel déclenchée par l'utilisateur Peut ignorer robots.txt
ClaudeBot Entraînement Anthropic Oui
PerplexityBot Index et citations Perplexity Oui

Deux nuances importantes, à garder en tête avant de toucher à quoi que ce soit.

Bloquer GPTBot n'empêche pas OAI-SearchBot de citer votre marque. Ce sont deux robots distincts, avec deux rôles distincts. Si votre objectif est d'être cité dans ChatGPT, c'est OAI-SearchBot qu'il faut autoriser, pas GPTBot — et la structure de contenu optimisée pour ChatGPT fait le reste.

Google-Extended ne bloque ni AI Overviews ni AI Mode. Ce token contrôle l'usage du contenu pour l'entraînement de Gemini et le grounding, mais il n'a aucun effet sur l'inclusion ou le classement dans Search. Pour limiter l'affichage dans les AI Overviews, il faut passer par nosnippet ou max-snippet:0, au prix de votre visibilité dans les résultats classiques.

Enfin, ChatGPT-User peut ignorer robots.txt, car il est déclenché par une action de l'utilisateur. Ce n'est pas un crawler d'indexation classique.

Le contexte rend ces réglages stratégiques : les crawlers IA ont explosé ces dernières années. Cloudflare relevait par exemple une hausse de 305 % des requêtes de GPTBot entre mai 2024 et mai 2025, et environ 80 % du crawl IA servait à l'entraînement, contre 18 % à la recherche. Autrement dit, la majorité des passages de robots IA ne vous rapportera aucune citation. Ce sont les 18 % qui comptent.

Étape 1 : auditer les noindex de votre WordPress

Avant de corriger, il faut savoir ce qui est bloqué, où, et par quoi. Voici la séquence.

  1. Vérifiez le réglage global. Allez dans Réglages > Lecture et regardez la case « Décourager les moteurs de recherche ». Si elle est cochée, tout le site est en noindex,nofollow. C'est la première chose à contrôler après une migration ou une mise en ligne.
  2. Inspectez le code source. Sur la page concernée, faites un clic droit puis « Afficher le code source » et cherchez robots. Vous verrez la balise meta et sa valeur exacte.
  3. Contrôlez les en-têtes HTTP. Utilisez un outil de test d'en-têtes pour voir si un X-Robots-Tag est envoyé par le serveur. C'est fréquent sur les PDF et les fichiers statiques.
  4. Passez en revue les défauts par plugin. Chaque plugin SEO gère ses propres valeurs par défaut. Le tableau ci-dessous liste les points à vérifier, pas un classement.
  5. Lisez votre robots.txt. Ouvrez votresite.com/robots.txt et cherchez les Disallow. Un Disallow sur une page que vous voulez indexer est un problème.
  6. Cherchez les pages orphelines et l'indexation résiduelle. Une page supprimée ou renommée peut rester dans l'index pendant un moment.
Plugin Points de vérification prioritaires
Yoast Recherche interne et 404 en noindex, follow par défaut ; sous-pages d'archives ; pièces jointes
Rank Math Noindex global par type de contenu et par taxonomie ; héritage et override par article
AIOSEO Réglages par type de contenu, archives, taxonomies, recherche interne
SEOPress Titres et métas par type de contenu, archives, pages de recherche

Point de contrôle après chaque étape : notez la valeur trouvée (index, noindex, disallow) dans un tableau. Vous aurez une carte de votre site avant de toucher à quoi que ce soit.

Étape 2 : corriger sans casser, la méthode pas à pas

La correction se fait dans l'ordre. Chaque étape a son point de contrôle.

  1. Ne combinez jamais Disallow et noindex. Si une page doit sortir de l'index, laissez-la accessible et posez un noindex. Si elle doit être bloquée au crawl, n'attendez pas de désindexation.
  2. Levez le noindex uniquement sur les pages à indexer. Pages produits, catégories, guides, articles de blog, pages de contact. Une par une, ou par lot via les réglages du plugin.
  3. Gardez le noindex sur les pages légitimes. Panier, page de remerciement, résultats de recherche interne, environnement de staging. Ces pages n'ont rien à faire dans un index, et les désindexer n'apporte rien.
  4. Gérez canonical et hreflang séparément. N'utilisez pas robots.txt pour la canonicalisation. Le canonical sert à indiquer la version de référence, le noindex à exclure une page. Ce sont deux outils différents, avec deux objectifs différents.
  5. Vérifiez la cohérence des données structurées. Si vous réindexez une page produit, assurez-vous que le schema correspond bien au contenu affiché.
  6. Redemandez l'indexation via Search Console. Utilisez l'inspection d'URL pour soumettre les pages corrigées.

À faire / à éviter À faire : corriger d'abord le réglage global, puis les plugins, puis les cas isolés. À éviter : désindexer une page utile parce qu'elle ne performe pas. Une page lente ou peu visitée n'est pas une page à supprimer de l'index.

Point de contrôle : après correction, reprenez votre tableau d'audit et vérifiez que chaque page à indexer affiche bien index dans le code source.

Étape 3 : vérifier que Google et les IA accèdent à nouveau au contenu

Corriger ne suffit pas. Il faut confirmer que les robots reviennent.

Côté Google. Le rapport d'indexation de Search Console montre combien de pages sont indexées et lesquelles sont exclues. L'inspection d'URL indique si Google a vu votre noindex, quand, et quelle est la version indexée. C'est la source la plus fiable pour savoir où vous en êtes.

Côté crawlers IA. Les logs serveur sont votre meilleur outil. Filtrez par user-agent pour voir si GPTBot, OAI-SearchBot, ClaudeBot ou PerplexityBot reviennent sur vos pages. Vous verrez aussi quelles pages les intéressent, ce qui est une information précieuse en soi.

Côté visibilité. Une fois l'accès rétabli, il faut mesurer l'effet. C'est là que Semly entre en jeu : la plateforme suit le taux de mention, le taux de citation et la part de voix d'une marque dans les réponses IA, et compare avec les concurrents. Vous passez d'un diagnostic technique à un suivi d'impact.

Un point important : la visibilité IA se construit sur plusieurs cycles. Ce n'est pas une action ponctuelle. Un accès rétabli ne se traduit pas en citations le lendemain, et personne ne peut vous garantir un délai précis. Ce qui se mesure, c'est la tendance sur la durée.

Les erreurs les plus fréquentes (et comment les réparer)

Voici les pièges les plus courants, avec le symptôme et la correction.

Erreur : combiner Disallow et noindex. Symptôme : la page reste indexée malgré le noindex. Correction : retirez le Disallow de la page, gardez le noindex, puis redemandez l'indexation.

Erreur : oublier les pièces jointes. Symptôme : des PDF ou des images apparaissent dans les résultats. Correction : vérifiez les réglages de pièces jointes dans votre plugin SEO et posez un noindex sur les fichiers concernés.

Erreur : laisser le noindex global activé après une migration. Symptôme : plus aucune page n'apparaît dans Google, le trafic s'effondre. Correction : décochez « Décourager les moteurs de recherche » dans Réglages > Lecture, puis inspectez quelques URL clés.

Erreur : confondre noindex et canonical. Symptôme : une page correcte disparaît de l'index alors qu'elle devait juste pointer vers une autre. Correction : utilisez le canonical pour indiquer la version de référence, le noindex uniquement pour exclure.

Erreur : bloquer tous les bots IA par défaut. Symptôme : la marque n'est plus citée dans ChatGPT ou Perplexity. Correction : décidez bot par bot. Autorisez ceux qui apportent des citations, bloquez ceux que vous ne voulez pas.

Erreur : croire que Google-Extended protège des AI Overviews. Symptôme : le contenu continue d'apparaître dans les AI Overviews malgré le blocage. Correction : Google-Extended ne bloque pas les AI Overviews. Si c'est votre objectif, il faut passer par nosnippet.

Et après ? Ce qu'il faut surveiller dans la durée

Une fois l'accès rétabli, le travail continue. Voici ce qui mérite votre attention.

Décidez explicitement pour chaque bot IA. Autoriser ou bloquer, c'est un choix, pas un défaut. Voici un arbre de décision simple.

  • Vous voulez être cité dans les réponses IA ? Autorisez OAI-SearchBot, PerplexityBot et les robots de recherche.
  • Vous ne voulez pas que votre contenu serve à l'entraînement ? Bloquez GPTBot, ClaudeBot et Google-Extended.
  • Vous voulez les deux ? Autorisez les robots de recherche, bloquez les robots d'entraînement. C'est possible, ce sont des user-agents distincts.
  • Vous ne savez pas ? Commencez par autoriser, mesurez, puis ajustez.

Gardez vos données cohérentes. Produits, catégories, guides, données structurées et informations de marque doivent dire la même chose. Un noindex corrigé sur une page dont le schema contredit le contenu ne vous aidera pas beaucoup.

Mesurez en continu. La visibilité IA n'est pas un réglage qu'on pose une fois. Semly suit cette évolution dans le temps et permet de voir si les corrections techniques se traduisent réellement par plus de citations.

Envisagez un llms.txt. Ce fichier, encore émergent, sert à indiquer aux modèles IA quelles pages sont importantes. Il ne remplace pas un robots.txt bien configuré, mais il complète la démarche.

Revoyez vos réglages régulièrement. Après une migration, une refonte, un changement de plugin SEO ou une mise à jour majeure, refaites l'audit. C'est là que les noindex involontaires apparaissent le plus souvent.

Si la visibilité IA ne bouge pas, ne cherchez pas forcément du côté du noindex. Vérifiez la cohérence des données, la qualité des sources citées par les concurrents, et la structure de vos pages. Le blocage technique est une cause possible, pas la seule.

FAQ

Pourquoi ma page reste indexée après un noindex ? Le plus souvent parce qu'un Disallow empêche le robot de lire la consigne. Vérifiez aussi que le noindex est bien présent dans le code source et non seulement dans un réglage de plugin.

Le noindex bloque-t-il ChatGPT ? Cela dépend du robot. Un crawler qui respecte le noindex ne reprendra pas la page. Mais bloquer GPTBot ne bloque pas OAI-SearchBot, qui gère les citations dans ChatGPT.

Comment vérifier si Google a vu mon noindex ? Utilisez l'inspection d'URL dans Search Console. Elle indique si Google a détecté la directive et quelle version de la page est indexée.

Faut-il un llms.txt ? Ce n'est pas obligatoire. C'est un complément utile pour signaler vos pages importantes aux modèles IA, mais il ne remplace pas un robots.txt correctement configuré.

Sources

Vérifiez si voit votre marque

Saisissez votre site web pour recevoir un rapport gratuit sur votre visibilité IA