TL;DR Un contenu
private, en brouillon ou protégé par mot de passe n'est jamais servi dans le HTML public, donc invisible pour Googlebot comme pour les crawlers IA.noindexn'est pas la même chose que contenu caché :noindex= page servie mais exclue, contenu caché = page non servie. Bloquer les bots IA (robots.txt, Cloudflare) ne supprime pas les citations et coûte du trafic. À rendre public : pages produits, FAQ, guides, politiques, données structurées. À garder fermé : données clients, prix confidentiels, contenu transactionnel à forte valeur. Aucune astuce ne rend indexable un contenu qui n'est pas servi.
Votre page n'apparaît pas dans Google. Elle n'est jamais citée dans ChatGPT, Gemini ou Google AI. Vous avez pourtant bien cliqué sur « Publier ». Le problème vient souvent d'ailleurs : le contenu est caché derrière la connexion, un mot de passe ou un réglage de statut. Résultat, les robots ne le voient tout simplement pas.
Ce guide vous montre comment auditer vos contenus WordPress, décider ce qui doit devenir public, et vérifier l'effet. Étape par étape, sans jargon inutile.
1. Contenus WordPress cachés derrière la connexion : pourquoi ils sont invisibles
WordPress propose plusieurs façons de « cacher » un contenu. Elles n'ont pas du tout le même effet. Certaines retirent la page du HTML public. D'autres la servent mais demandent aux moteurs de l'ignorer. La différence est énorme.
| Mécanisme WordPress | HTML servi au crawler ? | Indexable Google ? | Citable par IA ? |
|---|---|---|---|
Page publish (publique) |
Oui, complet | Oui | Oui |
Page private |
Non | Non | Non |
| Brouillon / en attente | Non | Non | Non |
| Protégée par mot de passe | Non (formulaire à la place) | Non | Non |
| Restreinte par plugin membership | Souvent non si retirée du HTML | Rarement | Non |
| Paywall « lead-in » (extrait public) | Oui, l'extrait | Oui | Oui |
| Paywall « content-locked » (rien dans le HTML) | Non | Non | Non |
noindex (meta ou en-tête) |
Oui | Non | Non |
Disallow dans robots.txt |
Oui, mais non exploré | Non | Non |
Le point à retenir : un contenu non servi dans le HTML public n'est ni indexable ni citable. Il n'existe pas pour les robots.
Non servi ou servi mais exclu : la confusion qui coûte cher
Un contenu private ou protégé par mot de passe n'est pas « noindexé ». Il est absent du HTML. C'est une nuance que beaucoup confondent.
- Contenu caché : la page n'est pas servie. Le robot reçoit un formulaire, une redirection ou une erreur.
noindex: la page est bien servie, mais elle porte une consigne d'exclusion. Google peut la lire, il choisit de ne pas l'afficher.
Autrement dit, noindex est utile quand vous voulez garder une page accessible mais hors des résultats. Inutile quand le contenu n'est même pas livré.
robots.txt contrôle l'exploration, pas l'indexation
Beaucoup croient qu'un Disallow suffit à faire disparaître une page. Faux. robots.txt dit aux robots ce qu'ils peuvent explorer. Il ne dit rien sur l'indexation.
Pire : si une page est bloquée par robots.txt, le robot ne lira jamais un éventuel noindex posé dessus. La page peut donc continuer à apparaître dans les résultats via des liens externes. Google le précise clairement dans sa documentation.
Les crawlers IA lisent surtout le HTML brut
Googlebot exécute le JavaScript, avec un délai. Les crawlers IA (GPTBot, OAI-SearchBot, PerplexityBot) lisent majoritairement le HTML brut et n'exécutent pas systématiquement le JS.
Conséquence directe : un contenu injecté uniquement côté client, chargé en AJAX après connexion ou masqué par JavaScript, a très peu de chances d'être vu. Si votre contenu n'est pas dans le code source, il est invisible.
À retenir : un contenu non servi dans le HTML public n'est ni indexable ni citable. Ni le sitemap, ni le schema, ni une astuce technique ne changent cela.
2. Ce qu'il faut rendre public (et ce qu'il faut garder fermé)
La bonne question n'est pas « faut-il tout ouvrir ? ». C'est « quel contenu a une valeur informationnelle ? ». Un critère simple suffit pour trancher.
Informationnel = public. Transactionnel ou sensible = fermé.
À rendre public
- Pages produits et fiches descriptives.
- FAQ et questions fréquentes.
- Guides, tutoriels, articles de fond.
- Politiques (retours, livraison, mentions légales).
- Pages auteur et informations d'expertise.
- Données structurées (JSON-LD) qui décrivent votre offre.
Ces contenus répondent à des questions. C'est exactement ce que les moteurs et les IA cherchent à citer.
À garder fermé
- Données clients et informations personnelles.
- Prix confidentiels ou tarifs négociés.
- Contenu transactionnel premium (formations payantes, rapports privés).
- Documents internes, procédures, intranet.
Le modèle hybride : le meilleur des deux
Vous voulez garder du contenu premium ? Utilisez un paywall « lead-in ». Vous publiez un extrait ouvert, le reste reste réservé aux abonnés.
Utile quand vous avez un vrai contenu à valeur ajoutée derrière. Inutile quand tout le contenu est verrouillé : dans ce cas, rien n'est citable.
Attention au RGPD avant de publier. Anonymisez les données personnelles, vérifiez votre base légale et vos CGV. Un contenu libéré trop vite peut exposer des informations que vous n'aviez pas prévu de rendre publiques.
C'est ici que Semly devient utile : la plateforme mesure quelles pages publiques sont réellement citées dans les réponses IA, et compare votre présence à celle de vos concurrents. Vous voyez l'effet concret de ce que vous ouvrez.
3. Rendre le contenu visible : la méthode pas à pas
3.1 Étape 1 — Auditer les statuts et protections
Listez tous vos contenus private, protégés par mot de passe ou gated par un plugin. Notez lesquels ont une valeur informationnelle.
Point de contrôle : ouvrez la page dans un navigateur en navigation privée, puis affichez le code source. Si le contenu n'apparaît pas dans le HTML, il est invisible.
3.2 Étape 2 — Vérifier robots.txt et les règles anti-bots
Ouvrez votre fichier /robots.txt. Cherchez les lignes Disallow qui visent GPTBot, OAI-SearchBot, PerplexityBot ou Google-Extended. Vérifiez aussi vos réglages Cloudflare.
Point de contrôle : ne confondez pas Google-Extended (contrôle d'entraînement Gemini) et Googlebot (recherche). De même, OAI-SearchBot n'est pas GPTBot.
Symptôme d'erreur : si une page est bloquée par robots.txt, le noindex n'est jamais lu. La page reste potentiellement visible dans les résultats.
3.3 Étape 3 — Publier la version ouverte
Passez le contenu informationnel en publish. Pour le contenu premium, créez un extrait public clair. Évitez la duplication.
Point de contrôle : une seule URL canonique par intention. Pas de contenu identique en version publique et en version gated.
3.4 Étape 4 — Structurer pour être citable
Travaillez la forme autant que le fond :
- Titres clairs et explicites.
- Réponses directes dès les premières lignes.
- FAQ quand c'est pertinent.
- Données structurées (JSON-LD).
- Fichier llms.txt pour guider les modèles.
Point de contrôle : le contenu doit être compréhensible sans JavaScript. Vérifiez le rendu réel.
3.5 Étape 5 — Mesurer et corriger
Suivez trois choses : l'indexation dans Search Console, les logs de bots, et les citations IA via un outil de suivi multi-modèles.
Point de contrôle : comptez environ 2 à 8 semaines pour une reprise en compte. Une mise à jour de robots.txt s'applique en général sous 24 heures.
Semly s'intègre à WordPress et WooCommerce, génère llms.txt et JSON-LD, et suit votre visibilité sur plusieurs modèles IA. Vous mesurez, puis vous corrigez.
4. Les erreurs fréquentes et comment les corriger
| Erreur | Cause | Correction |
|---|---|---|
| Croire que le sitemap indexe | Confusion entre déclarer et rendre indexable | Un sitemap ne sert qu'à signaler des URL. Rendez le contenu public. |
| Bloquer les bots IA « pour se protéger » | Peur de perdre du contenu | Le blocage ne supprime pas les citations et coûte du trafic. |
| Servir un HTML différent à Googlebot | Tentative de contournement | Risque de cloaking, sanctionné par Google. À éviter. |
| Dupliquer intranet et site public | Deux versions du même contenu | Canonical unique, une seule version publique. |
| Redirection login (302) | L'article renvoie vers /login | Google indexe /login à la place de l'article. Corrigez la redirection. |
Le cas du paywall mal marqué
Si vous utilisez un paywall, le marquage est obligatoire. Il faut isAccessibleForFree: false et hasPart.cssSelector en JSON-LD. Sans cela, Google peut considérer que vous servez un contenu différent aux robots : c'est du cloaking.
Pourquoi Google indexe ma page de connexion ?
C'est un classique. Votre article est protégé, la redirection 302 envoie tout le monde vers /login. Google suit la redirection et indexe la page de connexion à la place de l'article. La correction : rendre l'article public, ou supprimer la redirection pour les visiteurs non connectés.
Pourquoi ma page reste invisible après publication ?
Vérifiez trois points : le statut est bien publish, la page n'est pas bloquée par robots.txt, et le contenu est présent dans le HTML brut. Si l'un des trois manque, la page reste invisible.
5. Ce qu'il faut retenir et quoi faire ensuite
Trois points à garder en tête :
- Un contenu non servi n'est ni indexable ni citable. Aucune astuce ne contourne cela.
- Bloquer les bots IA ne protège pas et coûte du trafic. Les données montrent que la majorité des sites bloquant Google-Extended restent cités.
- La vraie variable, c'est la lisibilité : contenu public, structuré, accessible.
Plan 30-60-90 jours
- 30 jours : auditez vos statuts et protections. Listez ce qui est caché et ce qui a une valeur informationnelle.
- 60 jours : publiez les versions ouvertes. Créez des extraits publics pour le contenu premium. Corrigez robots.txt et les redirections.
- 90 jours : mesurez. Indexation, logs de bots, citations IA. Ajustez ce qui ne fonctionne pas.
Et si je ne peux rien publier ?
Si votre contenu est réellement sensible, gardez-le fermé. C'est un choix valable. Mais sachez ce qu'il implique : ce contenu ne sera ni indexé ni cité. Ne comptez pas sur lui pour votre visibilité.
Comment suivre les progrès ?
Combinez trois sources : Search Console pour l'indexation, vos logs serveur pour l'activité des bots, et un outil de suivi IA pour les citations. Semly propose un rapport gratuit en 2 minutes pour voir où votre marque est citée dans les modèles d'IA.
Aucun outil ne peut garantir une citation. Ce qu'on peut faire, c'est rendre le contenu visible, clair et vérifiable. Le reste suit la logique des modèles.