Comment vérifier si les robots IA peuvent accéder à votre site WordPress

TL;DR Couche 1 : lisez le robots.txt (attention, il est virtuel sur WordPress et peut être écrasé par un fichier physique ou un plugin SEO). Couche 2 : vérifiez les balises meta robots et l'en-tête X-Robots-Tag. Couche 3 : testez le blocage réseau (WAF, pare-feu, CDN type Cloudflare, hébergeur). Couche 4 : confirmez avec des tests réels (curl par user-agent, logs serveur, Search Console). Distinction clé : crawlers d'entraînement (GPTBot, ClaudeBot, CCBot, Google-Extended) vs crawlers de réponse/recherche (OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-User). Piège n°1 : un blocage involontaire (Cloudflare, WAF, mode « coming soon », noindex résiduel) rend le site invisible sans aucune alerte dans vos tableaux de bord SEO. Point de départ rapide : l'audit gratuit Semly.

Comment vérifier si les robots IA peuvent accéder à votre site WordPress : la méthode en 4 couches

Un seul test ne suffit jamais. Vous pouvez avoir un robots.txt impeccable et rester invisible pour ChatGPT, parce qu'un pare-feu bloque le robot avant même qu'il lise le fichier. C'est pour ça qu'on vérifie en 4 couches, dans l'ordre.

Le principe de base : robots.txt est une demande, pas une barrière. C'est une consigne que le robot est censé respecter. Un WAF, lui, est une barrière réelle. Les deux ne se voient pas au même endroit, et c'est là que la plupart des webmasters se font piéger.

Couche Ce qu'elle bloque Où ça se voit
1. robots.txt Accès déclaré (demande) Fichier /robots.txt
2. Meta robots / X-Robots-Tag Indexation, affichage Code source, en-têtes HTTP
3. Réseau (WAF, CDN, hébergeur) Accès réel (barrière) Nulle part dans robots.txt
4. Tests réels Confirme ou infirme curl, logs serveur, Search Console

Entraînement ou réponse : deux familles à ne pas confondre

C'est la confusion la plus fréquente, et elle coûte cher.

  • Crawlers d'entraînement : GPTBot, ClaudeBot, CCBot, Google-Extended. Ils alimentent les modèles. Les bloquer, c'est refuser l'entraînement.
  • Crawlers de réponse/recherche : OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-User. Ils vont chercher l'info en temps réel pour répondre à un utilisateur. Les bloquer, c'est sortir du pool de citations.

Bloquer GPTBot n'a pas le même effet que bloquer OAI-SearchBot. Le premier vous retire de l'entraînement, le second vous retire des réponses.

À retenir Un checker robots.txt ne détecte jamais un blocage WAF. Il lit un fichier texte, il ne teste pas l'accès réel à votre serveur.

Avant de commencer : ce qu'il vous faut et quand cette méthode ne s'applique pas

Pas besoin d'être développeur, mais il faut quelques accès. Préparez :

  • l'accès admin WordPress (pour les plugins SEO et les réglages) ;
  • l'accès à l'hébergement ou aux logs serveur (idéalement) ;
  • un terminal ou un outil de test HTTP (curl, ou un outil en ligne) ;
  • la liste des user-agents à tester (voir plus bas).

Quand la méthode ne suffit pas

  • Site entièrement derrière un login : les robots IA ne peuvent pas se connecter. La question de l'accès ne se pose pas de la même façon.
  • Environnement de staging : souvent protégé par mot de passe ou en noindex. Ne le confondez pas avec la prod.
  • Pas d'accès aux logs : passez par un test externe (curl depuis l'extérieur, ou un outil de vérification) pour au moins confirmer le code HTTP.

Vous n'avez pas les logs ? Ce n'est pas bloquant. Les couches 1 à 3 se vérifient sans serveur. C'est la couche 4 qui devient partielle.

Étape 1 — Lire le robots.txt de votre site WordPress

Ouvrez simplement votresite.com/robots.txt. Sur WordPress, ce fichier est virtuel par défaut : il n'existe pas physiquement sur le serveur, c'est WordPress qui le génère. Son contenu par défaut ressemble à ça :

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Deux choses à savoir :

  1. Un fichier physique à la racine écrase le virtuel. Si quelqu'un a déposé un robots.txt via FTP, c'est lui qui compte, pas celui de WordPress.
  2. Un plugin SEO peut le modifier. Avec Yoast SEO, allez dans SEO > Outils > Éditeur de fichiers. Sinon, passez par le File Manager de l'hébergeur ou le FTP.

Bloquer un bot IA : la syntaxe

Une règle par bot, c'est plus lisible et plus sûr :

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

Sitemap: https://votresite.com/sitemap_index.xml

Utilisez Allow: pour rouvrir une exception. Et gardez en tête le délai : côté OpenAI, comptez environ 24 h pour qu'une mise à jour du robots.txt soit prise en compte.

Points de contrôle :

  • Le fichier s'ouvre-t-il bien sur /robots.txt ?
  • Les règles visent-elles les bons bots IA ?
  • Un fichier physique écrase-t-il le virtuel sans que vous le sachiez ?

Étape 2 — Vérifier les balises meta robots et l'en-tête X-Robots-Tag

Un robots.txt propre ne garantit rien si une page porte un noindex. Faites un clic droit > « Afficher le code source » sur une page clé, et cherchez robots.

Signal Où le voir Ce que ça signifie
<meta name="robots" content="noindex"> Code source de la page Page exclue de l'index
X-Robots-Tag: noindex En-têtes de réponse HTTP Même effet, posé côté serveur
X-Robots-Tag: noindex sur tout le site En-têtes de toutes les pages Blocage global invisible

Le cas classique : un noindex oublié après une mise en staging, jamais retiré en production. Le site est en ligne, mais invisible.

Rappel important : robots.txt et meta robots sont indépendants. L'un ne remplace pas l'autre. Un bot peut lire le robots.txt, puis tomber sur un noindex.

Points de contrôle :

  • La page renvoie-t-elle noindex ?
  • L'en-tête est-il posé sur tout le site ou sur une seule page ?

Étape 3 — Tester le blocage réseau (WAF, pare-feu, CDN, hébergeur)

C'est la couche invisible. Elle n'apparaît nulle part dans robots.txt, et aucun tableau de bord SEO ne la signale.

Depuis juillet 2025, Cloudflare bloque les crawlers IA par défaut pour les nouveaux domaines. Et plus d'un million de clients ont activé ce blocage en un clic depuis septembre 2024. Autrement dit : votre site peut être bloqué sans que vous l'ayez jamais décidé.

Les suspects à vérifier :

  • CDN (Cloudflare et autres) : une règle de blocage des bots IA est-elle active ?
  • WAF / pare-feu applicatif : filtre-t-il les user-agents ?
  • Plugin de sécurité (type Wordfence) : bloque-t-il les robots, ou faut-il ajouter les IP officielles en allowlist ?
  • Mode « coming soon » / maintenance : actif sans que vous le sachiez ?
  • Cache : sert-il une version obsolète ou une page de maintenance ?
  • Redirections : une redirection mal configurée peut envoyer les bots ailleurs.

Na co uważać / À surveiller Un blocage à ce niveau ne se voit dans aucun tableau de bord SEO. Votre site peut être parfaitement indexé par Google et totalement inaccessible aux robots IA.

Points de contrôle :

  • Le mode maintenance est-il actif ?
  • Une règle Cloudflare bloque-t-elle les bots IA ?
  • Le plugin de sécurité filtre-t-il les user-agents ?

Étape 4 — Confirmer avec des tests réels (curl, logs, Search Console)

Ici, on passe de l'hypothèse à la preuve.

Tester avec curl

Simulez un robot IA en précisant son user-agent :

curl -A "GPTBot" -I https://votresite.com/

Regardez le code HTTP renvoyé. Puis répétez avec OAI-SearchBot, ClaudeBot, PerplexityBot.

Lire les logs serveur

C'est la source de vérité. Sur un serveur classique :

grep -i "gptbot\|claudebot\|perplexity" access.log

Si vous voyez des passages, les bots viennent. Si rien n'apparaît sur plusieurs semaines, suspectez un blocage.

Interpréter les codes HTTP

Code Signification Action
200 Accessible Rien à corriger
403 Bloqué (WAF/pare-feu) Vérifier CDN, WAF, plugin sécurité
429 Rate limiting Assouplir la limite pour les bots IA
503 Maintenance/surcharge Désactiver le mode maintenance
Redirection Cible à vérifier Contrôler la destination finale

Un point souvent oublié : les crawlers IA n'exécutent pas le JavaScript. Ils n'apparaîtront donc jamais dans GA4. Seuls les logs bruts et Search Console vous donnent une piste.

Points de contrôle :

  • Le code HTTP est-il cohérent avec ce que dit le robots.txt ?
  • Les logs montrent-ils des passages de bots IA ?

Les faux positifs WordPress qui font croire à un blocage

Avant de conclure au pire, éliminez ces causes classiques.

Symptôme Cause probable Correction
Site inaccessible aux bots Mode « coming soon » actif Désactiver le mode maintenance
Tout renvoie vers une page de connexion Protection par mot de passe Retirer la protection en prod
Bots filtrés sans raison Plugin de sécurité trop strict Ajouter les IP officielles en allowlist
Contenu obsolète servi Cache mal purgé Vider le cache CDN et serveur
Page clé absente Redirection mal configurée Corriger la règle de redirection
Site invisible malgré tout Noindex résiduel de staging Retirer le noindex

Les erreurs les plus fréquentes et comment les corriger

  • Confondre robots.txt et pare-feu. Correction : testez toujours le code HTTP réel, pas seulement le fichier.
  • Bloquer un crawler de recherche en croyant bloquer l'entraînement. Correction : vérifiez le rôle exact du bot avant de poser la règle.
  • Oublier le délai d'environ 24 h. Correction : attendez le lendemain avant de conclure que rien n'a changé.
  • Se fier à un checker robots.txt seul. Correction : complétez toujours par un test curl et une lecture des logs.
  • Bloquer par IP. Correction : évitez cette méthode, car elle empêche le robot de lire votre robots.txt. Anthropic le déconseille explicitement.

Et ensuite : mesurer ce que les IA voient vraiment

Une fois l'accès confirmé, vous n'avez fait que la moitié du chemin. L'accès, c'est la première brique. La visibilité, c'est autre chose.

Passez à la mesure : taux de mention, taux de citation, part de voix (SoMV). Et suivez plusieurs modèles, car ils ne s'accordent que dans 43,9 % des cas. Être cité par ChatGPT ne veut pas dire être cité par Gemini ou Claude.

Arbre de décision simple :

  • Accès bloqué → corrigez, puis re-testez.
  • Accès OK mais aucune citation → travaillez le contenu et la mesure.

C'est exactement là que Semly prend le relais. La plateforme analyse la façon dont votre marque apparaît dans les réponses IA, compare avec la concurrence et suit plusieurs modèles (ChatGPT, Gemini, Claude, Google AI, Grok). Commencez par l'audit gratuit Semly pour voir si l'IA peut réellement lire votre site, puis passez au suivi multi-modèles pour mesurer ce qu'elle en dit.

Checklist finale réutilisable

  1. robots.txt : lu, règles IA correctes, pas de fichier physique caché.
  2. Meta / X-Robots-Tag : aucun noindex résiduel.
  3. Réseau : CDN, WAF, plugin sécurité, maintenance vérifiés.
  4. Tests réels : curl par user-agent, logs serveur, Search Console.
  5. Corrections : appliquées, puis re-testées après le délai de prise en compte.

FAQ

Où se trouve le robots.txt sur WordPress ? À l'adresse votresite.com/robots.txt. Il est virtuel par défaut et se modifie via un plugin SEO (Yoast) ou un fichier physique à la racine.

Comment bloquer GPTBot ? Ajoutez User-agent: GPTBot puis Disallow: / dans le robots.txt. Comptez environ 24 h pour la prise en compte.

Qu'est-ce que Google-Extended ? Ce n'est pas un crawler, mais un token robots.txt. Il contrôle l'usage de votre contenu pour l'entraînement Gemini et Vertex AI, sans impact sur votre présence dans Google Search.

Comment tester un user-agent ? Avec curl : curl -A "GPTBot" -I https://votresite.com/. Le code HTTP renvoyé vous dit si l'accès passe ou non.

Sources

Vérifiez si voit votre marque

Saisissez votre site web pour recevoir un rapport gratuit sur votre visibilité IA