Sur le site WordPress d’un de nos clients, un courtier en assurance, les robots d’intelligence artificielle sont passés 3 337 fois en 30 jours. Googlebot, 229 fois. Dans Google Analytics, aucun de ces passages n’apparaît : le compteur affiche 0.
Ce n’est pas un bug. Google Analytics compte les visiteurs qui exécutent son script dans un navigateur, et un robot d’IA n’en exécute aucun : il télécharge le texte et repart. Les lecteurs qui nourrissent ChatGPT, Claude, Perplexity ou Meta AI sont donc invisibles dans l’outil que la plupart des sites regardent chaque matin. Voici comment les voir, les compter, et décider lesquels laisser passer.
L’essentiel en 5 points
- 3 337 contre 229. Passages de robots d’IA contre passages de Googlebot sur un même site WordPress, en 30 jours, relevés côté serveur le 22/09/2026.
- 0 dans Google Analytics. Les robots d’IA n’exécutent pas le JavaScript : aucun outil de statistiques côté navigateur ne peut les compter.
- Meta passe en tête (1 202 passages), devant ChatGPT (688) et Perplexity (393). Meta seul passe plus de 5 fois plus que Googlebot.
- « Claude-Web » n’existe pas. Ce nom, présent dans beaucoup de robots.txt, n’apparaît dans aucune documentation d’Anthropic. Le bloquer ne bloque pas Claude.
- Ils se voient dans le journal d’accès de votre hébergeur, ou page par page avec une extension qui les compte côté serveur.
Table of Contents
ToggleQu’est-ce qu’un robot d’IA ?
Un robot d’IA est un programme qui visite les pages web pour le compte d’une entreprise d’intelligence artificielle. Il se présente par un nom, écrit dans chaque requête (le « user-agent ») : GPTBot pour OpenAI, ClaudeBot pour Anthropic, meta-externalagent pour Meta, PerplexityBot pour Perplexity.
Tous n’ont pas le même métier, et c’est ce qui change tout au moment de décider quoi faire d’eux :
- Ceux qui collectent pour entraîner les modèles : GPTBot, ClaudeBot, meta-externalagent, CCBot (Common Crawl), Bytespider (ByteDance).
- Ceux qui lisent votre page pour répondre à une question, parfois au moment même où un utilisateur la pose : OAI-SearchBot et ChatGPT-User, Claude-SearchBot et Claude-User, PerplexityBot et Perplexity-User.
Seuls les seconds peuvent produire une réponse qui vous cite devant un humain. Sur un autre site que nous mesurons, 69 % des passages de robots d’IA relèvent de l’entraînement, 31 % de la réponse.
Combien de robots d’IA passent sur un site WordPress ?
Voici le relevé d’un site réel, un courtier en assurance sous WordPress, sur 30 jours, lu côté serveur.
| Robot | Éditeur | Passages en 30 jours |
|---|---|---|
| Meta AI (meta-externalagent) | Meta | 1 202 |
| ChatGPT (GPTBot, OAI-SearchBot, ChatGPT-User) | OpenAI | 688 |
| Perplexity | Perplexity | 393 |
| Amazon | Amazon | 244 |
| Claude | Anthropic | 212 |
| Tous les robots d’IA | 3 337 | |
| Googlebot, pour comparer | 229 |

(Relevé côté serveur, 1 site, 30 jours, 22/09/2026) Soit 14 fois plus de passages de robots d’IA que de Googlebot. Un seul site n’est pas une moyenne : chez vous le ratio sera différent, et c’est précisément pour ça qu’il faut le mesurer plutôt que le deviner.
Pourquoi Google Analytics ne voit pas les robots d’IA ?
Google Analytics, comme Matomo ou Plausible en mode classique, compte une visite quand un petit script JavaScript se lance dans le navigateur du visiteur. C’est ce script qui envoie « quelqu’un est sur cette page » à l’outil de statistiques.
Un robot d’IA ne fait rien de tout ça. Il demande la page au serveur, reçoit le HTML, en extrait le texte et repart. Aucun navigateur, aucun script exécuté, aucune visite enregistrée. Dans la vidéo, on lance une visite depuis ChatGPT sur le site : elle apparaît côté serveur en quelques secondes, et le temps réel de Google Analytics reste à 0.
Conséquence pratique : la seule trace fiable d’un robot d’IA est côté serveur, dans le journal d’accès de votre hébergeur ou dans un outil qui lit les requêtes avant que la page ne parte.
Comment voir les robots d’IA qui visitent votre site WordPress ?
Trois méthodes, de la plus artisanale à la plus confortable.
1. Le journal d’accès de votre hébergeur
Chaque requête reçue par votre serveur y laisse une ligne, avec la date, la page demandée et le nom du robot.
- Récupérez le fichier
access.log. Sous cPanel (o2switch, LWS, PlanetHoster…) : Métriques, puis Raw Access. Chez OVH mutualisé : Hébergements, puis Statistiques et logs. Sous Plesk (Ionos, Infomaniak…) : Journaux. - Comptez les robots d’IA, sur Mac ou Linux, dans le dossier du fichier :
grep -Eio "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|Meta-ExternalAgent|meta-externalfetcher|Amazonbot|CCBot|Bytespider" access.log | tr 'A-Z' 'a-z' | sort | uniq -c | sort -rn - Comparez avec Google :
grep -ic googlebot access.log.

2. Une extension qui les compte côté serveur
L’extension gratuite Hack The SEO reconnaît les robots d’IA au moment où ils demandent la page et les compte page par page, sans script dans le navigateur, sans compte et sans clé API. C’est l’écran de la capture plus haut. L’intérêt par rapport au journal brut : vous voyez tout de suite quelles pages sont lues, et lesquelles ne le sont jamais.
3. Demander à votre IA
Si votre WordPress est connecté à Claude par MCP (la connexion pas à pas en vidéo), une phrase suffit : « Quelles sont les 10 pages de mon site que les robots d’IA ont le plus lues ces 30 derniers jours ? ». Claude lit les compteurs et vous rend le classement.
À quoi sert de savoir qui lit vos pages ?
À une chose très concrète : une page qu’aucune IA ne lit ne risque pas d’être citée dans ses réponses.
Sur le site mesuré, le classement des pages les plus lues par les robots d’IA donne l’accueil en premier, puis la page de demande de devis. C’est la page qui fait le chiffre d’affaires, et c’est elle que les IA viennent lire. À l’inverse, un article publié le 3 juillet n’a reçu aucun passage en 30 jours. Sur un autre article du même site, on compte 6 passages d’IA contre 18 de robots SEO classiques.
Trois décisions en découlent :
- Commencez par vos pages qui rapportent : vérifiez qu’elles sont lues, et qu’elles répondent clairement aux questions qu’on pose à une IA sur votre métier.
- Repérez les pages jamais lues : maillage interne, sitemap, contenu trop mince. Un robot qui ne trouve pas la page ne peut pas la lire.
- Surveillez les variations : un robot qui disparaît du jour au lendemain signale souvent un blocage, pas un désintérêt.
Faut-il bloquer les robots d’IA dans le robots.txt ?
Bloquer, c’est prendre deux décisions différentes, et beaucoup de sites n’en prennent qu’une sans le savoir.
- Bloquer les robots d’entraînement (GPTBot, ClaudeBot, CCBot…) : vos pages ne servent plus à entraîner les modèles. Vous restez citable.
- Bloquer les robots de réponse (OAI-SearchBot, Claude-SearchBot, PerplexityBot…) : vous disparaissez des réponses de ces IA.
Le piège n°1 : des noms qui n’existent pas
Beaucoup de listes de blocage, dont celle que nous proposions nous-mêmes jusqu’à cette semaine, bloquent Claude-Web et anthropic-ai. La documentation d’Anthropic ne connaît que trois robots : ClaudeBot, Claude-User et Claude-SearchBot. Nous l’avons découvert en préparant la vidéo, et corrigé.

Le piège n°2 : les agents « User » peuvent ignorer votre robots.txt
ChatGPT-User, Perplexity-User ou meta-externalfetcher vont chercher votre page parce qu’un humain a posé une question. OpenAI et Perplexity préviennent que le robots.txt peut ne pas s’appliquer à ces visites déclenchées par un utilisateur.
Le piège n°3 : Google-Extended n’est pas un robot
C’est un jeton. Selon Google, il ne refuse aucune requête et ne vous retire pas des Aperçus IA : il dit seulement que vos pages ne doivent pas servir à entraîner Gemini.
Le bloc à coller : pas d’entraînement, citations autorisées
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Bytespider
User-agent: MistralAI-Training
Disallow: /
Puis ouvrez votresite.fr/robots.txt dans votre navigateur : c’est ce fichier-là que les robots lisent, pas celui qu’affiche votre éditeur. Pour le reste du fichier, voir notre guide robots.txt et sitemap.
Votre hébergeur bloque-t-il déjà ChatGPT ?
Le robots.txt n’est pas le seul portier. Avant lui, il y a le pare-feu de votre hébergeur, et certains refusent les robots d’IA sans prévenir. Nous l’avons constaté sur des sites hébergés chez IONOS, chez PlanetHoster ou derrière Cloudflare. Or Perplexity l’écrit dans sa documentation : pour apparaître dans ses résultats, il faut laisser passer son robot.
Le test prend deux minutes : demander la même page comme un navigateur, puis comme un robot d’IA.
curl -sL -o /dev/null -w "navigateur : %{http_code}\n" -A "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/140.0 Safari/537.36" https://votresite.fr/
curl -sL -o /dev/null -w "GPTBot : %{http_code}\n" -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" https://votresite.fr/
- 200 et 200 : rien ne bloque.
- 200 pour le navigateur, 403, 429 ou 503 pour le robot : ce robot est bloqué. Sur Cloudflare, le blocage des robots d’IA se désactive dans la section Bots ; ailleurs, écrivez au support avec le résultat du test.
- 403 partout : c’est votre adresse IP qui est refusée, refaites le test depuis une autre connexion.

3 337 passages de robots d’IA, 229 de Googlebot, et 0 dans Google Analytics. Les IA lisent votre site bien plus souvent que vous ne le croyez, et aucun tableau de bord classique ne vous le montre.
Les limites de cette mesure
- Un seul site. Les chiffres du tableau viennent d’un site de courtage en assurance, sur 30 jours au 22/09/2026. Ce n’est pas une moyenne du web.
- Un passage n’est pas une citation. Un robot qui lit votre page ne prouve pas qu’une IA vous recommande. Mais un robot qui ne passe jamais ne risque pas de le faire.
- La répartition 69 % / 31 % vient d’un autre site mesuré, pas du site du tableau.
Questions fréquentes
Comment savoir si ChatGPT visite mon site WordPress ?
Cherchez GPTBot, OAI-SearchBot et ChatGPT-User dans le journal d’accès de votre hébergeur, ou utilisez une extension qui compte les robots d’IA côté serveur. Google Analytics ne les montrera jamais : ces robots n’exécutent pas son script.
Pourquoi Google Analytics n’affiche-t-il pas les robots d’IA ?
Parce qu’il compte une visite quand un script JavaScript s’exécute dans un navigateur. Les robots d’IA téléchargent le HTML sans exécuter de script : ils ne laissent aucune trace dans les statistiques côté navigateur.
Faut-il bloquer GPTBot ?
Bloquer GPTBot empêche OpenAI d’utiliser vos pages pour entraîner ses modèles. Cela ne vous retire pas de la recherche de ChatGPT, qui passe par OAI-SearchBot. Si vous voulez rester cité, ne bloquez pas OAI-SearchBot.
Claude-Web existe-t-il encore ?
Non. La documentation d’Anthropic ne mentionne que ClaudeBot, Claude-User et Claude-SearchBot. Bloquer Claude-Web ou anthropic-ai dans votre robots.txt ne bloque pas Claude.
Bloquer Google-Extended me retire-t-il des Aperçus IA de Google ?
Non. Google-Extended est un jeton qui refuse seulement l’utilisation de vos pages pour entraîner Gemini. Il ne bloque aucune requête et n’a pas d’effet sur votre présence dans la recherche ni dans les Aperçus IA.
Mon site est-il bloqué pour les IA sans que je le sache ?
C’est possible : certains hébergeurs et pare-feu refusent les robots d’IA par défaut. Le test curl de cet article le vérifie en deux minutes : 200 pour le navigateur et 403 pour GPTBot signifie que le robot est bloqué.
À lire aussi
- Robots.txt et sitemap : optimiser l’exploration pour un meilleur SEO
- GEO vs SEO : 6 175 mots-clés mesurés avant et après l’arrivée des Aperçus IA en France
- Générateur llms.txt
- 150 statistiques SEO et GEO 2026
- Glossaire : robots.txt
Voyez les robots d’IA de votre site, page par page. L’extension Hack The SEO est gratuite, sans compte ni clé API : télécharger l’extension. Vous préférez qu’on regarde votre site ensemble ? Réservez 20 minutes avec Eric.
Notre mesure
- Hack The SEO, relevé côté serveur des passages de robots sur un site WordPress de courtage en assurance, 30 jours au 22/09/2026 (écran Activité des robots de l’extension gratuite).
- Hack The SEO, répartition entraînement / réponse des passages de robots d’IA sur un autre site mesuré.
- Test curl sur un site réel, 22/09/2026.
Documentation des éditeurs
- Anthropic, « Does Anthropic crawl data from the web, and how can site owners block the crawler? », relu le 22/09/2026
- OpenAI, Overview of OpenAI Crawlers
- Perplexity, Perplexity Crawlers
- Google Search Central, robots d’exploration courants de Google (dont Google-Extended)
- Meta, robots d’exploration web de Meta
Eric Ibanez, fondateur de Hack The SEO. Quinze ans de référencement, et les journaux serveur de nos sites ouverts tous les jours pour voir passer GPTBot, ClaudeBot et PerplexityBot. Chiffres relevés le 22/09/2026.
Eric Ibanez
Co-fondateur de Hack The SEO
Eric Ibanez a créé Hack The SEO et accompagne des stratégies SEO orientées croissance. Il est aussi co-auteur du livre SEO pour booster sa croissance, publié chez Dunod.
Suggested Articles



