Suivre GPTBot, ClaudeBot et PerplexityBot sur son site
Une part croissante des questions trouve sa réponse sans jamais ouvrir votre site. Savoir qui vous lit, ce qu'il lit et à quelle fréquence est devenu une mesure d'audience à part entière — et aucun traceur de navigateur ne peut la faire.
Mis à jour le 2 septembre 2026
Pourquoi votre outil d'audience ne les voit pas
Un traceur de navigateur mesure ce qui exécute du JavaScript. Les robots des moteurs de réponse n'en exécutent pas : ils demandent le HTML, le lisent, et repartent. Ils sont donc totalement invisibles pour Google Analytics, Matomo, Plausible, Clarity et tous les autres — non par négligence, mais par construction.
Deux sources permettent de les voir, et deux seulement : le journal d'accès de votre serveur, et le téléchargement du script de mesure lui-même, qui est une requête HTTP comme une autre — même quand le script n'est jamais exécuté.
Qui passe, et pour quoi faire
| Éditeur | Agents | Ce qu'ils font |
|---|---|---|
| OpenAI | GPTBot, OAI-SearchBot, ChatGPT-User | Entraînement, index de recherche, et récupération à la demande quand quelqu'un pose une question. |
| Anthropic | ClaudeBot, Claude-User, Claude-SearchBot | Mêmes trois usages, distingués par des agents différents. |
| Perplexity | PerplexityBot, Perplexity-User | Index et récupération à la demande. |
Google-Extended, GoogleOther | Contrôle l'usage pour les réponses générées, distinct de l'indexation classique. | |
| Autres | Applebot-Extended, CCBot, Amazonbot, MistralAI-User, Meta-ExternalAgent… | Entraînement ou récupération, selon l'éditeur. |
Puppis en reconnaît 35 nommément, avec pour chacun l'éditeur, le rôle et le domaine attendu de ses adresses.
Un robot d'entraînement lit pour nourrir un modèle : son passage ne vous rapporte rien directement. Un robot de récupération lit parce qu'un utilisateur vient de poser une question : son passage est l'équivalent d'une citation, et il précède parfois une visite. Les confondre dans un même compteur rend le chiffre inutilisable.
Le piège : n'importe qui peut se déclarer GPTBot
L'en-tête User-Agent est une chaîne de caractères librement choisie par celui qui fait la requête. Compter les passages sur ce seul critère revient à croire tout le monde sur parole — et les moissonneurs qui ne veulent pas être bloqués empruntent précisément les noms qu'on autorise.
La seule vérification qui tient est le DNS inverse confirmé, en trois temps :
- résoudre l'adresse IP en nom d'hôte ;
- vérifier que ce nom appartient bien au domaine attendu de l'éditeur ;
- résoudre ce nom à nouveau, en direct, et confirmer qu'il redonne l'adresse de départ — sans quoi un enregistrement inverse falsifié suffirait.
La troisième étape doit résoudre les enregistrements A et AAAA, pas seulement A. Un robot légitime qui passe en IPv6 depuis un hôte publiant aussi des adresses IPv4 est déclaré usurpateur par toute implémentation qui s'arrête au premier type d'enregistrement. C'est une erreur courante, et elle produit exactement l'accusation que le contrôle existe pour éviter.
Le faire soi-même, sans aucun outil
Rien n'empêche de commencer à la main. Sur un journal au format combined, un premier décompte tient en une ligne :
grep -Ei 'GPTBot|ClaudeBot|PerplexityBot|Google-Extended' access.log \
| awk '{print $1}' | sort | uniq -c | sort -rn | headCe que cela ne vous donne pas : l'authentification des adresses, la distinction entraînement / récupération, l'évolution dans le temps, ni le rapprochement avec les pages qui les intéressent. C'est exactement ce qui sépare un décompte d'une mesure — et c'est là que l'outillage devient utile.
Trois choses à faire cette semaine, outil ou pas
- Décidez explicitement, dans votre
robots.txt. Autoriser ou refuser, mais pas par défaut ni par oubli. Les robots d'entraînement et ceux de récupération peuvent être traités différemment — refuser l'entraînement tout en autorisant la citation est une position cohérente. - Publiez un
llms.txt. Un fichier à la racine qui résume ce que fait votre site, en texte, sans mise en forme. Il n'est encore lu que par une partie des moteurs, il coûte une heure, et il oriente ce qui sera repris de vous. - Vérifiez que vos pages tiennent sans JavaScript. Un contenu rendu uniquement côté client est un contenu que ces robots ne verront jamais — quelle que soit votre autorisation.
Ce que Puppis en fait
| Outil d'audience classique | Journal serveur brut | Puppis | |
|---|---|---|---|
| Voit les robots | |||
| Authentifie leur identité | DNS inverse confirmé | ||
| Sépare entraînement et citation | |||
| Sans installer d'agent serveur | Au téléchargement du script | ||
| Dans les mêmes écrans que l'audience |
La détection au téléchargement du script fonctionne sans rien installer sur votre serveur : le robot demande le fichier, la requête est consignée, et cela suffit à savoir qu'il est passé. L'agent de journaux ajoute ce que le script ne peut pas voir — les pages en 404, la bande passante, les robots qui ne demandent jamais le script.
Et pour la question du bandeau, qui se pose dès qu'on mesure quoi que ce soit : les six conditions de la dispense.