Suivre GPTBot, ClaudeBot et PerplexityBot sur son site

Une part croissante des questions trouve sa réponse sans jamais ouvrir votre site. Savoir qui vous lit, ce qu'il lit et à quelle fréquence est devenu une mesure d'audience à part entière — et aucun traceur de navigateur ne peut la faire.

Mis à jour le 2 septembre 2026

Pourquoi votre outil d'audience ne les voit pas

Un traceur de navigateur mesure ce qui exécute du JavaScript. Les robots des moteurs de réponse n'en exécutent pas : ils demandent le HTML, le lisent, et repartent. Ils sont donc totalement invisibles pour Google Analytics, Matomo, Plausible, Clarity et tous les autres — non par négligence, mais par construction.

Deux sources permettent de les voir, et deux seulement : le journal d'accès de votre serveur, et le téléchargement du script de mesure lui-même, qui est une requête HTTP comme une autre — même quand le script n'est jamais exécuté.

Qui passe, et pour quoi faire

ÉditeurAgentsCe qu'ils font
OpenAIGPTBot, OAI-SearchBot, ChatGPT-UserEntraînement, index de recherche, et récupération à la demande quand quelqu'un pose une question.
AnthropicClaudeBot, Claude-User, Claude-SearchBotMêmes trois usages, distingués par des agents différents.
PerplexityPerplexityBot, Perplexity-UserIndex et récupération à la demande.
GoogleGoogle-Extended, GoogleOtherContrôle l'usage pour les réponses générées, distinct de l'indexation classique.
AutresApplebot-Extended, CCBot, Amazonbot, MistralAI-User, Meta-ExternalAgent…Entraînement ou récupération, selon l'éditeur.

Puppis en reconnaît 35 nommément, avec pour chacun l'éditeur, le rôle et le domaine attendu de ses adresses.

La distinction qui compte

Un robot d'entraînement lit pour nourrir un modèle : son passage ne vous rapporte rien directement. Un robot de récupération lit parce qu'un utilisateur vient de poser une question : son passage est l'équivalent d'une citation, et il précède parfois une visite. Les confondre dans un même compteur rend le chiffre inutilisable.

Le piège : n'importe qui peut se déclarer GPTBot

L'en-tête User-Agent est une chaîne de caractères librement choisie par celui qui fait la requête. Compter les passages sur ce seul critère revient à croire tout le monde sur parole — et les moissonneurs qui ne veulent pas être bloqués empruntent précisément les noms qu'on autorise.

La seule vérification qui tient est le DNS inverse confirmé, en trois temps :

  1. résoudre l'adresse IP en nom d'hôte ;
  2. vérifier que ce nom appartient bien au domaine attendu de l'éditeur ;
  3. résoudre ce nom à nouveau, en direct, et confirmer qu'il redonne l'adresse de départ — sans quoi un enregistrement inverse falsifié suffirait.
Le détail qui fait accuser à tort

La troisième étape doit résoudre les enregistrements A et AAAA, pas seulement A. Un robot légitime qui passe en IPv6 depuis un hôte publiant aussi des adresses IPv4 est déclaré usurpateur par toute implémentation qui s'arrête au premier type d'enregistrement. C'est une erreur courante, et elle produit exactement l'accusation que le contrôle existe pour éviter.

Le faire soi-même, sans aucun outil

Rien n'empêche de commencer à la main. Sur un journal au format combined, un premier décompte tient en une ligne :

grep -Ei 'GPTBot|ClaudeBot|PerplexityBot|Google-Extended' access.log \
  | awk '{print $1}' | sort | uniq -c | sort -rn | head

Ce que cela ne vous donne pas : l'authentification des adresses, la distinction entraînement / récupération, l'évolution dans le temps, ni le rapprochement avec les pages qui les intéressent. C'est exactement ce qui sépare un décompte d'une mesure — et c'est là que l'outillage devient utile.

Trois choses à faire cette semaine, outil ou pas

  1. Décidez explicitement, dans votre robots.txt. Autoriser ou refuser, mais pas par défaut ni par oubli. Les robots d'entraînement et ceux de récupération peuvent être traités différemment — refuser l'entraînement tout en autorisant la citation est une position cohérente.
  2. Publiez un llms.txt. Un fichier à la racine qui résume ce que fait votre site, en texte, sans mise en forme. Il n'est encore lu que par une partie des moteurs, il coûte une heure, et il oriente ce qui sera repris de vous.
  3. Vérifiez que vos pages tiennent sans JavaScript. Un contenu rendu uniquement côté client est un contenu que ces robots ne verront jamais — quelle que soit votre autorisation.

Ce que Puppis en fait

Outil d'audience classiqueJournal serveur brutPuppis
Voit les robots
Authentifie leur identitéDNS inverse confirmé
Sépare entraînement et citation
Sans installer d'agent serveurAu téléchargement du script
Dans les mêmes écrans que l'audience

La détection au téléchargement du script fonctionne sans rien installer sur votre serveur : le robot demande le fichier, la requête est consignée, et cela suffit à savoir qu'il est passé. L'agent de journaux ajoute ce que le script ne peut pas voir — les pages en 404, la bande passante, les robots qui ne demandent jamais le script.

Et pour la question du bandeau, qui se pose dès qu'on mesure quoi que ce soit : les six conditions de la dispense.