5 min read

Lire les logs des crawlers IA : ce que GPTBot demande réellement

Les crawlers IA laissent des motifs très lisibles dans vos logs serveur. Comment segmenter les bots, ce que signifie le schéma de récupération de chacun, et les deux questions à se poser avant de toucher à un outil GEO.

GEOAI CrawlersTechnical SEOLogs
Lire les logs des crawlers IA : ce que GPTBot demande réellement

La plupart des conseils en GEO commencent par le contenu. Nous pensons qu'ils devraient commencer par les logs, car votre serveur conserve déjà le jeu de données le moins cher en matière de visibilité IA : un enregistrement horodaté des pages récupérées par les bots assistants, à quelle fréquence et dans quel ordre. Le lire répond à deux questions qu'aucun tableau de bord ne peut résoudre — est-ce que l'IA de quelqu'un nous lit réellement, et que considère-t-elle comme digne d'être récupérée.

Ceci est le suivi pratique de notre guide sur les crawlers IA. Même distribution ; cette fois, nous examinons ce qu'ils font après la poignée de main.

D'abord : segmentez les bots, sinon les données ne sont que du bruit

L'erreur courante est de traiter le « trafic IA » comme un seul ensemble. Les bots ne se comportent pas du tout de la même manière, et les mélanger produit des moyennes qui ne veulent rien dire.

  • Crawlers d'entraînement — GPTBot, ClaudeBot, anthropic-ai, Google-Extended, CCBot — crawlent de manière régulière et large. Leurs récupérations alimentent les futurs poids des modèles, pas les réponses d'aujourd'hui.
  • Crawlers de recherche — OAI-SearchBot, PerplexityBot — construisent l'index à partir duquel les réponses adossées à la recherche citent. Ce sont ceux dont vous voulez l'attention sur les nouvelles pages cette semaine.
  • Récupérateurs déclenchés par l'utilisateur — ChatGPT-User, Claude-User, Perplexity-User — ne récupèrent une page que lorsqu'une conversation d'un utilisateur spécifique en a besoin. Chaque hit ici est un reçu : une personne réelle a posé une question à votre sujet à l'instant même.

Les commandes

Sur n'importe quel log d'accès (le format nginx/Caddy fonctionne), une première passe :

# All AI crawler hits in the current log, newest last
grep -E "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|anthropic-ai|PerplexityBot|Perplexity-User|Google-Extended" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

Cela vous donne le classement brut des volumes. La coupe intéressante est bot × chemin :

# Which pages each bot fetches
grep "GPTBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

Deux schémas à rechercher. Un crawler d'entraînement qui récupère /robots.txt puis une répartition large et uniforme des pages est en train d'indexer. Un crawler de recherche qui récupère /, votre sitemap, puis un ensemble restreint de pages spécifiques suit la pertinence — et les pages qu'il ignore sont celles qu'il ne considère pas comme citables.

Trois schémas qui méritent un diagnostic

1. Le bot de recherche ne se montre jamais. Si OAI-SearchBot ou PerplexityBot ont zéro hit sur un mois, les causes habituelles sont une liste d'autorisation robots.txt copiée d'un ancien modèle (elle interdit le motif générique sous lequel ils tombent), ou un site qui change rarement — les index de recherche ignorent les sites statiques. La solution est le travail sur robots.txt et llms.txt, plus une cadence de mise à jour visible.

2. Les hits déclenchés par l'utilisateur culminent les jours où vous n'avez rien fait. ChatGPT-User et Perplexity-User ne récupèrent une page que lorsqu'une conversation d'un utilisateur en direct en a besoin. Une rafale sans publication de votre côté signifie généralement que quelqu'un a partagé ou discuté de votre produit — du trafic communautaire que le tableau de bord analytique n'étiquettera pas comme tel. Cela vaut la peine de grep vos référents le même jour.

3. Le crawler d'entraînement récupère vos pages privées. Si GPTBot touche /dashboard ou /settings, votre robots.txt ne dit pas ce que vous croyez — une ligne User-agent mal orthographiée désactive silencieusement tout le groupe. Notre modèle robots.txt garde les chemins privés bloqués tout en laissant ouverts les pages pertinentes pour la citation.

Deux mises en garde honnêtes

Les chaînes User-agent sont des déclarations, pas des identités. N'importe qui peut faire un curl avec User-agent: GPTBot. Pour les besoins du comptage, c'est acceptable ; pour la paranoïa du type « un concurrent a-t-il aspiré tout mon site », vérifiez la propriété comme le documentent les principaux fournisseurs (reverse-DNS pour ceux qui le prennent en charge) avant de tirer des conclusions.

Le volume n'est pas un KPI. Un crawler d'entraînement qui récupère 4 000 pages vous dit que vous faites partie du régime d'un futur modèle. Le chiffre qui paie le loyer est le nombre de récupérations déclenchées par l'utilisateur et par la recherche sur les pages qui convertissent — c'est la partie du pipeline où une récupération aujourd'hui peut devenir un visiteur demain.

Les deux questions

Lancez la segmentation une fois, répondez à ceci, et vous en saurez plus que la plupart des sites qui ont acheté un abonnement GEO :

  1. Les bots adossés à la recherche récupèrent-ils mes nouvelles pages dans les jours suivant leur publication ? Si non, l'index qui alimente les réponses citables ne sait pas que vous existez.
  2. Quelles pages les bots de recherche ne récupèrent-ils jamais ? Ces pages sont invisibles pour les assistants, quelle que soit la qualité de leur contenu.

Les deux solutions sont peu glamour — corrections de robots.txt, liens internes, cadence de mise à jour — ce qui est exactement pourquoi les logs valent la peine d'être lus avant tout le reste.

Vous avez créé quelque chose ?

Lancez-le sur aat.ee et soyez découvert

Listage dofollow permanent dans un annuaire indexé
Cité et recommandé par les assistants IA
Soumettez votre projet