5 min read

Lendo logs de crawlers de IA: o que o GPTBot realmente solicita

Rastreadores de IA deixam padrões muito legíveis nos logs do seu servidor. Como segmentar os bots, o que significa o padrão de busca de cada um e as duas perguntas que vale a pena responder antes de mexer em uma ferramenta de GEO.

GEOAI CrawlersTechnical SEOLogs
Lendo logs de crawlers de IA: o que o GPTBot realmente solicita

A maioria dos conselhos sobre GEO começa pelo conteúdo. Nós achamos que deveria começar pelos logs, porque o seu servidor já guarda o conjunto de dados mais barato em visibilidade de IA: um registro com carimbo de data e hora de quais bots de assistentes buscaram quais páginas, com que frequência e em que ordem. Lê-lo responde a duas perguntas que nenhum dashboard consegue — a IA de alguém está realmente a ler-nos, e o que é que eles acham que vale a pena buscar.

Este é o seguimento prático do nosso guia sobre crawlers de IA. O mesmo elenco de personagens; desta vez olhamos para o que eles fazem depois do aperto de mão.

Primeiro: segmentar os bots, ou os dados são ruído

O erro comum é tratar "tráfego de IA" como um único bloco. Os bots não se comportam de forma nada semelhante, e misturá-los produz médias que não significam nada.

  • Crawlers de treino — GPTBot, ClaudeBot, anthropic-ai, Google-Extended, CCBot — rastreiam de forma constante e abrangente. As suas buscas alimentam os pesos dos modelos futuros, não as respostas de hoje.
  • Crawlers de busca — OAI-SearchBot, PerplexityBot — constroem o índice a partir do qual as respostas com suporte de busca citam. Estes são aqueles cuja atenção quer nas páginas novas esta semana.
  • Buscadores acionados pelo utilizador — ChatGPT-User, Claude-User, Perplexity-User — buscam uma página apenas quando a conversa de um utilizador específico precisa dela. Cada acesso aqui é um recibo: uma pessoa real perguntou sobre você neste momento.

Os comandos

Em qualquer log de acesso (o formato nginx/Caddy funciona), uma primeira passagem:

# All AI crawler hits in the current log, newest last
grep -E "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|anthropic-ai|PerplexityBot|Perplexity-User|Google-Extended" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

Isso dá-lhe o ranking de volume bruto. O corte interessante é bot × caminho:

# Which pages each bot fetches
grep "GPTBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

Dois padrões a procurar. Um crawler de treino que busca /robots.txt e depois uma distribuição ampla e uniforme de páginas está a indexar. Um crawler de busca que busca /, o seu sitemap, e depois um conjunto restrito de páginas específicas está a seguir relevância — e as páginas que ignora são aquelas que não considera citáveis.

Três padrões que vale a pena diagnosticar

1. O bot de busca nunca aparece. Se OAI-SearchBot ou PerplexityBot têm zero acessos ao longo de um mês, as causas habituais são uma allowlist de robots.txt copiada de um modelo antigo (que bloqueia o padrão genérico sob o qual eles se enquadram), ou um site que raramente muda — os índices de busca ignoram sites estáticos. A solução é o trabalho de robots.txt e llms.txt, mais uma cadência de atualização visível.

2. Picos de acessos acionados pelo utilizador em dias em que não fez nada. ChatGPT-User e Perplexity-User só buscam quando a conversa de um utilizador em tempo real precisa da página. Uma rajada sem publicação da sua parte normalmente significa que alguém partilhou ou discutiu o seu produto — tráfego de comunidade que o dashboard de analytics não rotulará como tal. Vale a pena fazer grep aos seus referrers no mesmo dia.

3. O crawler de treino busca as suas páginas privadas. Se GPTBot está a acessar /dashboard ou /settings, o seu robots.txt não diz o que você pensa que diz — uma linha User-agent com erro de digitação desativa silenciosamente todo o grupo. O nosso modelo de robots.txt mantém os caminhos privados bloqueados enquanto deixa as páginas relevantes para citação abertas.

Dois avisos honestos

As strings de user-agent são alegações, não identidades. Qualquer pessoa pode fazer curl com User-agent: GPTBot. Para fins de contagem isto é aceitável; para a paranoia de "um concorrente raspou o meu site inteiro", verifique a propriedade da forma como os principais fornecedores documentam (reverse-DNS para os que o suportam) antes de tirar conclusões.

O volume não é um KPI. Um crawler de treino que busca 4.000 páginas diz-lhe que você está na dieta de um modelo futuro. O número que paga a renda é a contagem de buscas acionadas pelo utilizador e de busca nas páginas que convertem — essa é a parte do pipeline onde uma busca hoje pode tornar-se um visitante amanhã.

As duas perguntas

Faça a segmentação uma vez, responda a estas, e saberá mais do que a maioria dos sites que compraram uma subscrição de GEO:

  1. Os bots com suporte de busca estão a buscar as minhas páginas novas dias após a publicação? Se não, o índice que alimenta as respostas citáveis não sabe que você existe.
  2. Quais páginas os bots de busca nunca buscam? Essas páginas são invisíveis para os assistentes, independentemente de quão bom seja o seu conteúdo.

Ambas as soluções são pouco glamorosas — correções de robots.txt, links internos, uma cadência de atualização — o que é exatamente por isso que vale a pena ler os logs antes de qualquer outra coisa.

Criou algo novo?

Lance na aat.ee e seja descoberto

Listagem dofollow permanente em um diretório indexado
Nomeado e citado por assistentes de IA
Envie seu projeto