Lendo logs de crawlers de IA: o que o GPTBot realmente solicita
Rastreadores de IA deixam padrões muito legíveis nos logs do seu servidor. Como segmentar os bots, o que significa o padrão de busca de cada um e as duas perguntas que vale a pena responder antes de mexer em uma ferramenta de GEO.

A maioria dos conselhos sobre GEO começa pelo conteúdo. Nós achamos que deveria começar pelos logs, porque o seu servidor já guarda o conjunto de dados mais barato em visibilidade de IA: um registro com carimbo de data e hora de quais bots de assistentes buscaram quais páginas, com que frequência e em que ordem. Lê-lo responde a duas perguntas que nenhum dashboard consegue — a IA de alguém está realmente a ler-nos, e o que é que eles acham que vale a pena buscar.
Este é o seguimento prático do nosso guia sobre crawlers de IA. O mesmo elenco de personagens; desta vez olhamos para o que eles fazem depois do aperto de mão.
Primeiro: segmentar os bots, ou os dados são ruído
O erro comum é tratar "tráfego de IA" como um único bloco. Os bots não se comportam de forma nada semelhante, e misturá-los produz médias que não significam nada.
- Crawlers de treino —
GPTBot,ClaudeBot,anthropic-ai,Google-Extended,CCBot— rastreiam de forma constante e abrangente. As suas buscas alimentam os pesos dos modelos futuros, não as respostas de hoje. - Crawlers de busca —
OAI-SearchBot,PerplexityBot— constroem o índice a partir do qual as respostas com suporte de busca citam. Estes são aqueles cuja atenção quer nas páginas novas esta semana. - Buscadores acionados pelo utilizador —
ChatGPT-User,Claude-User,Perplexity-User— buscam uma página apenas quando a conversa de um utilizador específico precisa dela. Cada acesso aqui é um recibo: uma pessoa real perguntou sobre você neste momento.
Os comandos
Em qualquer log de acesso (o formato nginx/Caddy funciona), uma primeira passagem:
# All AI crawler hits in the current log, newest last
grep -E "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|anthropic-ai|PerplexityBot|Perplexity-User|Google-Extended" access.log \
| awk '{print $NF}' | sort | uniq -c | sort -rn# All AI crawler hits in the current log, newest last
grep -E "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|anthropic-ai|PerplexityBot|Perplexity-User|Google-Extended" access.log \
| awk '{print $NF}' | sort | uniq -c | sort -rnIsso dá-lhe o ranking de volume bruto. O corte interessante é bot × caminho:
# Which pages each bot fetches
grep "GPTBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20# Which pages each bot fetches
grep "GPTBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20Dois padrões a procurar. Um crawler de treino que busca /robots.txt e depois uma distribuição ampla e uniforme de páginas está a indexar. Um crawler de busca que busca /, o seu sitemap, e depois um conjunto restrito de páginas específicas está a seguir relevância — e as páginas que ignora são aquelas que não considera citáveis.
Três padrões que vale a pena diagnosticar
1. O bot de busca nunca aparece. Se OAI-SearchBot ou PerplexityBot têm zero acessos ao longo de um mês, as causas habituais são uma allowlist de robots.txt copiada de um modelo antigo (que bloqueia o padrão genérico sob o qual eles se enquadram), ou um site que raramente muda — os índices de busca ignoram sites estáticos. A solução é o trabalho de robots.txt e llms.txt, mais uma cadência de atualização visível.
2. Picos de acessos acionados pelo utilizador em dias em que não fez nada. ChatGPT-User e Perplexity-User só buscam quando a conversa de um utilizador em tempo real precisa da página. Uma rajada sem publicação da sua parte normalmente significa que alguém partilhou ou discutiu o seu produto — tráfego de comunidade que o dashboard de analytics não rotulará como tal. Vale a pena fazer grep aos seus referrers no mesmo dia.
3. O crawler de treino busca as suas páginas privadas. Se GPTBot está a acessar /dashboard ou /settings, o seu robots.txt não diz o que você pensa que diz — uma linha User-agent com erro de digitação desativa silenciosamente todo o grupo. O nosso modelo de robots.txt mantém os caminhos privados bloqueados enquanto deixa as páginas relevantes para citação abertas.
Dois avisos honestos
As strings de user-agent são alegações, não identidades. Qualquer pessoa pode fazer curl com User-agent: GPTBot. Para fins de contagem isto é aceitável; para a paranoia de "um concorrente raspou o meu site inteiro", verifique a propriedade da forma como os principais fornecedores documentam (reverse-DNS para os que o suportam) antes de tirar conclusões.
O volume não é um KPI. Um crawler de treino que busca 4.000 páginas diz-lhe que você está na dieta de um modelo futuro. O número que paga a renda é a contagem de buscas acionadas pelo utilizador e de busca nas páginas que convertem — essa é a parte do pipeline onde uma busca hoje pode tornar-se um visitante amanhã.
As duas perguntas
Faça a segmentação uma vez, responda a estas, e saberá mais do que a maioria dos sites que compraram uma subscrição de GEO:
- Os bots com suporte de busca estão a buscar as minhas páginas novas dias após a publicação? Se não, o índice que alimenta as respostas citáveis não sabe que você existe.
- Quais páginas os bots de busca nunca buscam? Essas páginas são invisíveis para os assistentes, independentemente de quão bom seja o seu conteúdo.
Ambas as soluções são pouco glamorosas — correções de robots.txt, links internos, uma cadência de atualização — o que é exatamente por isso que vale a pena ler os logs antes de qualquer outra coisa.