3 min read

AI 크롤러 로그 읽기: GPTBot이 실제로 요청하는 것

AI 크롤러는 서버 로그에 아주 읽기 쉬운 패턴을 남깁니다. 봇을 어떻게 구분하고, 각 봇의 fetch 패턴이 무엇을 의미하며, GEO 도구를 건드리기 전에 답할 가치가 있는 두 가지 질문

GEOAI CrawlersTechnical SEOLogs
AI 크롤러 로그 읽기: GPTBot이 실제로 요청하는 것

대부분의 GEO 조언은 콘텐츠에서 시작합니다. 우리는 로그에서 시작해야 한다고 생각합니다. 왜냐하면 여러분의 서버는 이미 AI 가시성에 관한 가장 저렴한 데이터셋, 즉 어떤 어시스턴트 봇이 어떤 페이지를, 얼마나 자주, 어떤 순서로 가져갔는지에 대한 타임스탬프 기록을 보관하고 있기 때문입니다. 이를 읽으면 어떤 대시보드도 답할 수 없는 두 가지 질문에 답할 수 있습니다 — 누군가의 AI가 실제로 우리를 읽고 있는가, 그리고 그들이 무엇을 가져갈 가치가 있다고 생각하는가.

이 글은 우리의 AI 크롤러 가이드의 실전 후속편입니다. 등장인물은 같고, 이번에는 그들이 핸드셰이크 이후에 무엇을 하는지 살펴봅니다.

먼저: 봇을 분류하세요, 그렇지 않으면 데이터는 노이즈입니다

흔한 실수는 "AI 트래픽"을 하나의 범주로 취급하는 것입니다. 봇들은 전혀 비슷하게 행동하지 않으며, 이들을 섞으면 아무 의미 없는 평균이 나옵니다.

  • 학습 크롤러 — GPTBot, ClaudeBot, anthropic-ai, Google-Extended, CCBot — 꾸준하고 광범위하게 크롤링합니다. 이들의 가져오기는 오늘의 답변이 아니라 미래 모델 가중치를 먹여 살립니다.
  • 검색 크롤러 — OAI-SearchBot, PerplexityBot — 검색 기반 답변이 인용하는 인덱스를 구축합니다. 이번 주에 새 페이지에 주목을 받고 싶다면 바로 이들입니다.
  • 사용자 트리거 가져오기 — ChatGPT-User, Claude-User, Perplexity-User — 특정 사용자의 대화가 필요로 할 때만 페이지를 가져옵니다. 여기서의 모든 히트는 영수증입니다: 실제 사람이 바로 지금 여러분에 대해 물어본 것입니다.

명령어

어떤 액세스 로그든(nginx/Caddy 형식이면 작동합니다), 첫 번째 패스:

# All AI crawler hits in the current log, newest last
grep -E "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|anthropic-ai|PerplexityBot|Perplexity-User|Google-Extended" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

이것이 원시 볼륨 순위를 제공합니다. 흥미로운 부분은 봇 × 경로입니다:

# Which pages each bot fetches
grep "GPTBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

찾아야 할 두 가지 패턴이 있습니다. /robots.txt를 가져온 다음 광범위하고 고르게 페이지를 퍼뜨리는 학습 크롤러는 인덱싱 중입니다. /, 사이트맵, 그다음 _좁은 특정 페이지 집합_을 가져오는 검색 크롤러는 관련성을 따라가는 중이며 — 무시하는 페이지가 바로 인용 가능하다고 여기지 않는 페이지입니다.

진단할 가치가 있는 세 가지 패턴

1. 검색 봇이 전혀 나타나지 않는다. OAI-SearchBot이나 PerplexityBot이 한 달 동안 히트가 0이라면, 흔한 원인은 오래된 템플릿에서 복사한 robots.txt 허용 목록(이들이 속하는 일반 패턴을 차단함)이거나, 거의 변하지 않는 사이트입니다 — 검색 인덱스는 정적 사이트를 건너뜁니다. 해결책은 robots.txt와 llms.txt 작업과 눈에 띄는 업데이트 주기입니다.

2. 아무것도 하지 않은 날에 사용자 트리거 히트가 급증한다. ChatGPT-User와 Perplexity-User는 실제 사용자의 대화가 그 페이지를 필요로 할 때만 가져옵니다. 여러분 쪽에서 발행한 것이 없는데 폭증한다는 것은 보통 누군가 여러분의 제품을 공유하거나 논의했다는 뜻입니다 — 분석 대시보드가 그렇게 표시하지 않을 커뮤니티 트래픽입니다. 같은 날 리퍼러를 grep해 볼 가치가 있습니다.

3. 학습 크롤러가 비공개 페이지를 가져온다. GPTBot이 /dashboard나 /settings를 치고 있다면, 여러분의 robots.txt는 여러분이 생각하는 것을 말하고 있지 않은 것입니다 — 오타 난 User-agent 줄은 전체 그룹을 조용히 비활성화합니다. 우리의 robots.txt 템플릿은 인용 관련 페이지는 열어 두면서 비공개 경로를 차단합니다.

두 가지 솔직한 주의사항

User-agent 문자열은 주장이지 신원이 아닙니다. 누구나 User-agent: GPTBot으로 curl할 수 있습니다. 집계 목적에는 이 정도면 충분하지만, "경쟁자가 내 사이트 전체를 스크랩했나" 하는 편집증에는 결론을 내리기 전에 주요 제공업체들이 문서화한 방식(지원하는 곳은 역방향 DNS)으로 소유권을 확인하세요.

볼륨은 KPI가 아닙니다. 학습 크롤러가 4,000페이지를 가져오는 것은 여러분이 미래 모델의 식단에 들어 있다는 것을 알려줍니다. 돈을 버는 숫자는 전환되는 페이지에 대한 사용자 트리거 및 검색 가져오기 횟수입니다 — 그것이 오늘의 가져오기가 내일의 방문자가 될 수 있는 파이프라인의 부분입니다.

두 가지 질문

분류를 한 번 실행하고, 이 질문들에 답하면, GEO 구독을 산 대부분의 사이트보다 더 많이 알게 될 것입니다:

  1. 검색 기반 봇들이 발행 후 며칠 안에 내 새 페이지를 가져오는가? 그렇지 않다면, 인용 가능한 답변을 공급하는 인덱스는 여러분이 존재한다는 것을 모릅니다.
  2. 검색 봇들이 절대 가져오지 않는 페이지는 어디인가? 그 페이지들은 콘텐츠가 아무리 좋아도 어시스턴트에게는 보이지 않습니다.

두 해결책 모두 매력적이지 않습니다 — robots.txt 수정, 내부 링크, 업데이트 주기 — 바로 그래서 로그를 무엇보다 먼저 읽을 가치가 있습니다.

새 제품을 만드셨나요?

aat.ee에서 론칭하고 발견되세요

색인된 디렉터리에 영구 dofollow 등록
AI 어시스턴트에게 언급되고 인용되기
프로젝트 제출하기