2026년 창업자를 위한 AI 크롤러 가이드: robots.txt, llms.txt, 그리고 인용되기
AI 크롤러가 실제로 여러분의 사이트에 도달하는 방식, robots.txt와 llms.txt에 들어가야 할 내용, 그리고 어시스턴트가 여러분을 인용할 수 있는지를 결정하는 온페이지 신호들.

AI 크롤러가 실제로 여러분의 사이트에 도달하는 방식, robots.txt와 llms.txt에 들어가야 할 내용, 그리고 어시스턴트가 여러분을 인용할 수 있는지를 결정하는 온페이지 신호들.

Boost your product's visibility and credibility
AI 어시스턴트가 인용하게 만드는 것은 콘텐츠 문제이기 전에 크롤러 문제입니다: 봇이 페이지를 가져와 파싱할 수 없다면, 아무리 좋은 글을 써도 답변에 나타나지 않습니다. 좋은 소식은 기술적인 부분이 작다는 것입니다 — 몇 가지 robots.txt 규칙, 선택적으로 llms.txt, 그리고 콘텐츠를 손쉽게 인용 가능하게 만드는 페이지 수준의 신호들입니다. 이 가이드는 바로 그것을, 실행해야 할 순서대로 다룹니다.
이 글은 aat.ee에서 이러한 파일들을 실제 프로덕션 환경에서 운영한 경험을 바탕으로 작성되었으며, 이 사이트를 지원하는 AI 크롤러 규칙과 llms.txt도 포함합니다.
두 가지 경로가 있으며, 둘 다 최적화해야 합니다:
실시간 검색은 이번 주에 영향을 미칠 수 있는 경로입니다. 여기서부터 시작하세요.
첫 번째 실패는 조용한 과잉 차단입니다. 많은 사이트가 "알 수 없는 봇"을 차단하거나 AI 사용자 에이전트를 차단하는 robots.txt를 복사해 놓고, 왜 자신들이 한 번도 언급되지 않는지 의아해합니다. 의도적으로 결정하세요.
핵심적인 구분: 학습 크롤러와 실시간 가져오기 에이전트는 별개의 사용자 에이전트이며, 하나를 차단해도 다른 하나는 차단되지 않습니다.
| 사용자 에이전트 | 하는 일 | 차단하면 |
|---|---|---|
GPTBot | OpenAI 학습 크롤러 | 향후 학습 데이터에서 제외됨 |
ChatGPT-User | 사용자 프롬프트에 페이지가 필요할 때 실시간 가져오기 | 브라우징하는 답변에서 ChatGPT가 페이지를 읽을 수 없음 |
ClaudeBot | Anthropic 크롤링 | 학습 및 검색 범위 축소 |
Claude-User | Claude 사용자가 트리거한 실시간 가져오기 | Claude가 요청 시 페이지를 읽을 수 없음 |
PerplexityBot | Perplexity의 크롤러 | Perplexity의 출처 표시 답변에서 제외됨 |
Google-Extended | Google이 크롤링한 콘텐츠의 Gemini/Vertex 학습 사용을 제어 | Google 검색은 여전히 작동하지만 Gemini 학습 사용은 비활성화됨 |
CCBot | Common Crawl, 많은 모델이 학습하는 코퍼스 | 널리 사용되는 오픈 코퍼스에서 제외됨 |
추천받는 것이 목표라면, 두 부류 모두 허용이 기본값이어야 합니다. 학습은 거부하면서 실시간 답변에서는 인용 가능하게 남고 싶은 특별한 이유가 있다면, 학습 에이전트(GPTBot, ClaudeBot, CCBot, Google-Extended)를 차단하고 실시간 가져오기 에이전트(ChatGPT-User, Claude-User, PerplexityBot)를 명시적으로 허용하세요. 그것은 일관된 입장입니다 — 다만 의도적으로 선택하세요.
반드시 차단해야 하는 경로(비공개 앱 영역, 관리자, 내부 도구)를 차단하고 나머지는 모두 크롤링되게 하세요. 다른 모든 이에게 적용하는 것과 동일한 비공개 경로 목록을 AI 에이전트에게도 유지하고, 사이트맵을 선언하세요:
User-agent: *
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Disallow: /settings/
Sitemap: https://example.com/sitemap.xml
User-agent: GPTBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Crawl-delay: 10
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Crawl-delay: 10
User-agent: PerplexityBot
Allow: /
Disallow: /api/
Disallow: /admin/
Crawl-delay: 10
실제 디버깅 시간을 절약해 주는 두 가지 참고 사항:
https://yoursite.com/robots.txt를 가져와 렌더링된 출력을 확인하세요 — 대부분의 프레임워크는 코드에서 이를 생성하며, 그 코드의 버그는 직접 확인하기 전까지 보이지 않습니다.Crawl-delay는 요청이지 보장이 아닙니다. 그래도 정중한 값을 설정할 가치는 있습니다: 작은 사이트에 대한 공격적인 크롤링은 호스트로부터 속도 제한이나 차단을 받게 되는 원인입니다.URL 패턴을 차단하는 규칙이 있는데 그 이유가 확실하지 않다면, 그대로 두기 전에 AI 에이전트를 차단하고 있는지 확인하세요. 물려받은 robots.txt 규칙은 "Google에는 색인되지만 ChatGPT가 절대 언급하지 않는" 가장 흔한 원인 중 하나입니다.
llms.txt는 제안된 관례일 뿐 표준이 아닙니다: /llms.txt에 위치한 Markdown 파일로, 모델에게 사이트의 큐레이션된 지도를 제공합니다 — 무엇인지, 가장 중요한 페이지는 무엇인지, 무엇을 크롤링하고 재사용해도 되는지. 특정 어시스턴트가 이를 읽는다는 보장은 없으며, 크롤링 가능한 페이지를 대체할 것이라고 기대해서는 안 됩니다.
그래도 게시할 가치는 있습니다. 두 가지 이유 때문입니다: 약 한 시간이면 되고, 콘텐츠를 어떻게 귀속시키기를 원하는지를 평범한 언어로 명시할 수 있는 유일한 곳이기 때문입니다. 이는 이를 읽기로 선택하는 모든 시스템에 유용하며, 크롤링 정책에 대한 명확한 공개 선언입니다.
유용한 llms.txt는 다섯 부분으로 구성됩니다:
# llms.txt - AI/LLM Crawling Instructions for example.com
# About
> example.com is a [one-line description of what the site is and who it is for].
# Key pages
- [Product directory](https://example.com/categories)
- [Pricing](https://example.com/pricing)
- [Blog](https://example.com/blog)
- [Latest launches](https://example.com/trending)
# Crawling permissions
## Allowed
- Homepage, product pages, blog articles, categories, legal pages
## Restricted
- API endpoints, dashboard, settings, admin areas
# Usage policy
- AI training: with attribution
- Indexing and retrieval: allowed
- Attribution: cite "according to example.com"
# Contact
- Website: https://example.com
- Sitemap: https://example.com/sitemap.xml
실제 라우트에 맞게 조정하세요. 가장 흔한 실수는 자신이 가지고 있지 않은 사이트를 설명하는 템플릿을 게시하는 것입니다 — 오래된 경로는 파일이 없는 것보다 나쁩니다.
이 관례는 마치 켜면 되는 스위치처럼 느껴져서 유혹적입니다. 그렇지 않습니다. 실시간으로 페이지를 검색하는 모델은 당신의 _매니페스트_가 아니라 _페이지_를 읽습니다. 귀속 명확성을 위해 llms.txt를 게시한 다음, 페이지 수준의 작업을 하러 가세요.
여기서 실제로 인용이 이루어집니다. 검색 시스템은 자기 완결적인 진술을 추출하므로, 페이지를 그에 맞게 구조화하세요.
크롤링 가능성은 고려 대상이 되게 하고, 신뢰성은 인용되게 합니다. 입력 요소들은 화려하지 않지만 복리로 쌓입니다:
/robots.txt를 실제로 가져와 크롤러가 읽는 방식으로 읽기/sitemap.xml이 존재하고, 유효하며, 실제 페이지를 나열하는지 검증/llms.txt 게시 또는 업데이트한 번 해두면, 이후의 작업은 최신성 유지뿐입니다.
AI 어시스턴트에게 인용되려면 llms.txt가 필요한가요?
아니요. 이는 읽힘이 보장되지 않는 선택적 관례입니다. 실제로 인용되게 하는 것은 크롤링 가능한 페이지와 추출 가능한 콘텐츠입니다; llms.txt는 귀속 명확성을 위한 저비용 보너스로 취급하세요.
GPTBot이나 ClaudeBot을 차단해야 하나요? 콘텐츠가 학습에 사용되는 것을 의도적으로 원하지 않는 경우에만 차단하세요. 학습 크롤러를 차단하면 모델이 당신의 카테고리 연관성을 학습하는 빈도가 줄어듭니다; 일반적으로 답변에서 실시간 가져오기 에이전트가 페이지를 읽는 것을 막지는 않습니다. 추천받는 것이 목표라면 둘 다 허용하는 것이 실용적인 기본값입니다.
ClaudeBot과 Claude-User의 차이는 무엇인가요?
ClaudeBot은 Anthropic의 크롤러로, 학습 데이터를 구축하고 갱신하는 데 사용됩니다. Claude-User는 지금 누군가 Claude에게 물어봤기 때문에 페이지를 가져오는 에이전트입니다. 두 번째를 차단하면 학습은 영향받지 않은 채 실시간 답변에서 제외됩니다.
Google-Extended가 검색 순위에 영향을 미치나요?
아니요. Google-Extended는 Google이 크롤링한 콘텐츠가 Gemini 및 Vertex AI 학습에 사용될 수 있는지를 제어합니다. Google 검색 색인 및 순위는 일반 Googlebot 규칙에 의해 관리됩니다.
결과를 보기까지 얼마나 걸리나요? 실시간 검색은 새롭고 색인되며 잘 구조화된 페이지를 며칠 내에 반영할 수 있습니다. 학습 데이터 연관성은 웹 전반에 걸쳐 신뢰할 수 있는 언급이 축적되면서 수개월에 걸쳐 구축됩니다. 이 비대칭성이 바로 지금 기술적인 작업을 해야 하는 이유입니다.
사이트를 인용하기 쉽게 만드세요: 크롤러와 어시스턴트가 실제로 읽을 수 있는 영구적인 dofollow 목록을 위해 aat.ee에 제품을 등록하거나, 디렉터리 및 GEO 요금제를 비교하세요.