핵심 요약
- AI 크롤러는 회사마다 학습용 봇과 검색·인용용 봇이 분리되어 있어, robots.txt에서도 따로 설정해야 한다.
- 주요 AI 크롤러를 최소 한 개라도 차단해두면, 해당 엔진에서의 AI 인용 기회를 최대 18~34% 잃을 수 있다는 조사 결과가 있다.
- 아래 코드를 사이트 루트의 robots.txt에 그대로 추가하면 된다.
robots.txt는 AI 검색 노출의 가장 기초가 되는 파일이다. 크롤러가 접근조차 못 하면 이후 콘텐츠 구조나 문장 품질은 아무 의미가 없다.
AI 크롤러는 왜 회사마다 여러 개로 나뉘어 있나
대부분의 AI 기업은 하나의 봇이 아니라 역할이 다른 여러 크롤러를 운영한다. 학습용 봇을 막아도 검색·인용용 봇은 여전히 활동할 수 있고, 반대의 경우도 있다. 이 둘을 하나로 착각하고 설정하면 의도와 다른 결과가 나온다.
| 회사 | 학습용 크롤러 | 검색·인용용 크롤러 |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot |
| Anthropic | ClaudeBot | Claude-SearchBot |
| Perplexity | — (별도 학습 봇 없음) | PerplexityBot |
| Google-Extended | (Google 자체 검색 크롤러에 포함) |
복사해서 쓰는 robots.txt 코드
아래 코드를 사이트 루트의 robots.txt에 추가하면 주요 AI 크롤러의 학습·검색 접근을 모두 허용한다. 민감한 경로(관리자 페이지 등)는 별도로 차단 규칙을 유지한 채 추가하면 된다.
# OpenAI
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
# Anthropic
User-agent: ClaudeBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
# Perplexity
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
# Google (AI 학습용, 일반 Googlebot과 별개)
User-agent: Google-Extended
Allow: /
# Common Crawl (여러 LLM의 학습 데이터로 사용됨)
User-agent: CCBot
Allow: /
# Apple
User-agent: Applebot-Extended
Allow: /
# Amazon
User-agent: Amazonbot
Allow: /
Sitemap: https://example.com/sitemap.xml
example.com 부분은 실제 도메인과 사이트맵 경로로 바꿔야 한다.
User-agent별 역할 확인표
| User-agent | 소속 | 차단 시 영향 |
|---|---|---|
| GPTBot | OpenAI | 모델 학습 데이터 미반영 (검색 노출과는 무관) |
| OAI-SearchBot | OpenAI | ChatGPT 검색 답변에 노출되지 않음 |
| ChatGPT-User | OpenAI | 사용자가 요청한 페이지를 ChatGPT가 열람하지 못함 |
| ClaudeBot | Anthropic | 모델 학습 데이터 미반영 |
| Claude-SearchBot | Anthropic | Claude 검색·인용 기능에 노출되지 않음 |
| Claude-User | Anthropic | 사용자가 요청한 페이지를 Claude가 열람하지 못함 |
| PerplexityBot | Perplexity | Perplexity 답변에 인용되지 않음 |
| Google-Extended | Gemini 등 AI 학습에 미반영 (일반 구글 검색 노출과는 무관) | |
| CCBot | Common Crawl | 다수 LLM의 학습 데이터셋에서 제외됨 |
robots.txt를 적용하는 절차
- 워드프레스 사이트 루트에 이미 robots.txt가 있는지 먼저 확인한다 (
도메인/robots.txt로 직접 접속). - SEO 플러그인(예: robots.txt 편집 기능이 있는 플러그인)을 쓰고 있다면 관리자 화면에서 코드를 추가한다. 플러그인이 없다면 파일로 직접 서버 루트에 업로드한다.
- 기존에 있던 Disallow 규칙(관리자 페이지, 검색 결과 페이지 등)은 그대로 두고, 위 AI 크롤러 허용 블록만 추가한다.
- 저장 후
도메인/robots.txt에 접속해 새 규칙이 실제로 반영됐는지 확인한다. - 변경 사항이 각 AI 기업의 시스템에 반영되기까지 통상 24시간 정도 걸리므로, 다음 날 다시 확인한다.
자주 묻는 질문
학습은 막고 검색 노출만 허용할 수 있나요?
가능하다. GPTBot(학습)은 차단하고 OAI-SearchBot(검색)은 허용하는 식으로, 회사별 두 크롤러를 독립적으로 설정하면 된다. 예를 들어 OpenAI의 경우 아래처럼 작성한다.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
워드프레스 기본 설정으로도 AI 크롤러가 차단되지 않나요?
워드프레스 자체는 기본적으로 AI 크롤러를 차단하지 않는다. 다만 보안 플러그인이나 캐싱 플러그인 중 일부가 알려지지 않은 User-agent를 자동으로 차단하는 경우가 있으므로, robots.txt 외에도 보안 플러그인의 봇 차단 설정을 함께 확인하는 것이 안전하다.
이미 차단해둔 사이트는 어떤 영향이 있나요?
주요 AI 크롤러 중 하나라도 차단되어 있으면 해당 엔진에서의 AI 인용 기회를 18~34% 정도 잃을 수 있다는 조사 결과가 있다(CapstonAI, 2026). 같은 조사에서 GPTBot, PerplexityBot, ClaudeBot을 함께 허용으로 전환한 사이트는 90일 안에 AI 유입 트래픽이 186% 증가한 사례도 확인됐다.
핵심 요약
- AI 크롤러는 학습용과 검색·인용용으로 나뉘며, robots.txt에서도 따로 설정해야 한다.
- 위 코드를 사이트 루트의 robots.txt에 추가하면 OpenAI, Anthropic, Perplexity, Google, Common Crawl 등 주요 크롤러를 한 번에 허용할 수 있다.
- 설정 반영까지 약 24시간이 걸리므로 적용 후 다음 날 재확인이 필요하다.
- 크롤러를 하나라도 차단해두면 해당 엔진에서의 인용 기회를 상당 부분 잃을 수 있다.
관련 글
지금 우리 사이트의 robots.txt가 AI 크롤러를 제대로 허용하고 있는지 궁금하다면, 무료 GEO 진단을 통해 확인해볼 수 있다.
이 글은 2026년 기준 정보를 바탕으로 작성되었으며, AI 검색 환경 변화에 따라 정기적으로 갱신됩니다.






























