핵심 요약

  • AI 크롤러는 회사마다 학습용 봇과 검색·인용용 봇이 분리되어 있어, robots.txt에서도 따로 설정해야 한다.
  • 주요 AI 크롤러를 최소 한 개라도 차단해두면, 해당 엔진에서의 AI 인용 기회를 최대 18~34% 잃을 수 있다는 조사 결과가 있다.
  • 아래 코드를 사이트 루트의 robots.txt에 그대로 추가하면 된다.

robots.txt는 AI 검색 노출의 가장 기초가 되는 파일이다. 크롤러가 접근조차 못 하면 이후 콘텐츠 구조나 문장 품질은 아무 의미가 없다.

AI 크롤러는 왜 회사마다 여러 개로 나뉘어 있나

대부분의 AI 기업은 하나의 봇이 아니라 역할이 다른 여러 크롤러를 운영한다. 학습용 봇을 막아도 검색·인용용 봇은 여전히 활동할 수 있고, 반대의 경우도 있다. 이 둘을 하나로 착각하고 설정하면 의도와 다른 결과가 나온다.

회사 학습용 크롤러 검색·인용용 크롤러
OpenAI GPTBot OAI-SearchBot
Anthropic ClaudeBot Claude-SearchBot
Perplexity — (별도 학습 봇 없음) PerplexityBot
Google Google-Extended (Google 자체 검색 크롤러에 포함)

복사해서 쓰는 robots.txt 코드

아래 코드를 사이트 루트의 robots.txt에 추가하면 주요 AI 크롤러의 학습·검색 접근을 모두 허용한다. 민감한 경로(관리자 페이지 등)는 별도로 차단 규칙을 유지한 채 추가하면 된다.

# OpenAI
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

# Anthropic
User-agent: ClaudeBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

# Perplexity
User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

# Google (AI 학습용, 일반 Googlebot과 별개)
User-agent: Google-Extended
Allow: /

# Common Crawl (여러 LLM의 학습 데이터로 사용됨)
User-agent: CCBot
Allow: /

# Apple
User-agent: Applebot-Extended
Allow: /

# Amazon
User-agent: Amazonbot
Allow: /

Sitemap: https://example.com/sitemap.xml

example.com 부분은 실제 도메인과 사이트맵 경로로 바꿔야 한다.

User-agent별 역할 확인표

User-agent 소속 차단 시 영향
GPTBot OpenAI 모델 학습 데이터 미반영 (검색 노출과는 무관)
OAI-SearchBot OpenAI ChatGPT 검색 답변에 노출되지 않음
ChatGPT-User OpenAI 사용자가 요청한 페이지를 ChatGPT가 열람하지 못함
ClaudeBot Anthropic 모델 학습 데이터 미반영
Claude-SearchBot Anthropic Claude 검색·인용 기능에 노출되지 않음
Claude-User Anthropic 사용자가 요청한 페이지를 Claude가 열람하지 못함
PerplexityBot Perplexity Perplexity 답변에 인용되지 않음
Google-Extended Google Gemini 등 AI 학습에 미반영 (일반 구글 검색 노출과는 무관)
CCBot Common Crawl 다수 LLM의 학습 데이터셋에서 제외됨

robots.txt를 적용하는 절차

  1. 워드프레스 사이트 루트에 이미 robots.txt가 있는지 먼저 확인한다 (도메인/robots.txt로 직접 접속).
  2. SEO 플러그인(예: robots.txt 편집 기능이 있는 플러그인)을 쓰고 있다면 관리자 화면에서 코드를 추가한다. 플러그인이 없다면 파일로 직접 서버 루트에 업로드한다.
  3. 기존에 있던 Disallow 규칙(관리자 페이지, 검색 결과 페이지 등)은 그대로 두고, 위 AI 크롤러 허용 블록만 추가한다.
  4. 저장 후 도메인/robots.txt에 접속해 새 규칙이 실제로 반영됐는지 확인한다.
  5. 변경 사항이 각 AI 기업의 시스템에 반영되기까지 통상 24시간 정도 걸리므로, 다음 날 다시 확인한다.

자주 묻는 질문

학습은 막고 검색 노출만 허용할 수 있나요?

가능하다. GPTBot(학습)은 차단하고 OAI-SearchBot(검색)은 허용하는 식으로, 회사별 두 크롤러를 독립적으로 설정하면 된다. 예를 들어 OpenAI의 경우 아래처럼 작성한다.

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

워드프레스 기본 설정으로도 AI 크롤러가 차단되지 않나요?

워드프레스 자체는 기본적으로 AI 크롤러를 차단하지 않는다. 다만 보안 플러그인이나 캐싱 플러그인 중 일부가 알려지지 않은 User-agent를 자동으로 차단하는 경우가 있으므로, robots.txt 외에도 보안 플러그인의 봇 차단 설정을 함께 확인하는 것이 안전하다.

이미 차단해둔 사이트는 어떤 영향이 있나요?

주요 AI 크롤러 중 하나라도 차단되어 있으면 해당 엔진에서의 AI 인용 기회를 18~34% 정도 잃을 수 있다는 조사 결과가 있다(CapstonAI, 2026). 같은 조사에서 GPTBot, PerplexityBot, ClaudeBot을 함께 허용으로 전환한 사이트는 90일 안에 AI 유입 트래픽이 186% 증가한 사례도 확인됐다.

핵심 요약

  • AI 크롤러는 학습용과 검색·인용용으로 나뉘며, robots.txt에서도 따로 설정해야 한다.
  • 위 코드를 사이트 루트의 robots.txt에 추가하면 OpenAI, Anthropic, Perplexity, Google, Common Crawl 등 주요 크롤러를 한 번에 허용할 수 있다.
  • 설정 반영까지 약 24시간이 걸리므로 적용 후 다음 날 재확인이 필요하다.
  • 크롤러를 하나라도 차단해두면 해당 엔진에서의 인용 기회를 상당 부분 잃을 수 있다.

관련 글

지금 우리 사이트의 robots.txt가 AI 크롤러를 제대로 허용하고 있는지 궁금하다면, 무료 GEO 진단을 통해 확인해볼 수 있다.

이 글은 2026년 기준 정보를 바탕으로 작성되었으며, AI 검색 환경 변화에 따라 정기적으로 갱신됩니다.