AI 크롤러를 robots.txt에서 허용해야 하나요?
요약
AI 답변에 인용되는 것이 목표라면 허용해야 합니다. 차단하면 그 엔진의 답변에 등장할 경로 자체가 사라집니다. 다만 콘텐츠 자체가 상품인 매체라면 학습용 크롤러만 선별적으로 막는 절충안이 합리적입니다.
결론부터
AI 답변에 인용되는 것이 목표라면 허용해야 합니다. 차단은 인용될 경로 자체를 없애는 조치입니다.
“AI에 우리 회사가 안 나온다”고 하시는 사이트를 진단해 보면, robots.txt에서 AI 크롤러를 막고 있는 경우가 실제로 적지 않습니다. 대개 의도한 차단이 아니라 어디선가 가져온 템플릿을 그대로 쓴 결과입니다.
먼저 확인하기
브라우저에서 내도메인.com/robots.txt 를 열어보시면 됩니다. 아래 같은 줄이 있는지 보세요.
User-agent: GPTBot
Disallow: /
이런 줄이 있으면 그 크롤러는 사이트를 읽지 않습니다. User-agent: * 아래에 Disallow: / 가 있다면 전체 차단 상태입니다.
주요 AI 크롤러
| 크롤러 | 소속 | 주 용도 |
|---|---|---|
GPTBot | OpenAI | 학습 데이터 수집 |
OAI-SearchBot | OpenAI | 검색 색인 |
ChatGPT-User | OpenAI | 사용자 요청 시 실시간 방문 |
ClaudeBot | Anthropic | 학습 데이터 수집 |
Claude-User | Anthropic | 사용자 요청 시 실시간 방문 |
Claude-SearchBot | Anthropic | 검색 색인 |
PerplexityBot | Perplexity | 검색 색인 |
Google-Extended | Gemini 학습·인용 제어 | |
Applebot-Extended | Apple | 학습 제어 |
CCBot | Common Crawl | 공개 아카이브 (여러 모델의 학습 소스) |
Google-Extended는 일반 검색 색인과 무관합니다. 이걸 막아도 구글 검색 노출에는 영향이 없고, Gemini 쪽 활용만 제한됩니다. 반대로Googlebot을 막으면 검색 자체에서 사라집니다. 둘을 혼동하지 마세요.
사업 유형별 판단
전면 허용이 맞는 경우
서비스업·B2B·전문직·제조·지역 사업 등 대부분이 여기 해당합니다.
이런 사업에서 웹사이트는 상품이 아니라 홍보 수단입니다. 사람들이 더 많이 알게 되는 것이 이익이므로, AI가 우리 정보를 읽고 인용하는 것도 이익입니다. 막을 이유가 없습니다.
선별 차단을 고민할 만한 경우
콘텐츠 자체가 상품인 매체 — 언론사, 유료 아카이브, 강의 플랫폼, 웹툰·소설 등.
이 경우 “읽히는 것”이 곧 매출 손실일 수 있습니다. 다만 여기서도 전면 차단은 신중해야 합니다. 검색용 크롤러까지 막으면 AI 답변에서 매체 이름 자체가 사라집니다.
용도별로 이름이 분리된 회사에 한해 이런 절충이 가능합니다.
# 학습용은 차단
User-agent: GPTBot
Disallow: /
# 검색·인용용은 허용 (매체명과 링크가 답변에 노출된다)
User-agent: OAI-SearchBot
Allow: /
부분 차단
전체를 열되 특정 경로만 막는 방식도 있습니다.
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /members/
Disallow: /api/
로그인이 필요한 영역, 관리 화면, API 엔드포인트는 어차피 인용될 내용이 아니므로 막아 두는 편이 낫습니다.
허용 설정 예시
AEO를 목표로 하는 일반적인 사이트라면 이 정도면 충분합니다.
User-agent: *
Allow: /
# OpenAI
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
# Anthropic
User-agent: ClaudeBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Perplexity
User-agent: PerplexityBot
Allow: /
# Google (Gemini · AI 개요)
User-agent: Google-Extended
Allow: /
Sitemap: https://example.com/sitemap-index.xml
User-agent: * 에 Allow: / 가 있으면 개별 크롤러를 명시하지 않아도 허용되지만, 명시해 두면 나중에 누군가 전체 차단 규칙을 추가했을 때 안전장치가 됩니다. 의도를 문서로 남기는 효과도 있습니다.
알아둘 한계
robots.txt는 자율 준수 규약이지 기술적 차단이 아닙니다. 주요 AI 회사의 공식 크롤러는 준수한다고 밝히고 있지만, 강제할 수단은 없습니다. 공식 크롤러가 아닌 제3자 수집기는 지키지 않을 수 있습니다.
정말로 막아야 하는 콘텐츠라면 robots.txt가 아니라 인증 뒤에 두거나 서버 단에서 차단해야 합니다.
열었는데 안 나오면
차단이 없는데도 AI에 안 나온다면 원인은 다른 곳에 있습니다. 대개 이 중 하나입니다.
- 본문이 자바스크립트로만 그려져 크롤러가 읽을 게 없다
- 빙 색인에 없다 (ChatGPT 웹 검색·Copilot이 빙을 씁니다)
- 그 질문에 답하는 문서 자체가 없다
자세한 점검 순서는 ChatGPT에 우리 회사가 안 나오는 이유에 정리해 두었습니다.
정리
- 대부분의 사업에서는 전면 허용이 맞습니다
- 콘텐츠가 상품인 매체는 학습용만 막고 검색용은 여는 절충을 고려하세요
Google-Extended와Googlebot은 다릅니다 — 후자를 막으면 검색에서 사라집니다- robots.txt는 자율 준수이므로 진짜 차단에는 다른 수단이 필요합니다
- 열었는데 안 나온다면 원인은 크롤러 접근이 아니라 다른 곳에 있습니다
참고로 이 사이트의 robots.txt를 그대로 보실 수 있습니다.
자주 묻는 질문
Q robots.txt로 막으면 AI가 정말 안 읽나요?
A 주요 AI 회사의 공식 크롤러는 robots.txt를 준수한다고 밝히고 있습니다. 다만 이는 강제력이 있는 규약이 아니라 자율 준수이고, 공식 크롤러가 아닌 제3자 수집기는 지키지 않을 수 있습니다. 확실한 차단이 필요하면 서버 단에서 User-Agent 기반으로 거부해야 합니다.
Q 학습은 막고 검색 인용만 허용할 수 있나요?
A 일부 회사는 용도별로 크롤러를 분리해 두었습니다. 예를 들어 OpenAI는 학습용과 검색용 크롤러의 이름이 다릅니다. 이름이 분리된 경우에는 선별 차단이 가능하지만, 모든 회사가 그렇게 나눠 두지는 않았습니다.
Q 이미 막고 있었는데 지금 열면 바로 인용되나요?
A 바로는 아닙니다. 크롤러가 다시 방문해 문서를 읽고 색인에 반영되기까지 시간이 걸립니다. 보통 2~4주 정도 보시면 되고, 사이트맵 제출과 IndexNow로 재방문을 앞당길 수 있습니다.