← 가이드 목록

robots.txt란 무엇인가 — 크롤러 접근 제어의 기본

robots.txt 파일의 역할, 작성법, 주요 크롤러별 설정 방법을 설명합니다. AI 크롤러(GPTBot, ClaudeBot 등)의 접근 제어도 다룹니다.

robots.txt란 무엇인가?

robots.txt는 웹사이트의 루트 디렉토리에 위치하는 텍스트 파일로, 검색엔진 크롤러에게 어떤 페이지를 수집해도 되고 어떤 페이지는 수집하면 안 되는지를 알려주는 역할을 합니다. 검색엔진뿐 아니라 AI 크롤러(GPTBot, ClaudeBot 등)의 접근도 이 파일로 제어할 수 있습니다.

robots.txt 기본 문법

# 모든 크롤러에게 전체 사이트 허용
User-agent: *
Allow: /

# 관리자 페이지 차단
User-agent: *
Disallow: /admin/
Disallow: /api/

# 사이트맵 위치 안내
Sitemap: https://example.com/sitemap.xml

주요 디렉티브

디렉티브역할예시
User-agent규칙을 적용할 크롤러 지정User-agent: Googlebot
Allow크롤링 허용 경로Allow: /public/
Disallow크롤링 차단 경로Disallow: /private/
Sitemap사이트맵 URL 안내Sitemap: https://example.com/sitemap.xml

AI 크롤러 접근 제어

AI 시대에는 전통 검색엔진 크롤러 외에도 AI 학습·검색용 크롤러의 접근을 관리해야 합니다.

# AI 크롤러별 접근 설정 예시
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

흔한 실수와 주의사항

  • 전체 차단 실수Disallow: /를 모든 크롤러에 적용하면 검색 결과에서 완전히 사라집니다
  • robots.txt는 강제가 아닌 권고 — 대부분의 주요 크롤러는 준수하지만, 악의적인 봇은 무시할 수 있습니다
  • 민감한 정보 보호 수단이 아님 — 비밀 페이지를 숨기려면 인증을 사용하세요. robots.txt의 URL 자체가 공개됩니다
  • CSS/JS 차단 주의 — 렌더링에 필요한 리소스를 차단하면 검색엔진이 페이지를 제대로 이해하지 못합니다

실전 예시: 작은 온라인 쇼핑몰의 robots.txt

“마을 공방”이라는 작은 수제 비누 쇼핑몰이 있다고 가정해 봅시다. 이 사이트에는 상품 상세 페이지, 장바구니, 결제 완료 페이지, 회원 마이페이지, 그리고 내부 검색 결과 페이지가 있습니다. 검색엔진과 AI에게는 상품과 소개, 블로그 페이지를 보여주고 싶지만, 장바구니나 마이페이지처럼 개인화된 페이지는 수집되지 않기를 바랍니다.

User-agent: *
Allow: /
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /search?

Sitemap: https://village-soap.example.com/sitemap.xml

이 설정은 상품·소개·블로그 페이지는 모두 열어 두되, 장바구니와 결제, 마이페이지, 그리고 사용자가 검색할 때마다 무한히 생성되는 내부 검색 결과 URL만 차단합니다. 마지막 줄에서 사이트맵 위치를 명시했기 때문에 크롤러는 어떤 상품 페이지가 있는지 빠르게 파악할 수 있습니다. 핵심은 “전부 막기”가 아니라 “가치 없는 페이지만 골라 막기”입니다.

AI 시대에 자주 놓치는 3가지

  • 사이트맵 줄을 빠뜨림 — robots.txt에 Sitemap: 줄이 없으면 크롤러가 사이트맵을 스스로 찾아야 합니다. 한 줄만 추가하면 새 페이지 발견 속도가 눈에 띄게 빨라집니다.
  • Disallow와 noindex를 혼동Disallow는 “읽지 마라”는 뜻일 뿐 “검색 결과에서 빼라”는 뜻이 아닙니다. 오히려 차단된 페이지가 외부 링크를 통해 URL만 검색 결과에 남을 수 있습니다. 노출 자체를 막으려면 해당 페이지에 noindex 메타 태그를 사용해야 합니다.
  • AI 크롤러를 무심코 차단 — 보안 플러그인이나 CDN이 기본값으로 GPTBot·ClaudeBot을 막아 두는 경우가 있습니다. AI 답변에 인용되고 싶다면 이 크롤러들이 실제로 허용 상태인지 반드시 확인하세요.

SearchLens에서 확인하기

SearchLens의 Technical SEO 모듈은 robots.txt의 존재 여부와 주요 크롤러 차단 여부를 점검합니다. AI Visibility 모듈은 GPTBot, ClaudeBot 등 AI 크롤러의 접근 허용 상태를 확인합니다. 위에서 설명한 사이트맵 참조 누락이나 의도치 않은 전체 차단 같은 문제도 URL 하나로 바로 점검할 수 있습니다.

국내 사이트들은 실제로 어떻게 설정해 두었을까

2026년 7월 국내 주요 사이트 40곳의 robots.txt를 직접 수집해 봤습니다. 판정 가능한 36곳 중 19곳(53%)이 GPTBot을 완전히 차단하고 있었고, 그중 11곳은 GPTBot을 콕 집어 막았습니다. 더 눈에 띈 것은 20곳(56%)이 AI 크롤러에 대한 규칙을 한 줄도 두지 않았다는 점입니다. 여기서 설명한 ‘의도치 않은 전체 차단’에 해당하는 사례도 실제로 발견됐습니다. 분야별 차이와 원자료는 한국 주요 사이트 40곳 AI 검색 대응 실태 조사에서 확인하실 수 있습니다.