사이트 설정 · 위키 · 3분

검색용 크롤러

서버 기록이나 robots.txt에서 본 봇 이름이 검색 표시용인지 학습용인지 사용자 요청용인지 가리는 기준을 정리했습니다. 공개 IP 목록으로 진짜 크롤러인지 맞춰 보는 법과 막을 때 robots.txt에 적는 순서도 담았습니다.

2026-10-05 작성출처 5개 · 확인일 표시

카테고리: 사이트 설정

흑연색 손잡이 달린 랜턴 하나가 비스듬히 놓여 있고 안쪽 불빛만 시트론 노란색입니다.
이 글의 순서 · 4개 절

검색용 크롤러는 검색 서비스가 결과나 답에 보여 줄 페이지를 모으려고 웹사이트를 방문하는 자동 프로그램입니다. 이름과 용도는 각 회사 문서가 밝히고 운영자는 robots.txt의 User-agent 줄에 그 이름을 적어 허용과 차단을 정합니다1.

항목 내용
다른 이름 봇, 로봇, 사용자 에이전트 이름
정하는 곳 이름과 용도는 각 회사 문서, robots.txt를 읽는 규칙은 RFC 93091
대표 이름 Googlebot(Google 검색)2, OAI-SearchBot(ChatGPT 검색)3, PerplexityBot(Perplexity 검색)4, Claude-SearchBot(Claude 검색 결과 품질)5
적혀 있는 곳 robots.txt의 User-agent 줄1, 서버 접근 기록의 사용자 에이전트 문자열
확인하는 곳 각 회사 크롤러 문서와 공개 IP 목록2345

표. 검색용 크롤러 요약. 출처: 각 회사 크롤러 문서2345, RFC 93091. 기준일: 2026-10-05 확인.

어디서 보게 되나

robots.txt를 열면 User-agent: OAI-SearchBot 같은 줄 아래에 그 크롤러에게만 적용되는 규칙이 붙어 있습니다. 이름이 적힌 묶음이 없으면 크롤러는 User-agent: * 묶음을 따라야 합니다1. 서버 접근 기록에서는 사용자 에이전트 칸에 compatible; PerplexityBot/1.0 같은 문자열로 남습니다4.

헷갈리기 쉬운 것

헷갈리는 말 차이 확인할 곳
학습용 크롤러 GPTBot은 기반 모델 학습용 수집이고 ClaudeBot을 막으면 이후 자료가 학습 데이터에서 빠짐35 회사별 크롤러 문서
사용자 요청용 접근 Perplexity-User는 사용자 질문에 따라 페이지를 열며 robots.txt를 대체로 무시함4. Claude-User를 막으면 사용자 주도 웹 검색에서 보일 가능성이 줄 수 있음5 같은 문서
Google-Extended robots.txt에만 쓰는 이름. 별도 HTTP 사용자 에이전트가 없고 Google 검색 포함 여부와 순위에 영향이 없음2 Google 일반 크롤러 목록

확인하는 법

  1. 서버 접근 기록에서 낯선 줄의 사용자 에이전트 문자열을 복사합니다. 크롤러 이름이 들어 있으면 다음 단계로 갑니다.
  2. 그 이름을 낸 회사의 크롤러 문서를 열어 용도를 읽습니다. 검색 표시, 학습, 사용자 요청 가운데 하나로 적습니다.
  3. 사용자 에이전트 문자열은 꾸밀 수 있으므로2 그 줄의 IP 주소를 회사가 공개한 IP 목록과 맞춥니다2345. 목록에 있으면 그 회사의 크롤러로 기록합니다.
  4. 막기로 했다면 robots.txt에 그 이름의 묶음을 따로 적습니다. Anthropic은 하위 도메인마다 적으라고 하고 IP 차단은 제대로 작동하지 않을 수 있다고 안내합니다5. 고친 robots.txt를 주소창에서 다시 열어 새 묶음이 보이면 끝입니다.

관련 용어

출처와 확인일5개
  1. 1IETF, RFC 9309 Robots Exclusion Protocolrfc-editor.org · 확인 2026-10-05
  2. 2Google Search Central, Google 일반 크롤러 목록developers.google.com · 확인 2026-10-05
  3. 3OpenAI, Overview of OpenAI Crawlersdevelopers.openai.com · 확인 2026-10-05
  4. 4Perplexity Docs, Perplexity Crawlersdocs.perplexity.ai · 확인 2026-10-05
  5. 5Claude Help Center, Does Anthropic crawl data from the web, and how can site owners block the crawler?support.claude.com · 확인 2026-10-05
같은 카테고리 · 사이트 설정

연관 글

글 전체 보기 →
  • 사이트 설정 · 가이드

    AI 검색 답변에 내 사이트가 빠질 때 설정 점검하기

    robots.txt, Search Console URL 검사, 페이지 소스, 서버 접근 기록에서 무엇이 보이면 통과인지 표로 짚고 결과를 점검 메모 한 장에 모은 뒤 고친 칸을 다시 확인하는 절차입니다.

    2026-10-05 · 9분 · 출처 9개
  • 사이트 설정 · 위키

    llms.txt

    llmstxt.org 제안서가 정한 마크다운 안내 파일 llms.txt를 두는 자리와 필수 구역, robots.txt와의 차이, Google 문서가 말한 범위를 정리했습니다. 형식과 지원 여부를 따로 점검하는 순서도 실었습니다.

    2026-10-05 · 3분 · 출처 2개
  • 사이트 설정 · 가이드

    구조화 데이터 넣고 검사 도구로 확인하기

    글 페이지에 Article 구조화 데이터를 JSON-LD로 넣고 리치 결과 테스트, URL 검사, 리치 결과 보고서가 각각 무엇을 보여 주는지 짚은 절차입니다. 기사 유형이 목록에 없는 화면과 기록 양식도 담았습니다.

    2026-10-05 · 9분 · 출처 8개