HOME용어사전AI 크롤러

AI 크롤러란? 한눈에 보는 정의

AI 크롤러는 AI 서비스 운영사가 웹페이지의 내용을 수집하거나 확인하기 위해 사용하는 자동 프로그램입니다. 검색엔진 크롤러처럼 사이트에 접속해 페이지의 내용을 읽지만, 수집 목적은 크롤러마다 다릅니다. 모델 개발을 위한 크롤러가 있고, AI 검색을 위한 크롤러도 있으며, 사용자의 요청에 따라 특정 페이지에 접속하는 경우도 있습니다.

검색엔진 크롤러와 무엇이 다른가요?

웹페이지에 접속하는 방식은 비슷합니다. 사이트에 페이지를 요청하고 서버가 돌려준 내용을 가져갑니다. 서버에는 사람이 아닌 자동 프로그램의 접속으로 남습니다.

차이는 목적입니다. Googlebot 같은 검색엔진 크롤러는 웹페이지를 수집해 검색 색인을 만들고 검색 결과에 활용합니다.

AI 서비스에서는 목적에 따라 크롤러를 나눠 운영하기도 합니다. OpenAI는 모델 개발에 사용하는 GPTBot과 ChatGPT 검색을 위한 OAI-SearchBot을 구분하고 있고, Anthropic도 ClaudeBot과 Claude-SearchBot, Claude-User를 별도로 운영합니다.

따라서 'AI 크롤러를 허용할 것인가'를 한꺼번에 결정하기보다 어떤 크롤러가 어떤 목적으로 접근하는지를 먼저 확인해야 합니다.

목적에 따라 나눠서 봅니다

  1. 1
    모델 개발용

    OpenAI의 GPTBot과 Anthropic의 ClaudeBot이 대표적입니다. OpenAI는 GPTBot 접근을 제한하면 해당 사이트의 콘텐츠를 잠재적인 모델 학습에서 제외할 수 있다고 안내하고 있습니다. Anthropic도 ClaudeBot을 모델 개발을 위한 웹 콘텐츠 수집에 사용한다고 설명합니다.

  2. 2
    AI 검색용

    OpenAI의 OAI-SearchBot과 Anthropic의 Claude-SearchBot, Perplexity의 PerplexityBot이 여기에 해당합니다. OAI-SearchBot은 사이트의 콘텐츠가 ChatGPT 검색에서 발견되고 인용되는 데 사용됩니다. Claude-SearchBot은 Claude의 검색 결과 품질을 높이기 위해 웹 콘텐츠를 확인하고, PerplexityBot은 Perplexity의 검색 색인을 만드는 데 사용됩니다.

  3. 3
    사용자 요청용

    Anthropic은 Claude-User를 별도로 운영하며, 사용자가 Claude에서 질문했을 때 필요한 웹페이지를 가져오는 데 사용할 수 있다고 설명합니다. Claude-User 역시 사이트 운영자가 robots.txt로 접근 여부를 정할 수 있습니다.

모델 개발과 AI 검색을 같은 것으로 보지 않아야 합니다. 학습 관련 크롤러의 접근을 제한하면서 AI 검색용 크롤러는 허용하는 식으로 목적에 따라 설정을 나눌 수 있습니다.

주요 AI 크롤러와 제어 항목

운영사이름주요 역할robots.txt
OpenAIGPTBot모델 개발에 사용할 수 있는 웹 콘텐츠 수집준수
OpenAIOAI-SearchBotChatGPT 검색에서 콘텐츠 발견과 표시준수
AnthropicClaudeBot모델 개발을 위한 웹 콘텐츠 수집준수
AnthropicClaude-SearchBotClaude 검색 결과 개선을 위한 웹 탐색준수
AnthropicClaude-User사용자 요청에 따라 웹 콘텐츠 접근준수
PerplexityPerplexityBotPerplexity 검색을 위한 페이지 색인준수
GoogleGoogle-ExtendedGemini 관련 학습과 사용 범위를 정하는 robots.txt 제어 토큰robots.txt에서 설정

각 회사의 공식 문서를 기준으로 2026년 8월 확인한 내용입니다. 크롤러의 이름과 역할, 정책은 바뀔 수 있으므로 실제 robots.txt를 수정하기 전에는 각 운영사의 최신 문서를 다시 확인합니다.

Google-Extended는 크롤러가 아닙니다

Google-Extended는 GPTBot이나 ClaudeBot처럼 별도의 크롤러가 접속할 때 사용하는 user-agent가 아닙니다.

구글은 Google-Extended를 robots.txt에서 사용하는 독립적인 제품 토큰으로 설명합니다. 실제 웹페이지 수집은 기존 Google user-agent를 통해 이뤄지고, 사이트 운영자는 Google-Extended를 이용해 해당 콘텐츠가 미래 Gemini 모델 학습과 일부 Gemini 관련 기능에 사용되는 범위를 제어할 수 있습니다.

Google-Extended를 차단한다고 일반 Google 검색에서 페이지가 빠지거나 검색 순위가 낮아지는 것은 아닙니다. 구글은 Google-Extended가 Google 검색의 포함 여부나 순위 신호로 사용되지 않는다고 명시하고 있습니다.

따라서 Googlebot과 Google-Extended는 구분해서 봐야 합니다.

AI 크롤러를 전부 막으면 어떻게 되나요?

모든 AI 관련 크롤러를 일괄적으로 차단할 이유는 없습니다. 먼저 어떤 목적으로 사이트를 공개할 것인지 정합니다.

예를 들어 OpenAI에서는 GPTBot과 OAI-SearchBot의 역할이 다릅니다. 모델 개발에 콘텐츠가 사용되는 것은 제한하면서 ChatGPT 검색에는 사이트가 나오게 하고 싶다면 GPTBot은 차단하고 OAI-SearchBot은 허용하는 방식으로 설정할 수 있습니다.

OpenAI는 ChatGPT 검색에서 사이트 콘텐츠가 발견되고 요약이나 인용에 사용되려면 OAI-SearchBot의 접근을 허용해야 한다고 안내하고 있습니다.

Anthropic도 비슷합니다. ClaudeBot, Claude-SearchBot, Claude-User를 별도로 제공하기 때문에 사이트 운영자가 목적에 따라 접근 여부를 정할 수 있습니다.

AI 검색에서 브랜드와 콘텐츠가 발견되는 것이 목표라면 검색용 크롤러의 접근 상태를 확인합니다. 반대로 유료 콘텐츠나 공개 범위를 제한해야 하는 자료라면 노출보다 접근 제한을 우선할 수 있습니다.

Perplexity는 현재 robots.txt를 준수합니다

Perplexity는 별도로 확인해 둡니다. 과거에는 robots.txt에서 차단된 URL이라도 사용자가 특정 페이지의 요약을 요청하면 내용을 가져올 수 있었습니다.

하지만 Perplexity는 2026년 7월 공식 도움말을 업데이트하면서 이 기능을 오용 방지를 위해 중단했다고 밝혔습니다. 현재 PerplexityBot은 robots.txt에서 차단된 사이트의 전체 또는 일부 텍스트를 색인하지 않습니다.

다만 페이지가 차단돼 있어도 도메인과 제목, 짧은 사실 요약은 색인될 수 있다고 안내하고 있습니다. Perplexity는 검색 인덱스를 구축하기 위해 외부 크롤러 업체와도 협력하고 있으며, 이 업체들도 robots.txt를 준수하도록 계약을 업데이트했다고 설명합니다.

또 Perplexity는 PerplexityBot으로 수집한 콘텐츠를 AI 모델 사전 학습에 사용하지 않는다고 밝히고 있습니다. PerplexityBot은 모델 학습용이 아니라 검색 색인을 위한 크롤러입니다.

우리 사이트에 실제로 들어오는지 확인하려면

robots.txt에 허용했다고 해서 실제 접근이 보장되는 것은 아닙니다. 서버나 CDN, WAF 같은 보안 설정에서 자동 접속을 별도로 차단하고 있을 수 있기 때문입니다.

가장 정확한 방법은 서버 접속 로그를 보는 것입니다. user-agent와 접속 시간, 요청한 URL, 응답 상태 코드를 보면 어떤 크롤러가 어느 페이지에 접근했는지 알 수 있습니다.

OpenAI도 robots.txt 외에 Cloudflare나 Akamai 같은 웹 보호 서비스, 방화벽, CAPTCHA, 자동화 차단 기능 때문에 정상적인 크롤러가 403 등의 응답을 받을 수 있다고 안내합니다.

그래서 GEO 기술 점검에서는 robots.txt만 보지 않고 실제 서버 응답도 함께 확인합니다. OAI-SearchBot이나 Claude-SearchBot이 계속 403 응답을 받고 있다면 robots.txt에서 허용한 상태라도 해당 서비스가 페이지 내용을 정상적으로 가져가지 못할 수 있습니다.

user-agent만 보고 진짜 봇이라고 판단하면 안 됩니다

서버 로그에 GPTBot이나 OAI-SearchBot이라는 이름이 있다고 해서 반드시 해당 회사의 실제 크롤러라고 단정할 수는 없습니다. user-agent 문자열은 다른 프로그램도 그대로 사용할 수 있기 때문입니다.

정확하게 확인하려면 운영사가 공개한 IP 정보나 검증 방법을 함께 사용해야 합니다.

OpenAI는 검색 크롤러의 공개 IP 범위를 제공하고 있으며, Anthropic도 자사 크롤러의 IP 정보를 공개하고 있습니다. 방화벽이나 CDN에서 허용 목록을 만들 때는 로그에서 본 임의의 IP가 아니라 운영사가 제공하는 최신 정보를 기준으로 설정합니다.

자주 묻는 질문

AI 크롤러를 막으면 구글 검색 순위에 영향이 있나요?

GPTBot이나 OAI-SearchBot, Anthropic의 크롤러를 막는 것은 Googlebot을 막는 것과 다른 문제이고, Google-Extended도 구글 검색 색인이나 순위 신호로 쓰이지 않습니다.

다만 Googlebot 자체를 차단하면 구글이 페이지를 수집하지 못할 수 있어 별도로 구분해야 합니다.

크롤러 이름은 어디에서 확인하나요?

각 운영사의 공식 문서가 가장 정확합니다. OpenAI와 Anthropic, Perplexity, Google은 크롤러와 robots.txt 제어 항목의 이름과 용도를 공개하고 있습니다.

정책이 바뀔 수 있으니 설정을 변경하는 시점에 공식 문서를 다시 확인합니다.

학습에는 쓰이기 싫은데 AI 답변에는 나오고 싶습니다

학습용과 검색용 크롤러를 구분해 제공한다면 가능합니다. OpenAI는 GPTBot을 막으면서 OAI-SearchBot을 허용할 수 있고, Anthropic도 ClaudeBot과 Claude-SearchBot을 각각 설정할 수 있습니다.

다만 공개 웹에 올린 콘텐츠가 다른 경로로 이용될 가능성까지 막는다는 뜻은 아닙니다.

robots.txt만 확인하면 되나요?

아닙니다. robots.txt에서 허용돼 있어도 WAF나 CDN, 방화벽, CAPTCHA, 로그인 설정에서 접근이 막힐 수 있습니다.

robots.txt는 접근 지침을 전달하는 파일이지 보안 장치가 아니므로, 중요한 자료는 인증이나 서버 접근 제어로 보호해야 합니다.

관련 용어

GEO를 시작해도 AI 답변에 브랜드가 안 나오는 이유 GEO와 SEO의 차이점