AI 크롤러에는 어떤 것들이 있나요?
같은 회사라도 목적에 따라 크롤러 이름이 다릅니다. robots.txt 는 이 이름으로 허용·차단을 정합니다.
| 크롤러 | 회사 | 용도 | BIX |
|---|---|---|---|
| OAI-SearchBot | OpenAI | ChatGPT 검색 결과 노출 | A01 |
| ChatGPT-User | OpenAI | 사용자가 대화 중 링크를 열 때 | A02 |
| GPTBot | OpenAI | 모델 학습 | A03 |
| Claude-SearchBot | Anthropic | Claude 검색 인용 | A04 |
| Claude-User | Anthropic | 사용자가 대화 중 링크를 열 때 | A05 |
| ClaudeBot | Anthropic | 모델 학습 | A06 |
| PerplexityBot | Perplexity | 답변 인용 색인 | A07 |
| Google-Extended | Gemini 학습 제어 토큰(검색 순위와 무관) | 참고만 |
robots.txt 는 어떻게 쓰면 되나요?
전체를 허용하는 규칙이 있다면 따로 적지 않아도 됩니다. 학습만 거부하고 싶을 때의 예시는 아래와 같습니다.
User-agent: *
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
Sitemap: https://example.co.kr/sitemap.xml자바스크립트로 그린 페이지는 불리한가요?
AI 크롤러가 자바스크립트를 실행하는지는 회사마다 공개 정도가 다릅니다. 처음 받은 HTML 에 본문이 들어 있으면 이런 차이에 흔들리지 않습니다. BIX 는 자바스크립트를 실행하지 않은 상태의 HTML 에서 본문이 200자 이상 읽히는지 확인합니다(A08).
무엇이 확인된 사실이고 무엇이 추측인가요?
- 확인된 사실: 크롤러 이름과 용도는 각 회사가 공개했습니다. robots.txt 로 막으면 해당 크롤러는 들어오지 않습니다.
- 확인된 사실: 구글은 AI Overviews·AI Mode 노출에 기존 SEO 원칙이 그대로 적용되고, 별도의 AI 전용 파일은 필요 없다고 안내합니다.
- 아직 모르는 것: 각 AI 가 여러 출처 중 무엇을 골라 인용하는지의 기준은 공개되지 않았습니다. “이것만 하면 AI 노출이 몇 % 오른다”는 주장은 근거를 확인해 보세요.
자주 묻는 질문
llms.txt 를 만들면 AI 노출이 늘어나나요?
llms.txt 는 제안된 형식이고, 주요 AI 회사가 이 파일을 순위나 인용에 쓴다고 공식적으로 밝힌 적은 없습니다. 구글은 AI 기능 노출에 별도 AI 파일이 필요 없다고 안내합니다. 만드는 비용이 작아 두어도 손해는 없지만, BIX 는 점수에 넣지 않습니다.
학습용 크롤러를 막으면 AI 검색에서도 빠지나요?
회사마다 학습용과 검색용 크롤러를 나눠 운영합니다. 예를 들어 OpenAI 는 학습용 GPTBot 과 검색용 OAI-SearchBot 을 따로 둡니다. 학습만 거부하고 검색 노출은 유지하려면 학습용 봇만 막고 검색용 봇은 허용하면 됩니다.
AI 가 우리 브랜드를 실제로 언급하는지는 어떻게 아나요?
크롤러 허용과 본문 구조는 준비 단계입니다. 실제 언급 여부는 AI 에 질문을 던져 답변을 모아 봐야 알 수 있습니다. BIX 는 이 측정을 AI Visibility 라는 별도 기능으로 준비하고 있습니다.
AI 크롤러가 우리 사이트에 들어올 수 있을까요?
robots.txt 규칙을 크롤러 7종 기준으로 바로 판정해 드립니다.