콘텐츠로 건너뛰기

🤖 robots.txt 생성기

20 종 이상의 주요 크롤러 (Googlebot / GPTBot / ClaudeBot 등) Allow / Disallow 일괄 설정. Crawl-delay · Sitemap · Host 지원.

완전 무료 가입 불필요 브라우저 완결 5 개 언어 다크 모드

🔒 개인정보 보호

⚡ 프리셋

🤖 크롤러 (User-agent)

📄 robots.txt


📖 자주 걸리는 지점

크롤러별 Allow / Disallow, Crawl-delay, Sitemap, Host 를 지정해 robots.txt 를 생성합니다. AI 크롤러용 프리셋도 준비되어 있습니다. 처리는 브라우저 안에서 끝납니다. robots.txt 가 제어하는 것은 크롤해도 되는가 뿐이며 검색 결과에 낼지 여부가 아닙니다 — 이 둘을 혼동하는 것이 이 파일에 얽힌 오해의 거의 전부의 원인입니다.

사례 무슨 일이 일어나는가 어떻게 하면 되는가
Disallow 했는데 검색 결과에 나온다 robots.txt 는 크롤을 멈출 뿐 인덱스 등록을 멈추지 않습니다. 다른 사이트에서 링크되어 있으면 Google 은 페이지의 내용을 읽지 않은 채 URL 만 등록합니다 — 그 결과 검색 결과에는 제목 대신 URL 이 늘어서고 설명문 자리에 이 페이지의 정보는 robots.txt 로 인해 가져올 수 없습니다 라고 표시됩니다. 즉 Disallow 는 숨기기는커녕 내용을 알 수 없는 URL 을 검색 결과에 남기게 됩니다. 게다가 내용을 읽을 수 없으므로 당신이 쓴 noindex 도 읽히지 않습니다. 검색 결과에 내고 싶지 않다면 noindex 를 쓰세요 — HTML 의 <meta name="robots" content="noindex"> 나 HTTP 헤더의 X-Robots-Tag: noindex 입니다. 그리고 그 페이지를 robots.txt 로 Disallow 해서는 안 됩니다noindex 를 읽으려면 크롤이 필요하기 때문이며 이 둘을 함께 쓰면 의도와 정반대의 결과가 됩니다. 이미 등록되어 버린 URL 을 지우고 싶을 때도 마찬가지로 먼저 Disallow 를 빼고 noindex 를 읽히고 삭제된 뒤에 다시 Disallow 하는 것이 올바른 순서입니다. 확실히 보이고 싶지 않은 것은 애초에 인증 뒤에 두세요 — 공개하고 있는 것을 검색 엔진에만 숨기는 구조는 원리적으로 믿을 수 없습니다.
Disallow 에 쓴 경로가 공격의 실마리가 된다 robots.txt누구나 읽을 수 있는 공개 파일입니다. Disallow: /admin/ 이나 Disallow: /backup/ 라고 쓰는 것은 여기에 관리 화면과 백업이 있습니다 라고 전 세계에 알리는 것과 같습니다. 그리고 robots.txt신사협정일 뿐이므로 악의적인 봇은 맨 먼저 이 파일을 읽고 거기 쓰인 경로를 노립니다 — 숨긴 줄 알았던 곳이 가장 효율 좋은 탐색의 출발점이 됩니다. 실제로 취약점 스캐너는 robots.txt 의 취득을 첫 단계로 넣고 있습니다. 지키고 싶은 것을 robots.txt 에 쓰지 마세요. 관리 화면 · 백업 · 내부 API 는 Basic 인증 · IP 제한 · VPN 뒤에 두는 것이 유일한 대책입니다 — 거기에 두면 애초에 robots.txt 에 쓸 필요가 없습니다(인증으로 401 을 돌려주면 크롤도 되지 않습니다). 굳이 경로를 숨기고 싶다면 개별 경로가 아니라 상위 디렉터리만 쓰는 방법도 있지만 이는 대책이 아니라 기분 위안입니다. 판단의 기준은 단순해서 그 경로가 공개되어 곤란하다면 그것은 robots.txt 의 일이 아니다 라는 것입니다.
CSS 나 JS 를 차단해 페이지의 평가가 떨어진다 Google 은 페이지를 실제로 렌더링해 평가합니다 — 즉 브라우저와 마찬가지로 CSS 와 JavaScript 를 읽어들입니다. 여기서 Disallow: /assets/Disallow: /wp-includes/ 같은 오래된 관습이 남아 있으면 렌더링이 실패하고 Google 에게는 레이아웃이 무너진 혹은 내용이 없는 페이지로 보입니다. 특히 클라이언트 쪽에서 본문을 그리는 구성에서는 본문 자체가 인식되지 않습니다. 모바일 프렌들리 판정도 CSS 를 읽을 수 없으면 통과하지 않습니다. 이 문제는 순위가 떨어지고 나서야 알아채게 되는 성질의 것입니다. 렌더링에 필요한 리소스는 반드시 허용하세요. 확인은 간단해서 Search Console 의 URL 검사에서 공개 URL 테스트를 실행하고 렌더링 후의 스크린숏과 차단된 리소스의 목록을 보면 금방 알 수 있습니다 — 화면이 새하얗거나 스타일이 먹지 않았다면 그것이 답입니다. 이미 Disallow 를 넓게 써 버린 경우에는 Allow 로 개별적으로 구멍을 낼 수 있습니다(Disallow: /assets/ 뒤에 Allow: /assets/*.cssAllow: /assets/*.js). 애초에 정적 리소스를 차단할 이유는 현대의 사이트에는 거의 없습니다 — 망설여지면 허용하세요.

robots.txt 는 도메인의 루트에만 둘 수 있습니다. example.com/blog/robots.txt 는 완전히 무시됩니다. 나아가 서브도메인 · 프로토콜 · 포트는 모두 별개 취급이므로 blog.example.com 에는 별도의 robots.txt 가 필요하고 http://https:// 도 이치상 별개입니다. AI 크롤러에 대해서는 — GPTBot · ClaudeBot · PerplexityBot · Google-Extended 는 검색용 크롤러와는 별개이므로 거부해도 검색 순위에는 영향을 주지 않습니다. Google-Extended 를 거부해도 Googlebot 의 크롤은 계속됩니다. 다만 AI 의 답변을 거친 유입을 기대한다면 허용해야 하며 이는 기술적인 정답이 없는 사업 판단입니다. 덧붙여 봇 이름은 계속 늘어나므로 지금 쓴 목록은 반년 뒤에는 낡습니다 — 한 번 쓰면 끝인 파일로 다루지 말고 정기적으로 재검토하세요. AI 에게 읽히고 싶은 내용을 보여 주고 싶다면 robots.txt 가 아니라 llms.txt 가 해당합니다 — 역할이 다릅니다.

📖 사용법

  1. 1
    크롤러 선택
    체크박스로 크롤러 선택하고 Allow / Disallow 전환.
  2. 2
    경로와 옵션 지정
    Allow / Disallow 경로, Crawl-delay, Sitemap, Host 입력.
  3. 3
    복사 또는 다운로드
    복사하거나 파일로 저장.

❓ 자주 묻는 질문

GPTBot 차단이 SEO에 영향?
아니요. AI 학습용 별도 크롤러로 검색 순위와 무관.
Disallow 무시되는 이유?
robots.txt는 권고. 악성 봇은 무시. 서버 인증 병행 필요.
robots.txt 위치?
도메인 루트에 배치.
🐛 이 도구에서 문제가 발생했나요?

무료 · 가입 불필요. 재현 절차만이라도 도움이 됩니다. 보고는 운영자에게 직접 전달되어 개선에 사용됩니다.

※ 재현을 위해 브라우저 정보 (UA / 화면 / 언어 / URL) 가 자동 전송됩니다