🤖 robots.txt 분석기
호스트명만 입력하면 /robots.txt를 가져와서 User-agent 그룹별 Allow / Disallow 규칙, Sitemap, Crawl-delay, 주요 검색 엔진과 AI 크롤러의 권한 상태를 분석합니다.
완전 무료
가입 불필요
서버 처리
로그 · DB 없음
레이트 리밋
5 개 언어
다크 모드
📖 이 진단으로 알 수 있는 것
이 진단은 /robots.txt 를 가져와 구문을 해석하고, User-agent 그룹별 규칙, 주요 검색 크롤러와 AI 봇의 허용 상태, Sitemap: 행을 나열합니다. 먼저 이해해야 할 것은 robots.txt 는 크롤을 제어하는 것이지 색인을 막는 것이 아니라는 점입니다. Disallow 한 페이지라도 다른 사이트에서 링크되어 있으면 URL 만 검색 결과에 실릴 수 있습니다.
| 판정 항목 | 무엇을 보는가 | 걸렸을 때의 대처 |
|---|---|---|
| Disallow 로 색인을 막으려 함 | Disallow 는 크롤을 막을 뿐입니다. 게다가 noindex 는 페이지를 읽어야 알 수 있으므로 Disallow 와 noindex 를 동시에 지정하면 noindex 가 영원히 읽히지 않습니다. robots.txt 로 차단했으나 색인에 등록됨이라는 서치 콘솔 경고가 바로 이 상태입니다. |
색인시키고 싶지 않다면 robots.txt 에서는 허용한 뒤 <meta name="robots" content="noindex"> 또는 HTML 이 아니면 X-Robots-Tag: noindex 헤더를 돌려줍니다. 완전히 보이고 싶지 않은 것은 robots.txt 가 아니라 인증(401 / 403)으로 지키세요. robots.txt 는 공개 파일이므로 숨기고 싶은 경로를 쓰는 것 자체가 안내가 됩니다. |
| User-agent 그룹이 듣지 않음 | 크롤러가 따르는 것은 자신에게 가장 구체적으로 일치하는 그룹 하나뿐이며 User-agent: * 그룹과 함께 쓰이지 않습니다. Googlebot 용 그룹을 만드는 순간 Googlebot 은 * 의 규칙을 완전히 무시합니다. 공통 Disallow 가 거기서 빠지는 사고가 매우 많은 지점입니다. |
개별 그룹을 만들었다면 * 에 적힌 공통 규칙을 그 그룹에도 복사합니다. 반대로 특정 봇만 다르게 다룰 필요가 없다면 * 하나로 모으는 것이 안전합니다. Allow 와 Disallow 가 충돌하면 경로가 긴(더 구체적인) 쪽이 이깁니다. |
| 경로 표기가 의도와 어긋남 | 경로는 전방 일치이며 대소문자를 구별합니다. Disallow: /admin 은 /administrator/ 에도 /admin-guide.html 에도 해당합니다. 쓸 수 있는 와일드카드는 *(임의의 문자열)와 $(끝)뿐이며 정규식은 해석되지 않습니다. |
디렉터리만 대상으로 하려면 끝에 / 를 붙입니다(Disallow: /admin/). 확장자로 좁히려면 Disallow: /*.pdf$. CSS 와 자바스크립트는 절대 Disallow 하지 마세요 — 구글은 페이지를 렌더링해 평가하므로 이들을 막으면 레이아웃이 깨진 것으로 판정되어 모바일 대응 평가에도 영향을 줍니다. |
robots.txt 는 호스트와 포트마다 별개입니다. https://example.com/robots.txt 와 https://www.example.com/robots.txt 는 무관하며 서브도메인마다 준비해야 합니다. 가져오지 못했을 때의 취급도 정해져 있어 404 면 전부 허용, 5xx 가 이어지면 구글은 일정 기간 전부 금지로 간주합니다. 점검 중 503 을 돌려주는 설계라면 robots.txt 만은 200 을 돌려주도록 하세요.
🔗 관련 도구
- ・LLMO 진단 — AI 크롤러 허용 · llms.txt
- ・기본 SEO 체크
- ・구조화 데이터 검증
- ・URL 종합 진단