🤖 robots.txt 分析
只需输入主机名即可获取 /robots.txt,并按 User-agent 组分析 Allow / Disallow 规则、Sitemap、Crawl-delay 以及主流搜索引擎和 AI 爬虫的权限状态。
完全免费
无需注册
服务器处理
无日志 / 数据库
限速
5 种语言
深色模式
📖 本诊断能告诉你什么
本诊断会抓取 /robots.txt,解析其语法,并列出各 User-agent 组的规则、主要搜索爬虫与 AI 机器人的许可状态,以及所有 Sitemap: 行。首先必须明确:robots.txt 控制的是抓取,而非收录。被 Disallow 的页面若被其他站点链接,仍可能以裸 URL 的形式出现在搜索结果中。
| 检查项 | 含义 | 未通过时的处理 |
|---|---|---|
| 试图用 Disallow 阻止收录 | Disallow 只会阻止抓取。更麻烦的是,noindex 必须读取页面才能得知,因此同时使用 Disallow 与 noindex 会导致 noindex 永远读不到。Search Console 中「已被 robots.txt 屏蔽但仍被编入索引」的警告,说的正是这种情况。 |
若不希望被收录,请在 robots.txt 中放行,并返回 <meta name="robots" content="noindex">,非 HTML 文件则返回 X-Robots-Tag: noindex 标头。完全不想被看到的内容应用认证(401 / 403)保护,而非 robots.txt——该文件是公开的,写上想隐藏的路径反而是指路。 |
| User-agent 组未生效 | 爬虫只遵循与自身名称最具体匹配的那一个组,并不会与 User-agent: * 组叠加。一旦你新建了 Googlebot 组,Googlebot 就会完全忽略 * 下的规则。共同的 Disallow 就此悄悄失效,是极常见的事故。 |
创建了单独的组之后,请把 * 中的共同规则也复制进去。反过来说,若没有哪个爬虫真的需要区别对待,全部集中在一个 * 组反而安全。当 Allow 与 Disallow 冲突时,路径更长(更具体)的一方胜出。 |
| 路径写法与意图不符 | 路径按前缀匹配,且区分大小写。Disallow: /admin 同样会命中 /administrator/ 与 /admin-guide.html。可用的通配符只有 *(任意字符串)与 $(结尾),不解析正则表达式。 |
若只想针对目录,请在末尾加 /(Disallow: /admin/)。若按扩展名过滤,用 Disallow: /*.pdf$。绝对不要 Disallow CSS 与 JavaScript——谷歌会渲染页面进行评估,屏蔽它们会被判定为版式错乱,也会拖累移动端适配的评价。 |
robots.txt 按主机与端口区分。https://example.com/robots.txt 与 https://www.example.com/robots.txt 互不相干,每个子域都需各自准备。取不到时的处理也有规定:404 视为全部允许,而持续 5xx 会让谷歌在一段时间内视为全站禁止。若维护模式全站返回 503,请让 robots.txt 单独返回 200。