跳到内容

🤖 robots.txt 测试器

仅需输入robots.txt的内容和目标URL路径,即可判定该路径对于Googlebot / GPTBot / ClaudeBot等各个User-agent是否被允许。正确解析Allow / Disallow / 最长匹配规则。

完全免费 无需注册 浏览器内完成 5 种语言 深色模式

🤖 主流爬虫批量检查

🔗 相关工具

📖 常见的坑

将你粘贴的 robots.txt 正文与 URL 路径比对,按 Allow / Disallow最长匹配规则给出判定,并同时展示 Googlebot、GPTBot、ClaudeBot 等主要爬虫的批量判定结果。处理全部在浏览器内完成,不会连接你的站点——若要抓取并分析实际发布的 robots.txt,请使用 robots.txt 详细解析。还有一个最重要的前提:这份文件控制的是抓取,而不是索引。「明明 Disallow 了却不从搜索结果里消失」,正是规范中的行为。

情形 会发生什么 怎么处理
Disallow 不等于「不会被索引」 Disallow 表达的是「不要来抓取」而不是「不要列进搜索结果」。只要外部有链接指向该 URL,搜索引擎可能在从未查看内容的情况下把它列出来——就是那种描述文字被替换成「无法提供此页面的信息」的状态。更严重的是顺序问题你可以在页面上写 noindex,但如果这个页面被 Disallow 了,爬虫永远读不到那条 noindex读不到的指令不会被执行。于是 Disallow 反倒成了「确保你的 noindex 永远不生效」的唯一可靠办法。 请按目的分开使用。要从搜索结果中移除,就允许抓取并返回 noindex——HTML 里的 <meta name="robots" content="noindex">,或 HTTP 头的 X-Robots-Tag: noindex(PDF 和图片用后者)。它在该页面被重新抓取时才生效,着急的话可搭配 Search Console 的移除工具。而Disallow 适用的场景是你想减少抓取本身——筛选参数的无穷组合、站内搜索结果、无限延伸到未来日期的日历等。并且两者都无法保护机密。请加上认证——除此之外的一切都只是「请求」而已。
爬虫只读取其中一个分组 这是规范中被误解最多的一点。爬虫只会选中与自己名字最具体匹配的那一个分组,并完全忽略其他所有分组——包括 User-agent: * 在内。规则不会合并。于是,你在 User-agent: * 下写了 Disallow: /admin/,后来又加了一个 User-agent: Googlebot 分组、里面只写 Allow: /Googlebot 就会整个忽略 * 分组并抓取 /admin/本想给某个爬虫加一条例外,结果把对它的全部限制都解除了——这种事故正是从这条规则来的。 一旦为某个爬虫单独建了分组,就把所有共同规则也完整抄进那个分组。这种重复不是冗余,在这套规范下是必需的。改完之后,请务必用本页的批量判定确认一遍——它会把主要爬虫竖排并对同一路径给出判定,哪一行结果不同,那个爬虫就是你漏抄的选择测试路径也有讲究如果你只测试想屏蔽的 URL,那么即使文件被误写成对全站 Disallow: /,看起来也「工作正常」请务必加入至少一个「希望被放行」的 URL——首页,或主要的文章页。
路径是前缀匹配,只有 *$ 是特殊的 Disallow 的值是作为「从 URL 路径开头起的字符串」来比较的,而不是目录名。因此 Disallow: /admin 不只挡住 /admin/,也会挡住 /administrator-guide/admin-policy.html而且区分大小写——/Admin/ 是另一个字符串。通配符只有 *(任意字符串)与 $(路径结尾)两个,不能使用正则表达式按扩展名指定时 $ 是必需的,因为 Disallow: /*.pdf 同样会命中 /a.pdf?x=1/a.pdf.html而代价最高的错误只有一个字符之差Disallow:(后面为空)表示「全部允许」,Disallow: / 表示「全部禁止」 如果你指的是目录,请务必写上结尾斜杠Disallow: /admin/)。然后在本页把两种写法都试一遍——让 /admin//admin-tools/ 各判定一次,是否命中范围超出预期当场就看得出来查询字符串同样在比对范围内,所以若想拦住筛选型 URL,请用你实际使用的形式来测,例如 Disallow: /*?。此外,发布之前务必把生产环境的 robots.txt 整份粘进来,确认首页判定为 Allow——把预发布用的 Disallow: / 原样发到生产的事故,靠这一步就能全部避免

robots.txt 是按源(origin)生效的。协议、主机名、端口只要有一项不同,就是另一份文件——https://example.com/robots.txt 既不适用于 http://,也不适用于 www.example.comblog.example.com它只能放在根目录下,放进子目录是不会被读取的。格式方面:Google 会忽略 Crawl-delay(想降速请在 Search Console 中设置)。唯有 Sitemap: 是例外,它不属于任何分组,写在文件的任何位置都有效。最后,这并不是一个具有强制力的机制遵不遵守由爬虫自行决定,恶意爬虫会读完之后照样无视。更糟的是,这份文件把「你想藏起来的路径清单」公开给了全世界——写下 Disallow: /secret-admin/,等同于公告那里有一个管理后台想保密的东西,请不要写进 robots.txt。

📖 使用方法

  1. 1
    粘贴 robots.txt 内容
    在左侧粘贴 robots.txt 内容。
  2. 2
    输入测试 URL 路径和 User-agent
    输入路径并从下拉选择 User-agent。
  3. 3
    查看判定结果和批量爬虫检查
    显示所选 User-agent 的判定结果和匹配规则。

❓ 常见问题

Disallow: / 和 Allow: / 同时存在时?
Google 采用最长匹配规则,相同长度时 Allow 优先。
Sitemap 指令会被解析吗?
此工具专注于 Allow/Disallow 规则,忽略 Sitemap 等指令。
User-agent 区分大小写吗?
此工具不区分大小写,与 Google 爬虫一致。
🐛 此工具出现问题了吗?

免费、无需注册。仅提供复现步骤也有帮助。报告将直接发送给运营者并用于改进。

※ 为复现问题,浏览器信息 (UA / 屏幕 / 语言 / URL) 将自动发送