跳到内容

🤖 robots.txt 生成器

为 20 多种主流爬虫 (Googlebot / GPTBot / ClaudeBot 等) 一键生成 Allow / Disallow 规则,支持 Crawl-delay、Sitemap、Host 指令。

完全免费 无需注册 浏览器内完成 5 种语言 深色模式

🔒 关于隐私

⚡ 预设

🤖 爬虫

📄 robots.txt


📖 常见的坑

按爬虫分别指定 Allow / Disallow、Crawl-delay、Sitemap 与 Host,生成 robots.txt,并提供面向 AI 爬虫的预设。处理全部在浏览器内完成。robots.txt 控制的是「能不能爬」,而不是「会不会出现在搜索结果里」——把这两件事混为一谈,几乎是关于这个文件的所有误解的根源。

情形 会发生什么 怎么处理
明明 Disallow 了,却仍出现在搜索结果里 robots.txt 阻止的是抓取,而不是索引。只要有别的站点链接到该页,Google 就会在完全没读过内容的情况下把 URL 收录进去——于是搜索结果里标题的位置只剩一串 URL,描述栏则写着「由于 robots.txt 的限制,无法提供该页面的信息」。也就是说,Disallow 非但没能藏住什么,反而在结果里留下了一条内容不明的 URL。而且既然内容读不到,你写的 noindex 同样不会被看到 不想出现在搜索结果里,就用 noindex——HTML 中的 <meta name="robots" content="noindex">,或 HTTP 头 X-Robots-Tag: noindex并且不要同时在 robots.txt 里 Disallow 该页:读取 noindex 本身就需要抓取,两者并用会得到与意图完全相反的结果。要移除已被收录的 URL 也是同理,正确顺序是先撤掉 Disallow,让 noindex 被读到,等它被删除之后再重新 Disallow确实不想被看到的东西,一开始就应放在认证之后——「公开发布、却只对搜索引擎隐藏」这种机制,原理上就不可靠。
Disallow 里写的路径成了攻击者的线索 robots.txt任何人都能读到的公开文件。写下 Disallow: /admin/Disallow: /backup/等于向全世界宣告「后台和备份就在这里」。而 robots.txt 只是一份君子协定,恶意机器人会第一个读它,然后直奔那些路径——你以为藏起来的地方,反而成了最高效的探测起点。漏洞扫描器把抓取 robots.txt 作为第一步,正是出于这个原因。 不要把你想保护的东西写进 robots.txt后台、备份、内部 API 应当放在 Basic 认证、IP 限制或 VPN 之后,这才是唯一有效的措施——放到那里之后,robots.txt 里压根就不必写它们(认证返回 401,抓取自然也就停了)。若实在想模糊化路径,只写上级目录而非逐条具体路径也是一种做法,但那是心理安慰,不是防护判断标准很简单:如果这条路径被公开会造成困扰,那它就不是 robots.txt 该管的事。
屏蔽了 CSS 与 JS,导致页面评价下降 Google 会真正渲染页面来做评估——也就是像浏览器一样加载 CSS 与 JavaScript。此时若还留着 Disallow: /assets/Disallow: /wp-includes/ 这类陈旧惯例,渲染就会失败,Google 看到的是一个版式崩坏、甚至完全没有内容的页面。尤其在由客户端绘制正文的架构下,正文本身根本不会被识别。移动友好性判定同样会因读不到 CSS 而不通过。这个问题的特点是:等你察觉时,排名已经掉下去了。 渲染所需的资源必须放行。确认很简单:在 Search Console 的「网址检查」中执行「测试已发布的网址」,看渲染后的截图与被屏蔽资源列表即可——画面一片空白、或样式没生效,答案就在那里。若已经写了范围很宽的 Disallow,可以用 Allow 单独开口(在 Disallow: /assets/ 之后加上 Allow: /assets/*.cssAllow: /assets/*.js)。说到底,现代站点几乎没有理由去屏蔽静态资源——拿不准就放行。

robots.txt 只在域名根目录下才有效。example.com/blog/robots.txt 会被完全忽略。而且子域名、协议、端口都算作彼此独立,因此 blog.example.com 需要另一份文件,严格来说 http://https:// 也是两回事。关于 AI 爬虫:GPTBotClaudeBotPerplexityBotGoogle-Extended 并不是搜索爬虫,因此拒绝它们不会影响排名——拒绝 Google-Extended,Googlebot 照常抓取。是否放行是没有技术标准答案的业务决策:若你希望获得经由 AI 回答带来的流量,就应当放行。另外请注意,机器人名单还在不断增加,今天写下的清单半年后就会过时——请把这份文件当作需要定期复查的东西,而不是「写一次就完事」。若你想向 AI 指明值得阅读的内容,那是 llms.txt 的职责,而非 robots.txt——两者分工不同。

📖 使用方法

  1. 1
    选择爬虫
    勾选爬虫并切换 Allow / Disallow。
  2. 2
    添加路径和选项
    输入路径、Crawl-delay、Sitemap 和 Host。
  3. 3
    复制或下载
    复制或保存为文件。

❓ 常见问题

屏蔽 GPTBot 影响 SEO 排名吗?
不会。它们是独立的 AI 训练爬虫,不影响搜索排名。
为什么 Disallow 被忽略?
robots.txt 是建议性的。恶意爬虫会忽略,需要服务器认证。
robots.txt 放在哪里?
必须放在域名根目录。
🐛 此工具出现问题了吗?

免费、无需注册。仅提供复现步骤也有帮助。报告将直接发送给运营者并用于改进。

※ 为复现问题,浏览器信息 (UA / 屏幕 / 语言 / URL) 将自动发送