🤖 robots.txt 生成器
为 20 多种主流爬虫 (Googlebot / GPTBot / ClaudeBot 等) 一键生成 Allow / Disallow 规则,支持 Crawl-delay、Sitemap、Host 指令。
🔒 关于隐私
- ・所有处理均在您的浏览器中完成
- ・不发送到服务器
- ・无需注册、登录或付款
⚡ 预设
🤖 爬虫
📄 robots.txt
📖 常见的坑
按爬虫分别指定 Allow / Disallow、Crawl-delay、Sitemap 与 Host,生成 robots.txt,并提供面向 AI 爬虫的预设。处理全部在浏览器内完成。robots.txt 控制的是「能不能爬」,而不是「会不会出现在搜索结果里」——把这两件事混为一谈,几乎是关于这个文件的所有误解的根源。
| 情形 | 会发生什么 | 怎么处理 |
|---|---|---|
| 明明 Disallow 了,却仍出现在搜索结果里 | robots.txt 阻止的是抓取,而不是索引。只要有别的站点链接到该页,Google 就会在完全没读过内容的情况下把 URL 收录进去——于是搜索结果里标题的位置只剩一串 URL,描述栏则写着「由于 robots.txt 的限制,无法提供该页面的信息」。也就是说,Disallow 非但没能藏住什么,反而在结果里留下了一条内容不明的 URL。而且既然内容读不到,你写的 noindex 同样不会被看到。 |
不想出现在搜索结果里,就用 noindex——HTML 中的 <meta name="robots" content="noindex">,或 HTTP 头 X-Robots-Tag: noindex。并且不要同时在 robots.txt 里 Disallow 该页:读取 noindex 本身就需要抓取,两者并用会得到与意图完全相反的结果。要移除已被收录的 URL 也是同理,正确顺序是先撤掉 Disallow,让 noindex 被读到,等它被删除之后再重新 Disallow。确实不想被看到的东西,一开始就应放在认证之后——「公开发布、却只对搜索引擎隐藏」这种机制,原理上就不可靠。 |
| Disallow 里写的路径成了攻击者的线索 | robots.txt 是任何人都能读到的公开文件。写下 Disallow: /admin/ 或 Disallow: /backup/,等于向全世界宣告「后台和备份就在这里」。而 robots.txt 只是一份君子协定,恶意机器人会第一个读它,然后直奔那些路径——你以为藏起来的地方,反而成了最高效的探测起点。漏洞扫描器把抓取 robots.txt 作为第一步,正是出于这个原因。 |
不要把你想保护的东西写进 robots.txt。后台、备份、内部 API 应当放在 Basic 认证、IP 限制或 VPN 之后,这才是唯一有效的措施——放到那里之后,robots.txt 里压根就不必写它们(认证返回 401,抓取自然也就停了)。若实在想模糊化路径,只写上级目录而非逐条具体路径也是一种做法,但那是心理安慰,不是防护。判断标准很简单:如果这条路径被公开会造成困扰,那它就不是 robots.txt 该管的事。 |
| 屏蔽了 CSS 与 JS,导致页面评价下降 | Google 会真正渲染页面来做评估——也就是像浏览器一样加载 CSS 与 JavaScript。此时若还留着 Disallow: /assets/、Disallow: /wp-includes/ 这类陈旧惯例,渲染就会失败,Google 看到的是一个版式崩坏、甚至完全没有内容的页面。尤其在由客户端绘制正文的架构下,正文本身根本不会被识别。移动友好性判定同样会因读不到 CSS 而不通过。这个问题的特点是:等你察觉时,排名已经掉下去了。 |
渲染所需的资源必须放行。确认很简单:在 Search Console 的「网址检查」中执行「测试已发布的网址」,看渲染后的截图与被屏蔽资源列表即可——画面一片空白、或样式没生效,答案就在那里。若已经写了范围很宽的 Disallow,可以用 Allow 单独开口(在 Disallow: /assets/ 之后加上 Allow: /assets/*.css 与 Allow: /assets/*.js)。说到底,现代站点几乎没有理由去屏蔽静态资源——拿不准就放行。 |
robots.txt 只在域名根目录下才有效。example.com/blog/robots.txt 会被完全忽略。而且子域名、协议、端口都算作彼此独立,因此 blog.example.com 需要另一份文件,严格来说 http:// 与 https:// 也是两回事。关于 AI 爬虫:GPTBot、ClaudeBot、PerplexityBot、Google-Extended 并不是搜索爬虫,因此拒绝它们不会影响排名——拒绝 Google-Extended,Googlebot 照常抓取。是否放行是没有技术标准答案的业务决策:若你希望获得经由 AI 回答带来的流量,就应当放行。另外请注意,机器人名单还在不断增加,今天写下的清单半年后就会过时——请把这份文件当作需要定期复查的东西,而不是「写一次就完事」。若你想向 AI 指明值得阅读的内容,那是 llms.txt 的职责,而非 robots.txt——两者分工不同。
📖 使用方法
-
1
选择爬虫勾选爬虫并切换 Allow / Disallow。
-
2
添加路径和选项输入路径、Crawl-delay、Sitemap 和 Host。
-
3
复制或下载复制或保存为文件。
❓ 常见问题
屏蔽 GPTBot 影响 SEO 排名吗?
为什么 Disallow 被忽略?
robots.txt 放在哪里?
🔗 相关工具
🐛 此工具出现问题了吗?
免费、无需注册。仅提供复现步骤也有帮助。报告将直接发送给运营者并用于改进。
感谢您的反馈!
已送达运营者,将用于改进工具。