跳到内容

llms.txt 生成器

生成 llms.txt 文件(符合 llmstxt.org 规范)告知 LLM 爬虫您的站点结构。表单输入或从 sitemap.xml 批量导入。

完全免费 无需注册 浏览器内完成 即刻下载 5 种语言 深色模式

分类 (H2)

从 sitemap.xml 批量导入

※ 仅提取 <loc>。标题从 URL 最后段推测

llms.txt

⬇ llms.txt

        

放置到站点根目录: https://example.com/llms.txt

📖 常见的坑

按照 llmstxt.org 提出的格式,把站点内容整理成面向大语言模型的 Markdown 目录,并支持从 sitemap.xml 批量导入。这是一份被提议的书写约定,而非 W3C 或 IETF 标准——放上去之后究竟有没有爬虫会读,无人保证。与其说是为了效果而做,不如说更接近「为自己的站点整理出一页能说清里面有什么的文档」这件事本身

情形 会发生什么 怎么处理
从 sitemap 导入后,标题还是 URL 里的 slug sitemap.xml 里只有 <loc>,也就是 URL,因此标题只能从路径的最后一段机械地猜出来/tools/cidr/ 会变成 cidr。真正的问题就出在这里——一份没有说明、只是 URL 罗列的 llms.txt,作为目录几乎毫无价值,因为读它的人或模型都判断不出该看哪一条。到那一步,它并没说出任何 sitemap.xml 尚未说过的东西。 请为每一行写上一句「这个页面能做什么」——例如 [CIDR 计算](/tools/cidr/):计算子网的可用主机数与地址范围补上光看标题得不到的信息,正是这个格式的要义。而且没必要把所有页面都列上;相反,精简到 20~50 个真正的入口页,作为目录反而更管用——一份一千行的清单毫无优先级信息,等于叫读者「全都看一遍」。收录的判断标准是:这一条是否有助于看清站点的覆盖范围。
放上去了,却看不出有谁在读 首先,看不出效果本属正常:读不读 llms.txt 完全由爬虫自行决定,也没有任何机制会告诉你它读过。但在此之前,相当多的站点其实根本没把这个文件正确提供出去。常见原因包括:SPA 的 fallback 让 /llms.txt 也返回 index.html;CDN 未预期 .txt 扩展名而返回 404;Content-Typeapplication/octet-stream,被当成下载处理。你在浏览器里能看到内容,不等于爬虫能取到它。 请用 curl -I https://example.com/llms.txt 确认:要拿到 200,且 Content-Typetext/plaintext/markdown再用 curl -s ... | head -5 确认正文不是 HTML——SPA 的 fallback 一眼就能看出来。顺便检查 robots.txt 是否大范围屏蔽了站点根目录。浏览器中间夹着缓存与 Service Worker,所以请用 curl 而非浏览器来下判断
把它当成 robots.txt 的替代品 llms.txt 不是访问控制。它是一份「希望被读到的内容」的目录;没写进去的页面不会因此被屏蔽,写进去的页面也不构成同意用于训练。反方向的误解同样常见——既不是「放了它 AI 才会读」,也不是「不放它就不会被读」。爬虫依旧照老规矩看 robots.txt 和实际的链接结构。 要控制 AI 爬虫,请写在 robots.txt,可以逐个指名:User-agent: GPTBot / ClaudeBot / PerplexityBot / Google-Extended这两个文件用途完全不同,因此两者并存才是正确配置——robots.txt 说明「允许爬什么」,llms.txt 说明「在允许的范围内,值得看什么」。另外,机器人名单还在不断增加,今天写下的清单必定会过时,请以定期复查为前提。

llms.txtllms-full.txt 是两个不同的文件。前者是目录:URL 加上各自一行说明;后者是包含每页正文的全文版,规模大时可达数 MB。该先做的是前者,全文版只在你确实有希望被摄取的技术文档时才考虑。运维上最现实的问题是陈旧化:手写的目录必定会烂掉,而满是死链的 llms.txt 比没有更糟,因为那等于递给读者一张错误的地图。唯一能长期维持的做法,是把「从 sitemap.xml 生成」这一步放进 CI,只把说明文字交由人来维护。同时,请在每次部署时检查死链——自动生成不等于正确,被合并或删除的页面会只留下链接。

📖 使用方法

  1. 1
    填写站点信息
    站点名和摘要为必填项
  2. 2
    添加分类和链接
    H2 分组 + [Title](URL): desc
  3. 3
    下载并放置到根目录
    https://example.com/llms.txt 返回 200 即被识别

❓ 常见问题

llms.txt 是什么?
llmstxt.org 规范。用 LLM 友好的 Markdown 描述站点
与 llms-full.txt 区别?
llms.txt = 目录。llms-full.txt = 完整内容
与 robots.txt 不同?
完全不同。robots.txt = 访问控制,llms.txt = LLM 内容目录
🐛 此工具出现问题了吗?

免费、无需注册。仅提供复现步骤也有帮助。报告将直接发送给运营者并用于改进。

※ 为复现问题,浏览器信息 (UA / 屏幕 / 语言 / URL) 将自动发送