🤖 LLMO 诊断
LLMO(Large Language Model Optimization)是面向 AI 搜索时代的优化诊断。 一次性确认 llms.txt 是否存在、GPTBot / ClaudeBot / Google-Extended 等主要 AI 爬虫的权限状态以及结构化数据。
完全免费
无需注册
服务器处理
无日志 / 数据库
限速
5 种语言
深色模式
📖 本诊断能告诉你什么
本诊断查看 /llms.txt 是否存在及其结构、robots.txt 中对 AI 爬虫(GPTBot / ClaudeBot / PerplexityBot / Google-Extended / CCBot 等)的许可状态,以及是否有结构化数据。你的页面会不会被 ChatGPT 或 AI 搜索引用,谁都无法测量,因为不存在相当于排名 API 的东西。这里能确认的只是前提条件:是否具备机器可读的形式,以及是否根本就把它们挡在了门外。
| 检查项 | 含义 | 未通过时的处理 |
|---|---|---|
| 没有 llms.txt | llms.txt 是 2024 年提出的规范,目前没有任何 LLM 将其列为必需,放置它与被引用之间也未确认因果关系。它的定位大致是以 Markdown 把站点地图交给机器。没有它并不需要视为缺陷。 | 若要准备,请在 /llms.txt 中用 H1 写站点名,接着写一段概述,其下按 ## 分区名 列出链接与一行说明的清单,全部用 Markdown。实质上就是把面向人的站点地图页以纯 Markdown 放置,不需要专门的生成工具。 |
| 一律屏蔽 AI 爬虫 | 每个 user-agent 的含义并不相同。Disallow Google-Extended 只是退出 AI Overviews 等用途,不影响常规搜索排名(抓取仍由 Googlebot 完成)。而屏蔽 GPTBot 或 ClaudeBot,则连同来自 AI 的引荐流量一并放弃。 |
若想区分「不希望被用于训练」与「希望被引用」,可只 Disallow 训练用途的爬虫(CCBot、GPTBot 等),而允许在回答时抓取的爬虫。但遵守与否取决于各家自律,若要确实拦截,请在服务器侧按 UA 拒绝。 |
| 没有结构化数据 | LLM 也会从正文中获取信息,但唯有 schema.org 的 JSON-LD 能明确传达「这是一篇文章、作者是谁、何时更新」。若日期与作者在正文中没有任何结构化的存在,摘要时就会被丢弃,或被错误地与别的数值关联。 | 请以 JSON-LD 添加 Article(或 BlogPosting)、Organization、BreadcrumbList。关键在于让标记与可见 HTML 由同一份数据生成,若分开撰写,必有一方过时。本站也曾在 FAQ 上犯过同样的错误,后改为由同一个数组同时输出两者。 |
LLMO 尚无成型的定式。目前确定有效的是 (1) 不依赖 JavaScript 也能读到正文,(2) 标题层级与内容一致,(3) 拥有别处没有的一手信息 这三点,与面向搜索引擎的做法基本相同。请把它们看得比放置 llms.txt 更优先。