llms.txt 检测与生成工具:按规范逐行校验

作者 Linus Li · 更新于 · 免费,在浏览器本地运行

给这个工具打分还没有人评分

输入域名或粘贴 llms.txt,工具按 llmstxt.org 规范逐行检查格式,标出问题所在的行,并给出修改示例。切换到「生成」可以从 sitemap 或页面列表做一份新的 llms.txt。粘贴的内容只在你的浏览器里处理,不会上传。

要点

  • 工具按 llmstxt.org 规范逐行检查 llms.txt 的格式,标出问题所在的行;切换到「生成」可以从 sitemap 或页面列表做一份新的 llms.txt。
  • Google 搜索不使用 llms.txt,目前也没有证据表明它能提高 ChatGPT、Perplexity 等产品的引用率。
  • 开发者文档、API 和 SaaS 产品文档值得做 llms.txt;外贸独立站、电商和内容站优先级低。
  • 粘贴的内容只在你的浏览器里处理,不会上传。

llms.txt 是什么

llms.txt 是放在网站根目录的一个 Markdown 文件(https://你的域名/llms.txt),由 Answer.AI 的 Jeremy Howard 在 2024 年 9 月提出,2026 年 8 月发布了 v2 版规范。它的用途是给 AI 智能体提供一份精简的网站目录:网站是做什么的,哪些页面值得读,每一页讲什么。智能体在帮用户查资料或写代码时,可以先读这份目录,再打开需要的链接,不用从 HTML 页面里剥离导航和广告。

它和 robots.txt、sitemap.xml 的分工不同:

  • robots.txt 声明哪些爬虫可以抓哪些路径,是访问控制。想禁止 AI 训练,要写在 robots.txt 里,llms.txt 管不了这件事。
  • sitemap.xml 列出所有希望被收录的网址,给搜索引擎用。
  • llms.txt 是挑选过的目录,只列重要页面,并用一句话说明每一页,给 AI 智能体在回答问题时现场读取。

规范规定的文件结构依次是:可选的 BOM;一个 H1,写网站或项目名称(这是唯一必需的部分);一段 blockquote 摘要;任意段落或列表形式的详细说明(不能有标题);若干个用 H2 分隔的分节,每节是一个链接列表,格式为 - [名称](网址): 说明。名为 Optional 的分节放可以跳过的次要链接。

先看证据:llms.txt 现在有没有用

做之前应该知道它的实际效果。下面按本站统一的证据等级列出目前能查到的材料(A 官方确认、B 文件佐证、C 专利可能、D 行业推测或第三方数据)。

说法 等级 出处
Google 搜索不使用 llms.txt,做了既不加分也不减分 A Google 搜索中心:针对生成式 AI 功能优化网站(2026-07-10 更新)
John Mueller 把 llms.txt 比作 keywords meta 标签,并说服务器日志显示 AI 服务根本不请求它 A Search Engine Journal 报道(2025-04,原话发在 Reddit)
Gary Illyes 在 Search Central Live 上说 Google 不支持 llms.txt,也没有支持计划 A Search Engine Land 报道(2025-07)
Chrome Lighthouse 13 新增「智能体浏览」类别,其中一项检查网站有没有合格的 llms.txt A Lighthouse 源码
Ahrefs 统计 137,210 个域名:28% 有 llms.txt,其中 97% 在 2026 年 5 月一次请求都没收到;收到的请求里只有 19.5% 来自 AI 工具 D Ahrefs 研究(2026-06)
SE Ranking 分析约 30 万个域名,没有发现 llms.txt 和 AI 引用次数之间有关联 D Search Engine Journal 报道

结论:llms.txt 不影响 Google 排名和 AI Overviews,目前也没有证据表明它能提高 ChatGPT、Perplexity 等产品的引用率。 Google 内部的态度并不一致:搜索团队说不需要,Chrome 团队把它放进了 Lighthouse 的智能体检查。规范作者在 v2 里写到 OpenAI、Anthropic 和 Google Gemini 都给自己的开发者文档发布了 llms.txt,编程类智能体会读取这类文件。

给老手:Ahrefs 数据的细节
  • 样本来自 Ahrefs Web Analytics 客户的服务器日志和实时流量,排除了软 404 和「文件存在但实际返回首页」的情况。
  • 收到请求的 3% 文件里,96% 的请求来自机器人,4% 来自人。机器人里最多的是 SEO 审计工具(21.7%),然后是未识别机器人、通用爬虫和技术栈探测工具。
  • AI 相关请求合计 19.5%:智能体类 10.5%(Claude-Code 最多),训练类爬虫 5.3%(GPTBot 最多),AI 助手类 2.5%,AI 检索类只有 1.1%。
  • 没有 llms.txt 的网站,AI 机器人也不会来请求,所以不能用「AI 会主动找这个文件」来证明它有用。

要不要做 llms.txt

按网站类型判断:

  • 开发者文档、API、SaaS 产品文档:值得做。编程类智能体会读这类文件,文档平台(如 Mintlify)也能自动生成。建议同时给重要页面提供 .md 版本。
  • 外贸独立站、电商、内容站:优先级低。做一份不难,也不会有坏处,但不要期待它带来排名或 AI 引用。把时间先花在可抓取、可索引、内容有独到信息这些 Google 明确说有用的事情上。
  • 已经做了的网站:不用删。用本工具确认格式没有错,再用 AI 爬虫日志分析器 看服务器日志里有没有 AI 爬虫请求过 /llms.txt,用自己的数据判断要不要继续维护。

怎么用这个工具

  1. 在「检测」里输入域名,工具由本站服务器获取 /llms.txt 和 /llms-full.txt;也可以直接粘贴文件内容。没有现成文件时,点「示例(含常见错误)」看工具的效果,或点「本站的 llms.txt」看一份真实文件。
  2. 先看「硬性条件」:规范要求的 H1,以及 Chrome Lighthouse 的三项检查,结果只有通过或不通过。
  3. 在「问题」里逐条看错误、警告和建议。点行号会跳到编辑框里对应的行;展开「为什么 · 怎么改」可以看到原因和可复制的修复示例。列表符号、中文冒号、相对地址、井号缺空格这类问题可以点「自动修复」一次改完,改错了可以撤销。
  4. 切到「结构预览」,看程序从文件里拆出的结构;切到「链接」检查重复和外站链接;切到「文件信息」看状态码、Content-Type、编码和 llms-full.txt。
  5. 没有 llms.txt 时,切到「生成」,粘贴 sitemap.xml 或页面列表,整理分组、填写说明,复制或下载结果。

检查项与依据

工具把检查分成三类,严重程度和证据等级分开标注:

  • 规范原文(A):llmstxt.org 规范明确写出的要求,例如 H1 必需、H1 和第一个 H2 之间不能有标题、H2 分节里每个列表项要有 [名称](网址) 链接。违反的判为错误或警告。
  • 参考实现的行为(B):规范作者发布的 llms_txt Python 包里有一个解析函数,工具复现了它的读取逻辑。它只认 - 开头的链接行,遇到 * 列表、有序列表、分节里的普通文字都会报错;同名分节只保留最后一个;### 会被当成新的分节。这些不一定违反规范,但说明有程序会读错。
  • 本站建议(D):没有官方依据、来自经验的建议,例如链接写说明、文件不要太大、链接不要几百个、用完整网址。只作为建议,不判错。

Chrome Lighthouse 的 llms.txt 检查(A)只看四件事:/llms.txt 返回 5xx 判失败,返回 4xx 判不适用;文件里有「# 加空格加文字」的 H1;至少有一个 [文字](网址) 形式的链接;不少于 50 个字符。工具的「硬性条件」照这四条逐项显示。

工具不打综合分。一个总分会把「缺 H1」和「少写几条说明」混在一起,看不出该先改什么。

常见错误与修复

H2 分节里放了不是链接的内容。 例如在分节里写一句说明,或者用 - 姓名: 张三 这种键值列表。规范规定分节里是链接列表,参考解析器遇到这种行会直接报错。说明文字应该放在 H1 和第一个 H2 之间,或者写在链接后面:

1
2
3
## 售后政策

- [退货政策](https://www.example.com/policies/refund-policy): 30 天无理由退货

说明前用了中文冒号。 - [帐篷](https://...):双人帐篷 中的「:」不会被识别为分隔符,说明会丢失。中文站很容易出现这个问题,改成英文冒号加空格 : 即可。

用了相对地址。 - [露营灯](/collections/lanterns) 在文件被单独读取时不知道以哪个域名为基准。改成 https://www.example.com/collections/lanterns。

可选分节没有命名为 Optional。 写成「可选」「Optional links」时,按约定识别的工具认不出来。规范 v2 起 Optional 只是约定,不再有程序上的特殊含义,但名字统一写成 ## Optional 没有坏处。

/llms.txt 返回了网页。 单页应用常把所有路径交给首页,或者 404 页面返回 200。用浏览器打开 /llms.txt,如果看到的是网站页面,就要在根目录放真正的文件,并确认服务器直接返回它。

中文乱码。 文件不是 UTF-8 编码,或者 Content-Type 没有声明 charset=utf-8。用编辑器另存为 UTF-8,并在服务器上设置 Content-Type: text/plain; charset=utf-8。工具在「为什么 · 怎么改」里给出了 Nginx、Apache 和 Vercel 的配置示例。

给老手:参考解析器的几处边界行为
  • 解析函数 parse_llms_file 先用 ^##\s*(.*?)$ 切分分节,所以 ### 行也会被切成分节,名称带一个 #。
  • 每个分节的非空行都要匹配 -\s*\[([^\]]+)\]\(([^)]+)\)(?::\s*(.*))?,任何一行不匹配就抛出异常,整份文件解析失败。链接名称里的转义方括号 \] 也会导致不匹配,所以生成器把方括号换成了圆括号。
  • 开头部分用 ^#\s*(.+?)$\n+(?:^>\s*(.+?)$)?\n+(.*) 匹配。H1 和第一个 H2 之间只有 H1 和摘要、没有其他段落时,这个表达式要么匹配失败(抛出异常),要么把摘要当成正文。在摘要后面加一段说明就能避免。
  • 工具的「结构预览」底部可以展开查看参考解析器读出的 JSON,和规范拆出的结构对照。

生成器怎么用

生成器支持四种输入:完整的 sitemap.xml;每行一个网址;「标题 | 网址 | 说明」格式的列表;Markdown 链接列表。导入后按网址的第一级目录自动分组,例如 /collections/ 和 /blogs/ 分成两组。链接标题默认从网址最后一段推出来,中文网址会自动解码。

导入后可以改分组名、拖动链接调整顺序或移到其他分组(也可以用每条链接右侧的下拉菜单和上下箭头,键盘和手机都能操作),把次要页面放进 Optional。右侧实时显示生成结果,可以复制、下载,或者送到「检测」里再检查一遍。

生成器不调用 AI 写说明。每条链接的说明需要你自己写,一句话说清这一页有什么即可。llms.txt 是精选目录,不是 sitemap 的副本,建议只保留几十个最重要的页面。sitemap 是索引文件(sitemapindex)时,工具会列出子 sitemap,请打开其中一个再粘贴。

常见问题

llms.txt 会影响 Google 排名吗?

不会。Google 在官方文档里写明,Google 搜索(包括 AI Overviews 和 AI 模式)不使用 llms.txt,做了既不会帮助也不会损害网站在 Google 的表现。

llms.txt 能阻止 AI 用我的内容训练吗?

不能。llms.txt 是给智能体看的目录,不是访问控制。要禁止 GPTBot、ClaudeBot 等训练爬虫,在 robots.txt 里写规则,可以用 AI 爬虫 robots.txt 检测 确认规则是否生效。

llms.txt 必须放在根目录吗?

规范 v2 允许放在任意路径,一个文件覆盖它所在路径下的页面,多个文件都适用时以路径最具体的为准。例如 /docs/llms.txt 只描述 /docs/ 下的页面。多语言网站可以在根目录和 /en/ 下各放一份,本站就是这样做的。本工具输入域名时只获取根目录的 /llms.txt,子路径下的文件请复制后粘贴。

llms-full.txt 是什么,需要做吗?

llms-full.txt 不在 llmstxt.org 规范里,是部分文档平台的约定,通常把整站正文合并成一个文件。规范 v2 推荐的做法是给每个重要页面提供 .md 版本。工具输入域名时会顺便获取 /llms-full.txt,只显示是否存在和大小,可以点按钮把它载入编辑器检查。

工具会上传我的内容或抓取我的网站吗?

粘贴的内容只在浏览器里处理。输入域名时,本站服务器只请求 /llms.txt 和 /llms-full.txt 这两个固定地址,只返回状态码、Content-Type、大小和前 500 KB 文本;如果返回的是 HTML 网页,不会返回网页内容。获取有频率限制(每个 IP 每小时 30 次,一次检查算两次),同一网址 10 分钟内会使用缓存。工具不会逐个访问文件里的链接,「链接」页提供了打开按钮,可以自己抽查。

为什么本站自己的 llms.txt 也有警告?

本站的 llms.txt 在「作者」分节里用了「- 姓名: Linus Li」这种键值列表,不符合规范对 H2 分节的要求,参考解析器读不出来。点「本站的 llms.txt」可以看到这些问题。

为什么不给一个总分?

总分会把性质不同的问题混在一起,也会让人以为分数高就能被 AI 引用。工具把规范要求和 Lighthouse 检查列为硬性条件,只判通过或不通过;其余按错误、警告、建议分级,并标注每条规则的出处。

延伸阅读

微信扫码关注公众号

微信扫码关注公众号