llms.txt 检测与生成工具:按规范逐行校验
输入域名或粘贴 llms.txt,工具按 llmstxt.org 规范逐行检查格式,标出问题所在的行,并给出修改示例。切换到「生成」可以从 sitemap 或页面列表做一份新的 llms.txt。粘贴的内容只在你的浏览器里处理,不会上传。
要点
- 工具按 llmstxt.org 规范逐行检查 llms.txt 的格式,标出问题所在的行;切换到「生成」可以从 sitemap 或页面列表做一份新的 llms.txt。
- Google 搜索不使用 llms.txt,目前也没有证据表明它能提高 ChatGPT、Perplexity 等产品的引用率。
- 开发者文档、API 和 SaaS 产品文档值得做 llms.txt;外贸独立站、电商和内容站优先级低。
- 粘贴的内容只在你的浏览器里处理,不会上传。
llms.txt 是什么
llms.txt 是放在网站根目录的一个 Markdown 文件(https://你的域名/llms.txt),由 Answer.AI 的 Jeremy Howard 在 2024 年 9 月提出,2026 年 8 月发布了 v2 版规范。它的用途是给 AI 智能体提供一份精简的网站目录:网站是做什么的,哪些页面值得读,每一页讲什么。智能体在帮用户查资料或写代码时,可以先读这份目录,再打开需要的链接,不用从 HTML 页面里剥离导航和广告。
它和 robots.txt、sitemap.xml 的分工不同:
- robots.txt 声明哪些爬虫可以抓哪些路径,是访问控制。想禁止 AI 训练,要写在 robots.txt 里,llms.txt 管不了这件事。
- sitemap.xml 列出所有希望被收录的网址,给搜索引擎用。
- llms.txt 是挑选过的目录,只列重要页面,并用一句话说明每一页,给 AI 智能体在回答问题时现场读取。
规范规定的文件结构依次是:可选的 BOM;一个 H1,写网站或项目名称(这是唯一必需的部分);一段 blockquote 摘要;任意段落或列表形式的详细说明(不能有标题);若干个用 H2 分隔的分节,每节是一个链接列表,格式为 - [名称](网址): 说明。名为 Optional 的分节放可以跳过的次要链接。
先看证据:llms.txt 现在有没有用
做之前应该知道它的实际效果。下面按本站统一的证据等级列出目前能查到的材料(A 官方确认、B 文件佐证、C 专利可能、D 行业推测或第三方数据)。
| 说法 | 等级 | 出处 |
|---|---|---|
| Google 搜索不使用 llms.txt,做了既不加分也不减分 | A | Google 搜索中心:针对生成式 AI 功能优化网站(2026-07-10 更新) |
| John Mueller 把 llms.txt 比作 keywords meta 标签,并说服务器日志显示 AI 服务根本不请求它 | A | Search Engine Journal 报道(2025-04,原话发在 Reddit) |
| Gary Illyes 在 Search Central Live 上说 Google 不支持 llms.txt,也没有支持计划 | A | Search Engine Land 报道(2025-07) |
| Chrome Lighthouse 13 新增「智能体浏览」类别,其中一项检查网站有没有合格的 llms.txt | A | Lighthouse 源码 |
| Ahrefs 统计 137,210 个域名:28% 有 llms.txt,其中 97% 在 2026 年 5 月一次请求都没收到;收到的请求里只有 19.5% 来自 AI 工具 | D | Ahrefs 研究(2026-06) |
| SE Ranking 分析约 30 万个域名,没有发现 llms.txt 和 AI 引用次数之间有关联 | D | Search Engine Journal 报道 |
结论:llms.txt 不影响 Google 排名和 AI Overviews,目前也没有证据表明它能提高 ChatGPT、Perplexity 等产品的引用率。 Google 内部的态度并不一致:搜索团队说不需要,Chrome 团队把它放进了 Lighthouse 的智能体检查。规范作者在 v2 里写到 OpenAI、Anthropic 和 Google Gemini 都给自己的开发者文档发布了 llms.txt,编程类智能体会读取这类文件。
给老手:Ahrefs 数据的细节
- 样本来自 Ahrefs Web Analytics 客户的服务器日志和实时流量,排除了软 404 和「文件存在但实际返回首页」的情况。
- 收到请求的 3% 文件里,96% 的请求来自机器人,4% 来自人。机器人里最多的是 SEO 审计工具(21.7%),然后是未识别机器人、通用爬虫和技术栈探测工具。
- AI 相关请求合计 19.5%:智能体类 10.5%(Claude-Code 最多),训练类爬虫 5.3%(GPTBot 最多),AI 助手类 2.5%,AI 检索类只有 1.1%。
- 没有 llms.txt 的网站,AI 机器人也不会来请求,所以不能用「AI 会主动找这个文件」来证明它有用。
要不要做 llms.txt
按网站类型判断:
- 开发者文档、API、SaaS 产品文档:值得做。编程类智能体会读这类文件,文档平台(如 Mintlify)也能自动生成。建议同时给重要页面提供
.md版本。 - 外贸独立站、电商、内容站:优先级低。做一份不难,也不会有坏处,但不要期待它带来排名或 AI 引用。把时间先花在可抓取、可索引、内容有独到信息这些 Google 明确说有用的事情上。
- 已经做了的网站:不用删。用本工具确认格式没有错,再用 AI 爬虫日志分析器 看服务器日志里有没有 AI 爬虫请求过
/llms.txt,用自己的数据判断要不要继续维护。
怎么用这个工具
- 在「检测」里输入域名,工具由本站服务器获取
/llms.txt和/llms-full.txt;也可以直接粘贴文件内容。没有现成文件时,点「示例(含常见错误)」看工具的效果,或点「本站的 llms.txt」看一份真实文件。 - 先看「硬性条件」:规范要求的 H1,以及 Chrome Lighthouse 的三项检查,结果只有通过或不通过。
- 在「问题」里逐条看错误、警告和建议。点行号会跳到编辑框里对应的行;展开「为什么 · 怎么改」可以看到原因和可复制的修复示例。列表符号、中文冒号、相对地址、井号缺空格这类问题可以点「自动修复」一次改完,改错了可以撤销。
- 切到「结构预览」,看程序从文件里拆出的结构;切到「链接」检查重复和外站链接;切到「文件信息」看状态码、Content-Type、编码和 llms-full.txt。
- 没有 llms.txt 时,切到「生成」,粘贴 sitemap.xml 或页面列表,整理分组、填写说明,复制或下载结果。
检查项与依据
工具把检查分成三类,严重程度和证据等级分开标注:
- 规范原文(A):llmstxt.org 规范明确写出的要求,例如 H1 必需、H1 和第一个 H2 之间不能有标题、H2 分节里每个列表项要有
[名称](网址)链接。违反的判为错误或警告。 - 参考实现的行为(B):规范作者发布的
llms_txtPython 包里有一个解析函数,工具复现了它的读取逻辑。它只认-开头的链接行,遇到*列表、有序列表、分节里的普通文字都会报错;同名分节只保留最后一个;###会被当成新的分节。这些不一定违反规范,但说明有程序会读错。 - 本站建议(D):没有官方依据、来自经验的建议,例如链接写说明、文件不要太大、链接不要几百个、用完整网址。只作为建议,不判错。
Chrome Lighthouse 的 llms.txt 检查(A)只看四件事:/llms.txt 返回 5xx 判失败,返回 4xx 判不适用;文件里有「# 加空格加文字」的 H1;至少有一个 [文字](网址) 形式的链接;不少于 50 个字符。工具的「硬性条件」照这四条逐项显示。
工具不打综合分。一个总分会把「缺 H1」和「少写几条说明」混在一起,看不出该先改什么。
常见错误与修复
H2 分节里放了不是链接的内容。 例如在分节里写一句说明,或者用 - 姓名: 张三 这种键值列表。规范规定分节里是链接列表,参考解析器遇到这种行会直接报错。说明文字应该放在 H1 和第一个 H2 之间,或者写在链接后面:
1 | ## 售后政策 |
说明前用了中文冒号。 - [帐篷](https://...):双人帐篷 中的「:」不会被识别为分隔符,说明会丢失。中文站很容易出现这个问题,改成英文冒号加空格 : 即可。
用了相对地址。 - [露营灯](/collections/lanterns) 在文件被单独读取时不知道以哪个域名为基准。改成 https://www.example.com/collections/lanterns。
可选分节没有命名为 Optional。 写成「可选」「Optional links」时,按约定识别的工具认不出来。规范 v2 起 Optional 只是约定,不再有程序上的特殊含义,但名字统一写成 ## Optional 没有坏处。
/llms.txt 返回了网页。 单页应用常把所有路径交给首页,或者 404 页面返回 200。用浏览器打开 /llms.txt,如果看到的是网站页面,就要在根目录放真正的文件,并确认服务器直接返回它。
中文乱码。 文件不是 UTF-8 编码,或者 Content-Type 没有声明 charset=utf-8。用编辑器另存为 UTF-8,并在服务器上设置 Content-Type: text/plain; charset=utf-8。工具在「为什么 · 怎么改」里给出了 Nginx、Apache 和 Vercel 的配置示例。
给老手:参考解析器的几处边界行为
- 解析函数
parse_llms_file先用^##\s*(.*?)$切分分节,所以###行也会被切成分节,名称带一个#。 - 每个分节的非空行都要匹配
-\s*\[([^\]]+)\]\(([^)]+)\)(?::\s*(.*))?,任何一行不匹配就抛出异常,整份文件解析失败。链接名称里的转义方括号\]也会导致不匹配,所以生成器把方括号换成了圆括号。 - 开头部分用
^#\s*(.+?)$\n+(?:^>\s*(.+?)$)?\n+(.*)匹配。H1 和第一个 H2 之间只有 H1 和摘要、没有其他段落时,这个表达式要么匹配失败(抛出异常),要么把摘要当成正文。在摘要后面加一段说明就能避免。 - 工具的「结构预览」底部可以展开查看参考解析器读出的 JSON,和规范拆出的结构对照。
生成器怎么用
生成器支持四种输入:完整的 sitemap.xml;每行一个网址;「标题 | 网址 | 说明」格式的列表;Markdown 链接列表。导入后按网址的第一级目录自动分组,例如 /collections/ 和 /blogs/ 分成两组。链接标题默认从网址最后一段推出来,中文网址会自动解码。
导入后可以改分组名、拖动链接调整顺序或移到其他分组(也可以用每条链接右侧的下拉菜单和上下箭头,键盘和手机都能操作),把次要页面放进 Optional。右侧实时显示生成结果,可以复制、下载,或者送到「检测」里再检查一遍。
生成器不调用 AI 写说明。每条链接的说明需要你自己写,一句话说清这一页有什么即可。llms.txt 是精选目录,不是 sitemap 的副本,建议只保留几十个最重要的页面。sitemap 是索引文件(sitemapindex)时,工具会列出子 sitemap,请打开其中一个再粘贴。
常见问题
llms.txt 会影响 Google 排名吗?
不会。Google 在官方文档里写明,Google 搜索(包括 AI Overviews 和 AI 模式)不使用 llms.txt,做了既不会帮助也不会损害网站在 Google 的表现。
llms.txt 能阻止 AI 用我的内容训练吗?
不能。llms.txt 是给智能体看的目录,不是访问控制。要禁止 GPTBot、ClaudeBot 等训练爬虫,在 robots.txt 里写规则,可以用 AI 爬虫 robots.txt 检测 确认规则是否生效。
llms.txt 必须放在根目录吗?
规范 v2 允许放在任意路径,一个文件覆盖它所在路径下的页面,多个文件都适用时以路径最具体的为准。例如 /docs/llms.txt 只描述 /docs/ 下的页面。多语言网站可以在根目录和 /en/ 下各放一份,本站就是这样做的。本工具输入域名时只获取根目录的 /llms.txt,子路径下的文件请复制后粘贴。
llms-full.txt 是什么,需要做吗?
llms-full.txt 不在 llmstxt.org 规范里,是部分文档平台的约定,通常把整站正文合并成一个文件。规范 v2 推荐的做法是给每个重要页面提供 .md 版本。工具输入域名时会顺便获取 /llms-full.txt,只显示是否存在和大小,可以点按钮把它载入编辑器检查。
工具会上传我的内容或抓取我的网站吗?
粘贴的内容只在浏览器里处理。输入域名时,本站服务器只请求 /llms.txt 和 /llms-full.txt 这两个固定地址,只返回状态码、Content-Type、大小和前 500 KB 文本;如果返回的是 HTML 网页,不会返回网页内容。获取有频率限制(每个 IP 每小时 30 次,一次检查算两次),同一网址 10 分钟内会使用缓存。工具不会逐个访问文件里的链接,「链接」页提供了打开按钮,可以自己抽查。
为什么本站自己的 llms.txt 也有警告?
本站的 llms.txt 在「作者」分节里用了「- 姓名: Linus Li」这种键值列表,不符合规范对 H2 分节的要求,参考解析器读不出来。点「本站的 llms.txt」可以看到这些问题。
为什么不给一个总分?
总分会把性质不同的问题混在一起,也会让人以为分数高就能被 AI 引用。工具把规范要求和 Lighthouse 检查列为硬性条件,只判通过或不通过;其余按错误、警告、建议分级,并标注每条规则的出处。
延伸阅读
- AI 爬虫日志分析器:用服务器日志确认 AI 爬虫有没有读过你的 llms.txt
- AI 爬虫 robots.txt 检测:检查 GPTBot、ClaudeBot 等能否抓取你的页面
- Schema 可视化工具:检查结构化数据
- llmstxt.org 规范原文
- 更多免费 SEO 与 GEO 工具