AI 可引用性检测:逐节检查文章能否被 AI 搜索引用

作者 Linus Li · 更新于 · 免费,在浏览器本地运行

给这个工具打分还没有人评分

粘贴一篇文章(Markdown、HTML 或纯文本),工具按 H2 / H3 把它切成小节,逐节检查标题下的第一句、长度、数字与出处、指代和套话,并标明每条建议依据的研究和证据等级。

要点

  • 工具按 H2 / H3 把文章切成小节,逐节检查第一句、长度、数字与出处、指代和套话。
  • 每条检查都标明依据和证据等级:Google 的说法是 A 级,GEO 论文是 C 级,行业研究是 D 级。
  • 工具不给综合分,也不保证改完以后一定会被 AI 引用。
  • 文章只在你的浏览器里分析,不上传到服务器,也不调用 AI 模型。

什么是 AI 可引用性

AI 可引用性指一段内容被单独摘出来以后,能否作为一个完整、可核对的回答。ChatGPT 搜索、Perplexity、Google AI Overviews 这类 AI 搜索在回答问题时,通常引用网页里的一段话,并把这段话的出处列为来源。因为被引用的是段落而不是整页,所以每个小节最好能独立成立:标题说明问题,第一句给出结论,后面给出条件、数据和出处。

可引用性不等于排名:一个页面要先被抓取和索引,才有机会被 AI 搜索选中;在这个前提下,结构清楚、结论靠前、有出处的段落更容易被准确地摘录。爬虫能否访问你的页面,可以用 AI 爬虫 robots.txt 检测 先查一遍。

工具检查哪些项目

检查项 判断方法 依据 等级
第一句直接回答 标题下第一句不是问句、不是铺垫句,长度不超过中文 70 字 / 英文 35 词 Search Engine Land 答案胶囊研究 D
自包含 第一句不以「它」「这」「上述」「此外」或 it、this、however 等依赖上文的词开头 同上 D
第一句不带链接 第一句里有链接时给提示 同上 D
小节长度 英文 120–180 词为参考区间,低于 50 词或高于 300 词给提示;中文按换算比例 SE Ranking 研究 D
数字与出处 统计数字个数和密度;有百分比、倍数、大数等统计数字但没有链接或「根据……报告」时给建议,只有年份、序号时给提示 GEO 论文 C(论文)
引语 统计引号内的长引语和引用块 GEO 论文 C(论文)
要点框位置 查找「要点」「TL;DR」「Key takeaways」等标签,判断是否在全文前 30% Kevin Indig 引用位置研究 D
前 30% 的信息分布 统计前 30% 内容里的数字、出处和定义句 同上 D
开头段 第一个小标题前有没有开头段,开头第一句是否为铺垫 同上 D
列表与表格 很长的小节里没有列表、表格或小标题时给建议 写作规则 规则
标题层级 H2 直接跳到 H4 等跳级 W3C 无障碍指南 规则
套话与重复 中英文各一份套话词表;重复句子和高度相似的段落 写作规则 规则

标题为「参考资料」「附录」「延伸阅读」等的小节不做第一句、长度和出处检查。

工具不给综合分。只有能明确判断的项目才标「通过」,其他都是「建议」或「提示」。点击任何一条,可以看到原因、改法、可复制的改写模板,并在左侧原文中高亮对应的段落。

AI 搜索怎么挑段落:已知证据与不确定性

Google 官方文档说明不需要为 AI 专门优化内容,GEO 论文和行业研究只提供方向性依据,所以本工具的检查以「对读者更清楚」为准。下面按本站统一的证据等级说明每条检查的依据:A 官方确认,B 文件佐证,C 专利可能,D 行业推测。

能确认的:Google 不要求为 AI 专门写作

Google 的 AI 功能与您的网站 文档写明,出现在 AI Overviews 和 AI 模式中没有额外的要求,也不需要特殊的优化,常规的 SEO 做法同样适用。2026 年 1 月,Danny Sullivan 和 John Mueller 在 Google 的 Search Off the Record 播客中进一步说明,为 LLM 把内容切成很多小块并不是 Google 排名会奖励的做法。

所以,本工具的建议都以「对读者更清楚」为前提。第一句直接回答、结论靠前、数字有出处,这些对读者本来就有用;把一节硬拆成几段、给每段都加一个问句标题,不在建议范围内。

有可能:GEO 论文(C 级)

普林斯顿大学等机构的论文 GEO: Generative Engine Optimization(KDD 2024)在自建的 GEO-bench 查询集上测试了 9 种改写方法。加入引用来源、加入引语、加入统计数字三种方法效果最好,让来源在生成式回答中的可见度最高提升约 40%;堆砌关键词基本无效。

这项研究是在模拟的生成式引擎上做的实验,不是对线上 ChatGPT 或 Google 的观察,而且它衡量的是来源在回答中的可见度,不是点击。本站证据等级的 C 级包括专利和论文,含义是技术上可行、不证明已在线上使用,所以本工具把 GEO 论文标为 C 级。

给老手:GEO 论文的指标和局限
  • 论文用两个指标衡量可见度:Position-Adjusted Word Count(来源在回答中被引用的字数,按位置加权)和 Subjective Impression(由模型评估的主观印象)。约 40% 是相对提升的最高值,不同领域差异很大。
  • 实验把一个来源改写后与其他未改写的来源一起交给引擎,改写方法由大模型执行,所以结果反映的是「相对竞争来源」的变化。
  • 论文也在 Perplexity 上做了验证,但样本和条件与线上真实查询不同。
  • 本工具只把这项研究当作「数字、出处、引语可能有帮助」的方向性依据,不据此要求每节都必须有数字。

行业研究:都是相关性

以下三项研究观察的是「被引用的页面有什么共同点」,都不能证明因果。

推不出的

现有公开材料不能证明以下几点,工具也不做这类判断:

  • 某一段改写以后一定会被某个 AI 引用。AI 搜索先要检索到你的页面,检索结果受索引、权威度和查询本身影响。
  • 中文页面和英文页面遵循同样的规律。上面的研究样本都以英文为主。
  • 问句式标题本身有加分。研究观察到的是「问句标题加上直接回答」这种组合,工具因此只把问句标题标为提示。
给老手:阈值从哪里来
  • 英文小节长度:参考区间 120–180 词,低于 50 词、高于 300 词给提示。前两个数字来自 SE Ranking;300 是本工具设定的上限,超过这个长度而且没有列表、表格或小标题时,才建议整理结构。
  • 中文小节长度:参考区间 180–360 字,低于 80 字、高于 550 字给提示。中文没有对应的研究,工具按翻译行业常用的粗略比例(1 个英文词约对应 1.5–2 个汉字)换算,这是本工具的假设。
  • 第一句长度:中文 70 字、英文 35 词以内。Search Engine Land 只说答案胶囊简短,没有给出可核实的统一字数,这个上限是工具的经验值。
  • 前 30%:按全文字数(不含代码块)计算位置,对应 Indig 研究的分段。全文不到 1,000 字(英文 600 词)时不提示「前 30% 没有数字和定义」。

使用步骤

  1. 复制文章内容。Markdown 最准确;网页可以在浏览器里查看源代码后整段复制 HTML,工具会只读取 <main> 或 <article> 里的内容,跳过导航、页脚和脚本。
  2. 粘贴到左侧输入框。工具自动识别格式和语言,右侧随即显示结果;也可以先点「中文示例」看效果。
  3. 先看「整页检查」:要点框、开头段、前 30% 的信息分布、套话和重复。
  4. 再看「逐节诊断」。有建议的小节默认展开,点击小节里的「在原文中定位」,左侧会高亮整节。
  5. 点击具体的检查项,展开原因、改法和改写模板。模板只给句式,不替你写内容。
  6. 改完以后直接在左侧编辑,结果会实时更新。需要交给同事时,点「复制报告」得到 Markdown 格式的检查清单。

文章只在你的浏览器里分析,不会上传到服务器,也不调用任何 AI 模型。

怎么改写:常见问题与改法

第一句是铺垫或问句

标题已经提出了问题,第一句再问一遍,答案就被推到了第二句或更后面。

  • 改前:「你有没有想过,为什么英文页面会出现在德国用户的搜索结果里?」
  • 改后:「hreflang 用来告诉 Google 同一内容有哪些语言版本,Google 据此给德国用户展示德语页面。」

第一句以「它」「这」开头

AI 引用时只取一段。以「它的格式是……」开头的句子,单独拿出来就不知道「它」是什么。

  • 改前:「它的格式是在每个页面的 head 里加一行 link 标签。」
  • 改后:「hreflang 的格式是在每个页面的 head 里为每个语言版本加一行 link 标签。」

英文同理,把 It、This、However 开头的第一句换成具体名称。

有数字但没有出处

数字是最容易被引用的信息,也是最需要核对的信息。给数字所在的句子加上来源链接,或者写明「根据某机构某年的某报告」。没有可靠来源的数字,宁可删掉,也不要为了「增加数据密度」去编。

长段落没有结构

一节超过 550 字(英文 300 词)而且没有列表、表格或小标题,读者很难找到答案。如果这一节其实回答了两个问题,就拆成两个小标题;如果是步骤或对比,就改成有序列表或表格。如果内容本来就是连贯的论述,保持原样即可。

要点框放在文末

「总结」放在文末是常见写法,但文末的内容最少被引用。可以在开头加一个「要点」框,列 3–5 条结论,文末的总结保留或删除都可以。

中文内容怎么处理

  • 字数: 每个汉字算 1 个字,英文单词和数字各算 1 个,标点不计,全角数字和字母会先转成半角再计数。所以「使用 Google Search Console 检查」计为 7 个字。
  • 分句: 以「。!?」和英文的「. ! ?」为句末,句末后面的右引号、右括号归入前一句;小数点、e.g. 等缩写和英文人名缩写不会被当成句末。
  • 指代词: 中文词表包括「它、这、那些、其中、该、此、上述、以上、前面、另外、此外、同时、因此、但是」等。「其他」「其实」不算指代。
  • 套话: 中文词表包括「众所周知」「随着科技的发展」「在当今……时代」「综上所述」「起着至关重要的作用」等常见套话,引号里提到的不计。词表只覆盖固定短语,查不出不代表文章没有空话。

常见问题

为什么不给一个总分?

不同检查项的证据强度差别很大:Google 的说法是 A 级,GEO 论文是模拟实验(C 级),行业研究是相关性(D 级)。把它们加权成一个 0–100 的分数,权重只能凭感觉定,分数看起来精确,实际没有依据。工具因此只列出每一条的判断和依据,由你决定先改哪一条。

照着改完,AI 就会引用我的文章吗?

不能保证。AI 搜索先要检索到你的页面,检索受索引情况、网站权威度和查询本身影响,SE Ranking 的研究里相关性最强的因素是引用域名数量。工具检查的是内容被检索到以后,能否被准确摘录。

要不要把每个小标题都改成问句?

不需要。研究观察到的是问句标题后面紧跟直接回答的组合。陈述式标题加上一句直接回答同样清楚。Google 也明确表示,不需要为 AI 把内容改写成问答碎片。

支持哪些格式?

Markdown、HTML 和纯文本。纯文本没有标题标记,工具会把「单独一行、较短、没有句末标点、后面跟着段落」的行推测为小标题,并在结果里注明。推测不准时,建议改用 Markdown。

可以直接输入网址吗?

目前不能。本站的网址抓取服务只返回结构化数据和 robots.txt,不返回网页正文。你可以在浏览器里查看网页源代码,把 HTML 整段粘贴进来,工具会自动跳过导航、页脚和脚本。

英文文章也能检查吗?

能。工具按全文的中英文比例自动判断语言,英文按词计数,使用英文的指代词表、套话词表和长度阈值。中英混排的文章按占比更高的语言处理。

相关工具

微信扫码关注公众号

微信扫码关注公众号