← 返回 Insights

2026年6月3日 · 12 分钟阅读

证据三件套:在 AI 搜索里,引用、统计与数据为何胜过关键词

迄今规模最大的 GEO 受控实验在 10,000 条查询上比较了 9 种优化手法 —— 三种「证据型」战术大胜,而关键词堆砌彻底失败。本文拆解发生了什么、为何能迁移,以及如何为 AI 引用重写一个页面。

GEO 研究 内容策略 AIEO
Junwei Yu Junwei Yu CEO

如果你想让 AI 搜索引擎引用你的内容,就按这个优先级去做:加入带署名出处的统计数字、 嵌入权威信源的直接引用(quote)、标注第三方出处。 在迄今为止规模最大的生成引擎 优化(GEO)受控实验 —— 普林斯顿大学的 GEO 论文(Aggarwal et al., arXiv 2311.09735, KDD 2024)中,研究者在一个 10,000 条查询的基准上比较了 9 种手法,发现 这套「证据三件套」能把信源的可见度提升 最高约 40%。与此同时,过去二十年统治 SEO 的「关键词堆砌」几乎毫无收益,且常常比基线还差。 这一组对比,正是 2026 年 内容团队关于 AI 搜索最该内化的一个事实。

本文将拆解这项实验,解释 为什么 证据获胜、关键词落败,并把结论落成一份你今天下午 就能用上的具体重写清单。文末还会触及多数团队会跳过的环节:如何 度量 一次重写到底 有没有撬动你的引用。


普林斯顿研究究竟测了什么

网上流传的多数「GEO 建议」,都是把轶事包装成原理。普林斯顿这项工作不同,因为它是 一个受控实验,并且用的是为生成时代量身设计的指标。

传统 SEO 度量的是 排名 —— 你在第 1、第 3 还是第 9 位?但在 AI 回答里,「排名」 几乎不存在。一段回答是被合成出来的文字,它可能把你的内容织进句子中段、提到你两次, 或者在不给出可见链接的情况下转述你。于是作者定义了两个新指标:

  • 位置加权词数(Position-Adjusted Word Count, PAWC) —— 生成回答中可归因于你 这个信源的篇幅,并按它 出现的位置(越靠前、越显眼,权重越高)加权。
  • 主观印象(Subjective Impression) —— 由 LLM 评判,你的信源在回答中显得多有 影响力、多权威。

随后,他们拿真实网页,分别施加 9 种不同的重写策略,在整个基准上重新生成回答,并度量 提升幅度。关键在于:这些查询横跨多个领域 —— 辩论、科学、how-to、历史、商业 —— 所以 结果并非单一垂类里的偶然。

标题不是「GEO 有用」。其本质是 GEO 各手法并不可互换:最优与最差战术之间的差距, 是「可见度 +30〜40%」与「负向移动」之间的差距。选错打法不仅是无效,更可能主动把 你压下去。


把 9 种手法按效果排序

这是论文最具实操价值的核心 —— 被检验的手法,以及各自大致如何撬动「位置加权词数 (PAWC)」。三位赢家有一个共同点:它们都在加入模型可以摘取并归因的 可验证证据

手法做了什么对可见度(PAWC)的影响
标注出处(Cite Sources)为可信的第三方参考加上引用+30〜40%
加入引用(Quotation Addition)嵌入专家/权威信源的直接引用约 +41%
加入统计(Statistics Addition)插入相关、带署名的定量数据约 +37%
流畅度优化改善可读性与行文小幅正向
易懂化简化语言小幅/不一
权威语气改写得更笃定小幅/不一
专业术语加入领域术语不一
独特词汇插入有辨识度的用词边际
关键词堆砌重复目标搜索词几无收益 —— 常常比基线更差

这张表之上,可叠加三点观察。

第一,证据三件套 —— 标注出处、加入引用、加入统计 —— 自成一档。 它们不是文体上的 微调,而是改变了页面的 认知实质。一个在组装回答的生成模型,本质上是在寻找它敢于 背书的句子。带署名统计或带归属引用的句子,比无支撑的断言 更安全可被复述,因为证据 是和它一起被带走的。

第二,流畅与语气只在边际上有用。 把页面写得好读是入场门槛,并不能让你脱颖而出 —— 因为别人的页面同样好读。

第三,关键词堆砌无法从 SEO 迁移到 GEO。 这正是该重排预算的发现。过去二十年被 实践最多的 SEO 手法 —— 密集重复查询词 —— 在 AI 回答里往好了说是惰性的,往坏了说是 适得其反。生成引擎不是在数词频,而是在评估一段文字是否 可被引用、可被辩护


为什么证据获胜(关键词不行)

理解其机制是值得的,因为它能告诉你在论文未测过的情形下该怎么做。

经典搜索索引主要靠词法与链接信号给文档排序 —— 页面里有没有查询词、有没有权威页面 链接到它。在那套体制下,重复关键词是理性的。生成引擎的工作方式不同:它 阅读候选 段落,并决定把哪些纳入一段流畅、可归因的回答。 选择的压力不再是「这是否匹配查询 字符串」,而是「我能不能引用它,并且它经得起推敲」。

在这种压力之下 ——

  • 一个带署名的统计,是一份借来的可信度。「采用率同比增长 37%(出处 X)」是模型 可以带着引用放进回答的;「采用率显著增长」则不是。
  • 一段引用,是预先归属好的权威。 来自公认专家的直接引用,让模型可以 经由你 去 引用那位 专家 —— 你的页面成了导管,并因此获得署名。
  • 一处第三方标注,表明该页面是可验证之网的一部分,而非一个封闭的断言。它降低了 模型复述无支撑内容的风险。
  • 重复的关键词不携带任何证据。 它没有给模型任何可归因的东西,因此对选择机制而言 是不可见的 —— 而触发垃圾内容判定的堆砌密度,还可能把你压到基线 以下

这把 GEO 写作从「为排名算法做优化」重新框定为「为模型供给它愿意以自己名义引用的 句子」。


挑战者优势:谁获益最大

论文里最具行动价值的一个细节是:效果并不均匀,而是高度取决于你的起点。

排名较低的信源获益最大。一个排在第 5 位左右的页面,仅靠「标注出处」就录得高达约 +115% 的增幅。直觉上是这样:生成引擎渴求可用的证据,会在候选清单里往下伸更远, 去找一段能给它可引用统计或带归属主张的文字。证据让弱势页面得以 打出超越其排名的 战绩

反过来,本已占据主导的信源可能丢失份额 —— 某些条件下最高约 30%。 当你已经是默认 被引用的对象时,再添证据,引擎手上就 多了其他 同样有充分支撑的段落可选,归属被 分散,你的份额反而被稀释。

对一个在拥挤的日本 B2B SaaS 品类里厮杀的挑战者品牌来说,这是 GEO 文献中最令人鼓舞 的结果:证据三件套在结构上偏向「尚未被引用的一方」。 如果你还不是默认答案, 证据就是你杠杆最大的一手。

战略读法是:在位的现有者应以 一致性与权威广度 防守;挑战者应以 证据密度 进攻。 两者并非在打同一场游戏。


一份具体的重写清单

把研究结论翻译成页面级的清单。在动其他任何东西之前,先让一篇现成文章过一遍下面四步。

1. 答案先行。 把直接、可摘取的答案放在开头 —— 最好在任何铺垫之前,前 50 个词以内。 这既符合直觉,也有依据:对 LLM 引用内容的分析发现,约 44% 的引用来自页面的前 30%。 把结论前置;模型对页面顶部读得最仔细。

2. 加入带署名的统计。 把每一个模糊的量词(「很多」「迅速」「显著」)替换成具体 数字 及其出处。「采用更快」改成「2025 年采用率增长 37%(据 [出处名])」。每一个都是 模型可以连同归属一字不差摘取的单位。

3. 嵌入权威引用。 至少插入一段来自公认专家、原始研究或行业机构的直接引用,并注明 归属。你是在把一份「预先获得资质认证的权威」递给引擎,让它经由你的页面传递出去。

4. 标注第三方出处。 为你的事实主张向可信参考做外链。对 SEO 老兵而言有些反直觉: 向外链接 反而提高你被引用的几率 —— 因为它把你的页面放进了一张可验证的证据之网, 而非呈现为一座无支撑的孤岛。

这份清单里显眼地 缺席 的,正是用目标关键词去塞满页面。数据告诉我们:那项工作往 好了说也是白费。


结构与证据交汇之处:GEO-SFE

普林斯顿的研究分离出 证据 维度 —— 页面说了什么、引用了什么。我们自己的研究分离出 其 互补 维度 —— 页面是如何被结构化的。《Structural Feature Engineering for Generative Engine Optimization》(arXiv 2603.29979)中,我们证明:在保持语义 不变的前提下,仅凭结构改写 —— 分节、事实摆位、列表使用、视觉强调 —— 就能在 6 个引擎 上把引用率提升 +17.3%、主观回答质量提升 +18.5%

这两项发现并不竞争,而是叠加。证据给模型「值得引用的东西」,结构让那份证据 易于 被找到、被摘取。一个埋在大段文字、位于页面中部的统计,表现不如同一个统计被放进 答案先行的开头、在一个短段落里、把数字加粗。GEO-SFE 还纳入了 引擎架构各异 这一 事实 —— Gemini(STS 型合成器)、Perplexity(IR 优先的检索器)、ChatGPT / Claude (上下文内选择器)对结构的权重不同 —— 所以你证据的最优摆位是「感知引擎的」,而非 一刀切。

这正是 VeReach GEO 落地的那一层。上面的证据清单告诉你 写什么;GEO-SFE 的结构层 告诉你 把它放在哪里,好让 ChatGPT、Gemini、Claude、Perplexity 各自最有可能把它 摘走。


VeReach GEO 如何度量这份提升

一次重写就是一个假设。要知道它是否奏效,唯一的办法是度量重写前后的引用行为 —— 这 比听上去更难,因为 AI 引用逐月波动、且各引擎之间各不相同。

VeReach GEO 把这个闭环合上:

  • 可见度分数(VS = 0.4·Coverage + 0.3·Position + 0.3·Influence) 把零散的提及 化成一个可比较的数字,让一次重写的效果可读,而非停留在轶事层面。
  • 四引擎追踪(ChatGPT / Gemini / Claude / Perplexity)显示你的证据是跨架构迁移, 还是只命中其中一个 —— 这正是我们论文所看重的跨引擎泛化。
  • 日语四级信源词典 按域名权威给引用加权 —— ITmedia / @IT / CNET 为 5.0, BOXIL / ITreview / IT Trend 为 3.0,MarkeZine / PR TIMES 为 1.5,note / Zenn / Qiita 为 1.0 —— 从而把「标注第三方出处」变成一个 被量化的 战术,而非一种感觉。 引用一个 Tier 1 信源,在度量上明确比引用一个 Tier 4 的更值钱。
  • 品牌名归一化(片假名/汉字/罗马字/ASCII)确保无论引擎用日语的哪种写法写出 你的名字,提及都会被计入 —— 这是在日本市场做诚实度量所不可或缺的。
  • 按 Focus 的时间序列(每个 Focus 对应一个原型 archetype)追踪重写对你所关心的那个 具体业务问题的影响,并且是随时间推移地追踪,而非一次性快照。

这套工作流,正是证据三件套所要求的闭环 —— 用带署名的统计、嵌入的引用、第三方出处去 重写一个页面,用 GEO-SFE 把它结构化,然后跨四引擎观察可见度分数,确认这份提升真实 且持久。


一点必要的说明

出于学术诚实,必须加一个限定。普林斯顿的实验是在 GPT-3.5 时代 进行的,且效果是 领域依赖 的。那些具体量级 —— 「引用 +41%」「第 5 名站点 +115%」 —— 应被当作 那个设定下的方向性证据,而非对当今前沿模型的保证。独立的业界复现也指向同一方向 (2026 年某项研究报告统计约 +22%、引用约 +37%),这正是我们信赖 机制 的原因 —— 生成引擎会挑选它能引用并归因的段落,而证据让一段文字变得可引用。随着引擎越来越倚重 grounding 与引用,这一逻辑只会更加成立。

所以:把证据三件套当作原理采纳,放弃关键词堆砌,并 用持续度量在你自己的领域里验证 其量级。原理加度量,才是这门功夫的全部。


想看看 AI 引擎到底引用了你的哪些页面,以及一次「证据 + 结构」的重写,能在 ChatGPT、 Gemini、Claude、Perplexity 上把你的可见度分数撬动多少?看看 VeReach GEO 怎么 度量,或联系团队


关于出处的说明:9 种手法的结果、证据三件套的效应、挑战者优势的数值,均来自 Aggarwal et al., GEO: Generative Engine Optimization(arXiv 2311.09735, KDD 2024);结构方面的结果来自 arXiv 2603.29979;「前 30% 贡献 44%」一数与 2026 年的复现来自公开的业界分析。数据截至 2026 年 6 月,反映各研究开展时可用的模型世代 —— 在做任何高风险决策前,请用当下的引擎自行验证。