GEO 投入的衡量方式是复验:把一份固定的问题基线每隔一段时间原样重跑,记三个口径——提及率、准确率、引用率——看它们随时间怎么变。这三个口径都不是平台官方数据,是你自己提问、自己判读、自己统计出来的,所以每次对外引用都必须标明非官方,并附上分子分母与采样窗口。缺了这两样,数字就只是个百分比,谁也复算不出来。

为什么排名指标在这里失效

传统搜索有稳定的「第几位」,因为同一个查询词、同一时间、同一批人,返回的是同一个列表。那个位置是可以被第三方独立核对的。

生成式答案不是列表,是一段现场生成的文字。同一个问题隔天再问、换个说法问、换个地区问,或者平台更新一次模型,答案都可能不同。「第几位」在这里没有稳定的所指——你截到的那张图,只证明那一次那么答过。

所以能拿来衡量的不是单次结果,而是同一组问题在多轮采样下的分布。这就是复验和截图的区别:截图是证据,复验才是指标。

三个口径:分子、分母、采样窗口

这是全文最需要抠细的地方。三个口径的定义如下:

口径分子分母回答什么问题
提及率品牌出现的答案条数本轮提问总条数我们进入候选了吗
准确率描述无实质错误的答案条数品牌出现的答案条数被提到时说对了吗
引用率含指向自有域名链接的答案条数本轮提问总条数官网被当成来源了吗

注意准确率的分母。它是「品牌出现的答案条数」,不是本轮提问总数。没提到你的答案里根本没有关于你的描述,无所谓对错,混进分母只会让准确率跟着提及率一起漂——提及率涨的时候准确率假跌,反之假涨。这是这套口径里最常见的一个错,一旦犯了,整条趋势线就废了。

每一轮的记录还必须附四项采样窗口信息:

  • 起止日期(一轮应在一周内跑完;拖过一周,前后已经不是同一个采样条件了)
  • 平台与模型版本
  • 问题集版本号
  • 判读人(谁来判「有没有实质错误」,换人就会换标准)

这三个口径没有任何平台提供官方数据。 它们是自定义口径。写进提案、汇报或对客材料时,必须标明「自定义口径,非平台官方数据」,并附分子分母与采样窗口。省掉这句话,一个百分比就变成了误导。

多久复测一轮

默认四周一轮,按季度看趋势。

不建议每周。生成式答案本身带噪声,一周的变化量分不清是你的改动还是抖动;而且 40–60 条问题 × 2–3 个平台每周跑一次,团队很快就撑不住——撑不住就断,断了就没有基线,这比测得慢严重得多。

也不建议半年。间隔太长,中间平台更新过几次、第三方来源变过几轮,你都不知道,最后拿到两个数字却无从解释。

官网做过大改之后(上线一批场景页、补齐结构化数据、改了品牌简介),可以加测一轮,但加测轮次要和常规轮次分开记,不要混进趋势线。它回答的是「这批改动之后现状如何」,不是趋势上的一个点。

还有一条纪律:一轮开始前冻结问题集。中途加问题会污染分母,让这一轮和上一轮不可比。想加就等下一轮,并把问题集版本号往上升,在趋势图上标出版本切换的位置。

变化能归因到什么程度

这一节比上面三节都重要,也是最容易被跳过的。

复验给的是前后对照,不是因果证明。

三个口径同时受这些因素影响:你的改动、平台的模型更新、竞品的动作、第三方来源的变化,以及采样噪声。这五项里你只控制第一项,而复验数据无法把它们拆开。

可以这样说(方括号处填你自己这一轮的数字):「在[采样起止日期]期间,问题集[版本号]在[平台]上的提及率从[A]变为[B];同期我们上线了[N]个场景页,并补齐了 Organization 结构化数据。」——这是事实陈述加时间相关,每一项都可以被别人独立复算。

不能这样说:「因为补了结构化数据,提及率涨了[N]个百分点。」——这是因果断言。你没有对照组,做不出这个结论。任何人给你这样的报告,都该被要求出示对照设计。

想更接近归因,可以分批上线:一批页面先改、一批后改,拉长观察,看变化是否跟随批次到来。但即便如此,得到的也只是更强的相关性,不是证明。

还有一个信号值得记住:三个平台同时同向大幅变化时,通常是平台侧的事,不是你的功劳,也不是你的锅。这种时候先去查平台有没有更新,再动自己的内容。

除了因果,这套口径还测不出三件事:

  • 测不出商业结果。 提及率涨了不等于线索涨了。从 AI 答案到询盘之间隔着点击、落地页和销售,复验不覆盖那一段。
  • 测不出真实用户的提问分布。 问题集是你猜的。真实提问要从销售、客服和站内搜索里捞回来,再迭代进问题集。
  • 测不出竞品做了什么。 竞品出现得多,可能是内容好,可能是第三方来源多,也可能只是名字更常见。

怎么把三个数字变成派活

三个口径的组合方式,直接指向方法链里的不同环节:

提及率准确率引用率说明什么下一步
你压根不在候选里内容:补场景层的事实与证据页
被看见了,但说错了内容:补清晰的定义句与业务边界,压过替你发言的旧来源
说对了,但官网没被当来源技术:查结构化数据、实体一致性、机器可读入口(llms.txt

第三行是最容易被误读的一种:内容明明是对的,团队会以为「已经做好了」,但答案引的是别人。这通常不是内容问题,是机器确认不了这些事实出自你这里。

顺带一提,官网到底有没有被 AI 爬虫访问过,是另一条独立的证据线——它来自服务器日志,而不是答案本身。两条线互相印证,但不能互相替代。

本周可以做的一件事

如果你已经按上一篇跑过一轮记录,这周只做一件事:给那份记录补一页口径说明

一页就够,写清四件事:问题集版本号与冻结日期、本轮覆盖哪几个平台与模型版本、采样起止日期、三个口径各自的分子分母定义。

验收标准很硬:把这页交给一个没参与提问的同事,他应该能照着独立复算出你的三个数字。算不出来,说明口径没写清——那么你现在手里的还不是基线,只是一次采样。

常见问题

一轮复验要花多少人力?

40–60 条问题 × 2–3 个平台,人工一轮约半天到一天。四周一轮、一年 13 轮,大约 7–13 人日。规模再大可以抽样,但抽法必须固定并写进口径页——随机换抽法等于每轮换了分母,趋势线就断了。

提及率涨了,能写进对客汇报吗?

可以,但必须连口径一起写:问题集版本、平台与模型版本、采样窗口、分子分母,以及「自定义口径,非平台官方数据」这句话。只给百分比不给口径的汇报是不可复验的,对方一追问就散了。

三个口径里最先看哪个?

先看提及率,它决定你在不在候选里。提及率接近 0 时,准确率的分母是空的,另外两个数没有意义。提及率起来之后重点转向准确率——被说错比不被提到更难修,因为你要跟已经存在的错误来源竞争。

平台更新了模型,之前的基线还能比吗?

能比,但要在趋势线上标出更新时间点,并且不跨越它做因果推断。基线的价值不在于绝对数字永远可比,而在于你握着一份能原样重跑的问题集——平台变了,你至少知道变化发生在哪一轮。


中屹信息提供生成式引擎优化(GEO)服务,覆盖诊断→内容→技术→监测。我们交付可验证的内容与技术基建、以及按问题基线复验的记录,不承诺不可控的 AI 推荐或排名结果。若需要把本文方法落到你的官网,可从服务联系开始。