AI 搜索可见度诊断从三类问题开始:你的品牌在行业问题下是否出现、出现时描述是否准确、答案引用的是哪些来源。把这三类固定成一份可重复提问的清单,先测出基线,再动内容和技术。顺序反了,之后所有改动都失去了可对照的起点——你会一直在改,但说不清改动有没有用。
为什么第一步不是写内容
多数企业发现自己在 AI 答案里「不太对劲」之后,第一反应是补文章。这一步跳得太快。
生成式答案不是从你的官网直接搬运的,它是模型根据能检索到的来源重新组织出来的。你不知道现在被引用的是哪些来源,就不知道该补什么:可能官网事实写得很清楚但机器读不到,可能内容齐全但第三方的旧资料声音更大,也可能问题出在同名公司混淆。这三种情况的修法完全不同,而没测过之前,它们看起来都是同一句「AI 不提我们」。
方法链的顺序是「诊断→内容→技术→监测」,诊断排在最前面,原因就是这个:它决定后面三步做什么。
三类问题:提及、准确、来源
这三类不是三组不同的问题,而是同一批提问要看的三个维度。
| 问哪一类 | 测什么 | 答案里看什么 | 记成什么 |
|---|---|---|---|
| 品类 / 场景问题(不带品牌名) | 品牌提及 | 品牌有没有出现、和哪些同行并列 | 出现 / 未出现,加同列品牌名 |
| 带品牌名的问题 | 答案准确性 | 业务范围、服务边界、行业、地域有没有说错 | 无误 / 有误,有误则抄下错在哪句 |
| 以上两类都要看 | 引用来源 | 答案引了哪些网址、有没有你自己的域名 | 引用域名清单 |
三个维度的信息量是递进的。只测提及,你只知道「有没有被看见」;加上准确,你知道「被看见时是什么样子」;再加上来源,你才知道「这个样子是谁给的」——而最后这一条才是你能动手的地方。
实践中最常被跳过的是第三列。很多人截了张「AI 没提我们」的图就去补文章,但那张图里如果答案引的全是三年前的行业目录站,那要解决的其实不是文章数量,而是官网上没有更新、更可信、且机器读得到的对应事实。
问题集怎么定
问题基线就是这份固定下来、每轮重复提问的清单。按买家离你的距离分四层:
- 品类层——「XX 是什么」「XX 怎么选」。买家还不知道有你的时候问的。
- 场景层——「XX 行业的 YY 环节一般怎么做」。你的解决方案本该出现的地方,通常也是缺口最大的一层。
- 品牌层——「XX 公司是做什么的」「XX 和 ZZ 有什么区别」。买家已经知道你,在核实。
- 决策层——「XX 靠不靠谱」「XX 有哪些客户」。临门一脚。
每层 8–15 条,总量 40–60 条起步。
不要一上来就列 200 条。问题集的判断标准不是数量,而是能不能每轮全部重跑——跑不完的问题集不会被复测,也就永远形不成基线,那份表就只是一次性的调研记录。规模不足时优先补场景层,那一层是买家还不认识你时唯一的入口。
平台矩阵:国内与海外分开记
覆盖哪几个平台,取决于你的买家在哪里提问,不取决于哪个平台名气大。国内 B2B 采购场景常见于豆包、DeepSeek、Kimi;面向海外或技术型买家,则要看 ChatGPT、Perplexity。两边的答案风格、是否给出可点击的来源链接、检索行为都不一样,不要把结果混在一张表里平均——混了之后,你既看不出哪个平台需要什么,也没法归因。
先选 2–3 个把基线跑稳,再扩。平台越多,每轮复测的人力成本越高;跑不动就断了,断了就没有基线。
本文不列各平台当前的具体行为,因为那是会过期的信息。生成式答案随提示词、地区、时间和模型版本变化,任何一份「某平台现在如何如何」的清单,写下来的那天就开始失效。可靠的做法是你自己测,并给每一轮记下核验日期。
每次提问记什么
一轮提问,每条至少记六列:
- 提问日期
- 平台与模型版本
- 问题原文(一字不改;改了就不是同一个问题了)
- 是否提及
- 描述是否准确(有误则抄下错在哪句)
- 答案引用的域名
前两列最容易被省掉,也最不能省。生成式答案随时间和模型版本变化,没有这两列,下一轮复测时你无法判断变化来自你的改动,还是平台自己更新了。
这六列是原始记录,不是指标。基于它们可以算出提及率、引用率一类的自定义口径——这些都不是任何平台官方提供的数据,是你自己采样统计的结果,对外引用时必须标明非官方。至于怎么定义分子分母、多久复测一轮、变化能归因到什么程度,属于方法链的监测阶段,留给后续专文。
输出三张缺口清单
一轮诊断跑完,把观察拆成三张可以直接派活的清单:
- 内容缺口——答案答不上来或答错的地方,官网缺哪一页、缺哪一句事实、缺哪个证据。
- 技术缺口——事实明明在官网上,但机器确认不了。通常指向结构化数据缺失、实体信息不一致,或者内容压根没有机器可读的入口(见 llms.txt)。
- 外部证据缺口——答案引的是第三方来源,而那些来源在替你发言,且说得不准。
拆成这三张,是因为它们分别对应方法链后面的三步,各自的负责人和工期都不同。停在「AI 对我们印象不好」这种整体判断上,是没法派活的。
这份诊断说明什么,不说明什么
说明的是:在这个采样窗口、这组问题、这几个平台上,你的品牌被提及、被说对、被引用的实际情况;以及哪些事实缺证据页、哪些页面机器读不到、哪些第三方来源在替你发言。
不说明的是:
- 不说明因果。 「补了内容所以 AI 提我了」,这中间没有可验证的因果链。诊断给的是前后对照,不是归因证明。任何人声称能证明因果,都该被要求出示证据。
- 不代表真实用户的提问分布。 你的问题集是你猜的,不是买家实际敲进去的。真实提问要从销售、客服和站内搜索里捞,那才是问题集迭代的来源。
- 单次采样不是稳定事实。 同一个问题隔天再问,答案可能不同。一轮测出来的是快照。
- 测不出竞品做了什么。 竞品出现得多,可能是内容好,可能是第三方来源多,也可能只是名字更常见。诊断分不出来。
- 不承诺排名或推荐。 这些不在任何服务商的控制范围内;能控制的只有你这一侧的证据质量。
常见问题
问题集要多大才够?
40–60 条起步,按品类、场景、品牌、决策四层分,每层 8–15 条。判断标准不是数量而是能否每轮全部重跑——跑不完的问题集不会被复测,也就形不成基线。规模不足时优先补场景层,那是买家还不知道你时的入口。
要覆盖多少个平台?
取决于你的买家在哪里提问。国内 B2B 采购常见于豆包、DeepSeek、Kimi;面向海外或技术型买家则看 ChatGPT、Perplexity。先选 2–3 个把基线跑稳再扩。平台越多每轮成本越高,跑不动就断了,断了就没有基线。
AI 把我们说错了,能直接联系平台改吗?
一般不能,也不该把希望放在这里。答案是模型基于可检索到的来源生成的,可行路径是改来源:补齐官网上的事实与证据页,让正确信息可抓取、可解析、可确认。这正是诊断之后要进入内容与技术阶段的原因。
没有专门工具,人工提问记录可行吗?
可行。40–60 条问题 × 2–3 个平台,一轮大约半天。工具能省时间,但不改变方法。起步阶段人工反而有好处:你会亲眼看见答案是怎么错的、错在哪个字,这些细节进不了自动化报表,却往往直接指出该补哪一页。
本周可以做的一件事
挑 10 个你最该出现、但不确定 AI 会不会提你的场景问题——买家还不知道有你的时候会问的那种,比如「XX 行业的 YY 环节一般怎么做」。在一个国内平台和一个海外平台上各问一遍,按上面六列记下来。
半天能跑完。跑完你会拿到两样东西:一份能复测的问题集雏形,和一份让你意外的错误清单。
验收标准很简单:这 10 条记录里,每一条都能回答「AI 提到我们了吗、说对了吗、引了谁」。有一条答不上来,就是记录口径漏了列,补上再跑。
中屹信息提供生成式引擎优化(GEO)服务,覆盖诊断→内容→技术→监测。我们交付可验证的内容与技术基建、以及按问题基线复验的记录,不承诺不可控的 AI 推荐或排名结果。若需要把本文方法落到你的官网,可从服务或联系开始。