诊断先问三件事:行业问题下 AI 提没提你的品牌,提到的时候说得对不对,答案引的是谁家的来源。把这三件事固定成一份能反复问的清单,先测出基线,再去动内容和技术。顺序反过来,你就没有可对照的起点了,改是一直在改,说不清有没有用。
为什么第一步不是写内容
多数企业察觉自己在 AI 答案里「不太对劲」,第一反应是补文章。这一步跳得太快。
生成式答案不是从你官网直接搬的,是模型拿它能检索到的来源重新组织出来的。不知道现在被引的是谁,就不知道该补什么。可能官网上事实写得很清楚,机器读不到;可能内容不缺,但第三方那份旧资料声音更大;也可能只是同名公司搞混了。这几种情况修法完全不一样,而在测过之前,它们长得一模一样,都是一句「AI 不提我们」。
方法链的顺序是诊断→内容→技术→监测。诊断排最前,就是因为它决定后面三步干什么。
三类问题:提及、准确、来源
这三类不是三组不同的问题,是同一批提问要看的三个维度。
| 问哪一类 | 测什么 | 答案里看什么 | 记成什么 |
|---|---|---|---|
| 品类 / 场景问题(不带品牌名) | 品牌提及 | 品牌有没有出现、和哪些同行并列 | 出现 / 未出现,加同列品牌名 |
| 带品牌名的问题 | 答案准确性 | 业务范围、服务边界、行业、地域有没有说错 | 无误 / 有误,有误则抄下错在哪句 |
| 以上两类都要看 | 引用来源 | 答案引了哪些网址、有没有你自己的域名 | 引用域名清单 |
三个维度的信息量是递进的。只测提及,你只知道有没有被看见;加上准确,你知道被看见时是什么样子;再加上来源,才知道这个样子是谁给的。最后这条才是你能动手的地方。
实践里最常被跳过的是第三列。很多人截一张「AI 没提我们」的图就去补文章。可那张图里,如果答案引的全是三年前的行业目录站,要解决的就不是文章数量,而是官网上缺一份更新、可信、机器又读得到的对应事实。
问题集怎么定
问题基线就是这份固定下来、每轮重复提问的清单。按买家离你的距离分四层:
- 品类层:「XX 是什么」「XX 怎么选」。买家还不知道有你的时候问的。
- 场景层:「XX 行业的 YY 环节一般怎么做」。你的解决方案本该出现的地方,通常也是缺口最大的一层。
- 品牌层:「XX 公司是做什么的」「XX 和 ZZ 有什么区别」。买家已经知道你,在核实。
- 决策层:「XX 靠不靠谱」「XX 有哪些客户」。临门一脚。
每层 8–15 条,总量 40–60 条起步。
别一上来就列 200 条。问题集好不好,不看条数,看能不能每轮全部重跑。跑不完的清单不会被复测,也就永远形不成基线,那张表就只是一次性的调研记录。条数不够的时候先补场景层,买家还不认识你的时候,那是唯一的入口。
平台矩阵:国内与海外分开记
覆盖哪几个平台,看你的买家在哪儿提问,不看哪个平台名气大。国内 B2B 采购常见于豆包、DeepSeek、Kimi;面向海外或技术型买家,就要看 ChatGPT、Perplexity。两边的答案风格不一样,给不给可点的来源链接不一样,检索行为也不一样,所以别把结果混在一张表里平均。混完你既看不出哪个平台需要什么,也没法归因。
先挑 2–3 个把基线跑稳,再扩。平台越多,每轮复测越费人力;跑不动就断,断了就没有基线。
各平台当前具体怎么表现,本文不列,那是会过期的信息。生成式答案随提示词、地区、时间和模型版本变化,任何一份「某平台现在如何如何」的清单,写下来的那天就开始失效。可靠的做法是你自己测,每一轮记下核验日期。
每次提问记什么
一轮提问,每条至少记六列:
- 提问日期
- 平台与模型版本
- 问题原文,一字不改(改了就不是同一个问题了)
- 是否提及
- 描述是否准确,有误就抄下错在哪句
- 答案引用的域名
前两列最容易被省掉,也最不能省。生成式答案随时间和模型版本变化,没有这两列,下一轮复测时你分不清变化是你改出来的,还是平台自己更新了。
这六列是原始记录,不是指标。基于它们可以算提及率、引用率这类自定义口径。注意这些都不是平台官方提供的数据,是你自己采样统计出来的,对外引用必须标明非官方。至于分子分母怎么定义、多久复测一轮、变化能归因到什么程度,属于方法链的监测阶段,留给后续专文。
输出三张缺口清单
一轮诊断跑完,把观察拆成三张能直接派活的清单:
内容缺口。答案答不上来或者答错的地方,官网缺哪一页、缺哪一句事实、缺哪个证据。
技术缺口。事实明明在官网上,机器却确认不了。多半指向结构化数据缺失、实体信息不一致,或者内容压根没有机器可读的入口(见 llms.txt)。
外部证据缺口。答案引的是第三方来源,那些来源在替你发言,还说得不准。
之所以拆成三张,是因为它们分别对应方法链后面的三步,负责人和工期都不一样。停在「AI 对我们印象不好」这种整体判断上,活派不下去。
这份诊断说明什么,不说明什么
说明的是:在这个采样窗口、这组问题、这几个平台上,你的品牌被提及、被说对、被引用的实际情况,以及哪些事实缺证据页、哪些页面机器读不到、哪些第三方来源在替你发言。
不说明的是:
- 因果。「补了内容所以 AI 提我了」,这中间没有可验证的因果链。诊断给的是前后对照,不是归因证明。谁声称能证明因果,都该被要求出示证据。
- 真实用户的提问分布。问题集是你猜的,不是买家实际敲进去的。真实提问要从销售、客服和站内搜索里捞,那才是问题集迭代的来源。
- 稳定事实。同一个问题隔天再问,答案可能就变了。一轮测出来的是快照。
- 竞品做了什么。竞品出现得多,可能是内容好,可能是第三方来源多,也可能只是名字更常见。诊断分不出来。
- 排名或推荐的承诺。这些不在任何服务商的控制范围内,能控制的只有你这一侧的证据质量。
常见问题
问题集要多大才够?
40–60 条起步,按品类、场景、品牌、决策四层分,每层 8–15 条。判断标准不是条数,是能不能每轮全部重跑。跑不完的清单不会被复测,也就形不成基线。条数不够时先补场景层,那是买家还不知道你时的入口。
要覆盖多少个平台?
看你的买家在哪儿提问。国内 B2B 采购常见于豆包、DeepSeek、Kimi;面向海外或技术型买家则看 ChatGPT、Perplexity。先挑 2–3 个把基线跑稳再扩。平台越多每轮成本越高,跑不动就断,断了就没有基线。
AI 把我们说错了,能直接联系平台改吗?
一般不能,也不该把希望放在这儿。答案是模型基于可检索到的来源生成的,可行的路是改来源:把官网上的事实与证据页补齐,让正确信息可抓取、可解析、可确认。这也正是诊断之后要进内容与技术阶段的原因。
没有专门工具,人工提问记录可行吗?
可行。40–60 条问题 × 2–3 个平台,一轮大约半天。工具能省时间,但不改变方法。起步阶段人工反而有好处:你会亲眼看见答案是怎么错的、错在哪个字,这些细节进不了自动化报表,却往往直接指出该补哪一页。
本周可以做的一件事
挑 10 个你最该出现、又不确定 AI 会不会提你的场景问题,买家还不知道有你的时候会问的那种,比如「XX 行业的 YY 环节一般怎么做」。找一个国内平台、一个海外平台各问一遍,按上面六列记下来。
半天跑得完。跑完你会拿到两样东西:一份能复测的问题集雏形,和一份让你意外的错误清单。
验收标准很简单:这 10 条记录,每一条都能回答「AI 提到我们了吗、说对了吗、引了谁」。有一条答不上来,说明记录口径漏了列,补上重跑。
中屹信息做生成式引擎优化(GEO),覆盖诊断→内容→技术→监测。我们交付可验证的内容与技术基建,以及按问题基线复验的记录,不承诺不可控的 AI 推荐或排名结果。想把本文的方法落到你的官网,可以从服务或联系开始。