生成式引擎选择引用来源,公开能核验的不是排序公式,而是三道门——可抓取、可解析、可信号:页面要能被搜索型爬虫抓到,要能被解析成稳定事实,还要能在站内外被认成同一个实体。截至 2026-09-10,ChatGPT、Perplexity、Kimi 都把搜索型抓取和训练型抓取拆开写;挡掉搜索型,官方口径是更难出现在对应产品的搜索答案里。豆包侧能对上的公开爬虫是头条搜索的 Bytespider;DeepSeek 未见官方爬虫说明。过了这三道门,只取得被引用的资格,不保证这一次答案会链到你。
没有公开的排序,只有可核验的资格
「AI 为什么从来不提我们」常被理解成:某家模型内部有一份品牌黑名单,或者有一套可以逆向的引用权重。各家没有发布这样的公式。
公开文档写的是另一件事:先成为候选,才谈得上被点开、被摘句、被放进来源列表。Aggarwal 等把这类产品叫生成式引擎:答案由多源综合而成,站点对「这一次会不会展示我」几乎不可控。那是学术观察,不是某家后台配置。对企业的推论只有一句:先把可核验的资格做对。
《AI 搜索可见度诊断从哪些问题开始》教你怎么测「提没提、说没说对、引了谁」。本篇接着讲:要过哪几道门,你的页面才有机会出现在那份「引了谁」里。
常见误区是把训练型爬虫、搜索型爬虫、用户提问时的临时取页当成同一个开关。三者用途不同。细则见《AI 爬虫来过你的网站吗》。本稿只看搜索型:它才直接关系到「会不会进搜索答案」。
成为候选的三道门
下面三道门是本文工作定义:用来把公开文档里的资格条件收成一张对照表。它不是任何平台公布的评分模型。
| 门 | 问的是 | 截至 2026-09-10 能核对什么 | 过了门之后 |
|---|---|---|---|
| 可抓取 | 搜索型机器人能不能拿到这页正文 | OpenAI:OAI-SearchBot 用于 ChatGPT 搜索展示;退出则不出现在搜索答案中,仍可能作为导航链接。Perplexity:PerplexityBot 用于搜索结果中的展示与链接,不用于训练。Kimi:Kimi-SearchBot 建搜索索引,禁止则不出现在 Kimi 搜索结果。头条搜索:Bytespider 抓网页做检索。百度:Baiduspider 写入搜索索引 | 只说明「能被对应检索体系看见」 |
| 可解析 | 拿到之后能否确认这页在说什么 | Google 写明结构化数据是给搜索引擎的页面含义线索。/llms.txt 是给智能体看的站点导览提案(Howard,v2 修订于 2026-08-10),不是各家爬虫文档里的承诺接口 | 只说明「机器有稳定事实可核对」 |
| 可信号 | 核对之后能否确认「这是你」 | 本文推断:站内名称、简介、Organization 与站外简介不一致时,答案更容易接到同名的别人。字段清单见结构化数据 | 只说明「被认成你的机会更大」,不是引用承诺 |
第一道门,国内和海外不要套同一张 UA 表。
海外侧,ChatGPT 与 Perplexity 都写了:搜索型和训练型独立;robots 变更后,搜索侧大约最多 24 小时调整(这只约束这两家自己的说明)。Kimi 同样三分:KimiBot 训练、Kimi-SearchBot 搜索、Kimi-User 用户触发。用户触发这一路,Perplexity 写明通常忽略 robots.txt;Kimi 写明因用户发起,robots 不一定直接适用。
国内侧,豆包没有另给一套与 Kimi 同级的三分官方 UA 表。能核验的是头条搜索站长口径:Bytespider 是头条搜索爬虫。「豆包引用等于头条索引」缺少豆包产品文档,只是行业推断。DeepSeek 官网未见爬虫说明;第三方目录里的 DeepSeekBot 只能记成声称。百度检索看 Baiduspider:官方写它为搜索建索引,没有单独的「文心引用爬虫」。
第二道门,不要把 Google 的结构化数据指南,读成 ChatGPT 或豆包的引用开关。Google 说标记帮助它理解页面,并用于富结果资格,不保证展示。ChatGPT、Perplexity、Kimi 的爬虫文档在本稿核验日列出的站长控件,是 robots.txt 和 IP 段,不是 JSON-LD 字段名。llms.txt 降低整站 HTML 塞进上下文的成本,替代不了正文里的事实。
第三道门是资格里最容易被当成「内容技巧」的一层。生成式答案是综合,不是搬运。你的服务边界写在官网第 3 屏,百科或目录站用旧简介写在第一句,模型摘哪一句,没有公开规则可查。企业能做的,是让可被抓到的页自己把事实说全,并且站内外同一套名称与简介。
企业能改的三步,和改不了的
能改的,对应三道门各一步。
放行搜索型,并把关键公开页做成 200。 训练型是否放行是合规决定,不要和搜索型绑死。OpenAI 写明可以放行 OAI-SearchBot、同时拒绝 GPTBot。Kimi 同样允许按爬虫分别写 robots。WAF 或 CDN 若在读到 robots.txt 之前拦截,文件写了也等于没放行;Perplexity 为此单独写了 WAF 放行说明。
让页面自己能被摘。 开篇用一两句回答真实提问;服务范围、适用对象、不做什么写在同一页,不要拆到要登录才看得到的 PDF。JSON-LD 与可见正文说同一件事。这是可解析,不是「调权重」。
让实体对得上。 官网、工商信息、百科、目录站,名称和一句话简介不要各写各的。对不上时,答案引用谁都不算平台「针对你」。
改不了的,至少有三类。
未公开的选择过程。 ChatGPT 帮助中心写的是:使用网页搜索的回复可能包含引用;点引用打开来源。它没有写「按什么分数挑选这三条」。Perplexity 帮助中心写答案带编号来源,并把来源称作 authoritative,那是产品自述,不是可复算的权重表。Kimi 用户协议写:联网搜索会展示第三方来源,输出是对来源的整合,不代表背书。协议承认「有来源」,不公布「为何是这几个域名」。
单次生成的波动。 同一问题隔天再问、换个说法、换个地区,答案和来源列表都可以变。衡量要用问题基线复验,不要用一张截图当机制证据。
第三方存量。 OpenAI 出版商 FAQ 写明:若 URL 来自第三方搜索提供商或其它已抓页面、且与问题相关,即使你的 robots 禁止了那一页,ChatGPT Atlas 仍可能只露出链接和标题;若连这种露出也不要,需要 noindex,并且爬虫得能读到这个标签。挡掉自家正文,也挡不住别人已经在转述你。
影响得了与影响不了
影响得了:搜索型 UA 对关键 URL 是不是 200;标记与可见事实是否一致;问题基线里「引用来源」列有没有自有域名。
影响不了:这一次 ChatGPT、Perplexity、豆包、DeepSeek、Kimi 会不会点名你;引用条数和排序;任何推荐位或排名。方法链仍是诊断→内容→技术→监测。没被引,先修资格,不要猜内部名单。
常见问题
挡掉 GPTBot / KimiBot,还会被搜索答案引用吗?
官方把训练型和搜索型拆开。OpenAI 与 Kimi 都允许拒绝训练、放行搜索。拒绝训练,不等于退出该产品的搜索答案;拒绝搜索型,才是官方写明的「不出现在搜索结果 / 搜索答案」条件。用户触发取页是第三条线,和收录不是一回事。
写了 llms.txt 或 JSON-LD,会不会被优先引用?
没有公开文档把这两项写成 ChatGPT、Perplexity、Kimi、豆包或 DeepSeek 的引用加分项。Google 的结构化数据指南约束的是 Google 搜索理解与富结果资格。llms.txt 是提案。它们提高可解析性,不构成引用承诺。
豆包、DeepSeek 没有三分爬虫表,三道门还适用吗?
适用的是工作定义,不是同一套 UA。豆包侧先核 Bytespider 和头条搜索站长口径,再靠问题基线观察答案引了谁。DeepSeek 先承认「没有官方爬虫页」这一事实,再用同一组问题看答案侧,不要伪造官方 UA。
答案里出现了我们的域名,等于官网已经被抓过吗?
不等于。域名也来自第三方转载。OpenAI 另写过:在 ChatGPT Atlas 里,第三方搜索提供商提供的 URL 可以只露出标题和链接——那是 Atlas 的口径,不是所有 ChatGPT 界面的通用规则。服务器日志里的搜索型 UA 与答案侧的引用要分开记,见《AI 爬虫来过你的网站吗》。
为什么同一问题,两次引用的网站不一样?
因为选择过程未公开,而且答案是当场生成的。两次不一致,证明不了「官网资格变了」,只证明单次结果不是机制。要看资格有没有变,回到三道门对照和问题基线,不要用两次截图互相打架。
本周可以做的一件事
只做一件事:选 1 个你最希望被当成答案来源的公开页(首页或核心服务页),填下面这张表。
| 检查项 | 记录 | 过 / 不过 |
|---|---|---|
robots.txt 是否放行 OAI-SearchBot、PerplexityBot、Kimi-SearchBot;面向中国大陆是否放行 Bytespider、Baiduspider | ||
| 该 URL 在浏览器无登录时是否 200,正文是否完整 | ||
| 页上是否有与可见内容一致的 Organization 或 Service / Article JSON-LD | ||
| 首段能否单独回答一个不带品牌名的行业问题 | ||
| 用诊断篇的来源列,在 ChatGPT 与 Kimi 各跑 3 条相关问题,记下答案里的域名 |
验收:没做过这个站的同事,应能根据表指出「卡在抓取、解析还是信号」。若只能说「AI 不喜欢我们」,表还没做成可移交的记录。
中屹信息提供生成式引擎优化(GEO)服务,覆盖诊断→内容→技术→监测。我们交付可验证的内容与技术基建、以及按问题基线复验的记录,不承诺不可控的 AI 推荐或排名结果。若需要把本文方法落到你的官网,可从服务或联系开始。