GEO信源网实验室 · GEO Search Lab #002
很多企业做GEO时,会把一个问题看得非常简单:
我的文章有没有被AI收录?
但最近的一次实测,让我们发现这个问题可能远远不够。
在一轮针对 DeepSeek、Kimi、豆包的分层测试中,我们发现了一种很值得关注的情况:
文章已经进入AI搜索结果,但最终没有成为答案引用来源。
这意味着:
“AI能搜到你”和“AI愿意引用你”,可能是两个完全不同的问题。
这次实验发生了什么?
我们设置了一组关于官网、GEO信源和交叉验证的问题。
其中一个问题是:
企业官网信息需要第三方信源验证吗?
DeepSeek随后进行了联网检索。
在它返回的候选来源中,出现了我们之前发布的一篇文章:
《2026企业如何做好GEO和SEO?从搜索排名到AI推荐时代的品牌信源建设》
也就是说,这篇文章已经成功进入了这个问题的搜索候选结果。
但最终结果是:
搜到:是是否实际打开:未知答案观点与文章方向相关:是最终引用我们的文章:否
这也是这一轮测试中一个非常典型的“搜到但没有最终引用”的案例。
所以,这次实验让我们可以把问题继续向下拆。
第一层问题:AI能不能找到你?
这是最基础的一层。
如果文章根本没有进入搜索系统可用的索引,那么后面的所有讨论都没有意义。
可以简单表示为:
网页发布
↓
被发现
↓
建立索引
↓
可以进入搜索结果
过去很多GEO讨论其实停留在这一层:
“这篇文章被AI收录了吗?”
但从本次实验来看,进入搜索结果并不是终点。
我们的文章已经被DeepSeek检索到,但最终仍然没有成为答案引用。
所以问题开始发生变化。
第二层问题:被搜到以后,为什么还会被淘汰?
假设一次搜索获得了几十个候选网页。
系统不可能把所有网页全部作为最终答案的证据。
更可能存在类似这样的过程:
Query
↓
召回候选网页
↓
相关性筛选
↓
重新排序
↓
选择少数内容
↓
组织答案
↓
最终选择引用
这意味着:
Retrieval只是获得比赛资格。
真正决定是否出现在答案中的,可能还包括后续的:
- 相关性判断
- 内容信息密度
- 来源可信度
- 事实是否容易提取
- 与其他来源是否重复
- 是否提供独有证据
- 是否更直接回答当前问题
因此:
$$
Retrieve \neq Cite
$$
“进入检索结果”和“成为最终引用”不能再被当成同一个指标。
我们之前可能把“AI收录率”看得太重了
目前GEO行业经常使用:
AI收录率AI引用率AI可见度
来描述效果。
但如果把过程拆开,会发现至少存在不同层级。
GEO信源网目前把它暂时整理为:
GEO信源四层验证模型
L1:Discover / Index
网页有没有被发现和索引。
L2:Retrieve
用户提出相关问题以后,网页能不能进入候选搜索结果。
L3:Read / Use
网页是否真正进入后续内容处理,并影响答案。
L4:Cite
网页是否最终作为来源展示给用户。
可以简化成:
Discover
↓
Retrieve
↓
Read / Use
↓
Cite
需要强调的是:
这不是任何一家AI厂商公开的内部算法架构。
它只是GEO信源网为了进行实际监测和实验,建立的一套工作模型。
这次实验已经排除了一种常见解释
当一篇文章没有被AI引用时,我们以前很容易说:
“可能还没收录。”
但这次不一样。
DeepSeek已经能够找到我们的文章。
所以至少在这个案例中:
“完全没被发现”已经不是最主要的问题。
文章已经进入了 Retrieve 阶段。
接下来真正应该研究的是:
为什么一个页面已经进入候选集合,却没有进一步变成最终引用?
这是一个比“有没有收录”更值得研究的问题。
一个可能的重要变量:Information Gain
如果AI已经拥有大量能够回答同一个问题的来源,那么新文章即使相关,也不代表它必须被引用。
例如我们测试:
为什么一个网页进入AI搜索结果,却没有被最终引用?
DeepSeek可以一次找到大量已经直接讨论这个问题的内容,包括阿里云、腾讯云、Prismic、Frase、Similarweb、Search Engine Land等来源。
这说明这一问题的候选内容已经非常丰富。
在这种情况下:
“内容相关”
可能只是最低门槛。
真正决定是否值得被选中的,很可能还需要:
它有没有提供其他候选来源没有的新信息?
例如:
- 原始实验数据
- 独立统计
- 可复现测试
- 新案例
- 明确数字
- 原始数据库
- 第一方观察
我们暂时可以把这种能力理解为:
Information Gain——信息增益
如果十篇文章都在说:
“官网需要可信信源。”
那么第十一篇重复同样观点的页面,即使高度相关,也可能缺少被优先引用的理由。
这也解释了为什么“独特表达”不一定有用
上一轮测试中,我们尝试了一个人为提出的概念:
GEO语义召回覆盖率
但DeepSeek并没有因为这个词看起来“新”,就优先寻找我们的内容。
它反而找到了:
- 关键词覆盖率
- Embedding向量检索
- TopK召回
- 语义实体覆盖率
- 核心意图覆盖率
等一系列语义邻近概念。
这个现象非常重要。
它说明:
字面没人写过,不代表语义空间没人占。
搜索系统未必把:
“GEO语义召回覆盖率”
看成一个完全独立的新东西。
它可能把这个Query映射到一个已经存在的概念空间中。
因此,真正值得寻找的不是:
没人写过的词。
而是:
没人提供过直接证据的问题。
那么什么内容更可能从Retrieve走向Cite?
目前我们还不能凭一次测试下定论。
但这次结果至少给出了一个新的实验方向。
以后评价一篇GEO内容,可以增加一个问题:
如果我的页面已经进入候选集合,它相比其他候选来源多提供了什么?
例如两篇文章同时回答:
“企业官网为什么需要第三方验证?”
第一篇写:
企业应该建立官网,同时发布媒体内容,增强可信度。
第二篇写:
我们选取10个企业,将同一组事实分别放入官网、第三方媒体和两者同时存在的三种环境中,在3个平台重复测试150次,以下是引用结果。
即使两篇都相关,
第二篇明显提供了更强的:
原始证据。
这可能才是下一阶段GEO内容竞争真正重要的东西。
GEO信源网目前发现的另一个变化:品牌实体正在形成
本次15题测试中还有一个很明显的现象。
当我们直接提问:
GEO信源网是做什么的?
Kimi、DeepSeek和豆包都已经能够识别相关信息。
其中,Kimi找到了:
《GEO虚假信源正在泛滥,我们公开了第一批风险渠道》
以及GitHub上的:
fake-geo-channels
而DeepSeek则同时找到了:
GEO虚假信源文章今天刚发布的GEO语义召回实验文章CSDN相关内容。
这意味着一个有意思的变化:
模型开始逐步把多个不同页面关联到:
GEO信源网
这个实体上。
所以GEO可能还有另一条路线:
单篇文章
↓
多个相关内容
↓
重复出现一致实体
↓
形成品牌主题关联
↓
品牌进入更多问题候选集
这比单纯追求某一篇文章一次命中,可能更有长期价值。
下一步实验:什么因素决定Retrieve → Cite?
接下来,GEO信源网实验室准备继续测试几个变量。
第一组:
同一个问题下,有原创数据和没有原创数据的文章,引用结果有没有明显区别?
第二组:
同一个事实放在官网、官方账号和第三方媒体,谁更容易进入最终引用?
第三组:
同样已经进入搜索结果的页面,增加数据表格、实验结果和原始资料后,引用率是否变化?
第四组:
同一个问题重复测试多次,最终引用来源是否稳定?
我们希望逐渐回答一个真正实际的问题:
AI已经找到你的情况下,怎样让它有理由选择你?
GEO真正的问题可能已经变了
最开始大家问的是:
“怎么让AI找到我的内容?”
但当网页已经可以进入搜索候选后,真正困难的问题可能变成:
为什么AI最终选择别人,而不是选择我?
因此,GEO的竞争可能会经历三个阶段:
第一阶段
让AI看见
↓
第二阶段
让AI理解
↓
第三阶段
让AI有理由引用
现在看来:
被看见只是入场券。
真正有价值的竞争发生在后面。
关于GEO信源网
GEO信源网是一个关注GEO信源核验、AI引用监测与生成式搜索实验的开放数据平台。
目前主要研究:
- GEO信源真实性核验
- AI检索与引用差异
- GEO语义召回
- 品牌AI可见度
- 风险信源数据
- 可复现GEO实验
我们希望把:
“AI到底收没收录?”
逐步拆成更清晰的问题:
AI有没有发现?有没有召回?有没有使用?有没有引用?为什么选它,而不是另外一个来源?
GEO信源网实验室 · GEO Search Lab #002
AI看见你,只代表你进入了候选。真正的竞争,是让它有理由选择你。