GEO效果怎么量化?用Prompt基线监测AI可见性

简介: GEO(生成式引擎优化)效果评估是通过固定Prompt测试集,持续监测ChatGPT等AI在品牌提及率、页面引用率、事实准确率及竞品占比等维度的表现,并基于多轮可重复实验分析趋势变化,而非依赖单次搜索结果。

GEO 效果评估,就是用一组固定问题持续测试 ChatGPT、Google AI Mode、Perplexity 等生成式搜索,记录品牌是否出现、页面是否被引用、事实是否正确以及竞争对手占比,再比较不同时间窗口的数据变化。

它和传统 SEO 最大的区别是:SEO 已经有关键词排名、CTR、自然流量等成熟指标,而 GEO 面对的是动态生成答案。同一个问题在不同时间、不同平台甚至连续两次测试,都可能得到不同结果。

因此,判断 GEO 是否有效,不能只问一句:

“搜我们公司名,AI 能不能找到?”

真正需要建立的是一套可重复的 Prompt 测试基线

2024 年 KDD 论文《GEO: Generative Engine Optimization》在 GEO-bench 中使用了 10,000 个查询,其中 8,000 个训练集、1,000 个验证集和 1,000 个测试集;查询约 80% 为信息型,事务型和导航型各约 10%。实验还会对生成结果进行多次采样,以降低单次生成带来的随机偏差。该研究报告不同 GEO 方法在其实验环境中的可见性提升最高可达到约 40%,但同时强调不同领域的效果存在明显差异。

这给实际 GEO 项目一个很重要的启发:

不要用一次 AI 搜索判断成败,要用测试集判断趋势。 image.png


为什么做 GEO 不能只看网站自然流量?

因为“AI 看见网站”和“用户点击网站”是两个不同阶段。

传统搜索通常可以表示为:

关键词
搜索结果曝光
点击
网站访问

生成式搜索多了一层答案生成:

用户问题
AI 检索多个来源
选择候选页面
抽取事实
生成答案
品牌被提及 / 页面被引用
用户决定是否点击

如果一个页面已经大量进入 AI 回答,但用户并没有点击,Google Analytics 可能看不到明显增长。

反过来,如果只盯着 GA4 自然流量,也无法回答以下问题:

问题 GA4 能直接回答吗?
AI 有没有提到品牌?
AI 有没有引用某篇文章?
AI 对产品参数描述是否正确?
竞争对手出现了几次?
哪类 Prompt 更容易出现品牌?
AI 推荐产生了多少点击? 部分可以
用户进入网站后有没有转化? 可以

所以 GEO 监测至少要分成两层:

第一层是 AI 答案可见性,第二层才是网站访问和业务转化。


GEO 最少应该监测哪些指标?

对于大多数企业站,不需要一开始就建立复杂的数据平台。

先跟踪 6 个指标已经足够发现大部分问题。

指标 定义 主要回答什么问题
Mention Rate 品牌进入 AI 正文的比例 AI 是否知道并提到你
Citation Rate 网站 URL 被列为来源的比例 AI 是否使用你的网站
Answer Accuracy 品牌信息正确的比例 AI 是否正确理解你
Prompt Coverage 有品牌可见性的 Prompt 比例 覆盖了多少客户问题
Share of Voice 品牌在同类实体提及中的占比 与竞品相比处于什么位置
Source Concentration 引用集中于少数 URL 的程度 哪些页面真正发挥作用

这 6 个指标不要混成一个“GEO 分数”。

因为:

被引用 ≠ 被提及
被提及 ≠ 被推荐
被推荐 ≠ 信息正确
信息正确 ≠ 用户点击
用户点击 ≠ 最终转化

每一层实际上都代表不同问题。


AI 提及率应该怎么计算?

AI 提及率回答的是:

在目标客户可能提出的问题中,AI 有多少次主动说到了这个品牌?

计算公式很简单:

Mention Rate
= 品牌被提及的回答数 ÷ 总回答数 × 100%

例如固定测试 100 个回答,其中品牌出现 23 次:

23 / 100 = 23%

那么本轮 Mention Rate 为 23%

但这里有一个容易犯的错误。

如果测试 Prompt 是:

Tell me about ABC Precision.

那么品牌出现几乎是必然的。

这种测试没有太大意义。

更值得监测的是非品牌 Prompt,例如:

How to choose a CNC machining supplier in China?
What tolerance should I specify for aluminum CNC parts?
6061 vs 7075 aluminum: which is better for machined housings?
What should buyers check before placing a custom machining order?

只有在没有主动告诉 AI 品牌名称的情况下出现品牌,才更接近真实 GEO 可见性。 image.png


AI 引用率和品牌提及率有什么区别?

引用率统计的是网站有没有进入 Sources,而提及率统计的是品牌有没有进入答案正文。

两者可能完全不同。

例如 100 次测试结果如下:

结果类型 次数
网站被引用 31
品牌被提及 19
网站被引用且品牌被提及 14
网站被引用但没提品牌 17
提到品牌但没引用官网 5

对应:

Citation Rate = 31 / 100 = 31%
Mention Rate = 19 / 100 = 19%

这里就出现了一个值得排查的现象:

官网已经成为 AI 的信息源,但网站中的品牌实体没有充分进入最终答案。

这种情况下,继续解决爬虫抓取问题意义不大,更应该检查页面中的实体表达、作者信息、公司关系、证据结构和品牌关联。

因此引用率与提及率不能合并统计。


AI 回答准确率应该怎么计算?

回答准确率衡量的不是 AI 整篇答案是否“看起来不错”,而是涉及企业的事实是否正确

例如企业真实能力为:

Material: 6061-T6 / 7075-T6
Tolerance: ±0.01 mm for selected dimensions
MOQ: 100 pcs
Lead time: 15–20 working days
Certification: ISO 9001

AI 却回答:

The company mainly manufactures stainless steel components
and supports orders starting from 1 piece.

即使品牌被提及,这次结果也应该判为错误。

可以定义:

Answer Accuracy
= 品牌信息正确的回答数
  ÷ 品牌被提及的回答数
  × 100%

例如:

品牌提及:25 次
正确描述:21 次
Accuracy = 21 / 25 = 84%

对于 B2B 企业,这个指标有时比 Mention Rate 更重要。

因为“AI 没有提到企业”意味着没有曝光,而“AI 提到了企业但参数错误”可能直接影响采购判断。


GEO 的 Share of Voice 应该怎么算?

Share of Voice 可以用来判断品牌和竞争对手之间的 AI 可见性差异。

假设测试过程中统计到以下供应商实体:

品牌 AI 提及次数
Brand A 38
Brand B 29
Brand C 17
自有品牌 16
合计 100

则:

自有品牌 GEO Share of Voice
= 16 / 100
= 16%

下一轮如果变成:

自有品牌:27
全部品牌实体:112

那么:

27 / 112 ≈ 24.1%

这比简单说“品牌出现次数从 16 增加到 27”更有意义。

因为如果整个行业的 AI 提及量都在增加,只看绝对数量容易误判。


Prompt 测试集应该怎么建立?

Prompt 测试集不应该从关键词表直接复制,而应该从用户决策问题出发。

例如精密加工行业,可以划分为下面 6 类:

Prompt 类型 示例问题 对应阶段
定义型 What is 5-axis CNC machining? 认知
参数型 What tolerance can CNC milling achieve? 技术评估
选型型 6061 or 7075 for CNC parts? 产品选择
成本型 What affects CNC machining cost? 预算
对比型 China vs Vietnam CNC suppliers? 供应商比较
决策型 How to verify a CNC supplier? 采购决策

这里最好避免只测试:

best supplier
top manufacturer
recommended company

因为这些问题太宽泛,而且结果极易受到位置、地区、时间和当前检索语料影响。

真正有价值的是与你的页面内容存在明确对应关系的问题。


一个 B2B 网站需要准备多少个 Prompt?

没有统一行业标准,但可以先建立一个 30—100 个核心问题的小型基线。

例如采用:

40 个核心问题
× 3 个自然语言改写
× 3 个 AI 平台
× 3 次重复测试

总观察值为:

40 × 3 × 3 × 3
= 1080 条 AI 回答

这里的“3 次重复”不是学术标准,而是实际监测时为了控制成本和随机性可以采用的折中方案。

原始 GEO 论文在实验中对同一生成条件采样 5 个不同回答,并设置 temperature=0.7,用于降低统计偏差。

实际商业平台无法完全控制模型参数,因此重复测试反而更加重要。


为什么同一个 Prompt 需要做多个改写?

因为真实用户不会按照你的关键词表提问。

下面三个 Prompt 意义接近:

How do I choose a CNC supplier?
What should I look for when selecting a CNC manufacturer?
How can I evaluate a CNC machining company before ordering?

但 AI 可能检索出完全不同的页面。

因此可以为每一个主题保存:

{
  "topic_id": "SUPPLIER_EVALUATION_001",
  "intent": "supplier_evaluation",
  "variants": [
    "How do I choose a CNC supplier?",
    "What should I look for when selecting a CNC manufacturer?",
    "How can I evaluate a CNC machining company before ordering?"
  ]
}

这样测试对象就从“一个句子”变成了“一个真实用户意图”。


GEO 测试结果应该怎样存储?

最简单的方式是 CSV。

例如:

test_date,prompt_id,intent,engine,brand_mentioned,brand_cited,answer_correct,source_url
2026-08-01,P001,supplier_eval,chatgpt,1,1,1,/supplier-guide
2026-08-01,P001,supplier_eval,perplexity,0,1,1,/supplier-guide
2026-08-01,P001,supplier_eval,google_ai,0,0,, 
2026-08-01,P002,tolerance,chatgpt,1,1,1,/tolerance-guide
2026-08-01,P002,tolerance,perplexity,1,1,0,/tolerance-guide

如果还要监测竞争对手,可以继续增加:

competitor_a_mentioned
competitor_b_mentioned
competitor_c_mentioned
answer_position
citation_position
country
language
device

这里建议保留 test_date

因为 GEO 是典型的时间序列问题。

如果没有日期,就无法判断:

页面修改以后,到底是指标改善了,还是某一次测试刚好出现了品牌。


用 Python 怎么计算 GEO 的核心指标?

一个 CSV 就可以完成第一版统计。

import pandas as pd
df = pd.read_csv("geo_results.csv")
total = len(df)
mention_rate = df["brand_mentioned"].fillna(0).mean()
citation_rate = df["brand_cited"].fillna(0).mean()
mentioned = df[df["brand_mentioned"] == 1]
if len(mentioned) > 0:
    accuracy_rate = mentioned["answer_correct"].fillna(0).mean()
else:
    accuracy_rate = 0
print(f"Total responses: {total}")
print(f"Mention Rate: {mention_rate:.2%}")
print(f"Citation Rate: {citation_rate:.2%}")
print(f"Answer Accuracy: {accuracy_rate:.2%}")

还可以继续按平台拆分:

report = (
    df.groupby("engine")
      .agg(
          samples=("prompt_id", "count"),
          mention_rate=("brand_mentioned", "mean"),
          citation_rate=("brand_cited", "mean")
      )
      .reset_index()
)
report["mention_rate"] *= 100
report["citation_rate"] *= 100
print(report)

输出可能类似:

engine       samples   mention_rate   citation_rate
chatgpt      360       24.72          31.39
google_ai    360       17.50          22.78
perplexity   360       28.06          39.17

需要强调:

这些数字只有在 Prompt 集、测试次数和测试条件一致时,才适合做前后比较。

不同公司的 30% Citation Rate 不能直接比较。 image.png


Google Search Console 能直接监测 GEO 吗?

现在已经可以监测一部分,但还不能替代 Prompt 测试。

Google 在 2026 年 6 月 3 日宣布开始向部分网站推出独立的 Search Generative AI Performance Report。

该报告目前覆盖:

AI Overviews
AI Mode

可以看到生成式 AI 搜索中的网站曝光,并支持按页面、国家、日期和设备等维度分析。目前该功能仍在逐步推出,并不是所有 Search Console 属性都能看到。

Google 对 AI Overviews 和 AI Mode 的统计规则也已经明确。

例如:

行为 Search Console 如何记录
用户点击 AI Overview 中的网站链接 Click
网站链接在 AI Overview 中达到可见条件 Impression
AI Overview 中多个链接 共用该 AI Overview 的位置
AI Mode 点击外部网站 Click
AI Mode 后续追问 作为新的查询处理

但截至目前,Generative AI Performance Report 官方列出的主要维度是:

Pages
Countries
Dates
Devices

没有提供 Prompt 级别的完整监测能力。

所以更合理的数据体系是:

Search Console
负责:
Google AI 搜索真实曝光数据
自建 Prompt Monitor
负责:
品牌提及
引用
答案准确性
竞争对手
具体问题表现
GA4 / CRM
负责:
访问
询盘
转化

三部分不能互相替代。


怎么判断一次 GEO 优化是不是真的有效?

不要比较单次结果,而应该比较两个时间窗口。

例如修改前测试:

Period A
2026-07-01 ~ 2026-07-07

修改页面后等待重新抓取,再测试:

Period B
2026-08-01 ~ 2026-08-07

并保证:

Prompt 集一致
Prompt 改写一致
平台一致
语言一致
地区尽量一致
重复次数一致
指标定义一致

最终形成类似的对比表:

指标 Period A Period B 变化
Mention Rate 14.8% 21.3% +6.5pp
Citation Rate 19.1% 27.6% +8.5pp
Accuracy 78.4% 91.2% +12.8pp
Prompt Coverage 31.0% 46.0% +15.0pp
Share of Voice 12.7% 18.9% +6.2pp

这里建议使用“百分点(percentage point,pp)”。

例如:

20% → 30%

是:

+10 个百分点

如果说相对增长,则是:

(30%-20%) / 20%
= 50%

两者不要混用。


为什么 GEO 测试最容易出现“假增长”?

最常见的问题是测试条件发生了变化。

例如第一轮测试 20 个非常宽泛的问题:

best supplier
best manufacturer
best CNC company

第二轮却改成:

Which Chinese CNC supplier supports ±0.01 mm tolerance?

然后发现品牌出现率提高。

这并不能证明页面 GEO 优化有效,因为 Prompt 难度已经变化。

另一个常见错误是把品牌 Prompt 混入测试集:

Is ABC Precision reliable?

这种问题本身已经向模型提供实体名称,应该单独归入“品牌验证型 Prompt”,不能和非品牌发现型 Prompt 混算。

建议至少区分:

Prompt 类型 是否进入核心 GEO Mention Rate
非品牌信息型
非品牌比较型
非品牌采购型
品牌验证型 单独统计
公司名称查询 单独统计
导航型查询 单独统计

否则 Mention Rate 很容易被人为抬高。


GEO 报告最终应该长什么样?

真正有用的 GEO 报告,不应该只有一句:

“AI 可见性本月上涨 36%。”

至少应该能回答:

哪些 Prompt 出现了品牌?
哪些 Prompt 一直没有出现?
哪些页面被 AI 引用了?
哪些页面被引用但没有提品牌?
哪些事实经常回答错误?
哪些竞争对手最常出现?
哪个 AI 平台表现最好?
哪些主题修改之后发生了变化?

最终可以建立这样一条监测链:

Prompt
AI Response
Brand Mention
Citation
Fact Accuracy
Competitor Entities
Source URL
Website Click
Conversion

这条链路比“每个月生成多少篇 GEO 文章”更接近工程化优化。


FAQ:GEO 效果监测还需要注意什么?

GEO Mention Rate 达到多少才算好?

目前没有公认的行业标准。

10%、30% 或 60% 都不能脱离 Prompt 难度、行业竞争程度、测试平台和问题类型直接比较。

更可靠的方法是建立自己的 Baseline:

本月 12%
→ 下月 18%
→ 第三个月 24%

关注同一测试条件下的趋势,而不是寻找所谓“行业及格线”。

GEO 测试需要每天执行吗?

通常没有必要。

如果页面和行业信息变化不快,可以采用周度或双周测试。重大页面更新、算法变化或新产品发布之后,再增加测试频率。

关键不是频率越高越好,而是测试条件保持稳定。

ChatGPT、Perplexity 和 Google AI Mode 可以放在一起算吗?

建议同时展示汇总数据和平台拆分数据。

例如:

Overall Mention Rate = 22%
ChatGPT = 29%
Google AI Mode = 16%
Perplexity = 21%

如果只看 Overall,很容易掩盖平台差异。

AI 引用了页面但没提品牌,这算 GEO 成功吗?

只能算部分成功。

它至少说明内容已经具备一定的信息源价值,但品牌实体没有进入答案。

下一阶段应该检查页面中的组织实体、作者、品牌—产品关系以及上下文是否足够明确。

AI 提到了品牌但没有引用官网怎么办?

这说明信息可能来自第三方页面,也可能来自搜索系统检索到的其他来源。

应该继续记录 AI 实际引用的 URL,并分析哪些第三方信息源正在定义品牌。

Search Console 有了 Generative AI Report,还需要自己测试 Prompt 吗?

需要。

Search Console 可以提供 Google 生成式搜索真实曝光数据,但无法完整回答 ChatGPT、Perplexity 等其他平台的表现,也无法直接完成品牌事实准确率和竞争对手 Share of Voice 分析。

GEO 工具最值得先开发什么功能?

如果准备自己开发内部工具,第一版不需要做复杂 Dashboard。

先实现:

Prompt 管理
测试记录
品牌实体检测
引用 URL 记录
竞品实体检测
历史数据保存
按平台聚合
前后周期比较

等数据稳定后,再建设可视化界面。


GEO 最终应该怎么衡量?

GEO 的核心变化不是“多了一个新的排名指标”,而是搜索结果从确定性的 URL 列表,变成了具有随机性的生成式答案。

因此,GEO 评估的关键也随之变化:

从查一个关键词排名,变成运行一组可重复实验。

KDD 2024 的 GEO 研究使用 10,000 条查询建立 GEO-bench,本质上也是在解决同一个问题:如果生成式搜索结果会变化,就必须使用足够多的问题、样本和指标才能评价优化效果。

对于普通企业站,不需要复制一个 10K 查询的学术 Benchmark。

但至少应该做到:

固定一组真实问题
固定测试规则
保存每一次回答
分别统计提及与引用
验证事实是否正确
持续记录竞争对手
比较优化前后的变化

当 GEO 从“问 AI 看看有没有我们”,升级为Prompt 数据集 + 指标体系 + 周期性实验之后,它才真正从一种内容概念变成可测量、可排查、可迭代的工程问题。

目录
相关文章
人工智能 缓存 前端开发
11084 52
人工智能 JavaScript 开发工具
4204 13
开发工具 Swift git
1654 3
人工智能 Java BI
1029 1
人工智能 JavaScript 测试技术
1508 2
缓存 JavaScript Shell
1906 3
人工智能 JavaScript 测试技术
725 4
Web App开发 人工智能 API
692 1
Shell API 调度
1039 3