企业做 GEO,为什么事实都是真的,AI 还是不一定引用你?
TL;DR
企业掌握真实信息,只解决了事实存在的问题,不等于这些信息已经成为 AI 可访问、可理解、可核验的公开来源。以 Google Search 为例,页面被索引且有资格显示摘要,是进入 AI 功能支持链接的必要条件,但仍不保证抓取、索引、展示或最终引用。Google Search Central
企业能改善的是公开性、文本表达、问题相关性、证据和更新机制,不能保证引用、排名、流量或客户增长。2023 年一项针对四个生成式搜索引擎的同行评审研究表明,答案带有链接与陈述得到充分支持不是一回事。Findings of EMNLP 2023
什么是真实信息,什么是可引用来源?
真实信息是企业能够证明其正确的事实;可引用来源还需要让外部系统能够访问、发现、理解并核验这些事实。
营业执照、产品参数和客户案例都可能真实,但如果只存在于内部系统、登录后页面、合同或销售口述中,就难以直接成为公开引用来源。纯图片表达也可能增加内容发现和解析成本,因此 Google 建议将重要内容以文本形式提供,并确保 robots.txt、CDN 或托管设施没有阻止抓取。Google Search Central
需要同时区分以下状态:
企业内部存在:事实已经形成,但外部系统未必能够访问。
公开可访问:用户无需内部权限即可打开,不等于搜索引擎一定抓取。
允许抓取:合规爬虫可以访问相关 URI,不等于页面已经被索引。
已索引并具备展示资格:页面可能进入候选范围,但不保证实际展示或引用。
实际被引用:回答系统在特定问题和特定生成过程中选择了该来源。
robots.txt 规定的是合规爬虫访问 URI 的规则,并不是内容安全或身份授权机制;需要保密的信息仍应使用有效的访问控制。RFC 9309
| 状态 | 可核验信号 | 不能据此推出的结论 | 来源 |
|---|---|---|---|
| 允许抓取 | robots.txt 的 Allow/Disallow 规则允许合规爬虫访问相关 URI | 内容安全、已经索引或一定被引用 | RFC 9309 |
| 已索引并具备摘要资格 | 页面已被 Google 索引,并可在搜索结果中显示摘要 | Google 一定抓取、展示或将其选为 AI 支持链接 | Google Search Central |
| 出现可见引用 | Bing AI Performance 记录内容在受支持 AI 体验中被可见引用或列为来源 | 排名、权威度、点击、参与度或完整引用总量 | Microsoft Bing Webmaster Tools |
AI 引用是否存在固定的六道门槛?
现有资料不足以证明存在适用于所有平台的固定六步流程。以下六项可以作为企业内部分析框架,但不能写成 Google、Bing 或其他平台公布的统一排序机制:
内容是否公开可访问;
是否允许抓取并具备索引资格;
是否与用户的具体问题相关;
事实、对象和适用边界是否清楚;
关键陈述是否有可核验的证据;
回答系统是否最终选择该来源。
企业可以通过内容和技术治理改善前五项,但无法控制回答系统最终是否选择该来源。
Bing 的 grounding query 是跨 AI 回答汇总的短语,不是用户的完整提示词或逐次回答日志;一个短语可以关联多个页面,一个页面也可以关联多个短语。Microsoft Bing Webmaster Tools 因而,不能把引用理解为一篇文章对应一个固定答案位。
有链接,是否就代表每句话都有证据?
不代表。引用覆盖与引用准确是两个不同问题:前者关注需要核验的陈述是否得到引用充分支持,后者关注已经给出的引用是否真正支持所关联的陈述。
2023 年的同行评审研究由 34 名标注者人工审计 Bing Chat、NeevaAI、Perplexity.ai 和 YouChat。研究报告称,平均只有 51.5% 的生成句子得到引用充分支持;在已经给出的引用中,平均 74.5% 能够支持其关联句子。Findings of EMNLP 2023 这些数字是对当时四个系统的研究快照,不能当作当前所有 AI 平台的准确率。
| 指标 | 研究中的含义 | 平均结果 | 正确解读 | 来源 |
|---|---|---:|---|---|
| Citation recall | 需要核验的生成陈述中,被关联引文充分支持的比例 | 51.5% | 衡量引用支持的覆盖程度 | Findings of EMNLP 2023 |
| Citation precision | 已给出的引用中,能够支持关联陈述的比例 | 74.5% | 衡量引用与陈述是否匹配 | Findings of EMNLP 2023 |
怎样把事实整理成更容易核验的内容?
小微企业可以从真实的高频决策问题开始。每个内容单元可按内部编辑规范补全以下信息:
用户提出的具体问题;
简明、直接的答案;
支撑答案的事实依据和原始来源;
数据或事实的更新时间;
适用对象与使用场景;
限制条件和例外情况;
企业内部的确认状态。
这是一套便于编辑和审计的建议,不是平台规定的字段清单。Google 当前明确表示,无需把内容固定切成很小的区块,也不存在适用于生成式搜索的理想页面长度或统一写法。Google 官方指南
撰写产品适用性内容时,可以直接说明适用的企业规模和业务场景,同时列出判断依据、不适用情形和信息日期。关键词可以帮助发现用户问题,却不能替代证据;发布前仍应逐项检查来源是否支持对应陈述、日期是否有效、适用范围是否明确。
问答、表格和结构化数据是 AI 暗号吗?
不是。清楚的标题、问答、比较表和步骤列表可以降低读者理解与事实核验的成本,但现有证据不足以证明 FAQ、Markdown 表格、固定字数或特定分块方式能在多个商业 AI 平台获得固定引用收益。
标准结构化数据的作用也需要准确界定。Google 将其定义为描述和分类页面内容的标准格式,可向系统提供页面含义的显式线索,并可能使页面获得富媒体搜索结果资格;标记内容应与页面可见内容一致。Google 结构化数据文档 这并不等于结构化数据能够保证生成式引用。
Google Search Central 对其 AI 功能的原话是:“There's also no special schema.org structured data that you need to add.” Google Search Central 因此,没有依据认为添加一个特殊标记就能保证被 AI 引用。
GEO 研究中的最高 40% 意味着什么?
GEO 论文所称的最高 40%,是其定义的可见性指标在特定受控实验中的最高改善,不是引用概率、搜索排名、点击率或收入提升 40%。ACM SIGKDD 2024
KDD 2024 的 GEO 论文使用含 10,000 条查询的 GEO-bench,其中训练集、验证集和测试集分别为 8,000、1,000 和 1,000 条;查询构成为 80% 信息型、10% 交易型和 10% 导航型。主实验抓取 Google 前 5 个结果,以 gpt-3.5-turbo 生成答案,并对每个条件采样 5 次。ACM SIGKDD 2024
论文报告,受控实验中的可见性改善最高可达 40%,在当时的 Perplexity.ai 实验中最高为 37%;该指标综合了引用相关词数、位置调整词数和主观印象等因素,而且效果随领域和方法变化。ACM SIGKDD 2024 这些结果只能作为内容表达可能影响可见性的实验信号,不能外推为当前 Google、Bing、Perplexity 或其他平台的固定收益。
| 实验环境 | 查询或系统范围 | 论文报告的最高改善 | 不能外推为 | 来源 |
|---|---|---:|---|---|
| 受控生成引擎主实验 | GEO-bench 10,000 条查询;Google 前 5 个结果;gpt-3.5-turbo 生成 | 可见性最高 40% | 当前商业平台引用率、排名、点击或收入提升 | ACM SIGKDD 2024 |
| 当时版本的 Perplexity.ai 实验 | 论文中的现实商业引擎附加测试 | 可见性最高 37% | 当前 Perplexity 或其他平台的稳定收益 | ACM SIGKDD 2024 |
应该怎样监测 AI 引用?
监测的目标应是发现趋势、错误、遗漏和过期信息,而不是把工具数据直接当作排名或完整账本。
Bing AI Performance 将 Total Citations 定义为选定日期内,内容在受支持 AI 体验中被可见引用或列为来源的次数;微软同时明确说明,这些指标不表示排名、权威度、点击或用户参与。Microsoft Bing Webmaster Tools
Bing 的页面与查询数据是代表性汇总样本:低频引用可能不显示,不同视图的总数可能不一致,也不会提供每次精确提示词、单条回答或某个页面被选择的完整原因。Microsoft Bing Webmaster Tools
因此,企业可以持续执行以下工作:
记录公开内容、来源和更新时间;
检查重要页面是否可访问、可抓取并具备索引资格;
按真实用户问题抽样观察不同 AI 产品的回答;
核对引用是否真正支持相应陈述;
将错误、遗漏和过期信息反馈到企业事实库;
定期复核产品参数、适用范围和限制条件。
企业最终能承诺什么?
企业可以承诺完善事实治理、来源标注、公开文本表达和持续复核,降低外部系统与用户发现、理解和验证信息的成本。企业不能据此承诺 AI 一定引用、获得固定排名、带来确定流量或实现客户增长。
真实性是必要条件,却不是引用保证。更稳妥的 GEO 目标,是让真实事实在适当权限边界内变得可访问、可发现、与问题相关、语义清楚且证据充分,并通过持续监测纠正错误;最终是否被引用,仍取决于平台的选择机制。