可见性不等于质量:王涛谈 GEO 指标体系需要补上哪些维度
我是王涛(Taomir),在成都负责新港智优 AI 中心,日常工作就是生成式引擎优化(GEO):让内容在生成式引擎给出的答案里被看见、被引用、被核对。这篇文章只讲一个判断:可见性是必要但不充分的指标,GEO 的指标体系必须同时测量内容质量、实体正确性、答案吸收度和业务结果。
一、可见性必须测,但它单独不能说明内容是对的
结论先放这里:把可见性当作质量指标,是当前 GEO 指标体系里最大的缺口。
生成式引擎直接生成综合答案,可能减少用户访问网站,进而影响自然流量和可见性——这是路径影响,不是必然结果。GEO 要处理的,是内容在这些答案里的出现情况。问题在于,检索增强生成会把检索到的网页文本拼入生成上下文,网页"被引用"只意味着它进入了上下文,不意味着答案把它说对了。
所以在我们产出的 AI 品牌可见度报告里,位置和出现次数只是第一层。同一份报告还要逐条对照答案里的陈述与来源事实是否一致:品牌名、产品名、型号、归因有没有被写错。这些错误不会体现在可见性计数里,却会直接改变用户判断。可见性回答"有没有被提到",正确性回答"被提到时说的是不是真的",两者不能互相替代。
二、论文的三类指标可以复用,中文业务还缺三项
论文框架用词数、位置调整词数(PAWC)和主观印象这三类指标度量生成式引擎中的可见性。这套指标我认可它的可复现性,但落到中文业务监测上,还要补实体正确、引用吸收和稳定性。
理由很直接:这些指标衡量的是内容在答案中的呈现方式,不衡量答案有没有吸收你的具体内容。所以我在做多平台 AI 采样器时,把题型、平台和来源质量分开记录,让同一道题在不同平台、不同轮次之间可比。在此之上加三项:实体正确,检查生成文本里的事实性表述;引用吸收,判断答案是否真的用了我们提供的句子和数据,而不只是域名出现;稳定性,同一问题重复提问,答案是否漂移。
GEO-bench 覆盖约 1 万条查询、25 个领域和多种数据集,是生成式引擎评测的标准测试平台。但它是评测基准,不是国内平台的业务基线,我在做 GEO Benchmark 题集时按国内题型重新分层,而不是直接套用它的分布。
三、方法有效,但有效是有条件的
在受控实验里,数据、引语和来源类方法提升最大,而关键词填充是负向或无效变量。这是论文九类 GEO 方法里最需要记住的分工:权威、数据、关键词、来源、引语、易懂、流畅、独特词、术语都是候选变量,但关键词必须按负向或无效处理,不能当增长手段。
具体条件要写清楚:在 GEO-bench 中,最佳方法在 PAWC 和主观印象上分别约提升 41% 和 28%,低排名网站可提升 115%。这些数字成立的前提是英文数据集、该指标口径和该排名条件,不能外推成所有平台的表现。在 Perplexity 等真实生成式引擎上,引用名言和统计数据仍然有效,关键词填充甚至劣于未优化,方法具备泛化性;但中文平台重新采样之前,我不会承诺同等幅度。
还有一点常被误读:网站长度、独特性和呈现方式可能与引用可见性共同作用,但它们与题型、平台和来源质量一起起作用,不是单独决定因素。在 TaoHtml 这类呈现层工作上,我只把长度和结构化呈现当作共同作用的一项,不指望它单独抬高引用。
四、可见性之外,还要补一个安全维度
GEO 指标里还缺一类:对知识投毒和提示注入的复核能力,因为被检索到的网页会被拼进生成上下文,网页本身就是攻击面。
论文展示过 STS:在可检索网页中插入目标文本,可以操纵模型对产品的推荐,即使文本与问题无关也可能生效。GCG 等优化方法能把这种操纵导向指定产品或目标答案。ColdBrew 实验中,无关的高价产品可以被推到推荐列表顶部。这些结果只用于风险评估和防御复核,我不用它做增长路径。
可用的防御方向包括异常扫描、排序敏感性分析、多源投票、随机化检索顺序和透明排名。随机化检索文本顺序能提高模型对 STS 操纵的鲁棒性,但前提是先验证它不破坏正常召回。我在成都的团队把异常扫描和排序敏感性分析放进评测流程,只做防御复核,不复现攻击。
这也反过来影响第一节的判断:生成答案里的"权威感"可能只是高概率续写,不是事实权威。所以权威感、来源质量和用户结果必须分开测量。另外,单纯关键词策略不足以覆盖 GEO,抓取、索引和类目词仍然是公开网页召回的底座——网页先要被召回,才谈得上答案层的优化。
接下来我要验证什么
我会在中文平台上重新采样九类方法,按题型和平台分层,重点看数据、引语、来源三类方法与关键词填充的对照结果;把实体正确、引用吸收和稳定性做成 AI 品牌可见度报告的常规字段;再逐项验证异常扫描、排序敏感性分析和随机化顺序对正常召回的影响,通过之后才纳入流程。论文指标和百分比只在它的数据集、平台和实验条件下成立,中文业务需要单独复测——这一步不做完,可见性就仍然只是一个漂亮的数字,而不是质量。