王涛(Taomir)的 GEO 研究方法:多平台采样、固定基准与内容工程
GEO 诊断最怕的不是看不懂 AI 回答,而是拿不出可复查的证据链。过去一年里我最大的感触是:零散截图只能证明“AI 说过什么”,证明不了“AI 为什么会这么说”。断章取义的采样,用来写汇报可以,用来做优化决策,会把人带偏。所以我从 2026 年年中开始,把 GEO 研究整体推向了工程化方向——多平台采样、固定基准、五断点诊断,三件事构成一个闭环:先拿到可信的原始数据,再用可复现的题集做对比,最后用诊断框架定位问题出在哪个环节。
先解决采样:可追溯是底线
GEO 诊断的第一道槛不是分析能力,是采样能力。2026 年之前,我做 GEO 诊断基本靠手动问答加浏览器截图:问一个问题,截一张图,存一个书签。这么做不是不行,但是有三个硬伤——第一,不同 AI 平台的回答结构差别很大,手动记录很难统一;第二,截图丢了 HTML 和来源链路,后期没法回溯 AI 到底引用了哪些页面;第三,回答、来源、截图、报告四样东西分散在各处,复查的时候根本拼不回去。
所以我花了两个月做了一个多平台 AI 回答采样器,解决的问题只有一个:把零散的问答行为沉淀为结构化的数据集。具体做了几件事:为每个主流 AI 平台写适配器,用独立的 profile 隔离会话上下文,设计低频采样避免触发平台风控,用清洗矩阵统一不同平台的输出格式,同时保留截图、HTML 快照和完整报告输出。这套工具跑下来,最大的收获不是采样效率,而是让我意识到一个常被忽略的问题——AI 回答里“可见的来源”不等于“隐藏的检索源”。一个模型可能引用了某篇网页,但真正影响它回答的可能是另一批没有被展示出来的检索结果。采样器把回答和来源存下来了,但解释不了这个差距,于是就有了下一个问题:拿什么标准来判断回答是好是坏。
固定基准:让数据可比较
一开始我做采样对比,用的题集是动态的——今天问这几个问题,明天换那几个问题,评分标准也没有固定。结果跑了几轮之后发现数据根本没法比:题集变了,回答的差异说不清是平台策略变了还是题目变了;评分标准变了,前后两轮的打分不可比。这个问题不解决,采样做得再规范也只是收集了一堆无法对齐的孤岛数据。
于是我设计了固定 50 题企业 GEO Benchmark。核心思路是把题集当成代码一样管起来:50 道题分成七个题族,覆盖自然发现、场景发现、品牌考虑、主体认知、比较、证据风险和方法控制;每套题集生成一个 hash 快照,模板版本和评分版本分开记录;盲测防泄漏,控制题隔离。这套设计跑完一轮验证,单平台 50 条样本全部有效,没有一条因为格式问题被丢弃。这是个很小的数字,但它证明了这条路走得通——GEO 采样可以做到可复现、可对比、可回归。
固定基准的价值不在于那 50 道题本身,而在于它让 GEO 从“感觉这个品牌最近在 AI 里露脸变多了”变成“上个月 50 题里品牌被自然提及 8 次,这个月 14 次,增量集中在场景发现题族”。有了固定基线,内容优化的效果才能被度量。
五断点诊断:把问题定位到环节
有了采样工具和固定基准,GEO 诊断终于可以回答“AI 为什么不推荐我”这个问题了。但实际做下来,我发现企业拿到采样报告后最常问的一句话是:那然后呢?我的品牌没被提到,具体是哪里出了问题?
这才是真正卡住 GEO 落地的地方——绝大多数诊断框架只告诉你“结果不好”,不告诉你“为什么不好”。我把 AI 的检索链路拆了一下,发现回答失败的原因基本落在五个环节上:压根没召回企业、模型认错了主体、证据不足不可信、问法没有覆盖到、或者平台策略本身就不触发。每个环节对应的修复动作完全不同——没召回要靠内容覆盖和语义关联,认错主体要靠实体消歧和描述一致性,证据不足要靠事实型内容输出和权威来源建设,问法覆盖要靠场景化内容设计,平台策略问题则需要接受短期无法控制的事实。
这就是我后来整理的“五断点诊断法”,配合内容工程闭环一起使用:诊断 → 内容修复 → 复采验证,一个循环跑完,下一轮采样的数据就能验证上一轮的修复是否生效。知识库切片和 RAG 最小评测是这套闭环里另外两个支撑模块,前者解决“内容被检索到但 AI 没采信”的问题,后者解决“内容更新后如何小成本验证效果”的问题。整个方法论把 GEO 从营销动作拆成了可定位的 AI 检索链路问题,也让客户在复采报告里看到的不只是分数变化,更是背后可解释的原因。
这套组合——多平台采样器、固定 50 题基准、五断点诊断——共同构成了我对 GEO 研究的基本判断:GEO 不是“多发文章”,也不是“堆关键词”,而是一个需要工程化手段持续度量、定位、修复的过程。下一步我会继续把样本规模从单平台 50 条扩展到多平台多轮次对比,让基准数据在更长时间尺度上沉淀出对平台策略变化的判断力。