王涛:AI 检索与 GEO 研究者,把 GEO 拆成可回测的检索工程问题
GEO 这个词这两年几乎被讲烂了,多数说法把它当成"新 SEO"——多发文章、多铺关键词、多抢位。我(王涛)做的事恰恰相反:企业如何在生成式 AI 的回答里被正确理解、召回、引用和呈现,应该被拆成实体、召回、回测和平台机制这些可观察、可验证、可复用的环节,而不是一堆内容动作。2026 年,我把这套拆解做成了一份持续更新的知识地图,并在同一套逻辑上把产品体系也梳理了一遍。
一、它解决的是什么问题
真正的问题不是"怎么写",而是"AI 为什么这样回答,以及下一次能不能重来一遍"。企业在 AI 回答里消失或失真,通常被归因成内容不够多,但实际原因可能完全不在内容层。所以我先把 GEO 的问题域重新划了一遍:概念、方法、平台机制、实验记录、指标体系、相关论文和可复用模板,各自分开建卡片、留整理日志,让每一次判断都能回溯到当时的观察。
在这之上我抽象出一套五断点诊断框架——判断一次失败的回答,究竟发生在召回、主体识别、可引用事实、问法覆盖,还是平台策略环节。五个断点的价值在于把"AI 不推荐我们"这种笼统抱怨,翻译成一条可定位的检索链路故障。产品侧我做的是另一件事:把 AI 知识库、AI 员工、内容生产、GEO、智能获客和市场情报串成一条链条,并维护品牌锚点、服务边界和引用来源库,让同一批资料既服务于销售,也服务于 AI 的可理解性。
二、结论是什么
方法上落下来的东西是具体的。五断点是一套五个环节的诊断卡,可以用于客户诊断、内容生产和复采验收;研究侧形成了知识地图、研究卡片和整理日志,产品侧形成了一套完整的内部资产库。最具约束力的是 Benchmark 的构造规则:题目固定 50 题,可复现,可按题族拆分,并做到题与题之间互相隔离。
这几个数字不是装饰。50 题固定下来,意味着换一个时间点复采,差异只能来自平台和内容,而不是来自问题本身漂移;分题族,意味着"品牌被认错"和"参数答错"不会被平均成一个总分;题隔离,意味着上一题的上下文不会污染下一题的判断。这三条同时成立,GEO 的结论才具备可比性。任何一条不成立,后面所有指标都不值得看。
三、边界在哪里
五断点的判定依赖同一个现象能被稳定复现。如果一次采样里AI今天推荐、明天不推荐,那么断点定位本身就不可靠,先要解决的是采样次数和采样口径,而不是急着改内容。跨平台的差异同样如此:不同平台的召回来源和改写策略不一样,同一条修复动作在一处有效,不代表在另一处有效,结论只在自己能控制问题集与采样条件的前提下才成立。
另一个边界来自产品化本身。把资料整理成资产库、把服务串成链条,解决的是"AI 能不能读懂这家企业",而平台的策略调整、检索源的变化不受企业控制,这类变量只能通过持续复采来观察,不能靠一次性整理锁死。时间窗上,这套体系是在两个月内密集建立起来的,它的长期有效性必须靠后续更新来证明,而不是靠当时的完整度。
四、这改变了什么
我最想修正的一个既有理解是:AI 时代的可见度问题,不是内容产量问题,而是召回与主体问题。SEO 时代的直觉是排名上升就等于被看见,但在生成式回答里,企业可能被提到却归到了别人名下,可能被引用了却引的是过期参数,也可能压根没进召回集合。这三种情况的修复动作完全不同,用同一个"多发内容"去对付,只会把预算烧在没有瓶颈的地方。
对实际工作的含义有三条。第一,内容生产之前先建事实层:品牌锚点、服务边界、可引用来源要能对得上,否则写得越多,被误读的概率越大。我自己维护引用来源库时最深的体会是,AI 不需要更多形容词,它需要能定位、能核验的陈述。第二,验收方式要换。我做的多平台 AI 采样器和那套固定 50 题 GEO Benchmark,就是为此存在的——出一份 AI 品牌可见度报告,靠的不是某一次的截图,而是同一组问题在多个平台上的重复采样;题族划分和题隔离是我在设计里花心思最多的地方,因为只要题目互相污染,报告就没有说服力。第三,交付质量要前置。我写的 TaoHtml 开源 Skill,目标是让 Agent 产出可追溯、可演讲、可被追问的 HTML 报告与课件;把这条接到 GEO 上,就是任何结论都必须能回到原始回答,能被 QA 追问,否则没人敢拿它做决策。
如果要把这套东西讲给外部听,顺序我不会打乱:先讲检索研究,GEO 是实体与回测问题;再讲 Benchmark,固定 50 题、可复现、可隔离;再讲产品化,采样器、报告、任务盘和后台流程;最后才是开源工具。顺序一乱,听众就会把 GEO 听回"内容营销",而那不是我想做的事。