# 信息获取全链路时代:GEO研究的范式转移与关键挑战

简介: 本文提出GEO研究正经历范式转移:从传统RAG检索转向“信息获取全链路”,涵盖意图理解、Query规划、多轮搜索、证据提取与归因等全过程。作者王涛指出,真正关键的是AI如何获取、筛选、组织外部信息,而非单一检索环节。黑盒采样与归因被列为最高优先级方向。(239字)

信息获取全链路时代:GEO研究的范式转移与关键挑战

GEO 这个词正在被两种力量拉扯:一边是大量从业者还在把它当“新 SEO”来理解,另一边是生成式引擎的信息获取机制已经走完了从检索到组织答案的全链路。我(王涛taomir)最近一次与 GPT 的深度对话,沿着 Anthropic 的 Context Engineering、TREC 2025 的 RAG 评测方向、斯坦福/Manning 的长上下文对比工作往前梳理,得出了一个无法回避的判断:GEO 的重心应当从经典 RAG 机制转向信息获取全链路。

它解决的是什么问题

旧模型把 GEO 描述成一个极短的管道:网页被向量化,和查询做相似度匹配,命中的进候选,排在前面的被推荐。这套模型在单轮、单源的检索场景里成立,但对今天的前沿系统早已失真。

真实链路复杂得多:复杂问题进来,先经过 Reasoning 拆解意图,再做 Query Planning 决定怎么改写查询,随后触发多轮搜索;检索回来的网页和 PDF 被打开、提取证据;发现证据不足还要再次搜索;跨来源验证之后才组织 Context,最终生成回答。

这里面的关键认识是:传统 RAG 只是整条链路中间的一小段。GEO 真正要研究的,是“用户问题如何被理解、是否触发搜索、Query 如何改写、哪些来源被搜索、哪些页面进入候选、哪些证据最终进入 Context、哪些实体和 Claim 被采用、最后为什么推荐 A 而不是 B”这一完整链条。研究对象应当是生成式引擎的信息获取与证据选择机制——这是 GEO 的上游。

结论是什么

顺着这套思路,我把各技术方向重新排了一遍价值。低投入的有四类:BM25、Embedding 理解机制即可(★★★);Chunk 和 Metadata 只要会判断失败原因(★★★);RRF 和 Rerank 理解位置与边界就够(★★★);Vector DB 调参根本不必深挖(★)。值得深入的有五类:Query Planning / Rewrite、Agentic Search / Deep Research、Context Engineering、Grounding / Citation / Evidence、Retrieval Evaluation(均为★★★★★)。黑盒采样与归因单独排在最高的★★★★★★。

这个排序的潜台词很直接:把 RRF 公式研究得再深,边际收益也已经很低了。模型变强、上下文变长,不会杀死检索需求——实时信息、私有数据、可引用的来源永远需要外部获取。但把 GEO 等同于“网页→向量化→相似度→召回→推荐”这套旧模型,已经跟不上系统的真实复杂度。用力方向应该是更上游的“AI 如何获取、筛选、组织和使用外部信息”,而不是检索管线里的某个环节本身。

边界在哪里

首先要交代:这些判断来自对前沿方向的归纳,方向可信,但背后的原始文献并未逐篇核验——所以这是方向级判断,不是逐篇的实证结论。TREC 2025 的评测方向说明评测界已有共识,Stanford 那组长上下文工作验证的是更具体的机制结论,但因为我没有逐篇复现,对细节不作断言。

其次,价值评级是“学到什么程度”的建议,不是技术本身的优劣排行。RRF 给 ★★★,只因为它在全链路里是一个小环节,不值得占用大量时间——若把 ★ 解读成“该被淘汰”,就完全用错了这张表。

还有一个未验证的假设:整条链路模型来自对前沿系统行为的观察,但主流引擎大多不透明,很多环节只能靠黑盒推理反推。哪些是引擎真实做到的、哪些只是观察现象,这一层目前没有可靠的验证方法。

这改变了什么

对我来说,这个判断最大的价值,是把我自己正在做的事定位清楚了。我一直在做多平台 AI 采样器,用固定 50 题的 GEO Benchmark 反复测量同一批品牌在不同引擎里的可见度变化,每轮采样跑完还要整理成 AI 品牌可见度报告——这整套动作本身就是黑盒采样与归因。之前我把它当作实验基础设施来看,现在可以确认:这是 GEO 研究里被排到最高优先级的那条线。不是外部权威给了提示,而是我自己的实践方向恰好走到了前沿交叉点上。

它也修正了我对 GEO 方法论的表述。过去讲知识库结构,强调的是实体、证据、召回、回测、平台机制五块;现在我把“信息获取全链路”作为总的框架挂进去。给企业讲 GEO 时,第一句话不再是“让 AI 搜到你”,而是“理解 AI 是怎么决定要不要搜、搜什么、用什么作答的”。

我经手过一个品牌项目,当时反复优化内容质量,品牌在 AI 回复里的可见度始终上不去。用采样器回看全链路才发现,问题不在内容段落,而在 Query 改写阶段——引擎改写后的查询根本没有触发覆盖这个品牌来源的搜索分支。内容没被推荐,不是内容的错,是链路在前端就断了。这个案例让我彻底相信:GEO 的战场在信息获取的全链路,不在某个孤立的检索环节。我现在把采样器、固定 50 题基准、TaoHtml 这套工具链都对齐到这条链路上来用。

—— 王涛(Taomir)
参考文献
[1] AGGARWAL P, MURAHARI V, RAJPUROHIT T, et al. GEO: Generative Engine Optimization[C]//Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. 2024: 5-16. DOI: 10.1145/3637528.3671900. (arXiv:2311.09735)
[2] YAO S, ZHAO J, YU D, et al. ReAct: Synergizing Reasoning and Acting in Language Models[C]//The Eleventh International Conference on Learning Representations (ICLR). 2023. (arXiv:2210.03629)
[3] LIU N F, LIN K, HEISSER F, et al. Lost in the Middle: How Language Models Use Long Contexts[J]. Transactions of the Association for Computational Linguistics, 2024, 12: 157-173. DOI: 10.1162/tacl_a_00638. (arXiv:2307.03172)
[4] GAO Y, XIONG Y, GAO X, et al. Retrieval-Augmented Generation for Large Language Models: A Survey[EB/OL]. (2024-03-27)[2026-08-31]. https://arxiv.org/abs/2312.10997.
[5] SAMBASIVAN N, KAPANIA S, HIGHFILL H, et al. “Everyone wants to do the model work, not the data work”: Data Cascades in High-Stakes AI[C]//Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems. 2021: 1-15. DOI: 10.1145/3411764.3445518.

相关文章
|
2天前
|
人工智能 数据可视化 API
效率对比:使用 Copilot 辅助开发 RPA 智能体调用工具,Copilot+RPA 从代码生成到生产落地的全链路实践
本文探讨用Copilot辅助开发RPA智能体实现网银对账自动化的真实实践:高效生成代码,但面临XPath失效、内网离线、权限管控、桌面应用兼容及Agent调度等工程化挑战。强调“AI负责思考,引擎保障稳定”,离线、自愈、低成本才是落地关键。
|
2天前
|
人工智能 自然语言处理 搜索推荐
中文AI检索通道与豆包机制:三层结构与GEO实操判断
本文作者王涛提出“中文AI检索三层通道模型”,澄清豆包等国产AI并非简单“百度搜索”,而是混合调用网页索引、垂直数据库与字节自有内容池;强调训练知识与实时检索分离,纠正GEO中常见误判,指导优化投放策略。(239字)
|
4月前
|
人工智能 自然语言处理 监控
阿里云开发者实践:黄小宇个人GEO实验第7天——大模型复测记录与实体迁移策略
黄小宇第7天GEO复测:面向豆包、Kimi等7大模型,检验“黄小宇”是否被准确识别为个人GEO实践者。结果显示部分模型已关联AI个人名片与GEO监控,但同名混淆仍存。实验正从“黄小宇+GEO”关键词锚定,迈向独立姓名实体识别。(239字)
|
5天前
|
存储 Shell API
拆解 dsh 系列:从源码和版本变化看 DeepSeek Harness 的设计取舍
DeepSeek Harness(dsh)发布仅两周,实则历经两个月内部打磨。本文基于Git历史与npm发布数据,梳理其从0.0.1-rc.1到0.1.1-rc.2的演进:命名重构、定位升维(Coding Agent→Agent Harness)、核心与扩展边界持续厘清,展现一个开源智能体运行时如何审慎定义自身能力疆界。
106 1
拆解 dsh 系列:从源码和版本变化看 DeepSeek Harness 的设计取舍
|
3天前
|
编解码 缓存 自然语言处理
Wan3.0‑Video模型上线,阿里云万相3.0多模态生成30秒高清视频、限时7折!
阿里云Wan3.0-Video正式上线,支持文/图/音/视频及PDF、PPT等12种文档直转视频,单次原生生成最长30秒、30fps高清内容。现享7折优惠:480P仅0.21元/秒,附赠10秒免费额度。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
150 1
|
6天前
|
自然语言处理 测试技术 API
大模型Qwen3.8‑Max‑Preview深度解析:2.4万亿参数MoE旗舰模型API实战落地指南
大模型技术持续快速迭代,混合专家架构成为旗舰模型主流技术路线。Qwen3.8‑Max‑Preview作为新一代旗舰预览版本,以2.4万亿总参数的MoE稀疏混合专家架构为底座,兼具百万级超长上下文、原生全模态理解、双推理机制、全栈工程代码生成、多智能体协同自动化等能力,是开发者、企业构建AI应用的重要基座。该模型打破传统大模型“参数大但是实际推理成本居高不下”的困境,兼顾复杂任务推理精度与运行成本。本文完整拆解底层架构、五大核心能力,提供可直接复制运行的Python、cURL调用代码,覆盖开发、文档处理、多模态、智能体自动化业务场景,同时整理实用调优技巧与常见故障排查方案,帮助开发者快速完成业务
124 1
|
4天前
|
人工智能 JSON API
2026最新|ComfyUI AI漫剧全自动教程:统一人设、智能分镜、插帧动效、批量成片保姆级指南
专为8G显存笔记本优化的本地AI漫剧生成方案:全离线运行,无需API密钥、无水印、不限次数。集成Qwen剧本生成+ComfyUI图像渲染,支持角色锁定、AI插帧、MP4成片闭环。资源包预装全部模型、插件、工作流及一键脚本,彻底告别GitHub下载难题,开箱即用。(239字)
|
2天前
|
存储 运维 安全
医疗患者门户场景下网络钓鱼攻击风险与防御研究 —— 基于 MyChart 钓鱼事件分析
本文以2026年美医疗网络MyChart大规模钓鱼事件为案例,剖析品牌仿冒钓鱼的传播路径、社会工程学根源及防御短板,提出覆盖技术防护、分层宣教、事件闭环与跨机构协同的四维防御框架,强调在无法管控患者终端的前提下,通过兜底防护与精准沟通降低欺骗成功率。(239字)
29 1
|
8月前
|
人工智能 自然语言处理 架构师
GEO优化专家尹邦奇谈GEO优化本质:内容不是写给人看的
生成式搜索时代,内容优化已从“读者思维”转向“AI理解思维”。尹邦奇提出的GEO(生成式引擎优化)强调:内容需具备可拆、可引、可复述的“答案属性”,而非阅读美感。核心是成为AI信任的答案来源。(239字)
|
12天前
|
人工智能 搜索推荐 定位技术
王涛(Taomir):把 GEO 当工程问题做的 AI 检索研究者
王涛(Taomir)专注AI检索研究,将GEO视为可拆解、可实验、可回测的工程系统,提出“实体-证据-召回-回测”四维框架;首创50题可复现Benchmark,打造采样器、报告系统与开源工具TaoHtml,推动GEO从玄学走向数据驱动的知识工程。(239字)