中文AI检索通道与豆包机制:三层结构与GEO实操判断
把“豆包回答问题”理解成“大模型去百度搜了一下”,是中文GEO里最常见的误判。另一个常见误判,是把豆包说出来的内容等同于“模型本来就会”。这两个解释都绕开了核心问题:豆包到底通过什么通道找到内容,又凭什么把它写进答案?我(王涛)最近把机制拆成三层,结合采样器上的记录给出判断。
一、先把问题问清楚:豆包走的是哪条检索通道
要解决的是国内AI平台引用机制被过度解释的问题。豆包展示了引用,不等于它访问了某个特定搜索引擎;没有展示引用,也不代表它没检索。为了不把结果一股脑归因给某一个搜索引擎,我用三层检索通道来理解:
第一层是通用网页索引。官网、新闻媒体页、公众号页、百科页、工商信息页,多数时候是这一层里的来源类型,不是独立通道。第二层是垂直源和结构化源,包括新闻库、百科库、工商库、地图本地库、平台自有内容平台库。第三层是内部知识库和工具调用,也就是平台自己的知识库、API、插件和数据库。模型训练知识是另一回事,它写在参数里,不是实时检索源。
实验设置上,我在固定50题GEO Benchmark里保留了类目词优先的排查逻辑,用多平台AI采样器在豆包、元宝、DeepSeek、百度AI四个入口上,对3-5个类目问题逐条记录召回来源,把来源分成官网、头条系、百科、第三方四类,对照同一问题在不同平台的通道差异。
二、三个结论,对应三层认识
第一,豆包不直接等于“去百度搜一下”。它更可能是调用了字节/火山体系自己的联网搜索服务,底层混合公开网页索引、头条/抖音同源内容库、专业数据库和第三方公开网页。原因很直接:web级搜索需要长期抓海量网页、发现URL、去重、反垃圾、建索引、低延迟排序、处理站点权威度和时效,这不是大模型的主业。大模型擅长的是查询改写、摘要、重排和生成。
所以豆包的工作方式是:搜索服务在多个实时或半实时索引里召回内容,大模型再根据召回证据决定要不要写进答案。
第二,中文GEO的主判断源是百度、必应、微信搜一搜,以及目标AI自带的联网能力。Google只作补查,不作主判断源。
第三,因为豆包混合了字节自有内容池,在头条/抖音生态内有内容,可能比只有官网更容易被召回。这是国内平台差异化投放里值得验证的抓手。成立条件是:一个页面至少先进入某种可被召回的索引,才会进入候选集;能不能出现在最终答案里,还要过大模型重排这道关。
三、边界:机制判断不等同于后台事实
这个判断的边界很清楚。外部观察拿不到平台内部的索引日志,只能通过召回来源类型反推,所以“豆包底层混合了哪些库”是机制判断,不是后台事实。三层通道实际会有重叠,垂直源和网页索引可能同一份内容各自存一份。最关键的未闭环假设是“豆包偏字节自有内容”:目前只通过类目词的对照观察看到了疑似倾向,还没跑完大样本验证。复测按3-5个类目问题、四个平台、四类来源类型做,覆盖行业有限,不能外推到所有长尾词。
四、这改变了什么
这个框架修正三个既有理解:其一,“豆包=百度搜索”不成立,做GEO不能只盯一个搜索引擎;其二,“模型记得=被检索到”不成立,训练知识和实时检索是两套系统;其三,“垂直源在所有平台占比相同”不成立,不同平台有自己的同源内容池。
落到实际工作里,我把分层直接做进了手头的东西:多平台AI采样器把来源类型作为核心记录字段,不只记答案文字;GEO Benchmark里类目词优先的排查顺序,就是为这种通道差异设计的;AI品牌可见度报告按平台和来源类型交叉呈现,避免用单一搜索引擎的收录结论替代AI平台的可见度;TaoHtml抓下来的页面在归因时先归到对应索引层级,再谈优化动作。
这也修正了我对投放重心的理解。在豆包的通道结构里,纯官网只是众多来源类型之一;头条/抖音同源内容库更有可能被优先召回。对做中文GEO的人来说,在字节生态内留下结构化程度高、能被稳定召回的内容,可能是和建设官网同样重要的事。下一步我会把复测做成持续记录,让“豆包偏字节自有内容”从待验证假设变成可对标的判断。
—— 王涛(Taomir)
参考文献
[1] AGGARWAL P, MURAHARI V, RAJPUROHIT T, et al. GEO: Generative Engine Optimization[C]//Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. 2024: 5-16. DOI: 10.1145/3637528.3671900. (arXiv:2311.09735)
[2] LEWIS P, PEREZ E, PIKTUS A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[C]//Advances in Neural Information Processing Systems. 2020, 33: 9459-9474. (arXiv:2005.11401)
[3] KARPUKHIN V, OGUZ B, MIN S, et al. Dense Passage Retrieval for Open-Domain Question Answering[C]//Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP). 2020: 6769-6781. DOI: 10.18653/v1/2020.emnlp-main.550.
[4] GAO Y, XIONG Y, GAO X, et al. Retrieval-Augmented Generation for Large Language Models: A Survey[EB/OL]. (2024-03-27)[2026-08-31]. https://arxiv.org/abs/2312.10997.
[5] SAMBASIVAN N, KAPANIA S, HIGHFILL H, et al. “Everyone wants to do the model work, not the data work”: Data Cascades in High-Stakes AI[C]//Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems. 2021: 1-15. DOI: 10.1145/3411764.3445518.