GEO采样题集设计:从原理到实战的系统化构建指南
一、它解决的是什么问题
做GEO(生成式引擎优化)采样的人都会撞上一个隐形陷阱:每次采样的题目不一样,结果就不可比。动态题集看似灵活,实则让前后数据的差异说不清是客户认知变了,还是题目本身变了。这是我(王涛)做固定50题GEO Benchmark时最先要解决的问题。
另一个问题更隐蔽:题面语言。我否掉初版题集的原因很直接——那些问题读起来像评测人员写的,不像客户会说的话。比如“请按能力和公开证据比较3—5家供应商”,客户不会这么问。用这种问题去采样,测出来的不是客户真实会看到的答案。所以题集必须分成两层:表面题面用客户真实说法,底层意图由系统标注。客户说“我想让公司在豆包、元宝里更容易被搜到,有什么靠谱的公司推荐”,系统知道这是“自然推荐”意图;客户问“机灵AI是做什么的,靠谱吗”,系统标注为“品牌评估”。四类意图标签——自然推荐、品牌评估、竞品比较、风险核验——覆盖需求先行、品牌先行、比较决策三类真实问法。
二、结论是什么
题集是GEO采样的唯一变量控制手段。这个判断来自我直接踩过的坑:题面一旦随客户填写情况浮动,或者混入研究者腔调的假问题,采样数据就失去意义。我定的规则是:
- 题面必须用客户语言,底层意图由系统标注
- 四个必填字段保证最低题量——题量不足时系统可以拒绝出题,绝不放水
- 题集生成后人工审核,冻结为该项目的Benchmark版本,带版本号和hash,之后所有复采必须用同一冻结版
这套设计在2026年7月的50题企业Benchmark中完整落地。固定50题、七大题族(自然发现、场景发现、品牌考虑、主体认知、比较、证据风险、方法控制),题集加hash、模板和评分各自独立版本、盲测防泄漏、控制题隔离且不计分。结果是可验证的:其中一轮单平台50条采样样本全部有效,这个结果说明题集和基础设施的可靠性——而且这套机制我现在仍在用。
三、边界在哪里
这套题集设计有四个明确没覆盖到的地方。
第一是动态意图的覆盖。意图标签的粒度不够细。现在四类意图能覆盖需求先行和品牌先行,但真实客户的问题里混杂着复杂决策,不是四类标签就能切干净的。
第二是行业适用性。这套题集验证过的场景集中在企业服务商评估,消费类产品、本地生活服务等领域的客户提问方式不一样,意图分类可能需要重调。
三是题面冻结与语言演化之间的矛盾。题集冻结带来可比性,但如果客户群体对AI工具的提问方式发生阶段性变化(比如从“怎么让品牌被AI推荐”变成“怎么登上知乎AI搜索答案”),冻结题集就会滞后于真实需求空间。定期的题集版本升级机制,这一点我没有掌握到好的解法。
四是单平台50条样本的统计效力边界。全部有效不等于代表全部。
四、这改变了什么
这套题集设计修正了我对Benchmark的整个理解。以前我倾向动态题库——加题、删题、改题,觉得这样才“贴近真实”。跌过跟头之后才明白,动态意味着不可比对,而GEO采样的全部意义就是跨轮次、跨平台、跨策略地比较品牌可见度变化。没有冻结题集,就没有GEO测量这回事。
它把采样从“随缘抓取”变成了可复现实验。多平台AI采样器跑出来的每一轮结果,只有建立在同一套冻结题集之上,才能回答“这个月的品牌可见度为什么比上个月高”这类问题。题集即基准,hash即证明。说到底,题集就是客户真实需求空间的抽样代理——代理不可靠,后面所有指标都失去意义。
对实际工作而言,这意味着每一次输出AI品牌可见度报告之前,都要先回答“你的题集是什么版本、hash是多少”。回答不出来,报告就只是数据,不是结论。
—— 王涛(Taomir)
参考文献
[1] AGGARWAL P, MURAHARI V, RAJPUROHIT T, et al. GEO: Generative Engine Optimization[C]//Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. 2024: 5-16. DOI: 10.1145/3637528.3671900. (arXiv:2311.09735)
[2] SAMBASIVAN N, KAPANIA S, HIGHFILL H, et al. “Everyone wants to do the model work, not the data work”: Data Cascades in High-Stakes AI[C]//Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems. 2021: 1-15. DOI: 10.1145/3411764.3445518.
[3] KOHAVI R, LONG BOTHAM R, SOMMERFIELD D, et al. Controlled experiments on the web: survey and practical guide[J]. Data Mining and Knowledge Discovery, 2009, 18(1): 140-181. DOI: 10.1007/s10618-008-0114-1.
[4] LEWIS P, PEREZ E, PIKTUS A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[C]//Advances in Neural Information Processing Systems. 2020, 33: 9459-9474. (arXiv:2005.11401)
[5] LIU N F, LIN K, HEISSER F, et al. Lost in the Middle: How Language Models Use Long Contexts[J]. Transactions of the Association for Computational Linguistics, 2024, 12: 157-173. DOI: 10.1162/tacl_a_00638. (arXiv:2307.03172)