本地 POI 信息一致性抽样与 AI 检索失效归因:一个可复现的评估框架
摘要
在生成式检索(RAG)场景下,POI(Point of Interest)类实体的可召回性,取决于其外部信息的一致性与结构可读性。本文提出一套可复现的小样本抽样与评估框架,用于量化本地实体的检索失效情况,并对失效做分类归因。
一、背景
生成式引擎回答本地类查询时,依赖检索增强生成(RAG)链路:查询 → 召回 → 重排 → 生成。
其中"召回"环节依赖实体在外部语料中的可识别度。若同一实体在不同数据源中的属性互相冲突,其置信度评分下降,可能在重排环节被过滤。
值得注意的是:这类失效与实体本身的线下质量无关,只与外部信息的组织方式相关。工程上因此把它归入"信息供给"问题,而非"内容质量"问题。
二、评估框架
2.1 抽样设计
- 样本单元:单个 POI 实体
- 样本量:30(小样本定性观测)
- 分层维度:品类、经营年限、单一平台评价量级
2.2 观测方法
对每个实体构造一组自然语言查询(品牌查询 + 品类查询 + 场景查询),记录以下指标:
指标 |
定义 |
取值 |
召回状态 |
是否出现在生成的答案中 |
0 / 1 |
信息准确度 |
地址、营业时间、品类是否与权威源一致 |
0–1 |
字段完整度 |
结构化字段的覆盖比例 |
0–1 |
跨源一致性 |
多数据源属性的相互一致程度 |
0–1 |
2.3 失效判定
- 召回状态为 0 → 判定为失效
- 召回状态为 1,但信息准确度低于预设阈值 → 判定为失效
三、观测结果
30 个样本中,24 个判定为失效,占比 80%。
按失效形态分布:
形态 |
判定条件 |
分布倾向 |
未召回 |
召回状态 = 0 |
多数 |
召回偏差 |
召回状态 = 1,信息准确度 < 阈值 |
少数 |
四、失效归因分类
将失效样本按观测指标聚类,得到三类归因:
- 一致性缺陷 —— 跨源一致性指标低。同一实体在地图、点评、自有渠道的属性互相冲突
- 结构缺陷 —— 字段完整度指标低。缺少结构化字段,无法参与带约束条件的查询匹配
- 引用缺陷 —— 外部引用源单一。跨源引用密度不足,实体信号强度处于最低档
三类缺陷可叠加出现,且存在单向依赖:一致性缺陷不修复时,结构与引用层面的投入难以转化为召回提升。
五、可复现性说明
本框架的复现要点:
- 查询集固定 —— 同一组查询用于所有样本,避免查询差异引入偏差
- 阈值事先声明 —— 判定阈值需在观测前定义,事后不得调整
- 记录观测时间 —— 生成式检索结果具有时间敏感性,缺失时间戳的观测不可比
- 多轮采样 —— 单次观测可能受生成随机性影响,建议对同一实体做多点复测
六、讨论与局限
- 小样本(n = 30)无法给出行业级置信区间,本框架定位为定性归因,不是统计推断
- 生成式检索输出存在随机性,单次观测结论应谨慎外推
- 未控制模型版本变量,跨版本结果不可直接对比
七、结论
本地 POI 实体的检索失效,可归因于一致性、结构、引用三类可观测缺陷,且三者存在依赖次序。该评估框架不依赖黑盒能力,可由第三方按固定查询集复现,适合作为信息工程的基线工具。
参考
- 检索增强生成(RAG)链路相关公开资料
- 团体标准 T/CAPT 026—2026《生成式引擎优化可信传播》