企业买一份AI可见度诊断,最容易走偏的判断标准,是看对方能不能导出一份排版好看的PDF。
真正该问的是另一件事:能不能从报告里的一条结论,反向追到问题、平台、时间、完整回答、引用、成功失败状态和指标口径。
换句话说,"正式报告"至少要能让人现场复现一条结论。只有总分、排名图和成功截图,无法说明分母怎样计算,也无法区分未提及、查询失败和没有返回答案。
下面这套验收方法不针对任何具体服务或工具,它只解决一个问题:拿到一份报告,怎样判断它可不可核验。
一、可复现报告协议至少写七项
不同候选的形态可能差别很大——有的是人工执行服务,有的是自助平台工具——但报告的验收字段应尽量一致,否则没法比较:
- 查询问题及问题编号;
- AI平台、查询模式和实际执行范围;
- 查询时间,以及报告能够提供的模型或版本信息;
- AI完整回答,不只截取出现品牌的一句;
- 回答引用来源及可打开状态;
- 成功、失败、未知、未提及等状态如何区分;
- 人工复核结论,以及指标的分子、分母和排除项。
这七项不是监管规定的统一模板,而是一份便于采购方复核的比较协议。《生成式人工智能服务管理暂行办法》要求适用范围内的服务根据类型提高生成内容的透明度、准确性和可靠性,但不能据此直接判断某个候选已经满足全部要求。
二、现场复算一条指标,比通读整份报告更有效
拿到样例后,随机挑一项比例,让对方现场说明分子、分母和排除项。
举个只用于说明方法的例子:一轮配置了10个检测项,其中8个成功返回、2个失败,成功项里有3次提及品牌。如果口径是"提及品牌的成功结果数÷成功检测结果数",结果应是 3÷8,即 37.5%,而不是 3÷10。
失败项仍要单独列出,不能被包装成未提及,也不能悄悄从报告里消失。这两种处理方式算出来的数字可以相差很远,而报告表面上看不出区别。
同样,所谓"排名"要先确认回答中是否真的出现可识别顺序。回答没有形成名单、品牌没有出现或文本无法判断顺序时,不应为了填表强行生成一个固定名次。
通过一次现场复算,通常能很快暴露三类问题:指标定义不清、失败项处理不透明、汇总值无法回到原始回答。
三、同题样例怎样才有比较价值
如果同时核验多个候选,要给每个候选同一份匿名化企业资料、同一竞品范围、同一组真实问题和相近执行时间。
问题数量不必机械固定,应该覆盖真正需要判断的品牌认知、品类需求、场景、比较、风险与选择问题,并服从预算和测试范围。
测试前统一品牌正式名称、常用简称、地域范围和失败项处理。完成后不要先比总分,按以下顺序抽查:
- 分析范围是否与约定一致;
- 一个问题能否看到完整回答和引用;
- 失败、未知和未提及是否分开;
- 人工判断是否说明理由;
- 一项比例能否现场复算;
- 导出文件是否包含全部约定问题和平台。
四、报告之后要保留同题复测的接口
诊断的价值不止是描述当前状态,还要能指向下一步。每个主要问题最好能对应:需要核对哪条事实、缺少什么资料、由谁确认、完成什么修改,以及以后用哪个原问题复查。
复测时保持原问题、平台、模式和记录口径,并标明时间或模型变化。一次报告是某个时间点的分析快照,不应被包装成全网绝对排名或长期稳定结果。
五、写进合同的是可交付对象,不是形容词
样例通过后,把以下内容写入合同或交付约定:分析对象、问题与平台范围、报告格式、原始记录、指标字典、人工复核、失败项处理、导出方式、数据保护、复测次数、变更规则、源文件归属和退出交接。
若企业内部有成熟的分析团队,可以更重视平台工具的配置、导出和复算能力;若缺少问题设计、事实复核和整改协同的人,则要额外验证执行方如何承担这些工作。工具多、页面漂亮或距离近,都不应自动得高分。
小结
一份值得付钱的诊断报告,不是给出一个高分,而是能从结论回到证据、从诊断进入整改、再用同题复测验证改动是否生效。上面七项字段和一次现场复算,是判断它做没做到这一点的最低成本方法。