Energy Distance:度量两个多元分布差异的统计方法

简介: 当训练集与测试集分布不一致(数据漂移)时,模型性能可能显著下降。Energy Distance 是一种基于欧氏距离的统计量,可量化两个多元分布的整体差异——值为0表示分布相同,越大差异越显著。它能捕捉变量间联合关系变化,优于单变量检验,常配合置换检验进行统计推断。

训练集和测试集如果来自不同的分布,会怎样?

类似的问题不是没遇到过只是语境不同,比如说模型上次构建以来是否发生了数据漂移?销售分析中产品 A 和产品 B 的分布是否存在差异?归结下来问的都是同一件事,如何量化两个分布之间的差异。

单变量分析是最直接的入手点,逐个变量比较训练集与测试集的分布形状。但光看单变量可能不够。变量之间的联合关系如果存在差异呢?

怎么量化这种差异?Energy Distance 可以解决这个问题

Energy Distance 是一种用来度量两个概率分布差异程度的统计指标。两个分布完全相同时取值为零,分布差距越大数值越高。

形式化的定义

给定概率分布 F 和 G,从中分别抽取随机向量 X 和 Y,Energy Distance D(F,G) 的定义如下:

D(F,G) = 2E||X, Y|| — E||X, X'|| — E||Y, Y'||

定义包含两类距离。E||X, Y|| 是跨分布数据点对之间的期望欧几里得距离(一个来自 X,一个来自 Y),称为交叉距离;E||X, X'|| 和 E||Y, Y'|| 则是同一分布内部数据点对之间的期望欧几里得距离,称为组内距离。

Energy Distance 的原理

可以把 Energy Distance 类比为一个带电粒子系统的净相互作用能。设想两团点云,一团带正电,一团带负电。交叉距离对应异号粒子之间的相互作用能,组内距离对应同一团点云内部的自相互作用能。当交叉作用恰好被自作用抵消:即两个分布完全一致——净能量为零;否则为正值。

用一句话概括:

Energy Distance 度量的是两个分布之间的分离程度超出各自内部自然分离程度的幅度。

下面用两个二元分布的可视化来展示这一思路,同样的原理可以推广到更高维。

两个分布完全相同时,Energy Distance 为零。

随着两个分布彼此远离,交叉作用占据主导,Energy Distance 上升。

当每个分布内部的数据点变得更分散时,自作用开始抵消交叉作用,Energy Distance 趋向于零。

Energy Distance 解读

单独看 Energy Distance 的数值意义不大,通常需要配合置换检验来判断观测到的数值:即从原始样本计算得到的 Energy Distance,是否反映了两个分布之间具有统计意义的差异。

置换检验的零假设是 X 和 Y 来自同一分布(F=G)。操作上,将两组样本合并后随机重新分配组标签,保持原始样本量不变,反复计算 Energy Distance,由此构建零假设下的经验分布。p 值等于置换统计量超过观测统计量的比例。

置换检验的结果未检测到训练集与测试集之间存在整体性的分布偏移,无证据表明发生了全局协变量偏移。但这不等于排除了局部外推的可能:特征空间中稀疏及尾部区域仍需额外检查。

总结

Energy Distance 是一种基于度量的统计工具,适用于衡量两个多元分布的差异程度。数据漂移检测、A/B 测试中的样本一致性验证、不同群体间的分布比较——只要涉及"两组多元数据是否来自同一分布"的判断,它都能派上用场。

相比逐变量的单维度检验,Energy Distance 的优势在于能够捕捉变量间联合关系的变化,而不仅仅是边缘分布的偏移。配合置换检验,可以得到具有统计意义的推断结论,而非停留在视觉直觉上。

不过也需要注意它的边界。Energy Distance 检测的是全局性的分布差异,对于局部区域——特别是特征空间中样本稀疏的尾部——敏感度有限。高维场景下,欧几里得距离本身的区分能力会随维度增加而衰减,这一点同样会影响 Energy Distance 的表现。在实际使用中,结合局部密度估计或分区域检验等方法做补充验证是更稳妥的做法。

https://avoid.overfit.cn/post/7e479c1020bb4a25ab533c7cc4761894

by Inno Tanaya

目录
相关文章
|
5月前
|
传感器 数据采集 运维
VAE 原理拆解:从概率编码到潜在空间正则化
本文深入浅出拆解VAE构建全流程,聚焦实现、训练、调试与部署,而非纯数学推导。逐行解读PyTorch最小实现,详解编码器、重参数化、解码器三大组件及损失设计,并系统介绍训练后五大推理模式:异常检测、生成合成数据、条件生成、潜在空间分析与数据填补。
599 7
VAE 原理拆解:从概率编码到潜在空间正则化
|
4月前
|
JSON 搜索推荐 定位技术
无 Embedding、无向量数据库的 RAG 方法:PageIndex 技术解析
PageIndex是无向量、基于推理的RAG框架,通过构建文档层次化目录树,让大模型像人类专家一样逐层推理导航,精准定位答案,支持可追溯、高相关性检索,专长于财报、法律、政策等结构化长文档。
749 0
无 Embedding、无向量数据库的 RAG 方法:PageIndex 技术解析
|
4月前
|
存储 人工智能 JavaScript
Prompt、Context、Harness:AI Agent 工程的三层架构解析
2023年重“Prompt”(如何说),2025年重“Context”(看到什么),2026年跃升至“Harness”(系统级约束与验证)。三者非替代而是分层:Prompt优化表达,Context管理信息环境,Harness构建可信执行系统——模型是马,Harness才是缰绳、马鞍与路。
1232 10
Prompt、Context、Harness:AI Agent 工程的三层架构解析
|
存储 安全 生物认证
基于STM32的指纹识别系统设计与实现
基于STM32的指纹识别系统设计与实现
737 1
|
供应链 监控 安全
企业如何搭建自己的联盟链 | 区块链落地项目运用开发
企业如何搭建自己的联盟链 | 区块链落地项目运用开发
|
存储 Linux Shell
linux基本功之历史记录history命令实战
linux基本功之历史记录history命令实战
1214 0
linux基本功之历史记录history命令实战
|
4月前
|
人工智能 IDE 编译器
Karpathy的LLM Wiki:一种将RAG从解释器模式升级为编译器模式的架构
Andrej Karpathy提出的LLM Wiki,摒弃传统RAG“每次查询重检索”的模式,转而让大模型将原始资料**编译为结构化、可链接、自更新的Markdown Wiki**,实现知识的持久沉淀与复利增长——Obsidian为IDE,LLM为程序员,Wiki即代码库。
3328 7
Karpathy的LLM Wiki:一种将RAG从解释器模式升级为编译器模式的架构
|
4月前
|
监控 网络协议 安全
windows工具箱,内置断网急救、DNS优选、批量重命名等20个功能
windows工具箱,内置断网急救、DNS优选、批量重命名等20个功能
509 10
|
6月前
|
人工智能 监控 物联网
大数据微调GPU选择
本文详解大模型微调的GPU选型逻辑:显存是能否运行的门槛(7B模型需8–16GB,33B需24–48GB),算力影响速度,NVIDIA生态最成熟。按预算分三档推荐显卡与实操方案,并教你看显存利用率、训练速度和成本效益,助新手少走弯路、高效入门。(239字)
|
机器学习/深度学习 数据可视化 机器人
比扩散策略更高效的生成模型:流匹配的理论基础与Pytorch代码实现
扩散模型和流匹配是生成高分辨率数据(如图像和机器人轨迹)的先进技术。扩散模型通过逐步去噪生成数据,其代表应用Stable Diffusion已扩展至机器人学领域形成“扩散策略”。流匹配作为更通用的方法,通过学习时间依赖的速度场将噪声转化为目标分布,适用于图像生成和机器人轨迹生成,且通常以较少资源实现更快生成。 本文深入解析流匹配在图像生成中的应用,核心思想是将图像视为随机变量的实现,并通过速度场将源分布转换为目标分布。文中提供了一维模型训练实例,展示了如何用神经网络学习速度场,以及使用最大均值差异(MMD)改进训练效果。与扩散模型相比,流匹配结构简单,资源需求低,适合多模态分布生成。
1521 17
比扩散策略更高效的生成模型:流匹配的理论基础与Pytorch代码实现