不用再往下划,信息熵(Entropy)概念及应用(附视频)都在这里啦!

简介: 不用再往下划,信息熵(Entropy)概念及应用(附视频)都在这里啦!

在学习浙财石向荣老师的“数据分析在审计中的应用”课程时,内容中涉及“信息熵”相关概念及应用,听完课程后仍旧困惑、一知半解,遂整理此文想法产生。因受限于数学功底,如有谬误还请多指教。您的支持,将是我前行的动力。


1 什么是信息熵


1.1 由来

1948年,香农提出了“信息熵”的概念,才解决了对信息的量化度量问题。信息熵这个词是C.E.Shannon(香农)从热力学中借用过来的。热力学中的热熵是表示分子状态混乱程度的物理量。香农用信息熵的概念来描述信源的不确定度。


一条信息的信息量与其不确定性有着直接的关系。比如说我们要搞清一件非常不确定的事,就需要了解大量的信息;反之,如果已对某件事了解较多,则不需要太多的信息就能把它搞清楚。所以,从这个角度,可以认为,信息量就等于不确定性的多少。而通过信息熵这个指标可以将其量化。


1.2 公式定义

image.png

1.3 性质

信息论之父克劳德·香农给出的信息熵的三个性质:

  1. 单调性,发生概率越高的事件,其携带的信息量越低;
  2. 非负性,信息熵可以看作为一种广度量,非负性是一种合理的必然;
  3. 累加性,即多随机事件同时发生存在的总不确定性的量度是可以表示为各事件不确定性的量度的和,这也是广度量的一种体现。


1.4 视频

这里推荐一个我喜欢的up主的良心视频,十分推荐。也许看完之后你将不再困惑!

【学习观10】老师,我没有传纸条作弊,我在学习信息论

【学习观11】为什么信息还有单位?如何计算信息量?


2 如何量化


2.1 《数学之美》足球赛例子

image.png


2.2 为什么用对数?

下图原文链接:https://zhuanlan.zhihu.com/p/52739409

9495b9832e1c4782ab26de7543d56f68.png

截自知乎作者忆臻的回答: https://www.zhihu.com/question/30828247/answer/160647576

74b2fc419f5d48f4ade2a3eec52a8fed.png


3 应用


信息熵(Information Entropy)是度量信息混乱程度的指标,越混乱值越大,越纯粹越接近于0。决策树的生成过程中,也使用了熵来作为样本最优属性划分的判据。


3.1 审计“参保人员购药骗保”

不法分子倾向于在医保最高限额下,从多家不同的药店和医院购买不同的药物用于贩卖。因此,其购药行为特点是所关联的药店和医院数量多,且金额倾向于平均。


可见,若要有效锁定不法分子,不能仅仅看消费总额,还要看消费方式。信息熵提供了这样一种度量方式,购药金额信息熵高的人存在较高嫌疑。

image.png


上图可以看出,4次购买记录,总金额相同情况下,不同的金额配比造成信息熵差异大,令我们从中挑出可能存在异常的数据提供了可能。


3.2 决策树

在决策树算法的学习过程中,信息增益是特征选择的一个重要指标,它定义为一个特征能够为分类系统带来多少信息,带来的信息越多,说明该特征越重要,相应的信息增益也就越大。


P.s


随着内容进一步深入,才觉知自己所识之匮乏。愿不负时光,加油!


相关阅读:

1 信息熵是什么? - 知乎 (zhihu.com)

2 信息熵及其相关概念 | M’ Blog (anmou.me)

3 为什么香农要将信息熵公式要定义成 -Σp·log₂§ 或 -∫p·log₂§dp? - 知乎 (zhihu.com)

4 信息熵的公式为什么这么定义? - 知乎 (zhihu.com)

5 [书籍]《数学之美》第6章 信息的度量和作用

6 [视频]老师,我没有传纸条作弊,我在学习信息论

7 [视频]为什么信息还有单位?如何计算信息量?

8 通俗理解决策树算法中的信息增益 - 知乎 (zhihu.com)

目录
相关文章
|
机器学习/深度学习 数据可视化 算法
机器学习-可解释性机器学习:随机森林与fastshap的可视化模型解析
机器学习-可解释性机器学习:随机森林与fastshap的可视化模型解析
2097 1
|
机器学习/深度学习 存储 数据可视化
【PyTorch基础教程23】可视化网络和训练过程
为了更好确定复杂网络模型中,每一层的输入结构,输出结构以及参数等信息,在Keras中可以调用一个叫做model.summary()的API能够显示我们的模型参数,输入大小,输出大小,模型的整体参数等。
2130 0
【PyTorch基础教程23】可视化网络和训练过程
|
机器学习/深度学习 算法 数据可视化
2024美赛C题保姆级分析完整思路代码数据教学
2024美赛C题保姆级分析完整思路代码数据教学
946 0
|
存储 缓存 算法
Google Guava之RateLimiter
在日常开发中,限流是高并发系统的三把守护利器之一,它的另外两个好兄弟缓存、降级下次再说。而限流在绝大多数场景中用来限制并发和请求量,像秒杀之类的高流量业务的场景,都能见到它的身影,所以它就是保护系统和下游的业务系统不被流量冲垮的利器。
683 6
Google Guava之RateLimiter
|
7月前
|
监控 关系型数据库 MySQL
MySQL 联合索引
联合索引是MySQL中提升多列查询性能的关键技术,由多个列组成,遵循最左前缀原则。合理设计索引顺序可显著加速查询,避免全表扫描。需结合实际查询需求创建,避免冗余,配合EXPLAIN分析执行计划,优化数据库性能。(238字)
|
JSON API 数据格式
淘宝商品列表API接口攻略(附代码示例)
淘宝商品列表API接口用于获取淘宝商品信息,支持按关键词、类目、价格区间等条件查询,返回商品标题、价格、销量等数据。通过构造HTTP请求并解析JSON响应,可提取所需信息。示例代码展示了使用Python调用该API的流程,包括生成签名和请求参数配置,方便开发者快速上手。
652 12
|
算法 调度 UED
操作系统(7)----调度相关知识点(万字总结~)(1)
操作系统(7)----调度相关知识点(万字总结~)
944 0
抖音快手小红书养号脚本,全自动刷视频养号插件,自动看视频看广告软件
这是一款用于抖音账号自动养号的脚本源码,可实现自动化操作,如搜索、关注和随机观看视频等功能。通过界面设置延迟时间和操作次数
|
人工智能 JSON Serverless
【AI 冰封挑战】搭档函数计算,“冰”封你的夏日记忆
夏日炎炎,别让高温打败你的创意,立即体验 ComfyUI 自制冰冻滤镜!无需繁琐的后期技巧,三步开启一段清凉无比的视觉探险。参与实验并上传作品即可获得运动无线蓝牙耳机,限量 800 个,先到先得!
8970 11
|
存储 C++
【PTA】L1-043 阅览室(C++)
【PTA】L1-043 阅览室(C++)
346 1