条件熵,信息增益(互信息)与特征选择

2024-05-25 03:08

本文主要是介绍条件熵,信息增益(互信息)与特征选择,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一定要先搞清楚什么是信息量,什么是信息熵。参考博文:https://blog.csdn.net/u010916338/article/details/91127242

一,什么是信息量?

简言之,就是把信源看做是一个随机变量。消息(信号)就是随机变量的取值,比如a1,a2···an。信息就是这些随机变量的不确程度(发生概率越低,不确定性越大),公式如下。为什么写成这样呢?原因有二。第一:概率和信息量(不确定性)是反比例关系;第二,当事件发生概率为1的时候,信息量为0。

注:信息量描绘的是一个随机变量的取值,a1有a1的信息量,a2有a2的信息量。

即信息量是对某一事件的不确定性的度量。

二,什么是信息熵 ?

接着上面,如何描绘随机变量的所有取值的信息量呢?就是求随机变量的期望。即求信息量的均值。

注:信息熵是对整个随机变量的不确定性的度量。

三,什么是信息增益(互信息)?

3.1  条件熵

先得搞清楚什么是条件熵,公式如下:

H(Y|X)=\sum_{x\in X}p(x)H(Y|X=x) 

直接看公式,摸不到头脑,我们直接引入一个案例,结合案例很容易就理解了。

3.2  案例:哪个特征对QQ用户是否流失影响较大?

数据如下表所示,代表QQ用户是否流失。uin表示用户id;gender表示用户性别;act_info表示用户活跃度;is_lost表示用户是否流失,是标签值。

 

需求:性别和活跃度两个特征,哪个对用户流失影响更大?

数据归纳之后如下表所示,其中positive为正样本(已流失),negative为负样本(未流失)。

 

3.3  计算整体熵:

 整体熵: 

H(Y)=-\frac{5}{15}\log_2( \frac{5}{15})-\frac{10}{15}\log_2( \frac{10}{15})=0.9182

3.4  计算性别特征的条件熵,以及性别特征的信息增益

任意过来一个用户,猜测是已流失还是未流失,设为随机变量Y。

任意过来一个用户是男性或者是女性,设为随机变量X。

任意过来一个用户是男性,设为事件x1;

任意过来一个用户是女性,设为事件x2;

随机变量X的概率空间为: 

\begin{bmatrix} X\\ p(x) \end{bmatrix}=\begin{bmatrix} x_1&x_2\\ \frac{8}{15}&\frac{7}{15} \end{bmatrix}

p(x_1)=\frac{8}{15}\qquad p(x_2)=\frac{7}{15}

(1)男性条件熵:

H(Y|X=x_1)=-\frac{3}{8}\log_2( \frac{3}{8})-\frac{5}{8}\log_2( \frac{5}{8})=0.9543

(2)女性条件熵:

H(Y|X=x_2)=-\frac{2}{7}\log_2( \frac{2}{7})-\frac{5}{7}\log_2( \frac{5}{7})=0.8631

(3)性别条件熵:

H(Y|X)=\sum_{x\in X}p(x)H(Y|X=x)

                =p(x_1)H(Y|X=x_1)+p(x_2)H(Y|X=x_2)

                =\frac{8}{15}\times 0.9543+\frac{7}{15}\times0.8631=0.9118

(4)性别信息增益:

 g(Y,X)=H(Y)-H(Y|X)=0.0064

 3.5  计算活跃度特征的条件熵,以及活跃度特征的信息增益

任意过来一个用户,猜测是已流失还是未流失,设为随机变量Y。

任意过来一个用户活跃度是高,中或者低,设为随机变量X。

任意过来一个用户活跃度高,设为事件x1;

任意过来一个用户活跃度中,设为事件x2;

任意过来一个用户活跃度低,设为事件x3;

随机变量X的概率空间为: 

\bg_white \begin{bmatrix} X\\ p(x) \end{bmatrix}=\begin{bmatrix} x_1&x_2&x_3\\ \frac{6}{15}&\frac{5}{15} &\frac{4}{15}\end{bmatrix}

p(x_1)=\frac{6}{15}\qquad p(x_2)=\frac{5}{15}\qquad p(x_3)=\frac{4}{15}

(1)活跃度高条件熵:

H(Y|X=x_1)=-\frac{0}{6}\log_2( \frac{0}{6})-\frac{6}{6}\log_2( \frac{6}{6})=0

(2)活跃度中条件熵:

H(Y|X=x_2)=-\frac{1}{5}\log_2( \frac{1}{5})-\frac{4}{5}\log_2( \frac{4}{5})=0.7219

(3)活跃度低条件熵:

H(Y|X=x_3)=-\frac{4}{4}\log_2( \frac{4}{4})-\frac{0}{4}\log_2( \frac{0}{4})=0

(4)活跃度条件熵:

H(Y|X)=\sum_{x\in X}p(x)H(Y|X=x)

                =p(x_1)H(Y|X=x_1)+p(x_2)H(Y|X=x_2)+p(x_3)H(Y|X=x_3)

                =\frac{6}{15}\times 0+\frac{6}{15}\times0.7219+\frac{4}{15}\times0=0.2406

(5)活跃度信息增益:

 g(Y,X)=H(Y)-H(Y|X)=0.6776

四,综述 

活跃度的信息增益比性别的信息增益大,也就是说,活跃度对用户流失的影响比性别大。

做特征选择或者数据分析的时候,我们应该重点考察活跃度这个指标。

什么意思?

假如原来没有性别和活跃度这两个维度,后来活跃度这个维度的加入会比性别维度的加入导致整体信息熵提升的更多

参考博文:https://blog.csdn.net/it_beecoder/article/details/79554388

这篇关于条件熵,信息增益(互信息)与特征选择的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1000312

相关文章

业务中14个需要进行A/B测试的时刻[信息图]

在本指南中,我们将全面了解有关 A/B测试 的所有内容。 我们将介绍不同类型的A/B测试,如何有效地规划和启动测试,如何评估测试是否成功,您应该关注哪些指标,多年来我们发现的常见错误等等。 什么是A/B测试? A/B测试(有时称为“分割测试”)是一种实验类型,其中您创建两种或多种内容变体——如登录页面、电子邮件或广告——并将它们显示给不同的受众群体,以查看哪一种效果最好。 本质上,A/B测

【北交大信息所AI-Max2】使用方法

BJTU信息所集群AI_MAX2使用方法 使用的前提是预约到相应的算力卡,拥有登录权限的账号密码,一般为导师组共用一个。 有浏览器、ssh工具就可以。 1.新建集群Terminal 浏览器登陆10.126.62.75 (如果是1集群把75改成66) 交互式开发 执行器选Terminal 密码随便设一个(需记住) 工作空间:私有数据、全部文件 加速器选GeForce_RTX_2080_Ti

封装MySQL操作时Where条件语句的组织

在对数据库进行封装的过程中,条件语句应该是相对难以处理的,毕竟条件语句太过于多样性。 条件语句大致分为以下几种: 1、单一条件,比如:where id = 1; 2、多个条件,相互间关系统一。比如:where id > 10 and age > 20 and score < 60; 3、多个条件,相互间关系不统一。比如:where (id > 10 OR age > 20) AND sco

Linux命令(11):系统信息查看命令

系统 # uname -a # 查看内核/操作系统/CPU信息# head -n 1 /etc/issue # 查看操作系统版本# cat /proc/cpuinfo # 查看CPU信息# hostname # 查看计算机名# lspci -tv # 列出所有PCI设备# lsusb -tv

【小迪安全笔记 V2022 】信息打点9~11

第9天 信息打点-CDN绕过篇&漏洞回链8接口探针&全网扫指&反向件 知识点: 0、CDN知识-工作原理及阻碍 1、CDN配置-域名&区域&类型 2、CDN绕过-靠谱十余种技战法 3、CDN绑定-HOSTS绑定指向访问 CDN 是构建在数据网络上的一种分布式的内容分发网。 CDN的作用是采用流媒体服务器集群技术,克服单机系统输出带宽及并发能力不足的缺点,可极大提升系统支持的并发流数目,减少或避

Weex入门教程之4,获取当前全局环境变量和配置信息(屏幕高度、宽度等)

$getConfig() 获取当前全局环境变量和配置信息。 Returns: config (object): 配置对象;bundleUrl (string): bundle 的 url;debug (boolean): 是否是调试模式;env (object): 环境对象; weexVersion (string): Weex sdk 版本;appName (string): 应用名字;

Python批量读取身份证信息录入系统和重命名

前言 大家好, 如果你对自动化处理身份证图片感兴趣,可以尝试以下操作:从身份证图片中快速提取信息,填入表格并提交到网页系统。如果你无法完成这个任务,我们将在“Python自动化办公2.0”课程中详细讲解实现整个过程。 实现过程概述: 模块与功能: re 模块:用于从 OCR 识别出的文本中提取所需的信息。 日期模块:计算年龄。 pandas:处理和操作表格数据。 PaddleOCR:百度的

使用条件变量实现线程同步:C++实战指南

使用条件变量实现线程同步:C++实战指南 在多线程编程中,线程同步是确保程序正确性和稳定性的关键。条件变量(condition variable)是一种强大的同步原语,用于在线程之间进行协调,避免数据竞争和死锁。本文将详细介绍如何在C++中使用条件变量实现线程同步,并提供完整的代码示例和详细的解释。 什么是条件变量? 条件变量是一种同步机制,允许线程在某个条件满足之前进入等待状态,并在条件满

一些数学经验总结——关于将原一元二次函数增加一些限制条件后最优结果的对比(主要针对公平关切相关的建模)

1.没有分段的情况 原函数为一元二次凹函数(开口向下),如下: 因为要使得其存在正解,必须满足,那么。 上述函数的最优结果为:,。 对应的mathematica代码如下: Clear["Global`*"]f0[x_, a_, b_, c_, d_] := (a*x - b)*(d - c*x);(*(b c+a d)/(2 a c)*)Maximize[{f0[x, a, b,

linux上查看java最耗时的线程信息

找到JAVA进程pid ps -ef|grep java或则jps -mlv 找进行下耗时的线程TID 使用top -Hp pid可以查看某个进程的线程信息 -H 显示线程信息,-p指定pid top -Hp 10906 查看最耗时的 TID即线程id printf "%x\n" [tid] 转成16进制 java中的线程类相关信息 jstack 线程ID 可以查看某个线程的堆栈情况,特别对于h