【数据分析】数据的离中趋势之二 - 方差和标准差、离散系数

2024-08-20 18:28

本文主要是介绍【数据分析】数据的离中趋势之二 - 方差和标准差、离散系数,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

四、方差和标准差

  • 方差是数据组中各数据值与其算术平均数离差平方的算术平均数。
  • 方差的平方根就是标准差
  • 标准差的本质与平均差基本相同,平均差取绝对值的方法消除离差正负号后用算数平均的方法求平均离差。标准差用平方的方法消除离差的正负号后用离差平方求平均数再开根号。
  • 标准差的性质:
    • 标准差度量了偏离平均数的大小
    • 标准差是一类平均偏差
    • 数列大多数项距离平均数少于1个标准差范围内,极少数项距离平均数 2个 或者 3个标准差以上。

两组工人日产量标准差计算如下:

甲   组乙   组
日产量离差离差平方日产量离差离差平方
xx - 平均数(x - 平均数) 的平方xx - 平均数(x - 平均数) 的平方
4-121447-981
7-98112-416
11-52514-24
14-2414-24
14-2415-11
16001711
17111711
248641939
2598120416
281214425981
合计---548合计---214
  • 甲组方差 = 甲组离差平方的平均值 = 548 / 10 = 54.8
  • 甲组标准差 = 7.40 (件)
  • 乙组方差 = 乙组离差平方的平均值 = 214 / 10 = 21.4
  • 乙组标准差 = 4.63(件)
  • 在甲乙两组工人平均日产量相等(都是16件)的情况下,甲组的标准差(7.40 件)大于乙组的标准差(4.63 件),因而其平均数的代表性比乙组小。

五、离散系数

  • 极差、平均差、标准差都是对数据的离中趋势进行绝对或平均差异的测定。
  • 在通常情况下,它们都带有计量单位,而月其离中趋势大小与变量平均水平的高低有关。
  • 因此,要比较数据平均水平不同的两组数据的离中程度的大小,就有必要计算它们的相对离中程度指标,即离散系数。
  • 常用的离散系数指标是标准差系数。

标准差系数是将一组数据的标准差与其算数平均数对比的结果,以测定其相对离中程度。

例:甲乙两班中,哪个班的平均成绩更具有代表性?

甲班的平均成绩为 70 分,标准差为 9.0 分,乙班的成绩分组如下:

成绩分组学生人数
60以下2
60 - 706
70 - 8025
80 - 9012
90 - 1005

以下分析乙班成绩:

按成绩分组

组中值(x)学生人数(f)xfx - 平均数(x - 平均数)的平方(x - 平均数)的平方 * 人数
60以下552110-22.4501.761003.52
60 - 70656390-12.4153.76922.56
70 - 8075251875-2.45.76144
80 - 90851210207.657.76693.12
90 - 10095547517.6309.761548.8
合计---503870------4312
  • 甲班的平均成绩为 70分,标准差为9.0分,标准差系数为 9.0 / 70 = 0.1286
  • 乙班的平均成绩为 3870 / 50 = 77.4 分
  • 乙班的标准差为 4312 / 50 的开根号 = 9.29 分

由于甲、乙两班成绩的平均值和标准差都不一样,无法使用标准差来比较哪个班的成绩波动大,因此必须使用离散系数来判断。从计算中可以看出:V乙<V甲,所以乙班的成绩波动小一些,则其班级的平均成绩更有代表性。

六、Python 计算 方差、标准差、离散系数

import dash
from dash import dcc, html
from dash.dependencies import Input, Output
import numpy as np# 创建 Dash 应用
app = dash.Dash(__name__)# 应用布局
app.layout = html.Div([html.H1('请输入数据'),dcc.Input(id='input-data', type='text', placeholder='输入数据,用逗号分隔'),html.Button('计算', id='compute-button', n_clicks=0),html.Div(id='output-container')
])# 回调函数,用于处理按钮点击事件
@app.callback(Output('output-container', 'children'),[Input('compute-button', 'n_clicks')],[dash.dependencies.State('input-data', 'value')]
)
def compute_var_std_mean(n_clicks, input_value):if n_clicks > 0:try:# 将输入字符串转换成数字列表data = list(map(float, input_value.split(',')))# 方差variance = np.var(data)# 标准差std_dev = np.std(data)# 均值mean = np.mean(data)# 离散系数coefficient_of_variation = std_dev / mean if mean != 0 else float('inf')# 显示结果output = [f'方差:{variance:.2f}'f'标准差:{std_dev:.2f}',f'离散系数:{coefficient_of_variation:.2f}']return '<br>'.join(output)except Exception as e:return str(e)if __name__ == '__main__':app.run_server(debug=True)

这篇关于【数据分析】数据的离中趋势之二 - 方差和标准差、离散系数的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1090841

相关文章

Java利用JSONPath操作JSON数据的技术指南

《Java利用JSONPath操作JSON数据的技术指南》JSONPath是一种强大的工具,用于查询和操作JSON数据,类似于SQL的语法,它为处理复杂的JSON数据结构提供了简单且高效... 目录1、简述2、什么是 jsONPath?3、Java 示例3.1 基本查询3.2 过滤查询3.3 递归搜索3.4

MySQL大表数据的分区与分库分表的实现

《MySQL大表数据的分区与分库分表的实现》数据库的分区和分库分表是两种常用的技术方案,本文主要介绍了MySQL大表数据的分区与分库分表的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有... 目录1. mysql大表数据的分区1.1 什么是分区?1.2 分区的类型1.3 分区的优点1.4 分

Mysql删除几亿条数据表中的部分数据的方法实现

《Mysql删除几亿条数据表中的部分数据的方法实现》在MySQL中删除一个大表中的数据时,需要特别注意操作的性能和对系统的影响,本文主要介绍了Mysql删除几亿条数据表中的部分数据的方法实现,具有一定... 目录1、需求2、方案1. 使用 DELETE 语句分批删除2. 使用 INPLACE ALTER T

Python Dash框架在数据可视化仪表板中的应用与实践记录

《PythonDash框架在数据可视化仪表板中的应用与实践记录》Python的PlotlyDash库提供了一种简便且强大的方式来构建和展示互动式数据仪表板,本篇文章将深入探讨如何使用Dash设计一... 目录python Dash框架在数据可视化仪表板中的应用与实践1. 什么是Plotly Dash?1.1

Redis 中的热点键和数据倾斜示例详解

《Redis中的热点键和数据倾斜示例详解》热点键是指在Redis中被频繁访问的特定键,这些键由于其高访问频率,可能导致Redis服务器的性能问题,尤其是在高并发场景下,本文给大家介绍Redis中的热... 目录Redis 中的热点键和数据倾斜热点键(Hot Key)定义特点应对策略示例数据倾斜(Data S

Python实现将MySQL中所有表的数据都导出为CSV文件并压缩

《Python实现将MySQL中所有表的数据都导出为CSV文件并压缩》这篇文章主要为大家详细介绍了如何使用Python将MySQL数据库中所有表的数据都导出为CSV文件到一个目录,并压缩为zip文件到... python将mysql数据库中所有表的数据都导出为CSV文件到一个目录,并压缩为zip文件到另一个

SpringBoot整合jasypt实现重要数据加密

《SpringBoot整合jasypt实现重要数据加密》Jasypt是一个专注于简化Java加密操作的开源工具,:本文主要介绍详细介绍了如何使用jasypt实现重要数据加密,感兴趣的小伙伴可... 目录jasypt简介 jasypt的优点SpringBoot使用jasypt创建mapper接口配置文件加密

使用Python高效获取网络数据的操作指南

《使用Python高效获取网络数据的操作指南》网络爬虫是一种自动化程序,用于访问和提取网站上的数据,Python是进行网络爬虫开发的理想语言,拥有丰富的库和工具,使得编写和维护爬虫变得简单高效,本文将... 目录网络爬虫的基本概念常用库介绍安装库Requests和BeautifulSoup爬虫开发发送请求解

Oracle存储过程里操作BLOB的字节数据的办法

《Oracle存储过程里操作BLOB的字节数据的办法》该篇文章介绍了如何在Oracle存储过程中操作BLOB的字节数据,作者研究了如何获取BLOB的字节长度、如何使用DBMS_LOB包进行BLOB操作... 目录一、缘由二、办法2.1 基本操作2.2 DBMS_LOB包2.3 字节级操作与RAW数据类型2.

MySQL使用binlog2sql工具实现在线恢复数据功能

《MySQL使用binlog2sql工具实现在线恢复数据功能》binlog2sql是大众点评开源的一款用于解析MySQLbinlog的工具,根据不同选项,可以得到原始SQL、回滚SQL等,下面我们就来... 目录背景目标步骤准备工作恢复数据结果验证结论背景生产数据库执行 SQL 脚本,一般会经过正规的审批