学习笔记|正态分布|图形法|偏度和峰度|非参数检验法|《小白爱上SPSS》课程:SPSS第三讲 | 正态分布怎么检验?看这篇文章就够了

本文主要是介绍学习笔记|正态分布|图形法|偏度和峰度|非参数检验法|《小白爱上SPSS》课程:SPSS第三讲 | 正态分布怎么检验?看这篇文章就够了,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目录

  • 学习目的
  • 软件版本
  • 原始文档
  • 为什么要假设它服从正态分布呢?
  • t检验
  • 一、图形法
  • 1、频数分布直方图
    • 解读
  • 2、正态Q-Q图
    • 操作
    • 解读
  • 3、正态P-P图
    • SPSS实战操作
    • 解读
  • 二、偏度和峰度
    • 解读:
  • 三、非参数检验法
    • 注意事项
  • 四、规范表达
  • 五、小结
  • 划重点

学习目的

SPSS第三讲 | 正态分布怎么检验?看这篇文章就够了

软件版本

IBM SPSS Statistics 26。

原始文档

《小白爱上SPSS》课程
#统计原理

为什么要假设它服从正态分布呢?

一方面,是由于正态分布非常普通平凡,所以假设一个随机事件服从正态分布,比假设其他分布的成功率更高。
另一方面,是因为正态分布能够指明探索的方向。比如,如果我们验证后发现,这个随机事件不服从正态分布,那它就一定不满足正态分布背后的中心极限定理。而不满足中心极限定理,我们就能知道——要么是它的影响因素不够多,要么是各种影响因素不相互独立,要么是某种影响因素的影响力太大等等…这时候,接下来的研究也就有了明确的方向。

t检验

正态分布是很多连续型数据比较分析的大前提,比如t检验、方差分析、相关分析以及线性回归等,均要求数据服从正态分布或近似正态分布。
但大多数人进行统计时容易忽略这一重要前提,导致统计效能下降和假阴性风险增加。
为此,在系统讲解推断性统计方法之前,本课程将呈现三种正态分布的检验方法,让我们一次性掌握正态分布的检验方法。

一、图形法

一提到正态分布,我们自然会想到一个钟型形状。如下图。特点是“中间多,两端少”。
在这里插入图片描述
那么,怎么检验一组数据是否服从正态分布呢?先呈现个案例。
案例:25名青少年数据如下表,请判断该组数据的身高是否服从正态?
导入数据,命令行:

GET FILE='E:\E盘备份\recent\小白爱上SPSS\小白数据\第三讲 正态分布.sav'. 

在这里插入图片描述
案例分析:身高数据明显属于连续型变量,可进行正态检验。

1、频数分布直方图

SPSS实战操作
第一步:【图形】→【旧对话框】→【直方图】
第二步:弹出直方图,将待分析变量移入【变量】框内,勾选显示正态曲线,本次我们考察“身高”数据,其他参数不用设置,直接【确定】命令执行。确定后,呈现如下直方图。
在这里插入图片描述
命令行:

GRAPH 			/*绘图*//HISTOGRAM(NORMAL)=身高.	/*直方图(正态)*/

解读

观察直方图的分布形状是否为一个倒扣“钟”型的对称形状,如果接近或相似,则可认为数据服从正态分布。
本例中,“身高”数据频数分布直方图的形状比较接近于倒扣的“钟形”,左右两边具有对称性,可认为该数据为正态分布数据。
执行:GRAPH /HISTOGRAM(NORMAL)=年龄. 显示“年龄”变量的直方图:
在这里插入图片描述
明显与正态曲线不重合。

2、正态Q-Q图

简介:Q-Q图反映了变量的实际分布与理论分布的符合程度,可以用来考察数据是否服从某种分布类型。若数据服从正态分布,则数据点应与理论直线基本重合。

操作

第一步:【分析】→【描述统计】→【QQ图】
第二步:将待分析的连续数据变量,如:身高,移入【变量】框内,软件默认是检验【正态分布】,其他参数不用设置,直接【确定】命令执行。
在这里插入图片描述
确定后,呈现如下Q-Q图。
在这里插入图片描述
命令行:
···
PPLOT
/VARIABLES=身高 /核心变量,其他行为可选参数,有默认或初始值/
/NOLOG
/NOSTANDARDIZE
/TYPE=Q-Q
/FRACTION=BLOM
/TIES=MEAN
/DIST=NORMAL.
···

解读

观察Q-Q图上的点能否分布在一条直线上,分布在一条直线上则说明近似或服从正态分布。
本例中,身高绝大多数的点能分布在一条直线上,直线趋势明显,可认为该连续数据服从正态分布。

3、正态P-P图

简介:P-P图反映了变量的实际累积概率与理论累积概率的符合程度,可以用来考察数据是否服从某种分布类型。若数据服从正态分布,则数据点应与理论直线基本重合。与Q-Q图意义相似。

SPSS实战操作

第一步:【分析】→【描述统计】→【P-P图】
第二步:将待分析的连续数据变量移入【变量】框内,本例检测“身高”数据的正态分布,软件默认是检验【正态分布】,其他参数不用设置,直接【确定】命令执行。
命令行:
···
PPLOT
/VARIABLES=身高 /核心变量,其他行为可选参数,有默认或初始值/
/TYPE=P-P
/DIST=NORMAL.
···
在这里插入图片描述

解读

观察P-P图上的点能否分布在理论分布的直线上,若基本分布在直线上则说明近似或服从正态分布。
本例中,“身高”的绝大多数的点能分布在一条直线上,直线趋势明显,可认为该连续数据服从正态分布。

二、偏度和峰度

简介:
[偏度]主要用于判定数据的对称性,整体数据偏左还是偏右,见下图。
在这里插入图片描述
当偏度S≈0时,可认为分布是对称的,服从正态分布;
当偏度S>0时,分布为右偏,即拖尾在右边,峰尖在左边,也称为正偏态;
当偏度S<0时,分布为左偏,即拖尾在左边,峰尖在右边,也称为负偏态;
注意:数据分布的左偏或右偏,指的是数值拖尾的方向,而不是峰的位置。
[峰度]是用于判定数据分布的陡缓程度,见下图。
在这里插入图片描述
当峰度K≈0时,可认为分布的峰态合适,服从正态分布(不胖不瘦);
当峰度K>0时,分布的峰态陡峭(高尖);
当峰度K<0时,分布的峰态平缓(矮胖);
了解偏度和峰度这两个统计量的含义很重要,是检验数据正态分布的重要指标。
实际上,我们收集到很难能满足S≈0,K≈0, 因此,可采用K与S系数来检验,检验公式如下。
在这里插入图片描述
其中,SS和SK均为S系数和K系数的标准误。在α=0.05的情况下,Z值的绝对值大于1.96时,可认为K系数或S系数显著不等于0,即样本数据非正态。
SPSS实战操作
第一步:【分析】→【描述统计】→【描述】
第二步:将“身高”选入【变量】框中,点击【选项】,勾选“平均值”、“标准差”、“峰度”和“偏度”。
在这里插入图片描述
第三步:点击“继续”、“确定”,得到计算结果。
命令行:
···
DESCRIPTIVES VARIABLES=身高
/STATISTICS=MEAN STDDEV KURTOSIS SKEWNESS. /统计指标=平均值 标准差 峰度 偏度/
···
在这里插入图片描述

解读:

①计算偏度系数:
手算:
在这里插入图片描述
②计算峰度系数:
手算:
在这里插入图片描述
由以上结果可知,偏度系数和峰度系数的绝对值均小于1.96,可以认为该组样本数据符合正态分布。
需注意:当样本量过大(超过100)时,采用峰度和偏度系数会对正态性的情况有所偏误,此时,可以直接尝试采用图示法(直方图、P-P、Q-Q)的方法进行检验会更直观。

三、非参数检验法

简介:正态性检验属于非参数检验,原假设为“样本来自的总体与正态分布无显著性差异”,只有P>0.05才能接受原假设,即数据符合正态分布。
常见的正态性检验有Kolmogorov-Smirnov检验(即柯尔莫戈洛夫-斯米诺夫检验,简称K-S检验)和Shapiro-Wilk检验(即夏皮-威尔克检验,简称S-W检验),K-S检验适用于大样本数据,S-W检验适用于小样本数据,当检验结果的p值小于0.05,则认为数据不满足正态性。
SPSS实战操作
第一步:【分析】-【描述统计】-【探索】 打开探索对话框。
第二步:本例我们想分别检验男女两组的身高是否服从正态分布,故将身高选入【因变量】列表,将性别选入【因子列表】
点击 【图】 --勾选“直方图”“含检验的正态图”
点击【继续】–【确定】,得到探索性分析结果。输出结果有很多图表,我们只解释正态性检验结果。
在这里插入图片描述
命令行:

EXAMINE VARIABLES=身高 BY 性别 /PLOT BOXPLOT NPPLOT /*若无此行,则不输出正态性检验表*//COMPARE GROUPS /STATISTICS DESCRIPTIVES /CINTERVAL 95 /MISSING LISTWISE /NOTOTAL.

结果解读:
当数据量≤50时,倾向于以夏皮洛-威尔克(S-W)检验结果为准;
当数据量>50时,倾向于以柯尔莫戈洛夫-斯米诺夫(K-S)检验结果为准;
当数据量>5000时,SPSS只会显示K-S检验结果。
本例中,我们比较25例男女中学生身高差异,需要分别看这两组的身高分布情况,上表显示,两组的样本量(可参考自由度那一列数值)均小于50,故以夏皮洛-威尔克(S-W)检验结果为准.
两组检验的p值(即显著性那一列)分别为0.690、0.771,均大于0.05,说明这两组身高均符合正态分布,故认为身高满足正态性。

注意事项

在使用S-W和K-S检验时需注意,当样本量较少的时候,检验结果不够敏感,即使数据分布有一定的偏离也不一定能检验出来;而当样本量较大的时候,检验结果又会太过敏感,只要数据稍微有一点偏离,P值就会<0.05,检验结果倾向于拒绝原假设,认为数据不服从正态分布。
所以,如果样本量足够多,即使检验结果P<0.05,数据来自的总体也可能是服从正态分布的。为此,我们要结合图直方图、P-P、Q-Q的图示法灵活使用。

四、规范表达

本次测量样本为25名,故采用夏皮洛-威尔克(S-W)检验,将SPSS输出结果整理为三线表,如下表1。
表1 身高的S-W正态性检验结果
在这里插入图片描述
从上表可知,男女生的正态性检验结果的统计分别为0.956和0.959,P值分别为0.690、0.771,均大于0.05。
同时结合直方图、P-P图和Q-Q图,可认为男生和女生的身高都服从正态分布。

五、小结

正态分布的检验方法包括图示法、偏度和峰度、非参数检验方法。
图形法检验正态分布往往是有效的,是实际应用中较为普遍的方式,是对正态分布显著性检验(如偏度和峰度的Z值、S-W及K-S检验)的有力辅助手段。
在实际的应用中,往往会出现明明直方图显示分布很对称,但参数检验的结果P值却<0.05,拒绝原假设认为不服从正态分布。
此时建议不要太刻意追求正态性检验的P值,一定要参考直方图、P-P图等图形工具来帮助判断。因此正态性检验三种方法均有重要实用意义。
很多统计学方法,如T检验、方差分析等,与其说要求数据严格服从正态分布,不如说“数据分布不要太偏态”更为合适。
小白学习完本节课内容之后,赶紧回去对40名大侠的数据进行正态性检验(第二讲数据),结果发现大侠们的身高、体重服从正态分布,而成绩不服从正态分布。
身高正态性检验(命令行):

EXAMINE VARIABLES=身高/PLOT BOXPLOT NPPLOT /*若无此行,则不输出正态性检验表*//COMPARE GROUPS /STATISTICS DESCRIPTIVES /CINTERVAL 95 /MISSING LISTWISE /NOTOTAL.

身高检验结果:
在这里插入图片描述
在这里插入图片描述
体重正态性检验(命令行):

EXAMINE VARIABLES=体重/PLOT BOXPLOT NPPLOT /*若无此行,则不输出正态性检验表*//COMPARE GROUPS /STATISTICS DESCRIPTIVES /CINTERVAL 95 /MISSING LISTWISE /NOTOTAL.

体重检验结果:
在这里插入图片描述
在这里插入图片描述
成绩正态性检验(命令行):

EXAMINE VARIABLES=成绩/PLOT BOXPLOT NPPLOT /*若无此行,则不输出正态性检验表*//COMPARE GROUPS /STATISTICS DESCRIPTIVES /CINTERVAL 95 /MISSING LISTWISE /NOTOTAL.

成绩检验结果:
在这里插入图片描述
在这里插入图片描述

于是,大侠们的身高和体重采用平均数、标准差来描述,而成绩采用中位数和四分位距来描述。
小白把上次的描述性结果呈送给主任,主任看后,满意地点点头。
然后,转过头对小白说:“小白,我想了解下今年这些大侠们的体重是否超标了?如果超标,就要加强训练,减脂减重,你能比较出来吗?”
小白这时比较淡定了,因为他非常清楚,《小白爱上SPSS》课程下一讲,将开启假设检验,讲解差异比较的T检验。
所以,搬好小板凳,等待开课就好了!

划重点

1、正态分布的检验方法包括图示法、偏度和峰度、非参数检验方法。
2、实际应用不必太刻意追求偏峰度的Z值和S-W及K-S检验的P值,需要结合直方图、P-P图和Q-Q图来判断。
3、对于统计方法,与其说要求数据严格服从正态分布,不如说“数据分布不要太偏态”更为合适。

这篇关于学习笔记|正态分布|图形法|偏度和峰度|非参数检验法|《小白爱上SPSS》课程:SPSS第三讲 | 正态分布怎么检验?看这篇文章就够了的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/313078

相关文章

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

AI绘图怎么变现?想做点副业的小白必看!

在科技飞速发展的今天,AI绘图作为一种新兴技术,不仅改变了艺术创作的方式,也为创作者提供了多种变现途径。本文将详细探讨几种常见的AI绘图变现方式,帮助创作者更好地利用这一技术实现经济收益。 更多实操教程和AI绘画工具,可以扫描下方,免费获取 定制服务:个性化的创意商机 个性化定制 AI绘图技术能够根据用户需求生成个性化的头像、壁纸、插画等作品。例如,姓氏头像在电商平台上非常受欢迎,

W外链微信推广短连接怎么做?

制作微信推广链接的难点分析 一、内容创作难度 制作微信推广链接时,首先需要创作有吸引力的内容。这不仅要求内容本身有趣、有价值,还要能够激起人们的分享欲望。对于许多企业和个人来说,尤其是那些缺乏创意和写作能力的人来说,这是制作微信推广链接的一大难点。 二、精准定位难度 微信用户群体庞大,不同用户的需求和兴趣各异。因此,制作推广链接时需要精准定位目标受众,以便更有效地吸引他们点击并分享链接

【前端学习】AntV G6-08 深入图形与图形分组、自定义节点、节点动画(下)

【课程链接】 AntV G6:深入图形与图形分组、自定义节点、节点动画(下)_哔哩哔哩_bilibili 本章十吾老师讲解了一个复杂的自定义节点中,应该怎样去计算和绘制图形,如何给一个图形制作不间断的动画,以及在鼠标事件之后产生动画。(有点难,需要好好理解) <!DOCTYPE html><html><head><meta charset="UTF-8"><title>06

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;

Andrej Karpathy最新采访:认知核心模型10亿参数就够了,AI会打破教育不公的僵局

夕小瑶科技说 原创  作者 | 海野 AI圈子的红人,AI大神Andrej Karpathy,曾是OpenAI联合创始人之一,特斯拉AI总监。上一次的动态是官宣创办一家名为 Eureka Labs 的人工智能+教育公司 ,宣布将长期致力于AI原生教育。 近日,Andrej Karpathy接受了No Priors(投资博客)的采访,与硅谷知名投资人 Sara Guo 和 Elad G

电脑桌面文件删除了怎么找回来?别急,快速恢复攻略在此

在日常使用电脑的过程中,我们经常会遇到这样的情况:一不小心,桌面上的某个重要文件被删除了。这时,大多数人可能会感到惊慌失措,不知所措。 其实,不必过于担心,因为有很多方法可以帮助我们找回被删除的桌面文件。下面,就让我们一起来了解一下这些恢复桌面文件的方法吧。 一、使用撤销操作 如果我们刚刚删除了桌面上的文件,并且还没有进行其他操作,那么可以尝试使用撤销操作来恢复文件。在键盘上同时按下“C

C++11第三弹:lambda表达式 | 新的类功能 | 模板的可变参数

🌈个人主页: 南桥几晴秋 🌈C++专栏: 南桥谈C++ 🌈C语言专栏: C语言学习系列 🌈Linux学习专栏: 南桥谈Linux 🌈数据结构学习专栏: 数据结构杂谈 🌈数据库学习专栏: 南桥谈MySQL 🌈Qt学习专栏: 南桥谈Qt 🌈菜鸡代码练习: 练习随想记录 🌈git学习: 南桥谈Git 🌈🌈🌈🌈🌈🌈🌈🌈🌈🌈🌈🌈🌈�

零基础学习Redis(10) -- zset类型命令使用

zset是有序集合,内部除了存储元素外,还会存储一个score,存储在zset中的元素会按照score的大小升序排列,不同元素的score可以重复,score相同的元素会按照元素的字典序排列。 1. zset常用命令 1.1 zadd  zadd key [NX | XX] [GT | LT]   [CH] [INCR] score member [score member ...]