教你使用几种常用的等概率抽样法

2023-10-12 00:59

本文主要是介绍教你使用几种常用的等概率抽样法,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

在统计建模过程中往往会使用到采样技术,通过样本来反映总体特征。关于采样,目前主要有两大类抽样技术,即等概率抽样和非等概率抽样,而在实际应用中,等概率抽样是最常见的,下面就讲讲等概率抽样中的几种抽样技术。


一、简单随机抽样

简单随机抽样(SRS)是我们经常接触到的抽样方法,比如摸彩或抽奖,或办公室需要有人出公差去送数据时用抽签决定人选。SRS的特色是母群体中的每一个体都有相同的机会被选中进入样本,这是一种最公平且概念上最简单的抽样法,可以直接套用统计学原理去进行估算与推论。关于简单随机抽样,在R中可以使用自带的sample()函数实现,下面是sample()函数的语法及参数意义:


sample(x, size, replace = FALSE, prob = NULL)

x:抽样对象,为一个向量

size:抽样规模,即需要从总体x中抽取多少样本

replace:指定是否有放回的抽样,默认为无放回,当设置为TRUE时,则表示简单随机抽样是有放回的

prob:指定抽样元素的概率,默认是每个个体被等概率抽中


例子:

```{r}

#向量--无放回

values <- runif(100, min = 10, max = 100)

sample1 <- sample(values, size = 10, replace = FALSE)

sample1

0?wx_fmt=png
#向量--有放回,不等概率

sample2 <- sample(c('A','B','C','D'), 500, replace = TRUE, prob = c(0.5,0.2,0.2,0.1))

table(sample2)

prop.table(table(sample2))

0?wx_fmt=png
#数据框

x <- runif(100)

y <- rnorm(100)

z <- rt(100,4)

df <- data.frame(x = x, y = y, z = z)


sample3 <- df[sample(1:nrow(df), size = 40),]

head(sample3)

0?wx_fmt=png
```


二、系统抽样

系统抽样方法是一种简化的随机抽样法,最普遍的做法是从母群体的名单中,按照一定的间隔取出足够的个体组成样本。比如我们可以从这500家医院的名单中,每10间医院取一间来做为样本个体。但首先我们必须先随机决定一个起始的号码,也就是从1-10之间随机选出一个号码,假如选中的是3号,则我们从3号开始,每10号取一家医院做为样本(3, 13, 23, 33,…493)。关于系统抽样,在R中可以使用sampling包中的UPsystematic()函数实现,下面是UPsystematic()函数的语法及参数意义:


UPsystematic(pik,eps=1e-6)

pik:为一向量,存放抽样的包含概率

esp:为一控制值,默认为1e-6


例子:

```{r}

x <- round(runif(1000, min = 1, max = 100))

#计算一阶包含概率

pik <- inclusionprobabilities(x,200)

#返回0-1值表示是否被抽样

s <- UPsystematic(pik) 

head(getdata(x,s),10)

0?wx_fmt=png
```

但从上面的返回的ID_unit看,并不是系统抽样定义的那样,即等间隔的抽取样本。为保证与定义一致,这里自定义系统抽样的函数:

```{r}

sys_sampling <- function(x, gap = 10, seed = 1234){

  set.seed(seed)

  i <- round(runif(1, min = 1, max = 10))

    ID <- numeric()

    sampling <- numeric()

  while(i<=length(x)){

    ID[ceiling(i/gap)] <- i

    sampling[ceiling(i/gap)] <- x[i]

    i <- i + gap

  }

 return(data.frame(ID = ID, data = sampling))   

}

```

其中,x为待抽样的总体;gap为抽样间隔,默认为10;seed为种子数,用于从[1,10]之间随机挑选一个起始号设定随机种子,默认为1234。


例子:

```{r}

head(sys_sampling(x = x, gap = 7, seed = 3),10)

0?wx_fmt=png
```


三、分层抽样

分层或分组抽样是一种比SRS更精准的随机抽样法,所用的方法是跟据我们的研究性质,依照相关的条件把母群体中的个体分成不同的层别或组别(strata),再分别从每一层别或组别中的个体随机抽出一定的个体来组成样本。在R中可以使用sampling包中的strata()函数实现,下面是strata()函数的语法及参数意义:


strata(data, stratanames=NULL, size, 

          method=c("srswor","srswr","poisson","systematic"), 

          pik,description=FALSE)

data:待抽样的数据框

stratanames:指定数据框中的分层变量

size:指定每个层中的抽样数量,默认按原数据中分层变量水平的顺序指定抽样数量

method:指定抽取各层数据的方法,默认为无放回的简单随机抽样,还可以是有放回的简单随机抽样、泊松抽样和系统抽样

pik:如果选择系统抽样时,需要指定系统抽样的包含概率pik向量


例子:

```{r}

Stratified <- rep(c('A','B','C','D'), c(100,200,300,400))

Values <- round(runif(1000, min = 1, max = 1000))

df <- data.frame(Stratified = Stratified, Values = Values)


#等比例抽样

n <- 400

size <- round(400*table(df$Stratified)/length(df$Stratified))

s <- strata(data = df, stratanames = 'Stratified', size = size, method = 'srswor')

head(getdata(data = df, m = s))

0?wx_fmt=png
#非等比例抽样,随意指定抽样数量

s <- strata(data = df, stratanames = 'Stratified', size = c(50, 100, 50, 200), method = 'srswor')

head(getdata(data = df, m = s))

0?wx_fmt=png
```


四、聚集抽样

聚集抽样也是跟据某种母群体的特性,将母群体中的个体分成不同的群组(clusters),然后从这些群组中随机抽出部分的群组,再从被选中的群组中随机抽出足够的个体来组成样本。

从定义上看,聚集抽样与分层抽样很相似,但各自的组是完全两回事。在聚集抽样中,尽量保证组内数据差异特别大,而组间差异尽量小;在分层抽样中就恰恰相反,即组内差异尽量小,而组间差异要求很大。在R中可以使用sampling包中的cluster()函数实现,下面是cluster()函数的语法及参数意义:


cluster(data, clustername, size, 

           method=c("srswor","srswr","poisson","systematic"),

           pik,description=FALSE)

data:待抽样的数据框

clustername:指定数据框中的聚集变量

size:指定抽取多少个组

method:指定抽取的方法,默认为无放回的简单随机抽样,还可以是有放回的简单随机抽样、泊松抽样和系统抽样

pik:如果选择系统抽样时,需要指定系统抽样的包含概率pik向量


例子:

```{r}

Clusters <- rep(c('A','B','C','D','E','F','G'), c(100,200,300,400, 100, 200, 300))

Values <- round(runif(1600, min = 1, max = 1000))

df <- data.frame(Clusters = Clusters, Values = Values)


#从7个聚集组中随机抽取3个组

s <- cluster(data = df, clustername = 'Clusters', size = 3, method=c('srswor'))

#查看随机抽取了哪三个组

unique(s$Clusters)

head(getdata(data = df, m = s))

```

0?wx_fmt=png


参考资料

https://www.douban.com/group/topic/72819666/



每天进步一点点2015

学习与分享,取长补短,关注小号!

0?wx_fmt=jpeg
     长按识别二维码à马上关注

这篇关于教你使用几种常用的等概率抽样法的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/192107

相关文章

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

JS常用组件收集

收集了一些平时遇到的前端比较优秀的组件,方便以后开发的时候查找!!! 函数工具: Lodash 页面固定: stickUp、jQuery.Pin 轮播: unslider、swiper 开关: switch 复选框: icheck 气泡: grumble 隐藏元素: Headroom

中文分词jieba库的使用与实景应用(一)

知识星球:https://articles.zsxq.com/id_fxvgc803qmr2.html 目录 一.定义: 精确模式(默认模式): 全模式: 搜索引擎模式: paddle 模式(基于深度学习的分词模式): 二 自定义词典 三.文本解析   调整词出现的频率 四. 关键词提取 A. 基于TF-IDF算法的关键词提取 B. 基于TextRank算法的关键词提取

使用SecondaryNameNode恢复NameNode的数据

1)需求: NameNode进程挂了并且存储的数据也丢失了,如何恢复NameNode 此种方式恢复的数据可能存在小部分数据的丢失。 2)故障模拟 (1)kill -9 NameNode进程 [lytfly@hadoop102 current]$ kill -9 19886 (2)删除NameNode存储的数据(/opt/module/hadoop-3.1.4/data/tmp/dfs/na

Hadoop数据压缩使用介绍

一、压缩原则 (1)运算密集型的Job,少用压缩 (2)IO密集型的Job,多用压缩 二、压缩算法比较 三、压缩位置选择 四、压缩参数配置 1)为了支持多种压缩/解压缩算法,Hadoop引入了编码/解码器 2)要在Hadoop中启用压缩,可以配置如下参数

Makefile简明使用教程

文章目录 规则makefile文件的基本语法:加在命令前的特殊符号:.PHONY伪目标: Makefilev1 直观写法v2 加上中间过程v3 伪目标v4 变量 make 选项-f-n-C Make 是一种流行的构建工具,常用于将源代码转换成可执行文件或者其他形式的输出文件(如库文件、文档等)。Make 可以自动化地执行编译、链接等一系列操作。 规则 makefile文件

使用opencv优化图片(画面变清晰)

文章目录 需求影响照片清晰度的因素 实现降噪测试代码 锐化空间锐化Unsharp Masking频率域锐化对比测试 对比度增强常用算法对比测试 需求 对图像进行优化,使其看起来更清晰,同时保持尺寸不变,通常涉及到图像处理技术如锐化、降噪、对比度增强等 影响照片清晰度的因素 影响照片清晰度的因素有很多,主要可以从以下几个方面来分析 1. 拍摄设备 相机传感器:相机传

【C++】_list常用方法解析及模拟实现

相信自己的力量,只要对自己始终保持信心,尽自己最大努力去完成任何事,就算事情最终结果是失败了,努力了也不留遗憾。💓💓💓 目录   ✨说在前面 🍋知识点一:什么是list? •🌰1.list的定义 •🌰2.list的基本特性 •🌰3.常用接口介绍 🍋知识点二:list常用接口 •🌰1.默认成员函数 🔥构造函数(⭐) 🔥析构函数 •🌰2.list对象

常用的jdk下载地址

jdk下载地址 安装方式可以看之前的博客: mac安装jdk oracle 版本:https://www.oracle.com/java/technologies/downloads/ Eclipse Temurin版本:https://adoptium.net/zh-CN/temurin/releases/ 阿里版本: github:https://github.com/

hdu4865(概率DP)

题意:已知前一天和今天的天气概率,某天的天气概率和叶子的潮湿程度的概率,n天叶子的湿度,求n天最有可能的天气情况。 思路:概率DP,dp[i][j]表示第i天天气为j的概率,状态转移如下:dp[i][j] = max(dp[i][j, dp[i-1][k]*table2[k][j]*table1[j][col] )  代码如下: #include <stdio.h>#include