《机器学习》西瓜书课后习题3.4——python解交叉验证和留一法的对率回归错误率

本文主要是介绍《机器学习》西瓜书课后习题3.4——python解交叉验证和留一法的对率回归错误率,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

《机器学习》西瓜书课后习题3.4——python解交叉验证和留一法的对率回归错误率

《机器学习》西瓜书P69

3.3 选择两个UCI数据集,比较10折交叉验证法和留一法所估计出的对率回归的错误率

数据集:鸢尾花数据集

数据集属性信息:

1.萼片长度(以厘米计)
2.萼片宽度(以厘米计)
3.花瓣长度(以厘米计)
4.花瓣宽度(以厘米计)
5.类别:

数据集处理说明:该数据集中鸢尾花种类共有3种,分别是:Iris-setosa、Iris-versicolor和Iris-virginica,由于题目中要求采用两种方法对数据集进行处理,因此我们将Iris-setosa和Iris-versicolor划分在一个数据集(称为1号数据集),并采用留一法法进行数据集的划分,Iris-versicolor和Iris-virginica放入另一个数据集(称为2号数据集)并使用交叉验证法进行划分。

【代码】

#Iris-setosa标记为0,Iris-versicolor标记为1,Iris-virginica标记为2
def loadDataset(filename):dataset_12=[]dataset_23=[]with open(filename,'r',encoding='utf-8') as csvfile:csv_reader = csv.reader(csvfile)for row in csv_reader:if row[4] == 'Iris-setosa':row[4]=0dataset_12.append(copy.deepcopy(row))elif row[4]=='Iris-virginica':row[4]=2dataset_23.append(copy.deepcopy(row) )else:row[4]=1dataset_12.append(copy.deepcopy(row))dataset_23.append(copy.deepcopy(row))data_12 = [[float(x) for x in row] for row in dataset_12]data_23= [[float(x) for x in row] for row in dataset_23]# print(data_12)# print(data_23)return data_12,data_23

注意:在该程序中我们使用append(copy.deepcopy(row))进行深度复制,目的是避免对数组的操作影响原数组的变化,下同!!!!


针对2号数据集:

【代码思路】我们使用10折交叉验证法对数据集每次划分为训练集和测试集,然后使用梯度下降法对训练集进行训练,并使用测试集求得每次的准确率,最终我们将10次准确率取平均值,即为最终的正确率。

【详细过程】

  1. 首先利用python中自带的函数进行10折交叉验证划分,由于返回的是划分数据的下标,因此我们需要找到对应的数据元素,然后,对得到的训练集和测试集中的数据进行预处理(在数组最后增加一列1,0,1存储真实标记),接着就可以参与训练,我们将迭代次数设置为2000次,我们发现当迭代次数达到2000之后,准确率很难再增长,于是取2000作为终止条件,将得到的w分别与10个测试集进行运算比较,得到10组准确率,取平均值即可。

  2. 最终我们得到10折交叉验证法进行对率回归得到的准确率为96%!

    #定义sigmoid函数
    def sigmoid(z):return 1.0 / (1 + np.exp(-z))#计算正确率
    def testing(testset,w,testlabel):data = np.mat(testset).astype(float)y = sigmoid(np.dot(data, w))b, c = np.shape(y)  # 功能是查看矩阵或者数组的维数。rightcount = 0for i in range(b):flag = -1if y[i, 0] > 0.5:flag = 1elif y[i, 0] < 0.5:flag = 0if testlabel[i] == flag:rightcount += 1rightrate = rightcount / len(testset)return rightrate#迭代求w
    def training(dataset,labelset,testset,testlabel):# np.dot(a,b) a和b矩阵点乘# np.transpose()  转置# np.ones((m,n))  创建一个m行n列的多维数组data=np.mat(dataset).astype(float)label=np.mat(labelset).transpose()w = np.ones((len(dataset[0]),1))#步长n=0.0001# 每次迭代计算一次正确率(在测试集上的正确率)# 达到0.90的正确率,停止迭代rightrate=0.0count=0while count<5000:c=sigmoid(np.dot(data,w))b=c-labelchange = np.dot(np.transpose(data),b)w=w-change*n#预测,更新准确率if rightrate<testing(testset,w,testlabel):rightrate=testing(testset,w,testlabel)count+=1return rightratedef formdata(dataset,flag):#flag=1代表的是对一号数据集进行数据预处理,falg=2针对2号数据集#主要是将训练集和测试集进行规范化处理,便于下一步进行正确率计算和迭代求wdata=[]label=[]if flag==1:for row in dataset:label.append(copy.deepcopy(row[4]))row[4]=1data.append(copy.deepcopy(row))elif flag == 2:for row in dataset:label.append(copy.deepcopy(row[4]-1))row[4]=1data.append(copy.deepcopy(row))return data,labeldef changedata(dataset,train_index,test_index):#对数据集进行处理,增加最后一列为1trainset=[]testset=[]for i in train_index:trainset.append(copy.deepcopy(dataset[i]))for i in test_index:testset.append(copy.deepcopy(dataset[i]))return trainset,testset#10折交叉验证法对数据集23进行分类
    def Flod_10(dataset):sam=KFold(n_splits=10)rightrate=0.0for train_index,test_index in sam.split(dataset):#得到训练集和测试集的索引# 下面将索引转化为所对应的元素,并将训练集进行迭代,每次求出最大的正确率trainset,testset=changedata(dataset,train_index,test_index)#print(trainset)trainset,trainlabel=formdata(trainset,2)testset,testlabel=formdata(testset,2)rightrate+=training(trainset,trainlabel,testset,testlabel)print(rightrate/10)

    最终结果

[[-1.90048431][-1.20567294][ 2.31544454][ 2.66095658][-0.20997301]]
[[-1.86985439][-1.3288315 ][ 2.3427924 ][ 2.64797632][-0.16119412]]
[[-1.90055107][-1.29322442][ 2.37973509][ 2.68461371][-0.26297932]]
[[-2.00438577][-1.18000688][ 2.43352222][ 2.65712983][-0.15617894]]
[[-1.94737348][-1.16692044][ 2.35919664][ 2.59038908][-0.14542583]]
[[-1.91467144][-1.22980709][ 2.27891615][ 2.74578832][-0.23887025]]
[[-1.94810073][-1.27450893][ 2.37093425][ 2.64955955][-0.24649082]]
[[-1.99150258][-1.25235181][ 2.35312496][ 2.75221192][-0.20701229]]
[[-1.96302072][-1.29024687][ 2.31087635][ 2.8008307 ][-0.16047752]]
[[-1.9630222 ][-1.35486554][ 2.50563773][ 2.44772595][-0.25646535]]
0.96

针对1号数据集

【代码思路】我们使用留一法进行划分,将数据集的75%作为训练集,25%作为测试集,由于Iris-setosa、Iris-versicolor的个数为1:1因此采用分层抽样的方法,我们将每种花的75%作为训练集,25%作为测试集,然后进行迭代求准确率即可!

#留出法——对数据集12进行分类
#将75%的样本作为训练,其余用作测试
def LeftOut(dataset):train12=[]test12=[]for i in range(len(dataset)):if i<=37:train12.append(copy.deepcopy(dataset[i]))elif i>50 and i<=88:train12.append(copy.deepcopy(dataset[i]))else:test12.append(copy.deepcopy(dataset[i]))trainset,trainlabel=formdata(train12,1)testset,testlabel=formdata(test12,1)rightrate=training(trainset,trainlabel,testset,testlabel)print(rightrate)

最终结果

[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-YWyjAXfj-1620097001273)(C:\Users\hp\AppData\Roaming\Typora\typora-user-images\image-20210504105611147.png)]
【完整源代码】

import copy
import csv
import numpy as np
from sklearn.model_selection import KFold#Iris-setosa标记为0,Iris-versicolor标记为1,Iris-virginica标记为2
def loadDataset(filename):dataset_12=[]dataset_23=[]with open(filename,'r',encoding='utf-8') as csvfile:csv_reader = csv.reader(csvfile)for row in csv_reader:if row[4] == 'Iris-setosa':row[4]=0dataset_12.append(copy.deepcopy(row))elif row[4]=='Iris-virginica':row[4]=2dataset_23.append(copy.deepcopy(row) )else:row[4]=1dataset_12.append(copy.deepcopy(row))dataset_23.append(copy.deepcopy(row))data_12 = [[float(x) for x in row] for row in dataset_12]data_23= [[float(x) for x in row] for row in dataset_23]# print(data_12)# print(data_23)return data_12,data_23#定义sigmoid函数
def sigmoid(z):return 1.0 / (1 + np.exp(-z))#计算正确率
def testing(testset,w,testlabel):data = np.mat(testset).astype(float)y = sigmoid(np.dot(data, w))b, c = np.shape(y)  # 功能是查看矩阵或者数组的维数。rightcount = 0for i in range(b):flag = -1if y[i, 0] > 0.5:flag = 1elif y[i, 0] < 0.5:flag = 0if testlabel[i] == flag:rightcount += 1rightrate = rightcount / len(testset)return rightrate#迭代求w
def training(dataset,labelset,testset,testlabel):# np.dot(a,b) a和b矩阵点乘# np.transpose()  转置# np.ones((m,n))  创建一个m行n列的多维数组data=np.mat(dataset).astype(float)label=np.mat(labelset).transpose()w = np.ones((len(dataset[0]),1))#步长n=0.0001# 每次迭代计算一次正确率(在测试集上的正确率)# 达到0.90的正确率,停止迭代rightrate=0.0count=0while count<5000:c=sigmoid(np.dot(data,w))b=c-labelchange = np.dot(np.transpose(data),b)w=w-change*n#预测,更新准确率if rightrate<testing(testset,w,testlabel):rightrate=testing(testset,w,testlabel)count+=1print(w)return rightratedef formdata(dataset,flag):#flag=1代表的是对一号数据集进行数据预处理,falg=2针对2号数据集#主要是将训练集和测试集进行规范化处理,便于下一步进行正确率计算和迭代求wdata=[]label=[]if flag==1:for row in dataset:label.append(copy.deepcopy(row[4]))row[4]=1data.append(copy.deepcopy(row))elif flag == 2:for row in dataset:label.append(copy.deepcopy(row[4]-1))row[4]=1data.append(copy.deepcopy(row))return data,labeldef changedata(dataset,train_index,test_index):#对数据集进行处理,增加最后一列为1trainset=[]testset=[]for i in train_index:trainset.append(copy.deepcopy(dataset[i]))for i in test_index:testset.append(copy.deepcopy(dataset[i]))return trainset,testset#留出法——对数据集12进行分类
#将75%的样本作为训练,其余用作测试
def LeftOut(dataset):train12=[]test12=[]for i in range(len(dataset)):if i<=37:train12.append(copy.deepcopy(dataset[i]))elif i>50 and i<=88:train12.append(copy.deepcopy(dataset[i]))else:test12.append(copy.deepcopy(dataset[i]))trainset,trainlabel=formdata(train12,1)testset,testlabel=formdata(test12,1)rightrate=training(trainset,trainlabel,testset,testlabel)print(rightrate)#10折交叉验证法对数据集23进行分类
def Flod_10(dataset):sam=KFold(n_splits=10)rightrate=0.0for train_index,test_index in sam.split(dataset):#得到训练集和测试集的索引# 下面将索引转化为所对应的元素,并将训练集进行迭代,每次求出最大的正确率trainset,testset=changedata(dataset,train_index,test_index)#print(trainset)trainset,trainlabel=formdata(trainset,2)testset,testlabel=formdata(testset,2)rightrate+=training(trainset,trainlabel,testset,testlabel)print(rightrate/10)filename="iris.csv"
data_12,data_23=loadDataset(filename)
LeftOut(data_12)
Flod_10(data_23)

【结论】

10折交叉验证法的错误率:0%(存在偶然性,需要进行多次随机抽样取平均值,我们未进行该操作

留一法所估计出的对率回归的错误率:4%

这篇关于《机器学习》西瓜书课后习题3.4——python解交叉验证和留一法的对率回归错误率的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/226024

相关文章

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

Spring Security基于数据库验证流程详解

Spring Security 校验流程图 相关解释说明(认真看哦) AbstractAuthenticationProcessingFilter 抽象类 /*** 调用 #requiresAuthentication(HttpServletRequest, HttpServletResponse) 决定是否需要进行验证操作。* 如果需要验证,则会调用 #attemptAuthentica

python: 多模块(.py)中全局变量的导入

文章目录 global关键字可变类型和不可变类型数据的内存地址单模块(单个py文件)的全局变量示例总结 多模块(多个py文件)的全局变量from x import x导入全局变量示例 import x导入全局变量示例 总结 global关键字 global 的作用范围是模块(.py)级别: 当你在一个模块(文件)中使用 global 声明变量时,这个变量只在该模块的全局命名空

【前端学习】AntV G6-08 深入图形与图形分组、自定义节点、节点动画(下)

【课程链接】 AntV G6:深入图形与图形分组、自定义节点、节点动画(下)_哔哩哔哩_bilibili 本章十吾老师讲解了一个复杂的自定义节点中,应该怎样去计算和绘制图形,如何给一个图形制作不间断的动画,以及在鼠标事件之后产生动画。(有点难,需要好好理解) <!DOCTYPE html><html><head><meta charset="UTF-8"><title>06

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;

【C++ Primer Plus习题】13.4

大家好,这里是国中之林! ❥前些天发现了一个巨牛的人工智能学习网站,通俗易懂,风趣幽默,忍不住分享一下给大家。点击跳转到网站。有兴趣的可以点点进去看看← 问题: 解答: main.cpp #include <iostream>#include "port.h"int main() {Port p1;Port p2("Abc", "Bcc", 30);std::cout <<

【Python编程】Linux创建虚拟环境并配置与notebook相连接

1.创建 使用 venv 创建虚拟环境。例如,在当前目录下创建一个名为 myenv 的虚拟环境: python3 -m venv myenv 2.激活 激活虚拟环境使其成为当前终端会话的活动环境。运行: source myenv/bin/activate 3.与notebook连接 在虚拟环境中,使用 pip 安装 Jupyter 和 ipykernel: pip instal

零基础学习Redis(10) -- zset类型命令使用

zset是有序集合,内部除了存储元素外,还会存储一个score,存储在zset中的元素会按照score的大小升序排列,不同元素的score可以重复,score相同的元素会按照元素的字典序排列。 1. zset常用命令 1.1 zadd  zadd key [NX | XX] [GT | LT]   [CH] [INCR] score member [score member ...]

【机器学习】高斯过程的基本概念和应用领域以及在python中的实例

引言 高斯过程(Gaussian Process,简称GP)是一种概率模型,用于描述一组随机变量的联合概率分布,其中任何一个有限维度的子集都具有高斯分布 文章目录 引言一、高斯过程1.1 基本定义1.1.1 随机过程1.1.2 高斯分布 1.2 高斯过程的特性1.2.1 联合高斯性1.2.2 均值函数1.2.3 协方差函数(或核函数) 1.3 核函数1.4 高斯过程回归(Gauss