机器学习 之 决策树与随机森林的实现

2024-08-23 00:44

本文主要是介绍机器学习 之 决策树与随机森林的实现,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

引言

随着互联网技术的发展,垃圾邮件过滤已成为一项重要的任务。机器学习技术,尤其是决策树和随机森林,在解决这类问题时表现出色。本文将介绍随机森林的基本概念,并通过一个具体的案例——筛选垃圾电子邮件——来展示随机森林的实际应用。

随机森林简介

随机森林是一种基于决策树的集成学习方法,它通过构建多个决策树并综合它们的预测结果来提高准确性和防止过拟合。随机森林的工作原理主要包括以下几个步骤:

  1. 自助采样:从原始数据集中通过有放回的方式抽取多个子样本集。
  2. 构建决策树:在每个子样本集上独立地构建一棵决策树。
  3. 随机特征选择:在构建每棵树的过程中,每个节点的分裂都是从所有特征的一个随机子集中选出最优特征。
  4. 投票机制:对于分类任务,每棵树都会对新样本给出一个预测类别,最终的预测类别是所有树预测结果的多数表决结果。

随机森林的优点包括:

  • 鲁棒性:由于使用了多棵决策树,单棵树的错误不会影响整体预测结果。
  • 易于实现:随机森林的实现相对简单,并且不需要太多的参数调整。
  • 并行计算:每棵树可以独立构建,这使得随机森林非常适合于并行计算环境。
  • 特征重要性:可以评估特征的重要性,帮助选择最具影响力的特征。
实验数据介绍

本次实验使用的数据集名为 spambase.xlsx。数据集包含了用于识别垃圾邮件的特征,其中包括:

  • 单词频率 (Word_freq_makeWord_freq_address, 等):特定单词在邮件中出现的频率。
  • 字符频率 (Char_freq1Char_freq2, 等):特定字符在邮件中出现的频率。
  • 大写字母连续长度统计 (Capital_run_length_averageCapital_run_length_longest, 等):大写字母连续出现的平均长度和最长长度。
  • 标签 (label):邮件是否为垃圾邮件,0表示非垃圾邮件,1表示垃圾邮件。

实例:随机森林实现垃圾邮件筛选
加载数据

首先,我们需要使用Pandas库加载Excel文件中的数据。

import pandas as pd# 读取数据
df = pd.read_csv('spambase.csv')# 分割特征和标签
X = df.iloc[:, :-1]  # 特征列
y = df.iloc[:, -1]   # 标签列
划分数据集

接着,我们将数据集分为训练集和测试集。

from sklearn.model_selection import train_test_split# 划分数据集
xtrain, xtest, ytrain, ytest = \train_test_split(X, y, test_size=0.2, random_state=100)
构建随机森林模型

现在,我们使用RandomForestClassifier类构建一个随机森林模型,并设置相关的超参数

from sklearn.ensemble import RandomForestClassifier# 创建随机森林分类器
rf = RandomForestClassifier(n_estimators=108,  # 决策树的数量max_features=0.8,  # 最大特征数量比例random_state=0     # 随机种子
)# 训练模型
rf.fit(xtrain, ytrain)
模型评估

最后,我们将评估模型在训练集和测试集上的表现。

from sklearn import metrics
import matplotlib.pyplot as plt
from sklearn.metrics import confusion_matrix# 定义混淆矩阵函数
def cm_plot(y, yp):cm = confusion_matrix(y, yp)plt.matshow(cm, cmap=plt.cm.Blues)plt.colorbar()for x in range(len(cm)):for y in range(len(cm)):plt.annotate(cm[x, y], xy=(y, x), horizontalalignment='center',verticalalignment='center')plt.ylabel('True label')  # 真实标签plt.xlabel('Predicted label')  # 预测标签return plt# 在训练集上进行预测
train_predicted = rf.predict(xtrain)# 输出训练集上的分类报告
print("Training Set Classification Report:")
print(metrics.classification_report(ytrain, train_predicted))# 绘制训练集上的混淆矩阵
cm_plot(ytrain, train_predicted).show()# 在测试集上进行预测
test_predicted = rf.predict(xtest)# 输出测试集上的分类报告
print("Test Set Classification Report:")
print(metrics.classification_report(ytest, test_predicted))# 绘制测试集上的混淆矩阵
cm_plot(ytest, test_predicted).show()
 输出结果:

训练集各指标报告:

训练集混淆函数: 

预测集各指标报告:

预测集混淆矩阵

结论

随机森林是一种强大的机器学习算法,能够有效地处理分类和回归任务。通过上述代码,我们已经成功地使用随机森林对spambase.xlsx数据集进行了训练和评估。从输出的分类报告和混淆矩阵中可以看出模型的性能情况。随机森林因其简单易用和高效的特点,在许多实际应用中都取得了很好的效果。

这篇关于机器学习 之 决策树与随机森林的实现的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1097867

相关文章

SpringBoot集成redisson实现延时队列教程

《SpringBoot集成redisson实现延时队列教程》文章介绍了使用Redisson实现延迟队列的完整步骤,包括依赖导入、Redis配置、工具类封装、业务枚举定义、执行器实现、Bean创建、消费... 目录1、先给项目导入Redisson依赖2、配置redis3、创建 RedissonConfig 配

Python的Darts库实现时间序列预测

《Python的Darts库实现时间序列预测》Darts一个集统计、机器学习与深度学习模型于一体的Python时间序列预测库,本文主要介绍了Python的Darts库实现时间序列预测,感兴趣的可以了解... 目录目录一、什么是 Darts?二、安装与基本配置安装 Darts导入基础模块三、时间序列数据结构与

Python使用FastAPI实现大文件分片上传与断点续传功能

《Python使用FastAPI实现大文件分片上传与断点续传功能》大文件直传常遇到超时、网络抖动失败、失败后只能重传的问题,分片上传+断点续传可以把大文件拆成若干小块逐个上传,并在中断后从已完成分片继... 目录一、接口设计二、服务端实现(FastAPI)2.1 运行环境2.2 目录结构建议2.3 serv

C#实现千万数据秒级导入的代码

《C#实现千万数据秒级导入的代码》在实际开发中excel导入很常见,现代社会中很容易遇到大数据处理业务,所以本文我就给大家分享一下千万数据秒级导入怎么实现,文中有详细的代码示例供大家参考,需要的朋友可... 目录前言一、数据存储二、处理逻辑优化前代码处理逻辑优化后的代码总结前言在实际开发中excel导入很

SpringBoot+RustFS 实现文件切片极速上传的实例代码

《SpringBoot+RustFS实现文件切片极速上传的实例代码》本文介绍利用SpringBoot和RustFS构建高性能文件切片上传系统,实现大文件秒传、断点续传和分片上传等功能,具有一定的参考... 目录一、为什么选择 RustFS + SpringBoot?二、环境准备与部署2.1 安装 RustF

Nginx部署HTTP/3的实现步骤

《Nginx部署HTTP/3的实现步骤》本文介绍了在Nginx中部署HTTP/3的详细步骤,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学... 目录前提条件第一步:安装必要的依赖库第二步:获取并构建 BoringSSL第三步:获取 Nginx

MyBatis Plus实现时间字段自动填充的完整方案

《MyBatisPlus实现时间字段自动填充的完整方案》在日常开发中,我们经常需要记录数据的创建时间和更新时间,传统的做法是在每次插入或更新操作时手动设置这些时间字段,这种方式不仅繁琐,还容易遗漏,... 目录前言解决目标技术栈实现步骤1. 实体类注解配置2. 创建元数据处理器3. 服务层代码优化填充机制详

Python实现Excel批量样式修改器(附完整代码)

《Python实现Excel批量样式修改器(附完整代码)》这篇文章主要为大家详细介绍了如何使用Python实现一个Excel批量样式修改器,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一... 目录前言功能特性核心功能界面特性系统要求安装说明使用指南基本操作流程高级功能技术实现核心技术栈关键函

Java实现字节字符转bcd编码

《Java实现字节字符转bcd编码》BCD是一种将十进制数字编码为二进制的表示方式,常用于数字显示和存储,本文将介绍如何在Java中实现字节字符转BCD码的过程,需要的小伙伴可以了解下... 目录前言BCD码是什么Java实现字节转bcd编码方法补充总结前言BCD码(Binary-Coded Decima

SpringBoot全局域名替换的实现

《SpringBoot全局域名替换的实现》本文主要介绍了SpringBoot全局域名替换的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录 项目结构⚙️ 配置文件application.yml️ 配置类AppProperties.Ja