实验楼21期--机器学习--信用卡持卡人风险预测

2023-11-02 20:40

本文主要是介绍实验楼21期--机器学习--信用卡持卡人风险预测,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

这篇文章是程序自动发表的, 详情可以见这里

  • 题目
    • 介绍
    • 目标
    • 要求
    • 提示
    • 知识点
  • 分析与解答
    • 模型选择
    • 读取数据
    • 非数值特征处理
    • 拟合预测
    • 保存数据
  • 总结与反思
  • 代码
  • 参考资料


参加实验楼的楼赛 21 期, 关于机器学习的, 我以前没怎么接触过, 所以是临时在网上查找资料解答的. 如果有一些错误或者是不完善的地方, 欢迎指出.

题目

介绍

题目提供一个来自某银行的真实数据集,数据集前 10 行预览如下:

其中:

  • 第 1~6 列为客户近期历史账单信息。
  • 第 7 列为该客户年龄。
  • 第 8 列为该客户性别。(Female, Male)
  • 第 9 列为该客户教育程度。(Graduate School, University, High School, Others)
  • 第 10 列为该客户婚姻状况。(Married, Single, Others)
  • 第 11 列为客户持卡风险状况 。(LOW, HIGH)

此外:

  • 训练数据集 credit_risk_train.csv 总共有 20000 条数据。
  • 测试数据集 credit_risk_test.csv 总共有 5000 条数据。

下载:

wget http://labfile.oss.aliyuncs.com/courses/1109/credit_risk_train.csv
wget http://labfile.oss.aliyuncs.com/courses/1109/credit_risk_test.csv

目标

你需要使用训练数据集构建机器学习分类预测模型,并针对测试数据集进行预测,准确率 \displaystyle \geq 0.8≥0.8 即为合格。

要求

  1. 提交时,请将预测结果按测试数据集中每条数据的排列顺序,以单列数据的形式存入 credit_risk_pred.csv 数据文件中,列名为 RISK

  2. 需要将 credit_risk_pred.csv 放置于 /home/shiyanlou/Code 路径下方。

credit_risk_pred.csv 数据文件仅存在 RISK 列,示例如下:

提示

  • 你可能会用到 scikit-learn 提供的分类预测模型。
  • 你可能会用到 Pandas 对数据进行预处理。
  • 完成本题目可以自由使用第三方模块,在线环境 /home/shiyanlou/anaconda3/bin/python 路径下有 scikit-learn, pandas 等常用模块。

知识点

  • 机器学习分类预测

分析与解答

模型选择

首先要选出合适的模型, 最开始随便试了 SGDClassifier,LogisticRegression等模型, 都没有达到 0.8 的准确度
然后上网查找, 根据这张图选择了 svm 支持向量机模型
model

from sklearn.svm import SVC as MODEL

读取数据

可以用 pandas 读取 csv 数据, 并进行一些预处理, 并分好训练数据集与测试数据集

import pandas as pd
def getData():data = pd.read_csv(trainfile)  test = pd.read_csv(testfile)  #names = cols)   #.replace(to_replace ='"',value = np.nan)data = label(data)test = label(test)x_train,y_train =data.iloc[:,:-1].as_matrix(), data.iloc[:,-1].as_matrix()x_test = test.iloc[:,:].as_matrix()y_test=Nonereturn x_train,y_train, x_test,y_test

非数值特征处理

有些特征是非数值的, 需要进行编码, 比如 gender education 等, 编码有很多方式, 比如 onehotkey, 由于这里是字符串类型的, 可以用 labelencoder , 它可以将一个特征下的值集合一次编码为 0,1,2…

要想解码, 保存最后的预测结果. 我设置了一个全局变量 converetor , 来保存这个 encoder

from sklearn.preprocessing import LabelEncoder as LEconvertor = None # result convertordef label(data):global convertorfor col in data.columns:if data[col].dtype == 'object':le = LE()if col=='RISK':convertor = lele.fit(data[col])data[col]= le.transform(data[col])return data

拟合预测

fit 函数拟合时, 不同的模型时间不一样, 适应的场景, 数据也不一样, 准确度也不一样

def predict(model=MODEL):        predictor = model()x_train,y_train,x_test,_ = getData()predictor.fit(x_train,y_train)res = predictor.predict(x_test)save(res)

保存数据

用 pandas 保存为 csv

def save(result):result = convertor.inverse_transform(result)dataframe = pd.DataFrame({'RISK':result})dataframe.to_csv('credit_risk_pred.csv',index=False,sep=',')

总结与反思

时间匆忙, 这个代码比较粗略, 还有很多可以考虑的地方, 比如检验一些值的方差是否过大, 特征缩放, 评估模型的准确度等等

最后, 感觉这个网站, 这个比赛挺有趣的, 如果想注册, 可以点这里, 邀请了:)

代码

import pandas as pd
from sklearn.preprocessing import LabelEncoder as LE
from sklearn.svm import SVC as MODELtrainfile = 'credit_risk_train.csv'
testfile = 'credit_risk_test.csv'
convertor = None # result convertordef label(data):global convertorfor col in data.columns:if data[col].dtype == 'object':le = LE()if col=='RISK':convertor = lele.fit(data[col])data[col]= le.transform(data[col])return datadef getData():data = pd.read_csv(trainfile)  test = pd.read_csv(testfile)  #names = cols)   #.replace(to_replace ='"',value = np.nan)data = label(data)test = label(test)x_train,y_train =data.iloc[:,:-1].as_matrix(), data.iloc[:,-1].as_matrix()x_test = test.iloc[:,:].as_matrix()y_test=Nonereturn x_train,y_train, x_test,y_testdef save(result):result = convertor.inverse_transform(result)dataframe = pd.DataFrame({'RISK':result})dataframe.to_csv('credit_risk_pred.csv',index=False,sep=',')def predict(model=MODEL):        predictor = model()x_train,y_train,x_test,_ = getData()predictor.fit(x_train,y_train)res = predictor.predict(x_test)save(res)if __name__=='__main__':predict()

参考资料

[1] : 数据预处理中的数据编码问题 | python 数据挖掘思考笔记 (2)
[2] : sklearn.preprocessing.LabelEncode
[3] : sklearn: 选择正确的模型
[4] : 利用 Scikit Learn 的 Python 数据预处理实战指南

这篇关于实验楼21期--机器学习--信用卡持卡人风险预测的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/333175

相关文章

Python的Darts库实现时间序列预测

《Python的Darts库实现时间序列预测》Darts一个集统计、机器学习与深度学习模型于一体的Python时间序列预测库,本文主要介绍了Python的Darts库实现时间序列预测,感兴趣的可以了解... 目录目录一、什么是 Darts?二、安装与基本配置安装 Darts导入基础模块三、时间序列数据结构与

Unity新手入门学习殿堂级知识详细讲解(图文)

《Unity新手入门学习殿堂级知识详细讲解(图文)》Unity是一款跨平台游戏引擎,支持2D/3D及VR/AR开发,核心功能模块包括图形、音频、物理等,通过可视化编辑器与脚本扩展实现开发,项目结构含A... 目录入门概述什么是 UnityUnity引擎基础认知编辑器核心操作Unity 编辑器项目模式分类工程

Python学习笔记之getattr和hasattr用法示例详解

《Python学习笔记之getattr和hasattr用法示例详解》在Python中,hasattr()、getattr()和setattr()是一组内置函数,用于对对象的属性进行操作和查询,这篇文章... 目录1.getattr用法详解1.1 基本作用1.2 示例1.3 原理2.hasattr用法详解2.

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

Android学习总结之Java和kotlin区别超详细分析

《Android学习总结之Java和kotlin区别超详细分析》Java和Kotlin都是用于Android开发的编程语言,它们各自具有独特的特点和优势,:本文主要介绍Android学习总结之Ja... 目录一、空安全机制真题 1:Kotlin 如何解决 Java 的 NullPointerExceptio

重新对Java的类加载器的学习方式

《重新对Java的类加载器的学习方式》:本文主要介绍重新对Java的类加载器的学习方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1、介绍1.1、简介1.2、符号引用和直接引用1、符号引用2、直接引用3、符号转直接的过程2、加载流程3、类加载的分类3.1、显示

Java学习手册之Filter和Listener使用方法

《Java学习手册之Filter和Listener使用方法》:本文主要介绍Java学习手册之Filter和Listener使用方法的相关资料,Filter是一种拦截器,可以在请求到达Servl... 目录一、Filter(过滤器)1. Filter 的工作原理2. Filter 的配置与使用二、Listen

Java进阶学习之如何开启远程调式

《Java进阶学习之如何开启远程调式》Java开发中的远程调试是一项至关重要的技能,特别是在处理生产环境的问题或者协作开发时,:本文主要介绍Java进阶学习之如何开启远程调式的相关资料,需要的朋友... 目录概述Java远程调试的开启与底层原理开启Java远程调试底层原理JVM参数总结&nbsMbKKXJx

Java深度学习库DJL实现Python的NumPy方式

《Java深度学习库DJL实现Python的NumPy方式》本文介绍了DJL库的背景和基本功能,包括NDArray的创建、数学运算、数据获取和设置等,同时,还展示了如何使用NDArray进行数据预处理... 目录1 NDArray 的背景介绍1.1 架构2 JavaDJL使用2.1 安装DJL2.2 基本操

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert