用pandas轻松搞定数据探索性分析(pandas参数、pandas风格、pandas-profiling)

2023-12-24 17:08

本文主要是介绍用pandas轻松搞定数据探索性分析(pandas参数、pandas风格、pandas-profiling),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

对于每个从事和数据科学有关的人来说,大部分的时间都花在了前期的数据工作中,包括清洗、处理、探索性数据分析等。前期的工作不仅关乎数据的质量,也关乎最终模型预测效果的好坏。本文介绍一些比较冷门但效果不错的pandas方法来对数据进行初步探索,已经最后介绍一个非常方便实用的库pandas-profiling。

import pandas as pd
import numpy as np

展示全部特征列 

data = pd.read_csv('loans_2020.csv')
data.head()

首先我们看到,对于一些比较大型的数据集导入时,会像上图这样将特征缩略,不能很好地直观看到所有的特征,那么此时可以将pandas的设置更改一下:

pd.set_option('display.max_columns', None)
data.head()

其中None可以改为你想要展示的具体最大列数。

展示单元格的全部内容

data1 = pd.DataFrame({'name': ['O'*80, 'X'*80]})
data1

像上图中如果一个单元格内的内容太多可能会缩略掉,若想展示全部内容的话也可以通过pandas设置来改变:

pd.set_option('display.max_colwidth', None)
data1

改变单元格中的浮点数位数

data2 = pd.DataFrame(np.random.randn(8, 5))
data2

pandas的单元格内浮点数默认为六位,我们可以通过pandas的设置来改变浮点数的位数:

pd.set_option('display.precision', 3)
data2

重置pandas设置

比如我们想要将上面的浮点数设置还原成原来的六位,那我们可以通过reset_option:

pd.reset_option('display.precision')
data2


改变单元格中浮点数的格式

pd.set_option('display.float_format', '{:.2%}'.format)
data2

还可以通过format的方法对不同的列进行不同的改变格式,首先创建一个分组数据:

pd.reset_option('display.float_format')
data.groupby('grade')['installment'].agg(['mean', 'sum', 'count']).reset_index()

然后通过.style.format的方法:

data.groupby('grade')['installment'].agg(['mean', 'sum', 'count']).reset_index().style.format({'mean':'${0:,.2f}', 'sum':'${0:,.2f}'})

 

用色条显示出列中的最大值与最小值

然后我们再尝试加入新的一列:

group_data = data.groupby('grade')['installment'].agg(['mean', 'sum', 'count']).reset_index()
group_data['count_%'] = group_data['count']/data['installment'].count()
group_data

format_dict = {'mean':'${0:,.2f}', 'sum': '${0:,.0f}', 'count_%': '{:.2%}'}(group_data.style.format(format_dict).highlight_max(subset='count_%', color='red').highlight_min(subset='count_%' ,color='lightgreen'))

 

用渐变色块展示列中数值的大小

(group_data.style.format(format_dict).background_gradient(subset=['mean', 'sum'], cmap='BuGn'))

在dataframe中我们还可以使用柱状图来展示:

(group_data.style.format(format_dict).bar(color='lightblue', vmin=0, subset=['mean'], align='left').bar(color='lightgreen', vmin=0, subset=['sum'], align='left'))

 

一行代码展示数据探索性分析

利用pandas-profiling库我们可以非常便捷有效地对pandas数据进行初步探索性分析。

首先是安装方法:

# 注意是“-”而不是“_”
pip install pandas-profiling
# 清华源
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple pandas-profiling
from pandas_profiling import ProfileReport
# 两种方法,ProfileReport(data)或者下面这种
data.profile_report()

经过片刻等待后,一份清晰完整的数据探索性分析报告就展示在我们面前了,包括每个特征的属性与分布,一些警告,特征之间的相关性,以及对缺失值的统计等。 

 


数据集与代码可关注公众号“数据科学与人工智能技术”并发送“探索性分析”获取。

 

这篇关于用pandas轻松搞定数据探索性分析(pandas参数、pandas风格、pandas-profiling)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/532481

相关文章

python处理带有时区的日期和时间数据

《python处理带有时区的日期和时间数据》这篇文章主要为大家详细介绍了如何在Python中使用pytz库处理时区信息,包括获取当前UTC时间,转换为特定时区等,有需要的小伙伴可以参考一下... 目录时区基本信息python datetime使用timezonepandas处理时区数据知识延展时区基本信息

Qt实现网络数据解析的方法总结

《Qt实现网络数据解析的方法总结》在Qt中解析网络数据通常涉及接收原始字节流,并将其转换为有意义的应用层数据,这篇文章为大家介绍了详细步骤和示例,感兴趣的小伙伴可以了解下... 目录1. 网络数据接收2. 缓冲区管理(处理粘包/拆包)3. 常见数据格式解析3.1 jsON解析3.2 XML解析3.3 自定义

SpringMVC 通过ajax 前后端数据交互的实现方法

《SpringMVC通过ajax前后端数据交互的实现方法》:本文主要介绍SpringMVC通过ajax前后端数据交互的实现方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价... 在前端的开发过程中,经常在html页面通过AJAX进行前后端数据的交互,SpringMVC的controll

Pandas透视表(Pivot Table)的具体使用

《Pandas透视表(PivotTable)的具体使用》透视表用于在数据分析和处理过程中进行数据重塑和汇总,本文就来介绍一下Pandas透视表(PivotTable)的具体使用,感兴趣的可以了解一下... 目录前言什么是透视表?使用步骤1. 引入必要的库2. 读取数据3. 创建透视表4. 查看透视表总结前言

pandas中位数填充空值的实现示例

《pandas中位数填充空值的实现示例》中位数填充是一种简单而有效的方法,用于填充数据集中缺失的值,本文就来介绍一下pandas中位数填充空值的实现,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是中位数填充?为什么选择中位数填充?示例数据结果分析完整代码总结在数据分析和机器学习过程中,处理缺失数

Pandas使用AdaBoost进行分类的实现

《Pandas使用AdaBoost进行分类的实现》Pandas和AdaBoost分类算法,可以高效地进行数据预处理和分类任务,本文主要介绍了Pandas使用AdaBoost进行分类的实现,具有一定的参... 目录什么是 AdaBoost?使用 AdaBoost 的步骤安装必要的库步骤一:数据准备步骤二:模型

Pandas统计每行数据中的空值的方法示例

《Pandas统计每行数据中的空值的方法示例》处理缺失数据(NaN值)是一个非常常见的问题,本文主要介绍了Pandas统计每行数据中的空值的方法示例,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是空值?为什么要统计空值?准备工作创建示例数据统计每行空值数量进一步分析www.chinasem.cn处

使用Pandas进行均值填充的实现

《使用Pandas进行均值填充的实现》缺失数据(NaN值)是一个常见的问题,我们可以通过多种方法来处理缺失数据,其中一种常用的方法是均值填充,本文主要介绍了使用Pandas进行均值填充的实现,感兴趣的... 目录什么是均值填充?为什么选择均值填充?均值填充的步骤实际代码示例总结在数据分析和处理过程中,缺失数

如何使用 Python 读取 Excel 数据

《如何使用Python读取Excel数据》:本文主要介绍使用Python读取Excel数据的详细教程,通过pandas和openpyxl,你可以轻松读取Excel文件,并进行各种数据处理操... 目录使用 python 读取 Excel 数据的详细教程1. 安装必要的依赖2. 读取 Excel 文件3. 读

SpringBoot请求参数接收控制指南分享

《SpringBoot请求参数接收控制指南分享》:本文主要介绍SpringBoot请求参数接收控制指南,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录Spring Boot 请求参数接收控制指南1. 概述2. 有注解时参数接收方式对比3. 无注解时接收参数默认位置