(八)Pandas窗口数据与数据读写 学习简要笔记 #Python #CDA学习打卡

2024-04-19 06:36

本文主要是介绍(八)Pandas窗口数据与数据读写 学习简要笔记 #Python #CDA学习打卡,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一. 窗口数据(Window Functions)

Pandas提供了窗口函数(Window Functions)用于在数据上执行滑动窗口操作,可以对数据进行滚动计算、滑动统计等操作。需要注意的是,在使用窗口函数时,需要根据实际需求选择合适的窗口大小和窗口函数,并确保数据的顺序和窗口大小的一致性。本文主要介绍滚动计算函数,以下是一些常用操作和示例代码。

1)滚动计算函数简介

滚动计算(Rolling Calculation)是一种数据处理技术,它在时间序列数据或数据框中执行基于移动窗口的计算。为了提升数据的准确性,将某个点的取值扩大到包含这个点的一段区间,用区间来进行判断,这个区间就是窗口。移动窗口就是窗口向一端滑行,默认是从右往左,每次滑行并不是区间整块的滑行,而是一个单位一个单位的滑行。

滚动统计函数rolling()又叫移动窗口函数,此函数可以应用于一系列数据,指定参数window=n,并在其上调用适合的统计函数。在Pandas中,要使用rolling方法,首先需要创建一个rolling对象。rolling对象可以应用于数据框的列,它表示一个窗口,用于滚动计算。

rolling_obj = df['column_name'].rolling(window=window_size)

其中:

  • df['column_name'] 是数据框列的选择,表示我们要在哪个列上执行滚动计算。
  • window_size 是窗口的大小,用于定义滚动窗口的大小。

滑动统计函数表达方式为:

rolling(window, min_periods=None, center=False, win_type=None, on=None, axis=0, closed=None)

其中参数包括:

  • window:可选参数,表示时间窗的大小,注意有两种形式(int或offset)。如果使用int,则数值表示计算统计量的观测值的数量即向前几个数据,如果是offset类型,表示时间窗的大小。
  • min_periods:每个窗口最少包含的观测值数量,小于这个值的窗口结果为NaN,用于处理边界效应。值可以是int,默认None,offset情况下,默认为1。
  • center:把窗口的标签设置为居中。布尔型,默认False,居右
  • win_type:窗口的类型,如矩形窗口或指数加权窗口。截取窗的各种函数,字符串类型,默认为None.
  • on:可选参数,对于dataframe而言,指定要计算滚动窗口的列,值为列名。
  • axis:int、字符串,默认为0,即对列进行计算
  • closed:定义区间的开闭,支持int类型的window。对于offset类型默认是左开右闭,默认为right,可以根据情况指定为left、both等。

2)滚动计算函数常用方法

滚动计算函数常用方法包括:

  • rolling_count():计算各个窗口中非NA观测值的数量
  • rolling_sum():计算各个移动窗口中的元素之和(按列计算)
  • rolling_mean():计算各个移动窗口中元素的均值
  • rolling_median():计算各个移动窗口中元素的中位数
  • rolling_var():计算各个移动窗口中元素的方差
  • rolling_std():计算各个移动窗口中元素的标准差
  • rolling_min():计算各个移动窗口中元素的最小值
  • rolling_max():计算各个移动窗口中元素的最大值
  • rolling_corr():计算各个移动窗口中元素的相关系数
  • rolling_corr_pairwise():计算各个移动窗口中配对数据的相关系数
  • rolling_cov():计算各个移动窗口中元素的的协方差
  • rolling_quantile():计算各个移动窗口中元素的分位数
  • rolling_skew():计算样本值的偏度(三阶矩)
  • rolling_kurt():计算样本值的峰度(四阶矩)

下面只详细介绍六个方法:

(a)移动平均值(Moving Average)

window=3表示窗口大小为3,即计算每3个数据的平均值。

(b)滚动求和(Rolling Sum)

window=5表示窗口大小为5,即计算每5个数据的和。

(c)滚动最大值(Rolling Maximum)

window=7表示窗口大小为7,即计算每7个数据的最大值。

(d)滚动最小值(Rolling Minimum)

window=7表示窗口大小为7,即计算每7个数据的最小值。

(e)滚动标准差(Rolling Standard Deviation)

window=5表示窗口大小为5,即计算每5个数据的标准差。

(f)自定义窗口函数:rolling().apply()方法

custom_function是自定义的窗口函数,data是窗口中的数据,result是窗口函数的计算结果。

二. 数据读写

Pandas提供了多种读取数据的方法,包括读取CSV、Ecel、SQL数据库等。

1)CSV

(a)写出csv文件

(b)读入刚写出的文件

2)EXCEL

(a)写出excel文件

(b)读取excel文件

3)HDF

(a)写出hdf文件

(b)读入刚刚写出的文件

4)SQL

(a)写出到mysql里

(b)读入刚列写出的文件

这篇关于(八)Pandas窗口数据与数据读写 学习简要笔记 #Python #CDA学习打卡的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/916819

相关文章

SpringBoot集成Milvus实现数据增删改查功能

《SpringBoot集成Milvus实现数据增删改查功能》milvus支持的语言比较多,支持python,Java,Go,node等开发语言,本文主要介绍如何使用Java语言,采用springboo... 目录1、Milvus基本概念2、添加maven依赖3、配置yml文件4、创建MilvusClient

python logging模块详解及其日志定时清理方式

《pythonlogging模块详解及其日志定时清理方式》:本文主要介绍pythonlogging模块详解及其日志定时清理方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录python logging模块及日志定时清理1.创建logger对象2.logging.basicCo

Python如何自动生成环境依赖包requirements

《Python如何自动生成环境依赖包requirements》:本文主要介绍Python如何自动生成环境依赖包requirements问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑... 目录生成当前 python 环境 安装的所有依赖包1、命令2、常见问题只生成当前 项目 的所有依赖包1、

如何将Python彻底卸载的三种方法

《如何将Python彻底卸载的三种方法》通常我们在一些软件的使用上有碰壁,第一反应就是卸载重装,所以有小伙伴就问我Python怎么卸载才能彻底卸载干净,今天这篇文章,小编就来教大家如何彻底卸载Pyth... 目录软件卸载①方法:②方法:③方法:清理相关文件夹软件卸载①方法:首先,在安装python时,下

python uv包管理小结

《pythonuv包管理小结》uv是一个高性能的Python包管理工具,它不仅能够高效地处理包管理和依赖解析,还提供了对Python版本管理的支持,本文主要介绍了pythonuv包管理小结,具有一... 目录安装 uv使用 uv 管理 python 版本安装指定版本的 Python查看已安装的 Python

使用Python开发一个带EPUB转换功能的Markdown编辑器

《使用Python开发一个带EPUB转换功能的Markdown编辑器》Markdown因其简单易用和强大的格式支持,成为了写作者、开发者及内容创作者的首选格式,本文将通过Python开发一个Markd... 目录应用概览代码结构与核心组件1. 初始化与布局 (__init__)2. 工具栏 (setup_t

Python中局部变量和全局变量举例详解

《Python中局部变量和全局变量举例详解》:本文主要介绍如何通过一个简单的Python代码示例来解释命名空间和作用域的概念,它详细说明了内置名称、全局名称、局部名称以及它们之间的查找顺序,文中通... 目录引入例子拆解源码运行结果如下图代码解析 python3命名空间和作用域命名空间命名空间查找顺序命名空

Python如何将大TXT文件分割成4KB小文件

《Python如何将大TXT文件分割成4KB小文件》处理大文本文件是程序员经常遇到的挑战,特别是当我们需要把一个几百MB甚至几个GB的TXT文件分割成小块时,下面我们来聊聊如何用Python自动完成这... 目录为什么需要分割TXT文件基础版:按行分割进阶版:精确控制文件大小完美解决方案:支持UTF-8编码

基于Python打造一个全能文本处理工具

《基于Python打造一个全能文本处理工具》:本文主要介绍一个基于Python+Tkinter开发的全功能本地化文本处理工具,它不仅具备基础的格式转换功能,更集成了中文特色处理等实用功能,有需要的... 目录1. 概述:当文本处理遇上python图形界面2. 功能全景图:六大核心模块解析3.运行效果4. 相

SpringValidation数据校验之约束注解与分组校验方式

《SpringValidation数据校验之约束注解与分组校验方式》本文将深入探讨SpringValidation的核心功能,帮助开发者掌握约束注解的使用技巧和分组校验的高级应用,从而构建更加健壮和可... 目录引言一、Spring Validation基础架构1.1 jsR-380标准与Spring整合1