Pandas实战案例 | 冷空气活动寒潮级别分类

2024-01-15 20:40

本文主要是介绍Pandas实战案例 | 冷空气活动寒潮级别分类,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

前言

本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理。

PS:如有需要Python学习资料的小伙伴可以加点击下方链接自行获取

python免费学习资料以及群交流解答点击即可加入


大家好,今天介绍如何把基础函数groupby和diff方法通过复杂而清晰逻辑去解决令人头大的需求,优雅~
目录:

  • 需求分析
  • 读取数据
  • 拿一个分组进行测试
  • 获取满足寒潮定义条件的对应数据id
  • 分组编号生成器
  • 测试对所有站计算寒潮
  • 测试所有寒潮级别
  • 完整代码

需求分析

寒潮的定义:

 

数据的输入和输出格式:

 

统计口径确认:

 

我一开始不理解,24小时内降温幅度大于8度如何计算,与需求方确认后,可以通过2日温度之差来计算。同样48小时内降温幅度可以用3日温度之差来代表,72小时内降温幅度可以用4日温度之差来代表,需求方的解释:

 

好了,理解清楚了需求,咱们就可以开始干活了:

读取数据

首先读取数据:

import pandas as pd
import numpy as npdf = pd.read_csv("data.csv")
df

结果:

 

拿一个分组进行测试

取出某个分组,用于测试:

tmp = df.groupby('number').get_group('e332')
tmp

结果:

 

获取满足寒潮定义条件的对应数据id

 

上图的极端情况显示,三大满足条件的id可能出现重复的情况,所以我使用了set这个无序不重复集合来保存id:

cold_wave_idxs = set()
# 获取2天内降温幅度超过8对应的数据id
ids = tmp.index[tmp.temperature.diff(-1) >= 8].values
cold_wave_idxs.update(ids)
cold_wave_idxs.update(ids+1)
# 获取3天内降温幅度超过10对应的数据id
ids = tmp.index[tmp.temperature.diff(-2) >= 10].values
cold_wave_idxs.update(ids)
cold_wave_idxs.update(ids+1)
cold_wave_idxs.update(ids+2)
# 获取4天内降温幅度超过12对应的数据id
ids = tmp.index[tmp.temperature.diff(-3) >= 12].values
cold_wave_idxs.update(ids)
cold_wave_idxs.update(ids+1)
cold_wave_idxs.update(ids+2)
cold_wave_idxs.update(ids+3)
# 排序并转换成列表
cold_wave_idxs = sorted(cold_wave_idxs)
print(cold_wave_idxs)

结果:

[11928, 11929, 11930, 11931, 11939, 11940, 11949, 11950, 11951, 11952, 11955, 11956, 11957, 11958, 12007, 12008, 12154, 12155, 12192, 12193, 12201, 12202, 12203, 12223, 12224, 12225, 12228, 12229, 12230]
上述代码中cold_wave_idxs.update(ids+1)表示,把ids列表里每个id的后一个id也添加到最终列表里,利用了numpy数组广播变量的特性,+2和+3也是同理。

上述结果就是从站码为'e332'的分组中计算出满足寒潮定义的对应数据id。

从结果可以看出,凡是连续的id都可以看作一个寒潮的过程,所以现在我们需要将每个寒潮过程都分为一组,为了作这样的分组,我发明了一种分组编号生成器的写法,下面已经封装成了一个方法:

分组编号生成器

def generate_group_num(values, diff=1):group_ids = []group_id = 0last_v = 0for value in values:if value-last_v > diff:group_id += 1group_ids.append(group_id)last_v = valuereturn group_ids

上面的方法实现了一个分组编号生成器,对于一段序列凡是连续的数字都会给一个相同的分组编号。

测试一下分组效果:

for i, cold_wave_idx_serial in pd.Series(cold_wave_idxs).groupby(generate_group_num(cold_wave_idxs)):cold_wave_idx_serial = cold_wave_idx_serial.valuesprint(cold_wave_idx_serial)

结果:

[11928 11929 11930 11931]
[11939 11940]
[11949 11950 11951 11952]
[11955 11956 11957 11958]
[12007 12008]
[12154 12155]
[12192 12193]
[12201 12202 12203]
[12223 12224 12225]
[12228 12229 12230]

从结果可以看到,凡是连续的序列都分到了一组,不是连续的序列就没有分到一组。

测试对所有站计算寒潮

首先将前面的测试好的用于获取满足寒潮定义的id的过程封装成方法:

def get_cold_wave_idxs(df, cold_wave_level=(8, 10, 12)):cold_wave_idxs = set()ids = df.index[df.temperature.diff(-1) >= cold_wave_level[0]].valuescold_wave_idxs.update(ids)cold_wave_idxs.update(ids+1)ids = df.index[df.temperature.diff(-2) >= cold_wave_level[1]].valuescold_wave_idxs.update(ids)cold_wave_idxs.update(ids+1)cold_wave_idxs.update(ids+2)ids = df.index[df.temperature.diff(-3) >= cold_wave_level[2]].valuescold_wave_idxs.update(ids)cold_wave_idxs.update(ids+1)cold_wave_idxs.update(ids+2)cold_wave_idxs.update(ids+3)return sorted(cold_wave_idxs)

然后运行:

cold_wave_result = []for number, tmp in df.groupby('number'):cold_wave_idxs = get_cold_wave_idxs(tmp, (8, 10, 12))for i, cold_wave_idx_serial in pd.Series(cold_wave_idxs).groupby(generate_group_num(cold_wave_idxs)):cold_wave_idx_serial = cold_wave_idx_serial.valuesstart_id, end_id = cold_wave_idx_serial[0], cold_wave_idx_serial[-1]#  假如最低温度小于4度,则说明满足全部条件if tmp.loc[end_id, 'temperature'] <= 4:cold_wave_result.append((number, tmp.loc[start_id, 'date'], tmp.loc[end_id, 'date'],tmp.loc[start_id, 'temperature'], tmp.loc[end_id, 'temperature'],end_id-start_id+1,tmp.loc[start_id, 'temperature'] -tmp.loc[end_id, 'temperature'],'寒潮'))
cold_wave_result = pd.DataFrame(cold_wave_result, columns=['站号', '开始日期', '结束日期', '开始温度', '结束温度',  '寒潮天数', '温度差', '寒潮类型'])
cold_wave_result

结果:


感觉没啥问题。

 

所有寒潮级别都测试一下:

测试所有寒潮级别

cold_wave_all = [{'cold_wave_temperature_diffs': (8, 10, 12),'min_temperature_limit': 4,'cold_wave_type': '寒潮'},{'cold_wave_temperature_diffs': (10, 12, 14),'min_temperature_limit': 2,'cold_wave_type': '强寒潮'},{'cold_wave_temperature_diffs': (12, 14, 16),'min_temperature_limit': 0,'cold_wave_type': '超强寒潮'}
]
cold_wave_result = []for number, tmp in df.groupby('number'):for cold_wave_dict in cold_wave_all:cold_wave_idxs = get_cold_wave_idxs(tmp, cold_wave_dict['cold_wave_temperature_diffs'])if len(cold_wave_idxs) < 2:continuefor i, cold_wave_idx_serial in pd.Series(cold_wave_idxs).groupby(generate_group_num(cold_wave_idxs)):cold_wave_idx_serial = cold_wave_idx_serial.valuesstart_id, end_id = cold_wave_idx_serial[0], cold_wave_idx_serial[-1]#  假如最低温度小于指定度数,则说明满足全部条件if tmp.loc[end_id, 'temperature'] <= cold_wave_dict['min_temperature_limit']:cold_wave_result.append((number, tmp.loc[start_id, 'date'], tmp.loc[end_id, 'date'],tmp.loc[start_id, 'temperature'], tmp.loc[end_id, 'temperature'],end_id-start_id+1,tmp.loc[start_id, 'temperature'] - tmp.loc[end_id, 'temperature'],cold_wave_dict['cold_wave_type']))
cold_wave_result = pd.DataFrame(cold_wave_result, columns=['站号', '开始日期', '结束日期', '开始温度', '结束温度',  '寒潮天数', '温度差', '寒潮类型'])
cold_wave_result

结果:


暂时也未发现错误。那么整理一下最终代码吧:

 

完整代码

import pandas as pd
import numpy as npdef generate_group_num(values, diff=1):group_ids = []group_id = 0last_v = 0for value in values:if value-last_v > diff:group_id += 1group_ids.append(group_id)last_v = valuereturn group_idsdef get_cold_wave_idxs(df, cold_wave_level=(8, 10, 12)):cold_wave_idxs = set()ids = df.index[df.temperature.diff(-1) >= cold_wave_level[0]].valuescold_wave_idxs.update(ids)cold_wave_idxs.update(ids+1)ids = df.index[df.temperature.diff(-2) >= cold_wave_level[1]].valuescold_wave_idxs.update(ids)cold_wave_idxs.update(ids+1)cold_wave_idxs.update(ids+2)ids = df.index[df.temperature.diff(-3) >= cold_wave_level[2]].valuescold_wave_idxs.update(ids)cold_wave_idxs.update(ids+1)cold_wave_idxs.update(ids+2)cold_wave_idxs.update(ids+3)return sorted(cold_wave_idxs)df = pd.read_csv("data.csv")
cold_wave_all = [{'cold_wave_temperature_diffs': (8, 10, 12),'min_temperature_limit': 4,'cold_wave_type': '寒潮'},{'cold_wave_temperature_diffs': (10, 12, 14),'min_temperature_limit': 2,'cold_wave_type': '强寒潮'},{'cold_wave_temperature_diffs': (12, 14, 16),'min_temperature_limit': 0,'cold_wave_type': '超强寒潮'}
]
cold_wave_result = []for number, tmp in df.groupby('number'):for cold_wave_dict in cold_wave_all:cold_wave_idxs = get_cold_wave_idxs(tmp, cold_wave_dict['cold_wave_temperature_diffs'])if len(cold_wave_idxs) < 2:continuefor i, cold_wave_idx_serial in pd.Series(cold_wave_idxs).groupby(generate_group_num(cold_wave_idxs)):cold_wave_idx_serial = cold_wave_idx_serial.valuesstart_id, end_id = cold_wave_idx_serial[0], cold_wave_idx_serial[-1]#  假如最低温度小于指定度数,则说明满足全部条件if tmp.loc[end_id, 'temperature'] <= cold_wave_dict['min_temperature_limit']:cold_wave_result.append((number, tmp.loc[start_id, 'date'], tmp.loc[end_id, 'date'],tmp.loc[start_id, 'temperature'], tmp.loc[end_id, 'temperature'],end_id-start_id+1,tmp.loc[start_id, 'temperature'] - tmp.loc[end_id, 'temperature'],cold_wave_dict['cold_wave_type']))
cold_wave_result = pd.DataFrame(cold_wave_result, columns=['站号', '开始日期', '结束日期', '开始温度', '结束温度',  '寒潮天数', '温度差', '寒潮类型'])
cold_wave_result.to_excel("cold_wave.xlsx", index=False)

最终得到的结果:

这篇关于Pandas实战案例 | 冷空气活动寒潮级别分类的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/610151

相关文章

MySQL 中的 JSON 查询案例详解

《MySQL中的JSON查询案例详解》:本文主要介绍MySQL的JSON查询的相关知识,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录mysql 的 jsON 路径格式基本结构路径组件详解特殊语法元素实际示例简单路径复杂路径简写操作符注意MySQL 的 J

pandas中位数填充空值的实现示例

《pandas中位数填充空值的实现示例》中位数填充是一种简单而有效的方法,用于填充数据集中缺失的值,本文就来介绍一下pandas中位数填充空值的实现,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是中位数填充?为什么选择中位数填充?示例数据结果分析完整代码总结在数据分析和机器学习过程中,处理缺失数

Pandas使用AdaBoost进行分类的实现

《Pandas使用AdaBoost进行分类的实现》Pandas和AdaBoost分类算法,可以高效地进行数据预处理和分类任务,本文主要介绍了Pandas使用AdaBoost进行分类的实现,具有一定的参... 目录什么是 AdaBoost?使用 AdaBoost 的步骤安装必要的库步骤一:数据准备步骤二:模型

Pandas统计每行数据中的空值的方法示例

《Pandas统计每行数据中的空值的方法示例》处理缺失数据(NaN值)是一个非常常见的问题,本文主要介绍了Pandas统计每行数据中的空值的方法示例,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是空值?为什么要统计空值?准备工作创建示例数据统计每行空值数量进一步分析www.chinasem.cn处

使用Pandas进行均值填充的实现

《使用Pandas进行均值填充的实现》缺失数据(NaN值)是一个常见的问题,我们可以通过多种方法来处理缺失数据,其中一种常用的方法是均值填充,本文主要介绍了使用Pandas进行均值填充的实现,感兴趣的... 目录什么是均值填充?为什么选择均值填充?均值填充的步骤实际代码示例总结在数据分析和处理过程中,缺失数

Python Transformers库(NLP处理库)案例代码讲解

《PythonTransformers库(NLP处理库)案例代码讲解》本文介绍transformers库的全面讲解,包含基础知识、高级用法、案例代码及学习路径,内容经过组织,适合不同阶段的学习者,对... 目录一、基础知识1. Transformers 库简介2. 安装与环境配置3. 快速上手示例二、核心模

Java使用SLF4J记录不同级别日志的示例详解

《Java使用SLF4J记录不同级别日志的示例详解》SLF4J是一个简单的日志门面,它允许在运行时选择不同的日志实现,这篇文章主要为大家详细介绍了如何使用SLF4J记录不同级别日志,感兴趣的可以了解下... 目录一、SLF4J简介二、添加依赖三、配置Logback四、记录不同级别的日志五、总结一、SLF4J

Python列表去重的4种核心方法与实战指南详解

《Python列表去重的4种核心方法与实战指南详解》在Python开发中,处理列表数据时经常需要去除重复元素,本文将详细介绍4种最实用的列表去重方法,有需要的小伙伴可以根据自己的需要进行选择... 目录方法1:集合(set)去重法(最快速)方法2:顺序遍历法(保持顺序)方法3:副本删除法(原地修改)方法4:

在Spring Boot中浅尝内存泄漏的实战记录

《在SpringBoot中浅尝内存泄漏的实战记录》本文给大家分享在SpringBoot中浅尝内存泄漏的实战记录,结合实例代码给大家介绍的非常详细,感兴趣的朋友一起看看吧... 目录使用静态集合持有对象引用,阻止GC回收关键点:可执行代码:验证:1,运行程序(启动时添加JVM参数限制堆大小):2,访问 htt

关于pandas的read_csv方法使用解读

《关于pandas的read_csv方法使用解读》:本文主要介绍关于pandas的read_csv方法使用,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录pandas的read_csv方法解读read_csv中的参数基本参数通用解析参数空值处理相关参数时间处理相关