【Python从入门到进阶】64、Pandas如何实现数据的Concat合并

2024-09-08 12:28

本文主要是介绍【Python从入门到进阶】64、Pandas如何实现数据的Concat合并,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

接上篇《63.Pandas如何实现数据的Merge》
上一篇我们学习了Pandas如何实现数据的Merge,本篇我们来继续学习Pandas如何实现数据的Concat合并。

一、引言

在数据处理过程中,经常需要将多个数据集合并为一个统一的数据集,以便进行进一步的分析或建模。这种需求在多种场景下都非常常见,比如合并不同来源的数据集以获取更全面的信息、将时间序列数据按时间顺序拼接起来以观察长期趋势等。在这些情况下,Pandas的concat函数就显得尤为重要,它是实现数据合并的主要工具之一。

在深入探讨concat函数之前,我们先快速回顾一下Pandas库的基本概念和主要功能。Pandas是一个开源的、基于NumPy的Python库,提供了高性能、易用的数据结构和数据分析工具。其核心数据结构包括DataFrame和Series。

●DataFrame:一个二维的、表格型的数据结构,可以看作是一个共享相同索引的Series的字典(或类似字典的对象)。DataFrame既有行索引也有列索引,非常适合存储和操作结构化数据。
●Series:一个一维的、长度可变的、能够保存任何数据类型(整数、字符串、浮点数、Python对象等)的数组,可以被看作是一个固定长度的有序字典。Series有一个索引(index)和一个值(value)数组。

二、Concat合并基础

1、定义与功能

pd.concat()函数是Pandas中用于合并多个Pandas对象(如DataFrame或Series)的函数。它允许用户沿着特定轴(axis)将多个对象合并成一个新的对象。这种合并可以是垂直的(沿着行,即axis=0),也可以是水平的(沿着列,即axis=1)。concat函数非常灵活,能够处理各种复杂的数据合并需求。

2、基本语法

pd.concat()函数的基本使用格式如下:

pd.concat(objs, axis=0, join='outer', ignore_index=False, keys=None, levels=None, names=None, verify_integrity=False, sort=False)

●objs:一个序列或映射的序列,其中的元素是要被合并的Pandas对象(如DataFrame或Series)。
●axis:默认为0,表示沿着行的方向(垂直方向)合并;如果设置为1,则表示沿着列的方向(水平方向)合并。
●ignore_index:默认为False,表示保留原始索引;如果为True,则重新生成一个整数索引。
●join:默认为'outer',表示使用并集的方式合并索引;'inner'表示使用交集的方式合并索引,即只保留在所有对象中都存在的索引。
●其他参数(如keys、levels、names等)提供了更高级的功能,如为合并后的对象添加层级索引等,但在此不展开详述。

通过调整这些参数,用户可以灵活地实现各种数据合并的需求。例如,可以使用ignore_index=True来避免合并后索引的重复或混乱;使用join='inner'来确保合并后的数据在每个对象中都有对应的索引。

三、实战演练:使用Concat合并数据

1. 垂直合并(行合并)

垂直合并,也称为行合并,是将多个DataFrame沿着行方向(即axis=0)合并为一个新的DataFrame。在合并过程中,索引的处理是一个关键考虑点。示例说明如何使用pd.concat()沿着axis=0合并多个DataFrame:

import pandas as pd# 创建两个DadaFrame
df1 = pd.DataFrame({'姓名': ['张三', '李四'],'年龄': [23, 34]
})df2 = pd.DataFrame({'姓名': ['王五', '赵六'],'年龄': [45, 51]
})# 使用Concat沿着axis=0合并(默认值,为行方向)
result_df = pd.concat([df1, df2])print(result_df)

效果:

合并时索引的处理:

●自动排序:默认情况下,合并后的索引是自动排序的,但如果不希望排序,可以通过在concat函数中设置sort=False来避免。
●重复索引:如果合并的DataFrame中存在重复索引,这些索引在结果DataFrame中将被保留。这可能导致后续处理时出现混淆。
●ignore_index参数的使用:通过设置ignore_index=True,可以在合并时忽略原始索引,并重新生成一个从0开始的整数索引。

合并后的结果及其索引变化:

# 使用ignore_index=True重新生成索引  
result_df_reset = pd.concat([df1, df2], ignore_index=True)  print(result_df_reset)

效果:

2. 水平合并(列合并)

水平合并是将多个DataFrame沿着列方向(即axis=1)合并为一个新的DataFrame。在这种合并中,列名的对齐非常重要。

示例说明如何使用axis=1参数进行水平合并:

# 创建另一个DataFrame,注意列名与df1不完全相同  
df3 = pd.DataFrame({  '籍贯': ['郑州', '商丘'],  '邮箱': ['hsdad@126.com', 'sdjfh@136.com']  
})  # 使用axis=1进行水平合并  
result_df_horizontal = pd.concat([df1, df3], axis=1)  print(result_df_horizontal)

效果:

在上述示例中,df1和df3的列名不完全相同,因此它们被简单地并排放置,形成了新的DataFrame result_df_horizontal。

列名(columns)对齐的重要性及不匹配时的处理方式:

●如果合并的DataFrame具有完全相同的列名(不包括索引列),则这些列在结果DataFrame中将被叠加。
●如果列名不匹配,则这些列将简单地并排放置,每个DataFrame的列名保持不变。
●如果需要基于某个或多个键进行列的对齐和合并(类似于SQL中的JOIN操作),则应该使用merge或join方法,而不是concat。

3. 合并Series

Series的合并与DataFrame类似,但也有一些特殊之处。
Series的合并特点:

●Series的合并同样支持垂直合并(沿着索引方向)和水平合并(通过to_frame()转换为DataFrame后再合并)。
●垂直合并时,索引的处理方式与DataFrame相同,包括索引的自动排序、重复索引的处理以及ignore_index参数的使用。
●水平合并通常需要将Series转换为DataFrame,因为Series本身不支持直接的列合并。

以下示例演示如何将多个Series垂直或水平合并:

(1)Series垂直合并
s1 = pd.Series([1, 2], index=['a', 'b'])  
s2 = pd.Series([3, 4], index=['b', 'c'])  # 垂直合并  
result_series = pd.concat([s1, s2], ignore_index=True)  print(result_series)

效果:

(2)Series水平合并(通过转换为DataFrame)
# 将Series转换为DataFrame  
df_s1 = s1.to_frame('Series1')  
df_s2 = s2.to_frame('Series2')  # 水平合并  
result_df_series = pd.concat([df_s1, df_s2], axis=1)  print(result_df_series)

效果:

在水平合并的示例中,我们首先使用to_frame()方法将Series转换为DataFrame,然后使用concat函数沿着axis=1进行合并。这样,我们就能够像合并DataFrame一样合并Series了。

四、进阶应用

1、合并时忽略某些列/行

当我们在合并DataFrame时,有时需要忽略某些列或行。这可以通过在合并之前使用drop方法删除不需要的列,或者使用条件筛选来过滤行。

(1)忽略列

假设我们有两个DataFrame,但只想合并其中的某些列:

import pandas as pd  # 创建两个DataFrame  
df1 = pd.DataFrame({  'A': [1, 2],  'B': [3, 4],  'C': [5, 6]  
})  df2 = pd.DataFrame({  'A': [7, 8],  'B': [9, 10],  'D': [11, 12]  
})  # 忽略'C'列和'D'列,只合并'A'和'B'  
df1_filtered = df1[['A', 'B']]  
df2_filtered = df2[['A', 'B']]  # 合并  
result_df = pd.concat([df1_filtered, df2_filtered])  print(result_df)

效果:

(2)忽略行

忽略行通常通过条件筛选来实现,但在合并上下文中,我们更可能是在合并后处理,或者在合并前分别处理每个DataFrame。这里展示一个合并前筛选的例子:

# 假设我们只想合并df1中'A'列大于1的行  
df1_filtered = df1[df1['A'] > 1]  # 直接与df2合并(这里不筛选df2,仅作示例)  
result_df = pd.concat([df1_filtered, df2])  print(result_df)

效果:


2、合并具有不同列的数据

当两个DataFrame的列不完全相同时,concat或merge(对于基于键的合并)可以处理这种情况。concat会简单地并排放置列,而merge会尝试基于共同列进行匹配。

# 使用concat合并(注意,非共有列将直接并排放置)  
result_concat = pd.concat([df1, df2], axis=0)  # 这里axis=0表示行合并,但为了展示列的不同,实际操作中可能需要根据需求调整  # 使用merge合并(需要基于共同列,这里以'A'为例)  
result_merge = pd.merge(df1, df2[['A', 'D']], on='A', how='outer')  print("result_concat:")
print(result_concat)
print("result_merge:")
print(result_merge)

注意:在上面的merge示例中,我们选择了outer连接方式来保留所有行,但只合并了共有的A列和df2中的D列。
效果:

3、合并多层索引的DataFrame

多层索引(MultiIndex)在Pandas中用于表示具有多个级别的索引。合并多层索引的DataFrame时,需要确保索引的对齐性。

# 创建具有多层索引的DataFrame  
index = pd.MultiIndex.from_tuples([('x', 'a'), ('x', 'b'), ('y', 'a'), ('y', 'b')], names=['level1', 'level2'])  
df_multi = pd.DataFrame({'data': [1, 2, 3, 4]}, index=index)  # 创建另一个具有相同多层索引的DataFrame  
df_multi_2 = pd.DataFrame({'data_2': [5, 6, 7, 8]}, index=index)  # 直接使用concat合并(因为索引完全相同)  
result_multi = pd.concat([df_multi, df_multi_2], axis=1)  print(result_multi)

效果:

在这个例子中,concat能够直接处理多层索引,因为两个DataFrame的索引完全相同。如果索引不完全相同,你可能需要先使用reindex、reset_index或set_index等方法来调整索引,以确保它们可以正确对齐。

至此,关于Pandas如何实现数据Concat合并的内容全部介绍完毕,下一篇我们继续学习Pandas如何批量拆分与合并Excel文件。

转载请注明出处:https://guangzai.blog.csdn.net/article/details/141712490

这篇关于【Python从入门到进阶】64、Pandas如何实现数据的Concat合并的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1148104

相关文章

使用Java将DOCX文档解析为Markdown文档的代码实现

《使用Java将DOCX文档解析为Markdown文档的代码实现》在现代文档处理中,Markdown(MD)因其简洁的语法和良好的可读性,逐渐成为开发者、技术写作者和内容创作者的首选格式,然而,许多文... 目录引言1. 工具和库介绍2. 安装依赖库3. 使用Apache POI解析DOCX文档4. 将解析

Qt中QGroupBox控件的实现

《Qt中QGroupBox控件的实现》QGroupBox是Qt框架中一个非常有用的控件,它主要用于组织和管理一组相关的控件,本文主要介绍了Qt中QGroupBox控件的实现,具有一定的参考价值,感兴趣... 目录引言一、基本属性二、常用方法2.1 构造函数 2.2 设置标题2.3 设置复选框模式2.4 是否

一文详解如何在Python中从字符串中提取部分内容

《一文详解如何在Python中从字符串中提取部分内容》:本文主要介绍如何在Python中从字符串中提取部分内容的相关资料,包括使用正则表达式、Pyparsing库、AST(抽象语法树)、字符串操作... 目录前言解决方案方法一:使用正则表达式方法二:使用 Pyparsing方法三:使用 AST方法四:使用字

C++使用printf语句实现进制转换的示例代码

《C++使用printf语句实现进制转换的示例代码》在C语言中,printf函数可以直接实现部分进制转换功能,通过格式说明符(formatspecifier)快速输出不同进制的数值,下面给大家分享C+... 目录一、printf 原生支持的进制转换1. 十进制、八进制、十六进制转换2. 显示进制前缀3. 指

springboot整合阿里云百炼DeepSeek实现sse流式打印的操作方法

《springboot整合阿里云百炼DeepSeek实现sse流式打印的操作方法》:本文主要介绍springboot整合阿里云百炼DeepSeek实现sse流式打印,本文给大家介绍的非常详细,对大... 目录1.开通阿里云百炼,获取到key2.新建SpringBoot项目3.工具类4.启动类5.测试类6.测

Python列表去重的4种核心方法与实战指南详解

《Python列表去重的4种核心方法与实战指南详解》在Python开发中,处理列表数据时经常需要去除重复元素,本文将详细介绍4种最实用的列表去重方法,有需要的小伙伴可以根据自己的需要进行选择... 目录方法1:集合(set)去重法(最快速)方法2:顺序遍历法(保持顺序)方法3:副本删除法(原地修改)方法4:

Python运行中频繁出现Restart提示的解决办法

《Python运行中频繁出现Restart提示的解决办法》在编程的世界里,遇到各种奇怪的问题是家常便饭,但是,当你的Python程序在运行过程中频繁出现“Restart”提示时,这可能不仅仅是令人头疼... 目录问题描述代码示例无限循环递归调用内存泄漏解决方案1. 检查代码逻辑无限循环递归调用内存泄漏2.

pytorch自动求梯度autograd的实现

《pytorch自动求梯度autograd的实现》autograd是一个自动微分引擎,它可以自动计算张量的梯度,本文主要介绍了pytorch自动求梯度autograd的实现,具有一定的参考价值,感兴趣... autograd是pytorch构建神经网络的核心。在 PyTorch 中,结合以下代码例子,当你

Python中判断对象是否为空的方法

《Python中判断对象是否为空的方法》在Python开发中,判断对象是否为“空”是高频操作,但看似简单的需求却暗藏玄机,从None到空容器,从零值到自定义对象的“假值”状态,不同场景下的“空”需要精... 目录一、python中的“空”值体系二、精准判定方法对比三、常见误区解析四、进阶处理技巧五、性能优化

使用Python构建一个Hexo博客发布工具

《使用Python构建一个Hexo博客发布工具》虽然Hexo的命令行工具非常强大,但对于日常的博客撰写和发布过程,我总觉得缺少一个直观的图形界面来简化操作,下面我们就来看看如何使用Python构建一个... 目录引言Hexo博客系统简介设计需求技术选择代码实现主框架界面设计核心功能实现1. 发布文章2. 加