【Python Cookbook】S01E18 针对任意多的分隔符拆分字符串

2024-06-04 13:04

本文主要是介绍【Python Cookbook】S01E18 针对任意多的分隔符拆分字符串,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目录

  • 问题
  • 解决方案
  • 讨论

问题

我们需要将字符串拆分为不同的字段,但是分隔符在整个字符串中不一致,换句话说,就是有很多分隔符,该怎么办?

解决方案

字符串常用拆分方法 xxx.split() 只能处理简单情况,不支持多个分隔符。但是如果使用正则化匹配 re.split('', xxx),则可以将字符串按照多个分隔符进行拆分。

line = 'asdf fjdk; afed, fjek,asdf,  foo'
print(line.split(r' '))
import re
line = 'asdf fjdk; afed, fjek,asdf,  foo'
print(re.split(r'[;,\s]', line))

结果:

['asdf', 'fjdk', '', 'afed', '', 'fjek', 'asdf', '', '', 'foo']

但是至此,我们还应该有两个疑问,

  • 第一,为什么 \s 在字符串的 split() 中不可以,但是在正则化匹配中可以实现按照空格拆分?
  • 第二,现在正则化结果中还包含一些奇怪的元素,这些元素是什么,该怎样清除?

带着这些问题我们进入讨论。

讨论

首先,问题1:为什么 line.split(r'\s') 不能实现按空格拆分?

答: 在普通字符串中,\s 并不是代表空格,而是被解释为反斜杠 \ 和小写字母 s 的组合体 \s

test_arr = "\ask your question\s, please"
print(test_arr.split(r"\s"))

而在正则化中,\s 是一个特殊字符类,用于匹配任何空白字符,包括空格、制表符、换行符等。这是正则表达式语言的一部分,用于简化对文本模式的匹配。

总而言之,

  • 在正则表达式中:\s 表示匹配任何空白字符。
  • 在普通字符串中:' ' 表示一个空格字符,而 \s 表示反斜杠字符 \ 后跟小写字母 s

其次,问题2:为什么结果中出现 “”, 如何清除?

答: 首先,理解如下正则表达式处理结果。

test_arr = "hello,;world"
print(re.split(r"[,;]", test_arr))

结果:

# 我们希望的结果
["hello", "world"]
# 实际得到的结果
['hello', '', 'world']

出现空白字符的原因是,在字符串 test_arr 中,连续的逗号和分号视为两个分隔符,因此 re.split() 做了两次分割,将字符串拆分成如下部分:

  • “hello”:逗号之前的部分。
  • “”:逗号和分号之间的部分(没有字符)。
  • “world”:分号之后的部分。

因此,结果是 [‘hello’, ‘’, ‘world’]
但是我们怎样实现我们期望的结果呢?通过符号 +

test_arr = "hello,;world"
print(re.split(r"[,;]+", test_arr))

其结果为:

['hello', 'world']

+ 的作用,指的是匹配 re.split(pattern, arr) 模式 pattern 中所有指定的分隔符的一个或者多个符号的组合。让我们使用复杂一些的代码更多测试:

test_arr = "hello,;world,hi;child;,;test"
print(re.split(r"[,;]+", test_arr))

结果为:

['hello', 'world', 'hi', 'child', 'test']

最后,回到本题目,如果我们希望能够成功得到如

['asdf', 'fjdk', 'afed', 'fjek', 'asdf', 'foo']

的结果,根据上述内容,我们可以将 pattern 改写为

print(re.split(r'[;,\s]+', line))# 输出结果为
['asdf', 'fjdk', 'afed', 'fjek', 'asdf', 'foo']

这篇关于【Python Cookbook】S01E18 针对任意多的分隔符拆分字符串的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1030160

相关文章

Python FastAPI+Celery+RabbitMQ实现分布式图片水印处理系统

《PythonFastAPI+Celery+RabbitMQ实现分布式图片水印处理系统》这篇文章主要为大家详细介绍了PythonFastAPI如何结合Celery以及RabbitMQ实现简单的分布式... 实现思路FastAPI 服务器Celery 任务队列RabbitMQ 作为消息代理定时任务处理完整

Python Websockets库的使用指南

《PythonWebsockets库的使用指南》pythonwebsockets库是一个用于创建WebSocket服务器和客户端的Python库,它提供了一种简单的方式来实现实时通信,支持异步和同步... 目录一、WebSocket 简介二、python 的 websockets 库安装三、完整代码示例1.

揭秘Python Socket网络编程的7种硬核用法

《揭秘PythonSocket网络编程的7种硬核用法》Socket不仅能做聊天室,还能干一大堆硬核操作,这篇文章就带大家看看Python网络编程的7种超实用玩法,感兴趣的小伙伴可以跟随小编一起... 目录1.端口扫描器:探测开放端口2.简易 HTTP 服务器:10 秒搭个网页3.局域网游戏:多人联机对战4.

使用Python实现快速搭建本地HTTP服务器

《使用Python实现快速搭建本地HTTP服务器》:本文主要介绍如何使用Python快速搭建本地HTTP服务器,轻松实现一键HTTP文件共享,同时结合二维码技术,让访问更简单,感兴趣的小伙伴可以了... 目录1. 概述2. 快速搭建 HTTP 文件共享服务2.1 核心思路2.2 代码实现2.3 代码解读3.

Python使用自带的base64库进行base64编码和解码

《Python使用自带的base64库进行base64编码和解码》在Python中,处理数据的编码和解码是数据传输和存储中非常普遍的需求,其中,Base64是一种常用的编码方案,本文我将详细介绍如何使... 目录引言使用python的base64库进行编码和解码编码函数解码函数Base64编码的应用场景注意

C#数据结构之字符串(string)详解

《C#数据结构之字符串(string)详解》:本文主要介绍C#数据结构之字符串(string),具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录转义字符序列字符串的创建字符串的声明null字符串与空字符串重复单字符字符串的构造字符串的属性和常用方法属性常用方法总结摘

Python基于wxPython和FFmpeg开发一个视频标签工具

《Python基于wxPython和FFmpeg开发一个视频标签工具》在当今数字媒体时代,视频内容的管理和标记变得越来越重要,无论是研究人员需要对实验视频进行时间点标记,还是个人用户希望对家庭视频进行... 目录引言1. 应用概述2. 技术栈分析2.1 核心库和模块2.2 wxpython作为GUI选择的优

Java实现时间与字符串互相转换详解

《Java实现时间与字符串互相转换详解》这篇文章主要为大家详细介绍了Java中实现时间与字符串互相转换的相关方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、日期格式化为字符串(一)使用预定义格式(二)自定义格式二、字符串解析为日期(一)解析ISO格式字符串(二)解析自定义

Python如何使用__slots__实现节省内存和性能优化

《Python如何使用__slots__实现节省内存和性能优化》你有想过,一个小小的__slots__能让你的Python类内存消耗直接减半吗,没错,今天咱们要聊的就是这个让人眼前一亮的技巧,感兴趣的... 目录背景:内存吃得满满的类__slots__:你的内存管理小助手举个大概的例子:看看效果如何?1.

Python+PyQt5实现多屏幕协同播放功能

《Python+PyQt5实现多屏幕协同播放功能》在现代会议展示、数字广告、展览展示等场景中,多屏幕协同播放已成为刚需,下面我们就来看看如何利用Python和PyQt5开发一套功能强大的跨屏播控系统吧... 目录一、项目概述:突破传统播放限制二、核心技术解析2.1 多屏管理机制2.2 播放引擎设计2.3 专