Python办公自动化 获取文本数据 支持多种类型文件

2024-08-30 04:28

本文主要是介绍Python办公自动化 获取文本数据 支持多种类型文件,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

学好办公自动化,走遍天下都不怕!!

        前面我们已经学习了,如何用python的下载安装以及入门基础知识,并且也知道如何使用python自动处理Excel文件数据、如何批量生成Word文件、如何对数据分析后生成洞察报告、如何用python实现自动发送包含附件的邮件等。

        今天我们主要学习python如何获取文本数据,比如获取word文件以及pdf文件的文本转换成txt类型的文件,为了方便使用,对代码进行封装,支持多种文件类型的工具。有问题请在评论区留言交流,谢谢。

目录

1. 安装下载以及导入

2.代码实现

3.运行结果

3.1 遇到一个问题

4.总结


1. 安装下载以及导入

需要的包文件都在下面了

# 导入需要的包和文件
import os,fnmatch
from win32com import client as wc
from win32com.client import Dispatch

2.代码实现

目前程序支持 doc | docx | pdf 文件类型。

1.根据文件的地址切分后得到文件的路径和文件名称

2.根据文件的后缀名生成新的txt后缀的文件名

3.设置新的保存路径 4.加载文本提取的处理程序 5.保存文件

#定义方法
#文件转换成txt文件,该方法两个参数:
#1.文件路径 需要转换的文件地址 2.保存路径 转换成txt文件之后保存的地址
def FilesToText(filePath,savePath=''):# 1.切分文件路径为文件目录和文件名dirs,filename = os.path.split(filePath)# print(dirs,'\n',filename)# return# 2.修改切分后文件的后缀typename= os.path.splitext(filename)[-1].lower() #获取文件后缀new_name = TranType(filename,typename)# print(typename,new_name)# 3.设置新的文件保存路径if savePath == '':savePath = dirselse:savePath = savePathnewtxtPath = os.path.join(savePath,new_name)# print('!!!!',newtxtPath)   # 4.加载文本提取的处理程序,word 转换 txtwordapp = wc.Dispatch('Word.Application')mytxt = wordapp.Documents.Open(filePath) print(filePath)  print(wordapp,'\n',mytxt)# 5.保存文本信息mytxt.SaveAs(newtxtPath,4) # 参数4代表抽取文本mytxt.Close()def TranType(filename,typename):new_name = ''if typename == '.pdf':if fnmatch.fnmatch(filename,'*.pdf'):new_name = filename[:-4]+'.txt'else:returnelif typename == '.doc' or '.docx':if fnmatch.fnmatch(filename,'*.doc'):new_name = filename[:-4]+'.txt'elif fnmatch.fnmatch(filename,'*.docx'):new_name = filename[:-5]+'.txt'            else:returnelse:print('转换失败 格式不正确无法转换')returnreturn new_nameif __name__=='__main__':filePath1 = os.path.abspath(r'../demo/file/年终总结模板.doc') filePath2 = os.path.abspath(r'../demo/file/2024年终总结模板.docx') filePath3 = os.path.abspath(r'2023项目汇报.pdf') FilesToText(filePath2)  

3.运行结果

现在我们运行项目,我们分别拿doc和docx文件、pdf文件做测试,看是否能转换成txt文件。

D:\CODE\VSCODE\python\demo> python wordtotxt.py

 

 可以看到docx和doc文件分别生成了对应的txt文件。

3.1 遇到一个问题

但是在执行pdf文件的时候出现了一个问题,Documents.Open()返回结果为none,代码以及报错截图如下图所示,经过查找filePath也是有数据的,wordapp也是有数据的,就是执行结果mytxt是none,但是执行的时候pdf文件是自动打开的,文件路径也没有问题。

 

如果小伙伴有遇到相同的问题以及解决方案,麻烦评论区留言分享一下,感谢。 

4.总结

本篇文章主要介绍了,后缀doc和docx结尾的word文件、pdf文件如何通过python转换成txt文件。

首先需要安装下载导入包、代码实现文件类型转换、最终实现文件类型的转换。

这篇关于Python办公自动化 获取文本数据 支持多种类型文件的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1119788

相关文章

Python MySQL如何通过Binlog获取变更记录恢复数据

《PythonMySQL如何通过Binlog获取变更记录恢复数据》本文介绍了如何使用Python和pymysqlreplication库通过MySQL的二进制日志(Binlog)获取数据库的变更记录... 目录python mysql通过Binlog获取变更记录恢复数据1.安装pymysqlreplicat

利用Python编写一个简单的聊天机器人

《利用Python编写一个简单的聊天机器人》这篇文章主要为大家详细介绍了如何利用Python编写一个简单的聊天机器人,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 使用 python 编写一个简单的聊天机器人可以从最基础的逻辑开始,然后逐步加入更复杂的功能。这里我们将先实现一个简单的

Linux使用dd命令来复制和转换数据的操作方法

《Linux使用dd命令来复制和转换数据的操作方法》Linux中的dd命令是一个功能强大的数据复制和转换实用程序,它以较低级别运行,通常用于创建可启动的USB驱动器、克隆磁盘和生成随机数据等任务,本文... 目录简介功能和能力语法常用选项示例用法基础用法创建可启动www.chinasem.cn的 USB 驱动

基于Python开发电脑定时关机工具

《基于Python开发电脑定时关机工具》这篇文章主要为大家详细介绍了如何基于Python开发一个电脑定时关机工具,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录1. 简介2. 运行效果3. 相关源码1. 简介这个程序就像一个“忠实的管家”,帮你按时关掉电脑,而且全程不需要你多做

Python实现高效地读写大型文件

《Python实现高效地读写大型文件》Python如何读写的是大型文件,有没有什么方法来提高效率呢,这篇文章就来和大家聊聊如何在Python中高效地读写大型文件,需要的可以了解下... 目录一、逐行读取大型文件二、分块读取大型文件三、使用 mmap 模块进行内存映射文件操作(适用于大文件)四、使用 pand

python实现pdf转word和excel的示例代码

《python实现pdf转word和excel的示例代码》本文主要介绍了python实现pdf转word和excel的示例代码,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价... 目录一、引言二、python编程1,PDF转Word2,PDF转Excel三、前端页面效果展示总结一

Python xmltodict实现简化XML数据处理

《Pythonxmltodict实现简化XML数据处理》Python社区为提供了xmltodict库,它专为简化XML与Python数据结构的转换而设计,本文主要来为大家介绍一下如何使用xmltod... 目录一、引言二、XMLtodict介绍设计理念适用场景三、功能参数与属性1、parse函数2、unpa

Python中使用defaultdict和Counter的方法

《Python中使用defaultdict和Counter的方法》本文深入探讨了Python中的两个强大工具——defaultdict和Counter,并详细介绍了它们的工作原理、应用场景以及在实际编... 目录引言defaultdict的深入应用什么是defaultdictdefaultdict的工作原理

C#实现获取电脑中的端口号和硬件信息

《C#实现获取电脑中的端口号和硬件信息》这篇文章主要为大家详细介绍了C#实现获取电脑中的端口号和硬件信息的相关方法,文中的示例代码讲解详细,有需要的小伙伴可以参考一下... 我们经常在使用一个串口软件的时候,发现软件中的端口号并不是普通的COM1,而是带有硬件信息的。那么如果我们使用C#编写软件时候,如

Python中@classmethod和@staticmethod的区别

《Python中@classmethod和@staticmethod的区别》本文主要介绍了Python中@classmethod和@staticmethod的区别,文中通过示例代码介绍的非常详细,对大... 目录1.@classmethod2.@staticmethod3.例子1.@classmethod