PDF进行批量OCR文字识别并转Word文本的最优解(完全免费)

2023-10-11 08:10

本文主要是介绍PDF进行批量OCR文字识别并转Word文本的最优解(完全免费),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

       背景:公司要求将大量扫描件电子文档转化为可识别文字的word格式,以方便后续文档管理系统进行档案内容的快速检索。

      解决过程:在网上搜寻pdf批量文字识别方案,放眼望去都是各种app的广告,而且大多都要收费。经过几天的研究,终于总结出这么一套免费但准确率高的完整解决方案,总体思路也很简单,就是利用 Adobe Acrobat Pro DC的orc文字识别工具配合其自动化步骤进行批量作业。假如你还在苦恼于几乎找不到真正免费的批量pdf文字识别软件,那么这篇文章绝对可以帮到你,话不多说,直接上教程!

第一步:安装 Acrobat Pro DC

       Adobe Acrobat Pro DC 是一款强大的PDF编辑工具,具有非常全面的PDF编辑功能,重点是完全免费!这个软件网上一搜一大把,如果有需要的话可以在下方评论留言获得。

 第二步:打开动作向导

         在上方 “工具” — “自定义”   中找到 “动作向导” ,进入编辑:

        点击上方 “新建动作”:

 第三步:编辑自动化动作     

        从左侧栏中选择“使用OCR识别文本”“保存”“保存”三个工具添加到右侧,如下动作步骤:

      需要注意的是,每个步骤都是可以编辑自定义的,接下来按照需求进行更改:

      首先去掉 “使用OCR识别文本” 前面的勾,这样可以避免每次都询问用户

      然后点击第一个“保存”,将其改为“保存至本地文件夹”,然后选择你想要批量导出的目录:

      点击第一个“保存” 下方 “指定设置”,可以设置导出格式,这里选择“Word文档”

       点击第二个“保存”,将其改为“不要保存更改”,这是为了防止每次执行完一个文件都要询问是否保存:

        最后点击下方保存并自定义命名动作为“批量识别”,大功告成!

 第四步:开始进行批量识别

        设置完成后接下来就很简单了,在主页右侧动作列表中选择我们刚刚新建的自动化动作“批量识别”

        选择“添加文件夹”,选择你放有需要批量转化pdf的文件夹

        点击下方的开始,等待转化完成,之后我们便可以在第三步中选择的保存文件夹中找到转化后的word文件了。

        假如以后再需要进行类似的批量识别工作的时候都可以直接使用不需要再进行设置了,一劳永逸了属于是!

这篇关于PDF进行批量OCR文字识别并转Word文本的最优解(完全免费)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/186706

相关文章

[word] word设置上标快捷键 #学习方法#其他#媒体

word设置上标快捷键 办公中,少不了使用word,这个是大家必备的软件,今天给大家分享word设置上标快捷键,希望在办公中能帮到您! 1、添加上标 在录入一些公式,或者是化学产品时,需要添加上标内容,按下快捷键Ctrl+shift++就能将需要的内容设置为上标符号。 word设置上标快捷键的方法就是以上内容了,需要的小伙伴都可以试一试呢!

RedHat运维-Linux文本操作基础-AWK进阶

你不用整理,跟着敲一遍,有个印象,然后把它保存到本地,以后要用再去看,如果有了新东西,你自个再添加。这是我参考牛客上的shell编程专项题,只不过换成了问答的方式而已。不用背,就算是我自己亲自敲,我现在好多也记不住。 1. 输出nowcoder.txt文件第5行的内容 2. 输出nowcoder.txt文件第6行的内容 3. 输出nowcoder.txt文件第7行的内容 4. 输出nowcode

大语言模型(LLMs)能够进行推理和规划吗?

大语言模型(LLMs),基本上是经过强化训练的 n-gram 模型,它们在网络规模的语言语料库(实际上,可以说是我们文明的知识库)上进行了训练,展现出了一种超乎预期的语言行为,引发了我们的广泛关注。从训练和操作的角度来看,LLMs 可以被认为是一种巨大的、非真实的记忆库,相当于为我们所有人提供了一个外部的系统 1(见图 1)。然而,它们表面上的多功能性让许多研究者好奇,这些模型是否也能在通常需要系

vue项目集成CanvasEditor实现Word在线编辑器

CanvasEditor实现Word在线编辑器 官网文档:https://hufe.club/canvas-editor-docs/guide/schema.html 源码地址:https://github.com/Hufe921/canvas-editor 前提声明: 由于CanvasEditor目前不支持vue、react 等框架开箱即用版,所以需要我们去Git下载源码,拿到其中两个主

Python应用开发——30天学习Streamlit Python包进行APP的构建(9)

st.area_chart 显示区域图。 这是围绕 st.altair_chart 的语法糖。主要区别在于该命令使用数据自身的列和指数来计算图表的 Altair 规格。因此,在许多 "只需绘制此图 "的情况下,该命令更易于使用,但可定制性较差。 如果 st.area_chart 无法正确猜测数据规格,请尝试使用 st.altair_chart 指定所需的图表。 Function signa

基于CTPN(tensorflow)+CRNN(pytorch)+CTC的不定长文本检测和识别

转发来源:https://swift.ctolib.com/ooooverflow-chinese-ocr.html chinese-ocr 基于CTPN(tensorflow)+CRNN(pytorch)+CTC的不定长文本检测和识别 环境部署 sh setup.sh 使用环境: python 3.6 + tensorflow 1.10 +pytorch 0.4.1 注:CPU环境

百度OCR识别结构结构化处理视频

https://edu.csdn.net/course/detail/10506

气象站的种类和应用范围可以根据不同的分类标准进行详细的划分和描述

气象站的种类和应用范围可以根据不同的分类标准进行详细的划分和描述。以下是从不同角度对气象站的种类和应用范围的介绍: 一、气象站的种类 根据用途和安装环境分类: 农业气象站:专为农业生产服务,监测土壤温度、湿度等参数,为农业生产提供科学依据。交通气象站:用于公路、铁路、机场等交通场所的气象监测,提供实时气象数据以支持交通运营和调度。林业气象站:监测林区风速、湿度、温度等气象要素,为林区保护和

企业如何进行员工的网络安全意识培训?

企业网络安全意识培训的重要性         企业网络安全意识培训是提升员工网络安全素质的关键环节。随着网络技术的快速发展,企业面临的网络安全威胁日益增多,员工的网络安全意识和技能水平直接关系到企业的信息安全和业务连续性。因此,企业需要通过系统的网络安全意识培训,提高员工对网络安全的认识和防范能力,从而降低企业在面对潜在安全风险时的损失和影响。 企业网络安全意识培训的方法         企

前端 CSS 经典:文字描边

前言:文字描边有两种实现方式 1. text-shadow 设置 8 个方向的文字阴影,缺点是只有八个方向,文字转角处可能有锯齿状。不支持文字透明,设置 color: transparent,文字会成描边颜色。 <!DOCTYPE html><html lang="en"><head><meta charset="utf-8" /><meta http-equiv="X-UA-Comp