Windows pytesseract image_to_osd Invalid resolution 0 dpi. Using 70 instead. Too few characters报错及解决

本文主要是介绍Windows pytesseract image_to_osd Invalid resolution 0 dpi. Using 70 instead. Too few characters报错及解决,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Windows pytesseract image_to_osd Invalid resolution 0 dpi. Using 70 instead. Too few characters报错及解决

1. 安装

  1. python3.7+

  2. pip install pytesseract==0.1.9

  3. 安装tesseract-ocr(配置path环境变量或者在代码中指定tesseract_cmd)

2.报错及解决

2.1 TesseractNotFoundError

  • 报错: 无可执行的tesseract
  • 解决:配置PATH环境变量或者在代码中指定tesseract_cmd
import pytesseract# 如果未在PATH中配置tesseract环境变量,则需要手动设置tesseract可执行文件的全路径
pytesseract.pytesseract.tesseract_cmd = r'D:\tesseract\tesseract.exe'
# Example tesseract_cmd = r'C:\Program Files (x86)\Tesseract-OCR\tesseract'

2.2 Error opening data file D:\Tesseract-OCR\fra.traineddata Please make sure the TESSDATA_PREFIX environment variable is set to your “tessdata” directory. Failed loading language ‘fra’ Tesseract couldn’t load any languages! Could not initialize tesseract

  • 解决: 把fra.traineddata放到tesseract.exe上一级./tessdata的路径 或者在代码中导入:
import osimport pytesseract# 语言文件.traindata
os.environ['TESSDATA_PREFIX'] = 'D:\\tesseract\\tessdata'  # 在PATH中配置tesseract环境变量或者此处指定# 如果未在PATH中配置tesseract环境变量,则需要手动设置tesseract可执行文件的全路径
pytesseract.pytesseract.tesseract_cmd = r'D:\\tesseract\\tesseract.exe'

2.3 raise TesseractError(proc.returncode, get_errors(error_string)) pytesseract.pytesseract.TesseractError: (1, ‘Estimating resolution as 304 UZN file C:\Users\ADMINI~1\AppData\Local\Temp\tess_oeu8q72f loaded. Warning. Invalid resolution 0 dpi. Using 70 instead. Too few characters. Skipping this page Error during processing.’)

直接执行命令行ok,pytesseract.image_to_osd(Image.open(‘test.png’))) 报错

tesseract E:\mat\py-demo-22\extreme_points\images\normal.jpg E:\mat\py-demo-22\extreme_points\images\normal_1 -l osd --psm 0
  • 报错:tesseract升级的bug

  • 解决:直接传递照片文件路径,或者切回低版本的tesseract:5.0.0-alpha-20201224 ok。详情可参考
    在这里插入图片描述
    在这里插入图片描述

# 获取方向和文本系统
# print(pytesseract.image_to_osd(Image.open('test.png'))) # happening on tesseract version released after Jan1, 2021.I have tested in tesseract version 5.0.0-alpha-20201224
print(pytesseract.image_to_osd('test.png'))

遇到其他问题了可以去github issues里找解决办法;

3. 源码

# 测试pytesseract的方法
# test_osd.py
import osimport pytesseract
from PIL import Image# 语言文件.traindata
os.environ['TESSDATA_PREFIX'] = 'D:\\tesseract\\tessdata'  # 在PATH中配置tesseract环境变量或者此处指定# 如果未在PATH中配置tesseract环境变量,则需要手动设置tesseract可执行文件的全路径
pytesseract.pytesseract.tesseract_cmd = r'D:\\tesseract\\tesseract.exe'# 图片转string
print("PIL image_to_string: ", pytesseract.image_to_string(Image.open('test.png')))# 提供图片的相对或者绝对路径
print('image_to_string: ', pytesseract.image_to_string('test.png'))# 打印pytesseract支持的所有语言
print('langs: ', pytesseract.get_languages(config=''))# French语言的识别
print('fra image_to_string: ',pytesseract.image_to_string(Image.open('test-european.jpg'), lang='fra'))# 批量处理单个文件list
print('batch Images image_to_string: ',pytesseract.image_to_string('images.txt'))# 超时后结束pyteseract
try:print(pytesseract.image_to_string('test.jpg', timeout=2))  # Timeout after 2 secondsprint(pytesseract.image_to_string('test.jpg', timeout=0.5))  # Timeout after half a second
except RuntimeError as timeout_error:# Tesseract processing is terminatedpass# 获取预测的边界框
# print(pytesseract.image_to_boxes(Image.open('test.png')))
print('image_to_boxes: ',pytesseract.image_to_boxes('test.png'))# 获取详细数据,包括方框、置信度、行号和页码
print('image_to_data: ',pytesseract.image_to_data(Image.open('test.png')))# 获取方向和文本系统
# print(pytesseract.image_to_osd(Image.open('test.png')))  # but this issue is happening on tesseract version released after Jan1, 2021.I have tested in tesseract version 5.0.0-alpha-20201224
print('image_to_osd: ',pytesseract.image_to_osd('test.png'))# Get a searchable PDF
# pdf = pytesseract.image_to_pdf_or_hocr('test.png', extension='pdf') # 报错
# with open('test.pdf', 'w+b') as f:
#     f.write(pdf) # pdf type is bytes by default# Get HOCR output
# hocr = pytesseract.image_to_pdf_or_hocr('test.png', extension='hocr') # error tesseract v5.2.0.20220712 # Get ALTO XML output
xml = pytesseract.image_to_alto_xml('test.png')
print('image_to_alto_xml: ', xml)

参考

  • https://digi.bib.uni-mannheim.de/tesseract/
  • https://pypi.org/project/pytesseract/0.1.9/
  • https://github.com/seminar2012/tesseract?organization=seminar2012&organization=seminar2012
  • 各版本语言包下载路径:

这篇关于Windows pytesseract image_to_osd Invalid resolution 0 dpi. Using 70 instead. Too few characters报错及解决的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/486624

相关文章

如何解决线上平台抽佣高 线下门店客流少的痛点!

目前,许多传统零售店铺正遭遇客源下降的难题。尽管广告推广能带来一定的客流,但其费用昂贵。鉴于此,众多零售商纷纷选择加入像美团、饿了么和抖音这样的大型在线平台,但这些平台的高佣金率导致了利润的大幅缩水。在这样的市场环境下,商家之间的合作网络逐渐成为一种有效的解决方案,通过资源和客户基础的共享,实现共同的利益增长。 以最近在上海兴起的一个跨行业合作平台为例,该平台融合了环保消费积分系统,在短

pip-tools:打造可重复、可控的 Python 开发环境,解决依赖关系,让代码更稳定

在 Python 开发中,管理依赖关系是一项繁琐且容易出错的任务。手动更新依赖版本、处理冲突、确保一致性等等,都可能让开发者感到头疼。而 pip-tools 为开发者提供了一套稳定可靠的解决方案。 什么是 pip-tools? pip-tools 是一组命令行工具,旨在简化 Python 依赖关系的管理,确保项目环境的稳定性和可重复性。它主要包含两个核心工具:pip-compile 和 pip

【VUE】跨域问题的概念,以及解决方法。

目录 1.跨域概念 2.解决方法 2.1 配置网络请求代理 2.2 使用@CrossOrigin 注解 2.3 通过配置文件实现跨域 2.4 添加 CorsWebFilter 来解决跨域问题 1.跨域概念 跨域问题是由于浏览器实施了同源策略,该策略要求请求的域名、协议和端口必须与提供资源的服务相同。如果不相同,则需要服务器显式地允许这种跨域请求。一般在springbo

在 Windows 上部署 gitblit

在 Windows 上部署 gitblit 在 Windows 上部署 gitblit 缘起gitblit 是什么安装JDK部署 gitblit 下载 gitblit 并解压配置登录注册为 windows 服务 修改 installService.cmd 文件运行 installService.cmd运行 gitblitw.exe查看 services.msc 缘起

速盾高防cdn是怎么解决网站攻击的?

速盾高防CDN是一种基于云计算技术的网络安全解决方案,可以有效地保护网站免受各种网络攻击的威胁。它通过在全球多个节点部署服务器,将网站内容缓存到这些服务器上,并通过智能路由技术将用户的请求引导到最近的服务器上,以提供更快的访问速度和更好的网络性能。 速盾高防CDN主要采用以下几种方式来解决网站攻击: 分布式拒绝服务攻击(DDoS)防护:DDoS攻击是一种常见的网络攻击手段,攻击者通过向目标网

Windows如何添加右键新建菜单

Windows如何添加右键新建菜单 文章目录 Windows如何添加右键新建菜单实验环境缘起以新建`.md`文件为例第一步第二步第三步 总结 实验环境 Windows7 缘起 因为我习惯用 Markdown 格式写文本,每次新建一个.txt后都要手动修改为.md,真的麻烦。如何在右键新建菜单中添加.md选项呢? 网上有很多方法,这些方法我都尝试了,要么太麻烦,要么不凑效

Jenkins 插件 地址证书报错问题解决思路

问题提示摘要: SunCertPathBuilderException: unable to find valid certification path to requested target...... 网上很多的解决方式是更新站点的地址,我这里修改了一个日本的地址(清华镜像也好),其实发现是解决不了上述的报错问题的,其实,最终拉去插件的时候,会提示证书的问题,几经周折找到了其中一遍博文

Windows下Nginx的安装及开机启动

1、将nginx-1.16.1.zip解压拷贝至D:\web\nginx目录下。 2、启动Nginx,两种方法: (1)直接双击nginx.exe,双击后一个黑色的弹窗一闪而过。 (2)打开cmd命令窗口,切换到nginx目录下,输入命令 nginx.exe 或者 start nginx ,回车即可。 3、检查nginx是否启动成功。 直接在浏览器地址栏输入网址 http://lo

lvgl8.3.6 控件垂直布局 label控件在image控件的下方显示

在使用 LVGL 8.3.6 创建一个垂直布局,其中 label 控件位于 image 控件下方,你可以使用 lv_obj_set_flex_flow 来设置布局为垂直,并确保 label 控件在 image 控件后添加。这里是如何步骤性地实现它的一个基本示例: 创建父容器:首先创建一个容器对象,该对象将作为布局的基础。设置容器为垂直布局:使用 lv_obj_set_flex_flow 设置容器

Redis中使用布隆过滤器解决缓存穿透问题

一、缓存穿透(失效)问题 缓存穿透是指查询一个一定不存在的数据,由于缓存中没有命中,会去数据库中查询,而数据库中也没有该数据,并且每次查询都不会命中缓存,从而每次请求都直接打到了数据库上,这会给数据库带来巨大压力。 二、布隆过滤器原理 布隆过滤器(Bloom Filter)是一种空间效率很高的随机数据结构,它利用多个不同的哈希函数将一个元素映射到一个位数组中的多个位置,并将这些位置的值置