CTPN源码解析5-文本线构造算法构造文本行

2024-03-03 18:32

本文主要是介绍CTPN源码解析5-文本线构造算法构造文本行,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文本检测算法一:CTPN

CTPN源码解析1-数据预处理split_label.py

CTPN源码解析2-代码整体结构和框架

CTPN源码解析3.1-model()函数解析

CTPN源码解析3.2-loss()函数解析

CTPN源码解析4-损失函数

CTPN源码解析5-文本线构造算法构造文本行

CTPN训练自己的数据集

由于解析的这个CTPN代码是被banjin-xjyeragonruan大神重新封装过的,所以代码整体结构非常的清晰,简洁!不像上次解析FasterRCNN的代码那样跳来跳去,没跳几步脑子就被跳乱了[捂脸],向大神致敬!PS:里面肯定会有理解和注释错误的,欢迎批评指正!

解析源码地址:https://github.com/eragonruan/text-detection-ctpn

知乎:从代码实现的角度理解CTPN:https://zhuanlan.zhihu.com/p/49588885

知乎:理解文本检测网络CTPN:https://zhuanlan.zhihu.com/p/77883736

知乎:场景文字检测—CTPN原理与实现:https://zhuanlan.zhihu.com/p/34757009

 

文本线构造法(获取预测碎片框后合并成一行的后处理方法)

理论:

在上一个步骤中,已经获得了图Text proposal所示的一串或多串text proposal,接下来就要采用文本线构造法,把这些text proposal连接成一个文本检测框。

为了说明问题,假设某张图有上图所示的2个text proposal,即蓝色和红色2组Anchor,CTPN采用如下算法构造文本线:

具体参考这篇文章:https://blog.csdn.net/weixin_31866177/article/details/890437

代码流程:

代码:

根据文本碎片框及其得分,图像尺寸,使用文本线构造法获得文本行及其得分。步骤:

  1. 删除得分较低的proposal
  2. proposal按得分排序
  3. 对proposal做nms
  4. 根据预测的碎片框,及其得分,图像宽高进行文本行合并
  5. 按一定条件过滤合并后的文本行
 '''根据文本碎片框及其得分,图像尺寸,使用文本线构造法获得文本行及其得分'''def detect(self, text_proposals, scores, size):# 删除得分较低的proposalkeep_inds = np.where(scores > TextLineCfg.TEXT_PROPOSALS_MIN_SCORE)[0]  # 获取文本框得分大于0.7的索引text_proposals, scores = text_proposals[keep_inds], scores[keep_inds]  # 根据索引获得文本框信息和得分# 按得分排序sorted_indices = np.argsort(scores.ravel())[::-1]text_proposals, scores = text_proposals[sorted_indices], scores[sorted_indices]# 对proposal做nmskeep_inds = nms(np.hstack((text_proposals, scores)), TextLineCfg.TEXT_PROPOSALS_NMS_THRESH)text_proposals, scores = text_proposals[keep_inds], scores[keep_inds]# 根据预测的碎片框,及其得分,图像宽高进行文本行合并# utils/text_connector/text_proposal_connector.pytext_recs = self.text_proposal_connector.get_text_lines(text_proposals, scores, size)# 按一定条件过滤合并后的文本行keep_inds = self.filter_boxes(text_recs)return text_recs[keep_inds]

其中的第4步:根据预测碎片框,文本框得分,图像宽高获得文本行,步骤:

  1. 确定每一行的碎片框(碎片框配对)
  2. 根据每一行的碎片框,计算每个文本行四个角的坐标及每行得分
 '''根据预测碎片框,文本框得分,图像宽高获得文本行'''def get_text_lines(self, text_proposals, scores, im_size):# tp=text proposaltp_groups = self.group_text_proposals(text_proposals, scores, im_size)  # 返回值里存放着每行的相似框,每个子图是一行text_lines = np.zeros((len(tp_groups), 5), np.float32)for index, tp_indices in enumerate(tp_groups):text_line_boxes = text_proposals[list(tp_indices)]  # 取一行相似碎片框x0 = np.min(text_line_boxes[:, 0])  # 获取x的最小值x1 = np.max(text_line_boxes[:, 2])  # 获取x的最大值offset = (text_line_boxes[0, 2] - text_line_boxes[0, 0]) * 0.5  #第一个相似框宽度的一半,其实每个框宽度都等于16lt_y, rt_y = self.fit_y(text_line_boxes[:, 0], text_line_boxes[:, 1], x0 + offset, x1 - offset)  # 左上y, 右上ylb_y, rb_y = self.fit_y(text_line_boxes[:, 0], text_line_boxes[:, 3], x0 + offset, x1 - offset)  # 坐下y,右下y# the score of a text line is the average score of the scores# of all text proposals contained in the text line# 文本行的分数是该文本行中包含的所有文本碎片框的分数的平均分数score = scores[list(tp_indices)].sum() / float(len(tp_indices))text_lines[index, 0] = x0text_lines[index, 1] = min(lt_y, rt_y)   # y0text_lines[index, 2] = x1text_lines[index, 3] = max(lb_y, rb_y)   # y1text_lines[index, 4] = score             # 得分text_lines = clip_boxes(text_lines, im_size)  # 保证文本框在图像内text_recs = np.zeros((len(text_lines), 9), np.float)index = 0for line in text_lines:  # 得到每一文本行四个角坐标xmin, ymin, xmax, ymax = line[0], line[1], line[2], line[3]text_recs[index, 0] = xmin    # 左上点xtext_recs[index, 1] = ymin    # 左上点ytext_recs[index, 2] = xmax    # 右上点xtext_recs[index, 3] = ymin    # 右上点ytext_recs[index, 4] = xmaxtext_recs[index, 5] = ymaxtext_recs[index, 6] = xmintext_recs[index, 7] = ymaxtext_recs[index, 8] = line[4]  # 得分index = index + 1return text_recs  # 返回各个文本行及其得分

其中的第1步:确定每一行的碎片框(碎片框配对),步骤:

  1. 将所有的碎片预测框,按左上点x坐标进行归类
  2. 定义graph,graph大小 n*n  n是碎片预测框的数量
  3. 遍历碎片预测框,根据当前索引,先往右找满足条件的配对框,再往左找满足条件的配对框(需两两相互配对)
  4. 返回Graph(graph)
    '''找配对相似框'''def build_graph(self, text_proposals, scores, im_size):self.text_proposals = text_proposals    # 预测的文本框碎片self.scores = scores                    # 得分self.im_size = im_size                  # 图像宽高self.heights = text_proposals[:, 3] - text_proposals[:, 1] + 1   # 文本框的高度# 下面这段代码的功能是将所有的预测框,按左上点x坐标进行归类boxes_table = [[] for _ in range(self.im_size[1])]   # im_size[1] = w  图像宽度for index, box in enumerate(text_proposals):  # text_proposals shape(?,4)boxes_table[int(box[0])].append(index)    #  box[0]是预测碎片框的左上点x坐标self.boxes_table = boxes_table# graph类型 n*n  n是预测框的大小graph = np.zeros((text_proposals.shape[0], text_proposals.shape[0]), np.bool)for index, box in enumerate(text_proposals):   # 遍历预测出的碎片框successions = self.get_successions(index)  # 在当前索引左上点x坐标一定区间范围内找与当前索引相似的预测碎片框作为返回值if len(successions) == 0:  # 没有与当前索引相似的碎片框continue# 往右找相似碎片框succession_index = successions[np.argmax(scores[successions])]  #取出所有相似碎片框中scores最大值所对应的索引if self.is_succession_node(index, succession_index):  # 往左找相似碎片框,左右相互相似# NOTE: a box can have multiple successions(precursors) if multiple successions(precursors)# have equal scores. 一个预测框可能有多个得分一样的相似框graph[index, succession_index] = True   # 当前索引和其相似索引标记为True,形成对应关系return Graph(graph)

buid_graph()调用的相关函数,就不一一介绍了

    # 往右边寻找# 根据当前索引,判断当前预测碎片框左上点x坐标+1,到当前预测碎片框左上点x坐标+1+最大间隙值(20)与图像宽度中取较小值# 在这个区间范围内找与当前索引相似的预测碎片框作为返回值def get_successions(self, index):  # index 是当前预测碎片框的索引box = self.text_proposals[index]  # 根据索引获得预测碎片框坐标 x1,y1,x2,y2results = []# left 范围是当前预测碎片框左上点x坐标+1,到当前预测碎片框左上点x坐标+1+最大间隙值(20)与图像宽度中取较小值for left in range(int(box[0]) + 1, min(int(box[0]) + TextLineCfg.MAX_HORIZONTAL_GAP + 1, self.im_size[1])):adj_box_indices = self.boxes_table[left]   # 所有左上点x坐标为left的索引for adj_box_index in adj_box_indices:  # 遍历左上点x坐标为left的索引if self.meet_v_iou(adj_box_index, index):   # 判断两个预选框的偏差,如果差别较小则加入结果results.append(adj_box_index)if len(results) != 0:return results  # 返回相关索引return results# 往左边寻找相似框,思路和向右的一样def get_precursors(self, index):box = self.text_proposals[index]results = []for left in range(int(box[0]) - 1, max(int(box[0] - TextLineCfg.MAX_HORIZONTAL_GAP), 0) - 1, -1):adj_box_indices = self.boxes_table[left]for adj_box_index in adj_box_indices:if self.meet_v_iou(adj_box_index, index):results.append(adj_box_index)if len(results) != 0:return resultsreturn results# 右边是左边的相似框,反过来判断左边是不是右边的相似框def is_succession_node(self, index, succession_index):precursors = self.get_precursors(succession_index)  # 得到左边与右边相似的碎片框if self.scores[index] >= np.max(self.scores[precursors]):return Truereturn False# 判断两个预选框的偏差,高度的偏差和y坐标差与最小高度的比值def meet_v_iou(self, index1, index2):   # index1 左上点x坐标为left的索引  index2 是当前预测碎片框的索引# 计算两个预选框y方向坐标差与最小高度的比值def overlaps_v(index1, index2):h1 = self.heights[index1]h2 = self.heights[index2]y0 = max(self.text_proposals[index2][1], self.text_proposals[index1][1])  # 获取两个索引左上点y坐标的最大值y1 = min(self.text_proposals[index2][3], self.text_proposals[index1][3])  # 获取两个索引右下点y坐标的最小值return max(0, y1 - y0 + 1) / min(h1, h2)# 计算两个预选框高度的比例,横小于1的情况小越接近1 说明越相似def size_similarity(index1, index2):h1 = self.heights[index1]h2 = self.heights[index2]return min(h1, h2) / max(h1, h2)return overlaps_v(index1, index2) >= TextLineCfg.MIN_V_OVERLAPS and \size_similarity(index1, index2) >= TextLineCfg.MIN_SIZE_SIM

至此,CTPN源码算是粗略的解析完了,里面肯定会有理解和注释错误的,欢迎批评指正! 

 

这篇关于CTPN源码解析5-文本线构造算法构造文本行的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/770519

相关文章

PostgreSQL的扩展dict_int应用案例解析

《PostgreSQL的扩展dict_int应用案例解析》dict_int扩展为PostgreSQL提供了专业的整数文本处理能力,特别适合需要精确处理数字内容的搜索场景,本文给大家介绍PostgreS... 目录PostgreSQL的扩展dict_int一、扩展概述二、核心功能三、安装与启用四、字典配置方法

深度解析Java DTO(最新推荐)

《深度解析JavaDTO(最新推荐)》DTO(DataTransferObject)是一种用于在不同层(如Controller层、Service层)之间传输数据的对象设计模式,其核心目的是封装数据,... 目录一、什么是DTO?DTO的核心特点:二、为什么需要DTO?(对比Entity)三、实际应用场景解析

深度解析Java项目中包和包之间的联系

《深度解析Java项目中包和包之间的联系》文章浏览阅读850次,点赞13次,收藏8次。本文详细介绍了Java分层架构中的几个关键包:DTO、Controller、Service和Mapper。_jav... 目录前言一、各大包1.DTO1.1、DTO的核心用途1.2. DTO与实体类(Entity)的区别1

Java中的雪花算法Snowflake解析与实践技巧

《Java中的雪花算法Snowflake解析与实践技巧》本文解析了雪花算法的原理、Java实现及生产实践,涵盖ID结构、位运算技巧、时钟回拨处理、WorkerId分配等关键点,并探讨了百度UidGen... 目录一、雪花算法核心原理1.1 算法起源1.2 ID结构详解1.3 核心特性二、Java实现解析2.

使用Python绘制3D堆叠条形图全解析

《使用Python绘制3D堆叠条形图全解析》在数据可视化的工具箱里,3D图表总能带来眼前一亮的效果,本文就来和大家聊聊如何使用Python实现绘制3D堆叠条形图,感兴趣的小伙伴可以了解下... 目录为什么选择 3D 堆叠条形图代码实现:从数据到 3D 世界的搭建核心代码逐行解析细节优化应用场景:3D 堆叠图

深度解析Python装饰器常见用法与进阶技巧

《深度解析Python装饰器常见用法与进阶技巧》Python装饰器(Decorator)是提升代码可读性与复用性的强大工具,本文将深入解析Python装饰器的原理,常见用法,进阶技巧与最佳实践,希望可... 目录装饰器的基本原理函数装饰器的常见用法带参数的装饰器类装饰器与方法装饰器装饰器的嵌套与组合进阶技巧

解析C++11 static_assert及与Boost库的关联从入门到精通

《解析C++11static_assert及与Boost库的关联从入门到精通》static_assert是C++中强大的编译时验证工具,它能够在编译阶段拦截不符合预期的类型或值,增强代码的健壮性,通... 目录一、背景知识:传统断言方法的局限性1.1 assert宏1.2 #error指令1.3 第三方解决

全面解析MySQL索引长度限制问题与解决方案

《全面解析MySQL索引长度限制问题与解决方案》MySQL对索引长度设限是为了保持高效的数据检索性能,这个限制不是MySQL的缺陷,而是数据库设计中的权衡结果,下面我们就来看看如何解决这一问题吧... 目录引言:为什么会有索引键长度问题?一、问题根源深度解析mysql索引长度限制原理实际场景示例二、五大解决

深度解析Spring Boot拦截器Interceptor与过滤器Filter的区别与实战指南

《深度解析SpringBoot拦截器Interceptor与过滤器Filter的区别与实战指南》本文深度解析SpringBoot中拦截器与过滤器的区别,涵盖执行顺序、依赖关系、异常处理等核心差异,并... 目录Spring Boot拦截器(Interceptor)与过滤器(Filter)深度解析:区别、实现

深度解析Spring AOP @Aspect 原理、实战与最佳实践教程

《深度解析SpringAOP@Aspect原理、实战与最佳实践教程》文章系统讲解了SpringAOP核心概念、实现方式及原理,涵盖横切关注点分离、代理机制(JDK/CGLIB)、切入点类型、性能... 目录1. @ASPect 核心概念1.1 AOP 编程范式1.2 @Aspect 关键特性2. 完整代码实