文字识别助力智能运营,加速金融业务流转效率

2023-10-12 05:20

本文主要是介绍文字识别助力智能运营,加速金融业务流转效率,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

智慧金融在金融服务的业务流程中不断深入,金融行业数字化建设的过程除了面向外部客户的服务与销售外,行业内部的支持性系统也在随之升级。智能合规、智能运营广泛应用于企业内部财务管理系统、报销系统、核算系统以及审核系统等平台中,促使数据沉淀,加速流程效率,实现数字化建设闭环。

在智能运营覆盖的各个场景中,计算机视觉、自然语言处理、传统机器学习算法等人工智能技术充分应用。其中文字识别技术(OCR)作为计算机视觉的主要方向之一,其识别对象包括扫描合同、印章、卡证、表格与票据信息结构化,在业务办理、风险控制、内部数据库建设与信息支撑等场景中都扮演着重要角色。

图片

图1 智能运营中的OCR应用

场景问题

在这些场景中,图片数据一方面通过对纸质文档和票据的扫描来获取,另一方面包含对证件拍照的方式获取。面临的场景难点和技术难点同时存在

  • 难点一:印章识别场景中的文字遮挡、模糊、弯曲程度高,印章类型多;

  • 难点二:扫描文档文字密集,检测漏检与识别精度对后续关键信息提取系统影响大;

  • 难点三:拍摄卡证图片时的透视变换、过曝过暗、有色阴影等问题;

  • 难点四:表格种类繁多,差异性大,缺乏开源数据,无标注工具;

  • 难点五:基于图像处理和规则的表格识别难度大,通用性差;

  • 难点六:弯曲文本的端到端算法的精度问题与两阶段算法的速度问题需要权衡。

图片

图2 表格识别中数据种类的多样性

解决方法

良好的算法模型是解决上述问题的首要因素,这不仅要求算法模型对于某个类型的对象的识别精度能够满足业务需求,还要其拥有良好的泛化能力。飞桨文字识别开发套件PaddleOCR针对自然场景下的OCR任务提供面向产业级的超轻量通用OCR系统PP-OCRv3,经过海量数据训练,达到产业级SOTA,在工业制造、交通等行业中得到广泛验证。针对文档场景提供智能文档分析系统PP-Structurev2,实现表格识别、关键信息提取、版面分析与恢复任务。

图片

图3 PP-OCRv3应用效果

图片

图4 PP-Structurev2文档分析流程图

场景应用

场景1

印章弯曲文本检测与识别

印章检测识别是定位合同文件和常用票据中印章位置,提取识别印章内容的任务。可以用于检测合同文件和票据中是否有印章,对比印章内容,验证是否有业务风险。实际业务中通过人工审核对比的方式成本高,效率低。为了降本增效,提高生产效率,基于PaddleDetection和PaddleOCR开发套件,实现印章检测以及印章文字识别任务,代替人工识别,降低成本,辅助印章比对验证业务,提高验证效率,降低财税及商务合同签订过程的业务风险。

图片

图5 印章文本检测与识别

场景2

扫描版合同关键信息抽取

合同审核广泛应用于大中型企业、上市公司、证券、基金公司中,是规避风险的重要任务。实际业务中人工进行纸质版合同审核成本高,工作量大。针对以上场景PaddleOCR+PaddleNLP可以快速提取文本内容,经过少量数据微调即可准确抽取关键信息,高效完成合同内容对比、合规性检查、风险点识别等任务,提高效率,降低风险。

图片

图6 扫描版合同关键信息抽取

场景3

通用卡证结构化信息提取

卡证识别的应用遍布于银行、保险、证券、信托等各种金融机构,在业务办理和信息核验场景中需要识别身份证、银行卡、驾驶证、营业执照等。由于数据的采集来源多样,存在各种噪声,如图片方向混乱、反光、模糊、倾斜问题的干扰,且一般需要对卡证信息进行结构化输出。针对上述问题,基于PaddleClas与PaddleOCR完成卡证方向与类型分类,多方案卡证检测对比与识别,最终H-Means达到93%以上

图片

图7 通用卡证结构化信息提取

(个人信息为虚构,仅用于展示说明使用)

场景4

中文表格识别与属性分析

中文表格识别在保险理赔、财报分析和信息录入等场景应用颇多,实际业务中人工进行录入成本高,同时,开源中文表格数据集少也限制了中文表格识别模型的发展。针对以上情况,通过采用数据标注、数据合成和微调等场景适配方法,同时结合表格属性识别,快速完成中文表格识别任务

图片

图8 中文表格识别与属性分析

关于
PaddleOCR

PaddleOCR除了提供产业级特色模型PP-OCR与PP-Structure以外,打通从数据合成标注、模型训练到推理部署的应用全流程。提供22种训练部署方式,半自动标注工具PPOCRLabel,《动手学OCR》电子书以及丰富的场景应用和前沿算法,通过全流程的开发体验助力产业界快速落地OCR应用。

图片

图9 PaddleOCR全景图

注:上述图片均来源于网络

相关地址

  • 飞桨官网

https://www.paddlepaddle.org.cn

  • PaddleOCR项目地址

https://github.com/PaddlePaddle/PaddleOCR

https://gitee.com/PaddlePaddle/PaddleOCR

关注【飞桨PaddlePaddle】公众号

获取更多技术内容~

这篇关于文字识别助力智能运营,加速金融业务流转效率的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/193542

相关文章

嵌入式QT开发:构建高效智能的嵌入式系统

摘要: 本文深入探讨了嵌入式 QT 相关的各个方面。从 QT 框架的基础架构和核心概念出发,详细阐述了其在嵌入式环境中的优势与特点。文中分析了嵌入式 QT 的开发环境搭建过程,包括交叉编译工具链的配置等关键步骤。进一步探讨了嵌入式 QT 的界面设计与开发,涵盖了从基本控件的使用到复杂界面布局的构建。同时也深入研究了信号与槽机制在嵌入式系统中的应用,以及嵌入式 QT 与硬件设备的交互,包括输入输出设

阿里开源语音识别SenseVoiceWindows环境部署

SenseVoice介绍 SenseVoice 专注于高精度多语言语音识别、情感辨识和音频事件检测多语言识别: 采用超过 40 万小时数据训练,支持超过 50 种语言,识别效果上优于 Whisper 模型。富文本识别:具备优秀的情感识别,能够在测试数据上达到和超过目前最佳情感识别模型的效果。支持声音事件检测能力,支持音乐、掌声、笑声、哭声、咳嗽、喷嚏等多种常见人机交互事件进行检测。高效推

让树莓派智能语音助手实现定时提醒功能

最初的时候是想直接在rasa 的chatbot上实现,因为rasa本身是带有remindschedule模块的。不过经过一番折腾后,忽然发现,chatbot上实现的定时,语音助手不一定会有响应。因为,我目前语音助手的代码设置了长时间无应答会结束对话,这样一来,chatbot定时提醒的触发就不会被语音助手获悉。那怎么让语音助手也具有定时提醒功能呢? 我最后选择的方法是用threading.Time

高效录音转文字:2024年四大工具精选!

在快节奏的工作生活中,能够快速将录音转换成文字是一项非常实用的能力。特别是在需要记录会议纪要、讲座内容或者是采访素材的时候,一款优秀的在线录音转文字工具能派上大用场。以下推荐几个好用的录音转文字工具! 365在线转文字 直达链接:https://www.pdf365.cn/ 365在线转文字是一款提供在线录音转文字服务的工具,它以其高效、便捷的特点受到用户的青睐。用户无需下载安装任何软件,只

客户案例:安全海外中继助力知名家电企业化解海外通邮困境

1、客户背景 广东格兰仕集团有限公司(以下简称“格兰仕”),成立于1978年,是中国家电行业的领军企业之一。作为全球最大的微波炉生产基地,格兰仕拥有多项国际领先的家电制造技术,连续多年位列中国家电出口前列。格兰仕不仅注重业务的全球拓展,更重视业务流程的高效与顺畅,以确保在国际舞台上的竞争力。 2、需求痛点 随着格兰仕全球化战略的深入实施,其海外业务快速增长,电子邮件成为了关键的沟通工具。

智能交通(二)——Spinger特刊推荐

特刊征稿 01  期刊名称: Autonomous Intelligent Systems  特刊名称: Understanding the Policy Shift  with the Digital Twins in Smart  Transportation and Mobility 截止时间: 开放提交:2024年1月20日 提交截止日

基于 YOLOv5 的积水检测系统:打造高效智能的智慧城市应用

在城市发展中,积水问题日益严重,特别是在大雨过后,积水往往会影响交通甚至威胁人们的安全。通过现代计算机视觉技术,我们能够智能化地检测和识别积水区域,减少潜在危险。本文将介绍如何使用 YOLOv5 和 PyQt5 搭建一个积水检测系统,结合深度学习和直观的图形界面,为用户提供高效的解决方案。 源码地址: PyQt5+YoloV5 实现积水检测系统 预览: 项目背景

【C++学习笔记 20】C++中的智能指针

智能指针的功能 在上一篇笔记提到了在栈和堆上创建变量的区别,使用new关键字创建变量时,需要搭配delete关键字销毁变量。而智能指针的作用就是调用new分配内存时,不必自己去调用delete,甚至不用调用new。 智能指针实际上就是对原始指针的包装。 unique_ptr 最简单的智能指针,是一种作用域指针,意思是当指针超出该作用域时,会自动调用delete。它名为unique的原因是这个

单片机毕业设计基于单片机的智能门禁系统的设计与实现

文章目录 前言资料获取设计介绍功能介绍程序代码部分参考 设计清单具体实现截图参考文献设计获取 前言 💗博主介绍:✌全网粉丝10W+,CSDN特邀作者、博客专家、CSDN新星计划导师,一名热衷于单片机技术探索与分享的博主、专注于 精通51/STM32/MSP430/AVR等单片机设计 主要对象是咱们电子相关专业的大学生,希望您们都共创辉煌!✌💗 👇🏻 精彩专栏 推荐订

生信圆桌x生信分析平台:助力生物信息学研究的综合工具

介绍 少走弯路,高效分析;了解生信云,访问 【生信圆桌x生信专用云服务器】 : www.tebteb.cc 生物信息学的迅速发展催生了众多生信分析平台,这些平台通过集成各种生物信息学工具和算法,极大地简化了数据处理和分析流程,使研究人员能够更高效地从海量生物数据中提取有价值的信息。这些平台通常具备友好的用户界面和强大的计算能力,支持不同类型的生物数据分析,如基因组、转录组、蛋白质组等。