TextIn ParseX:助力开发者解析版面元素信息

2024-09-06 06:04

本文主要是介绍TextIn ParseX:助力开发者解析版面元素信息,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

TextIn ParseX通用文档解析是一款大模型友好的解析工具,支持将pdf文档、jpg、img图像等文件快速转换为markdown格式,支持各类表格、公式解析,帮助大语言模型的数据清洗和文档问答任务。

产品特点

  • 支持多种扫描内容:能良好处理各类图片与扫描文档,包括手机照片、截屏等内容。

  • 支持多种语言:支持简体中文/繁体中文/英文/数字/西欧主流语言/东欧主流语言等共 50+ 种语言。

  • 表格识别效果好:能准确识别各种格式的表格,包括有线表格、无线表格、密集表格,并支持各种类型的合并单元格识别与还原。

  • 阅读顺序还原准:能理解和还原文档的结构和元素排列,确保阅读顺序的准确性,支持多栏布局的论文、年报、业务报告等内容。

  • 自研文档树引擎:从语义出发,提取段落embedding值,预测标题层级关系,通过构造文档树提高检索召回效果。

为了让用户获得文档解析引擎返回的丰富版面元素,我们开发了一系列的sdk函数,包括目录树、公式、表格、图片、全文markdown等结果的获取函数。对于api用户来说,评估文档解析引擎的版面分析结果准确性是困难的,可视化的前端界面可以一定程度解决定性评估的问题,另外一些场景中,用户希望能够可视化文件解析的结果,并对结果进行编辑修正,获得更高精度的解析结果,这个时候前端可视化组件就是必不可少的了。为了满足这些需求,方便用户,我们将textin.com上面的前端可视化组件进行了开源,请用户批评指正。

1、SDK功能介绍

TextIn ParseX是一套标准的多平台支持的python sdk,帮助开发者解析pdf_to_markdownRestful API返回结果,获取对应的版面元素的数据结构。开发者只需在终端安装对应的依赖就可以使用。

为了方便用户获取版面元素,此次更新,调用接口增加了'page_details'参数,返回的json结果里面新增加了'pages'的字段。

pip install TextInParseX

如果报错timeout,可以尝试国内源:

pip3 install TextInParseX -i http://mirrors.aliyun.com/pypi/simple/ --trusted-host=mirrors.aliyun.com

首先,你要在textin开通文档解析服务,然后可以在试用工作台点击用户图标,再点击账号与开发者信息(或者登陆后从textin首页->账户与充值->账号与开发者信息,或者点击https://www.textin.com/console/dashboard/setting中获得api_id和secret_code。

你可以通过ParseX直接调用url获取解析对象。

import TextInParseX as px# 初始化解析器
app_id = "#############################"     #填入你的textin的api_id和secret——code
secret_code = "#############################"parseX_client = px.ParseXClient(app_id, secret_code)pdf_file_path = "example.pdf" #你的本地文件路径#通过ParseX直接调用url获取解析对象
result = parseX_client.begin_analyze_document_from_url(pdf_file_path)

也可以参考textin.com的restful api调用,通过python,curl,或者postman工具获得api的原始json文件,再通过ParseX解析json文件获得解析对象。

import TextInParseX as px
import jsonjson_file = 'test_json/example.json'
with open(json_file, 'r') as fr:json_result = json.load(fr)parseX_client = px.ParseXClient()
result = parseX_client.begin_analyze_document_from_json(json_result)#或者直接输入json文件
result = parseX_client.begin_analyze_document_from_file(json_file)

如果你想要获得全文级别的结果,例如文档的markdown信息,所有文本、表格、段落、图片信息,可以如下处理:

print('Markdown:')
print(result.all_markdown)
print("\n")print("All text in document:")
#为可视化方便, 输出0-1000个字符
parseX_client.print_all_elements(result.all_text, 0, 1000)
print("\n")
print(f"Total tables in document: {len(result.all_tables)}")
for index, table in enumerate(result.all_tables):print(f"Table {index}:")parseX_client.print_all_elements(table)print("\n")print(f"Total paragraphs in document: {len(result.all_paragraphs)}")
for p_idx, each_paragraph in enumerate(result.all_paragraphs):print(f"\n--- Paragraph {p_idx}/{len(result.all_paragraphs)} ---")print(f"Paragraph position: {each_paragraph.pos}")for l_idx, each_line in enumerate(each_paragraph.lines):print(f"  Line {l_idx}/{len(each_paragraph.lines)}")print(f"    Line positions: {each_line.pos}")print(f"  Line text: {each_line.text}")print(f"Total images in document: {len(result.all_images)}")
for index, image in enumerate(result.all_images):print(f"Image {index}:")parseX_client.print_all_elements(image)print("\n")all_images_cv_mat = result.get_all_images_cv_mat()
print(f"Total images (as cv::Mat) in document: {len(all_images_cv_mat)}")
for idx, mat in enumerate(all_images_cv_mat):print(f"Image {idx} (cv::Mat) shape: {mat.shape}")

分别获取每页的表格信息、图片信息,段落纯文本信息,段落坐标,每行的信息:

#页的索引指向pdf和文档的页,按照页数的规则,从1开始; table等版面元素的索引默认程序读取的规则,从0开始
for page in result.pages:print(f"=== Page {page.page_id} ===")print("\n")for index, table in enumerate(page.tables):print(f"Table {index}:")parseX_client.print_all_elements(table)print("\n")for index, image in enumerate(page.images):print(f"Image {index}:")parseX_client.print_all_elements(image) print("\n")images_cv_mat = page.get_images_cv_mat()print(f"Total images (as cv::Mat) in page {page.page_id}: {len(images_cv_mat)}")for idx, mat in enumerate(images_cv_mat):print(f"Image {idx} (cv::Mat) shape: {mat.shape}")print("\n")print("Text:")# 限定只能打印前1000个字符parseX_client.print_all_elements(page.paragraph_text, 0, 1000)  print("\n")# 获取当前页的段落print(f"Total paragraphs: {len(page.paragraphs)}")for p_idx, each_paragraph in enumerate(page.paragraphs):print(f"\n--- Paragraph {p_idx}/{len(page.paragraphs)} ---")print(f"Paragraph position: {each_paragraph.pos}")for l_idx, each_line in enumerate(each_paragraph.lines):print(f"  Line {l_idx}/{len(each_paragraph.lines)}")print(f"    Line positions: {each_line.pos}")print(f"  Line text: {each_line.text}")print('Finished getting paragraphs')print("\n\n")

如果想获取每行的位置和文本,可以如下处理:

 
    # 获取当前页的段落print(f"Total paragraphs: {len(page.paragraphs)}")for p_idx, each_paragraph in enumerate(page.paragraphs):print(f"\n--- Paragraph {p_idx}/{len(page.paragraphs)} ---")print(f"Paragraph position: {each_paragraph.pos}")for l_idx, each_line in enumerate(each_paragraph.lines):print(f"  Line {l_idx}/{len(each_paragraph.lines)}")print(f"    Line positions: {each_line.pos}")print(f"  Line text: {each_line.text}")print('Finished getting paragraphs')print("\n\n")

2、前端组件功能介绍

在解析结果审核校对、效果测评等场景下,需要可视化展示文档解析后的结果。

在 TextIn.com 体验页上,我们提供丰富的可视化和交互功能,这部分前端组件现已开源!

项目用ES6开发,基于React框架。仓库地址:https://github.com/intsig-textin/parsex-frontend

目前前端组件已实现以下特性:

  1. 预览渲染主流图片格式和pdf文件,提供缩放和旋转功能

  2. markdown结果渲染,支持各级标题、图片、公式渲染展示

  3. 各类解析元素提取展示,支持查看表格、公式、图片,和原始 JSON 结果

  4. 解析元素文档位置溯源,原文画框标注各元素位置,可以点击画框跳转解析结果,也可以点击解析结果跳转原文画框

  5. 各级目录树还原展示,支持点击跳转相应章节

  6. 接口调用选项参数配置,支持配置不同参数组合,获取相应解析结果

  7. 复制和导出markdown文件

  8. 复制解析后的表格和图片,可以直接粘贴到Excel表格中

以上功能,都可以在 TextIn.com 上体验使用,地址: TextInTextInicon-default.png?t=N7T8https://www.textin.com/console/recognition/robot_markdown?service=pdf_to_markdown

后续我们将开放更多的sdk函数,例如让用户获取所有的手写元素,复选框元素,也欢迎各位用户朋友给我们提更多的类似需求。

在一些国家标准、专利、扫描书的场景,用户还需要将文件解析后的结果进行校对,为了满足这样的需求,后续我们会在前端组件里面导入编辑的功能,并增加电子档pdf格式的导出功能。

Copy以下链接,即刻使用:

SDK:https://github.com/intsig-textin/parsex-sdk

前端组件:https://github.com/intsig-textin/parsex-frontend

文档解析的测评工具:https://github.com/intsig-textin/markdown_tester

文本向量化模型:https://huggingface.co/aspire/acge_text_embedding

欢迎随时与我们技术团队小伙伴探讨你的场景需求!

这篇关于TextIn ParseX:助力开发者解析版面元素信息的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1141204

相关文章

网页解析 lxml 库--实战

lxml库使用流程 lxml 是 Python 的第三方解析库,完全使用 Python 语言编写,它对 XPath表达式提供了良好的支 持,因此能够了高效地解析 HTML/XML 文档。本节讲解如何通过 lxml 库解析 HTML 文档。 pip install lxml lxm| 库提供了一个 etree 模块,该模块专门用来解析 HTML/XML 文档,下面来介绍一下 lxml 库

【C++】_list常用方法解析及模拟实现

相信自己的力量,只要对自己始终保持信心,尽自己最大努力去完成任何事,就算事情最终结果是失败了,努力了也不留遗憾。💓💓💓 目录   ✨说在前面 🍋知识点一:什么是list? •🌰1.list的定义 •🌰2.list的基本特性 •🌰3.常用接口介绍 🍋知识点二:list常用接口 •🌰1.默认成员函数 🔥构造函数(⭐) 🔥析构函数 •🌰2.list对象

业务中14个需要进行A/B测试的时刻[信息图]

在本指南中,我们将全面了解有关 A/B测试 的所有内容。 我们将介绍不同类型的A/B测试,如何有效地规划和启动测试,如何评估测试是否成功,您应该关注哪些指标,多年来我们发现的常见错误等等。 什么是A/B测试? A/B测试(有时称为“分割测试”)是一种实验类型,其中您创建两种或多种内容变体——如登录页面、电子邮件或广告——并将它们显示给不同的受众群体,以查看哪一种效果最好。 本质上,A/B测

客户案例:安全海外中继助力知名家电企业化解海外通邮困境

1、客户背景 广东格兰仕集团有限公司(以下简称“格兰仕”),成立于1978年,是中国家电行业的领军企业之一。作为全球最大的微波炉生产基地,格兰仕拥有多项国际领先的家电制造技术,连续多年位列中国家电出口前列。格兰仕不仅注重业务的全球拓展,更重视业务流程的高效与顺畅,以确保在国际舞台上的竞争力。 2、需求痛点 随着格兰仕全球化战略的深入实施,其海外业务快速增长,电子邮件成为了关键的沟通工具。

【北交大信息所AI-Max2】使用方法

BJTU信息所集群AI_MAX2使用方法 使用的前提是预约到相应的算力卡,拥有登录权限的账号密码,一般为导师组共用一个。 有浏览器、ssh工具就可以。 1.新建集群Terminal 浏览器登陆10.126.62.75 (如果是1集群把75改成66) 交互式开发 执行器选Terminal 密码随便设一个(需记住) 工作空间:私有数据、全部文件 加速器选GeForce_RTX_2080_Ti

OWASP十大安全漏洞解析

OWASP(开放式Web应用程序安全项目)发布的“十大安全漏洞”列表是Web应用程序安全领域的权威指南,它总结了Web应用程序中最常见、最危险的安全隐患。以下是对OWASP十大安全漏洞的详细解析: 1. 注入漏洞(Injection) 描述:攻击者通过在应用程序的输入数据中插入恶意代码,从而控制应用程序的行为。常见的注入类型包括SQL注入、OS命令注入、LDAP注入等。 影响:可能导致数据泄

从状态管理到性能优化:全面解析 Android Compose

文章目录 引言一、Android Compose基本概念1.1 什么是Android Compose?1.2 Compose的优势1.3 如何在项目中使用Compose 二、Compose中的状态管理2.1 状态管理的重要性2.2 Compose中的状态和数据流2.3 使用State和MutableState处理状态2.4 通过ViewModel进行状态管理 三、Compose中的列表和滚动

Spring 源码解读:自定义实现Bean定义的注册与解析

引言 在Spring框架中,Bean的注册与解析是整个依赖注入流程的核心步骤。通过Bean定义,Spring容器知道如何创建、配置和管理每个Bean实例。本篇文章将通过实现一个简化版的Bean定义注册与解析机制,帮助你理解Spring框架背后的设计逻辑。我们还将对比Spring中的BeanDefinition和BeanDefinitionRegistry,以全面掌握Bean注册和解析的核心原理。

CSP 2023 提高级第一轮 CSP-S 2023初试题 完善程序第二题解析 未完

一、题目阅读 (最大值之和)给定整数序列 a0,⋯,an−1,求该序列所有非空连续子序列的最大值之和。上述参数满足 1≤n≤105 和 1≤ai≤108。 一个序列的非空连续子序列可以用两个下标 ll 和 rr(其中0≤l≤r<n0≤l≤r<n)表示,对应的序列为 al,al+1,⋯,ar​。两个非空连续子序列不同,当且仅当下标不同。 例如,当原序列为 [1,2,1,2] 时,要计算子序列 [

多线程解析报表

假如有这样一个需求,当我们需要解析一个Excel里多个sheet的数据时,可以考虑使用多线程,每个线程解析一个sheet里的数据,等到所有的sheet都解析完之后,程序需要提示解析完成。 Way1 join import java.time.LocalTime;public class Main {public static void main(String[] args) thro