打造高效问答系统:合合信息文档解析工具的应用与实践

本文主要是介绍打造高效问答系统:合合信息文档解析工具的应用与实践,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

官.网地址:合合TextIn - 合合信息旗下OCR云服务产品

LLM(大型语言模型)的应用落地正快速推动着各行各业工作模式的革新。根据埃森哲在2023年发布的研究报告,预计全行业中有40%的工作时间将得到大语言模型的支持与协助。通过引入AI作为辅助,不仅能重塑员工的工作方式,还能通过自动化技术显著提升工作效率和生产力。

除了常规的知识问答,针对细分领域的专业问答对企业人员来说更具实用价值,比如在阅读冗长的论文或报告时,大模型可以完成综述、归纳和辅助分析等工作。但是这也引出了一个问题:当提供的材料相对复杂冗长时,大型模型是否能够进行文档解析并给出准确答案呢?

一、基于文档内容,大模型能给出准确的回答吗?

在文档交互中,大模型需要做到:根据文件内容给出精准回答、提供关联信息建议并给出专业分析参考。

通常企业在工作过程中,会面临大量的文件信息,人工阅读往往需要消耗大量的时间和精力。尤其在面对扫描或图片文档时,常规办公软件无法完成关键词检索,导致信息收集困难。大模型可以解决这个问题吗?合合信息技术团队以国内某自然语言大模型为例进行了测试。

01.企业年报

首先,上传一份多达100页的企业年报扫描文本,并进行提问:根据文档内容,该公司的上市时间、地点以及营业期限分别的何时何地?大模型准确无误地给出了答案。

接着,再次提问:报告中提到的企业与客户间的销售商品合同包含哪些条款?大模型同样精准地提供了答案。将回答与原文对比,发现其信息不仅准确,而且详尽全面。

这些示例表明,在处理年报等长篇文档的信息提取任务时,大模型能够有效地提供分析辅助,帮助用户快速把握关键信息。

02.经济报告

上传一份包含数据与图表的经济报告并进行提问:依据报告,美国CPI食品的1月官方值是多少?

大模型回答如下:

根据您提供的文件内容,报告中并没有直接提供美国CPI食品的1月官方值。如果需要1月的具体数值,可能需要查阅其他官方数据发布渠道或等待官方数据的公布。

但是如果进行人工检索,可在报告中获得如下表格,清楚地写明了CPI食品1月的官方值。

那么问题来了,为什么大模型读取不到这一信息呢?

03.期刊论文

上传扫描版论文后,提出具体问题:根据所给文件,精氨酸在40度的水中,溶解度是多少?

大模型回答如下:

文档中并没有直接提供精氨酸在40℃时的具体溶解度数值。同时,它补充:如果文档中确实包含了40℃的溶解度数据,但由于文档不完整或扫描不清晰导致无法读取,请提供更详细的信息或完整的文档,以便进行准确回答。

然而,表格中清晰地提供了这些信息:

在实际的工作场景中,需要识别的文件往往是纷繁多样的,其中包括清晰且便于机器读取的纯文字电子文件,也可能包含大量形式的图表,或是来源时期不一的纸质扫描档、模糊或扭曲的页面。大模型目前的回答还未达到理想状态。

二、为什么大模型的回答会不准确?

通过上述几项测试可以看到大模型在面对经济报告和期刊论文的回答并不准确。使用合合信息的文档解析工具把PDF版的经济报告转成Markdown格式后再次发送给大模型,并提出相同的问题。此时大模型给出了正确答案。

在期刊论文案例中,有线表格中的内容同样得到了正确提取。这表明,问题就出现在文档解析环节。

在先前的测试中,大模型没有从文档中准确捕捉到关键信息,而当合合信息文档解析产品把图文档进行格式处理,转化成机器可读格式,大模型就能基于文档内容,快速准确的给出答案。

在业界实践中,目前问答模型的落地面临以下几个挑战:

第一,文档识别的失败率较高。

当面对复杂的版面时,模型无法正确地解析文档,包括获取标题、分块文本、图表等内容。在这种情况下,大型模型常常无法提供细节信息的答案,或者给出错误的答案。

第二,逻辑结构的解析不完整。

模型在划分段落语义时可能出现错误,导致回答不全面或存在总结性偏差。

第三,召回效果不佳。

这可能是由于训练数据的不平衡,影响了模型的检索召回能力。

而面对前两种问题,文档解析工具能够助力解析获取内容极大提升大模型的应答能力,优化用户体验。

三、如何试用文档解析工具?

合合信息文档解析产品已经上架TextIn平台,每位开发者都可以注册账号并开通使用。

访问入口icon-default.png?t=N7T8https://link.zhihu.com/?target=https%3A//www.textin.com/market/detail/pdf_to_markdown

点击【免费体验】,即可在线试用,如下图所示:

如果想试试用代码调用,也可以访问对应的接口文档内容:

代码调用入口​icon-default.png?t=N7T8https://link.zhihu.com/?target=https%3A//www.textin.com/document/pdf_to_markdown

平台提供了一个Playground,帮开发者们预先调试接口。

点击页面中【API调试】按钮,即可进入调试页面。

在这里可以简单配置一些接口参数,发起调用后,右侧就会出现调用结果。

这篇关于打造高效问答系统:合合信息文档解析工具的应用与实践的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1031915

相关文章

Java调用DeepSeek API的最佳实践及详细代码示例

《Java调用DeepSeekAPI的最佳实践及详细代码示例》:本文主要介绍如何使用Java调用DeepSeekAPI,包括获取API密钥、添加HTTP客户端依赖、创建HTTP请求、处理响应、... 目录1. 获取API密钥2. 添加HTTP客户端依赖3. 创建HTTP请求4. 处理响应5. 错误处理6.

Python如何实现PDF隐私信息检测

《Python如何实现PDF隐私信息检测》随着越来越多的个人信息以电子形式存储和传输,确保这些信息的安全至关重要,本文将介绍如何使用Python检测PDF文件中的隐私信息,需要的可以参考下... 目录项目背景技术栈代码解析功能说明运行结php果在当今,数据隐私保护变得尤为重要。随着越来越多的个人信息以电子形

使用Python快速实现链接转word文档

《使用Python快速实现链接转word文档》这篇文章主要为大家详细介绍了如何使用Python快速实现链接转word文档功能,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 演示代码展示from newspaper import Articlefrom docx import

golang内存对齐的项目实践

《golang内存对齐的项目实践》本文主要介绍了golang内存对齐的项目实践,内存对齐不仅有助于提高内存访问效率,还确保了与硬件接口的兼容性,是Go语言编程中不可忽视的重要优化手段,下面就来介绍一下... 目录一、结构体中的字段顺序与内存对齐二、内存对齐的原理与规则三、调整结构体字段顺序优化内存对齐四、内

在不同系统间迁移Python程序的方法与教程

《在不同系统间迁移Python程序的方法与教程》本文介绍了几种将Windows上编写的Python程序迁移到Linux服务器上的方法,包括使用虚拟环境和依赖冻结、容器化技术(如Docker)、使用An... 目录使用虚拟环境和依赖冻结1. 创建虚拟环境2. 冻结依赖使用容器化技术(如 docker)1. 创

浅析如何使用Swagger生成带权限控制的API文档

《浅析如何使用Swagger生成带权限控制的API文档》当涉及到权限控制时,如何生成既安全又详细的API文档就成了一个关键问题,所以这篇文章小编就来和大家好好聊聊如何用Swagger来生成带有... 目录准备工作配置 Swagger权限控制给 API 加上权限注解查看文档注意事项在咱们的开发工作里,API

Java数字转换工具类NumberUtil的使用

《Java数字转换工具类NumberUtil的使用》NumberUtil是一个功能强大的Java工具类,用于处理数字的各种操作,包括数值运算、格式化、随机数生成和数值判断,下面就来介绍一下Number... 目录一、NumberUtil类概述二、主要功能介绍1. 数值运算2. 格式化3. 数值判断4. 随机

使用Navicat工具比对两个数据库所有表结构的差异案例详解

《使用Navicat工具比对两个数据库所有表结构的差异案例详解》:本文主要介绍如何使用Navicat工具对比两个数据库test_old和test_new,并生成相应的DDLSQL语句,以便将te... 目录概要案例一、如图两个数据库test_old和test_new进行比较:二、开始比较总结概要公司存在多

轻松上手MYSQL之JSON函数实现高效数据查询与操作

《轻松上手MYSQL之JSON函数实现高效数据查询与操作》:本文主要介绍轻松上手MYSQL之JSON函数实现高效数据查询与操作的相关资料,MySQL提供了多个JSON函数,用于处理和查询JSON数... 目录一、jsON_EXTRACT 提取指定数据二、JSON_UNQUOTE 取消双引号三、JSON_KE

C语言中自动与强制转换全解析

《C语言中自动与强制转换全解析》在编写C程序时,类型转换是确保数据正确性和一致性的关键环节,无论是隐式转换还是显式转换,都各有特点和应用场景,本文将详细探讨C语言中的类型转换机制,帮助您更好地理解并在... 目录类型转换的重要性自动类型转换(隐式转换)强制类型转换(显式转换)常见错误与注意事项总结与建议类型