本文主要是介绍MinerU 是一款将PDF转化如markdown、json工具,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
MinerU
项目简介
MinerU
是一款将PDF
转化为机器可读格式的工具(如markdown
、json
),可以很方便地抽取为任意格式。 MinerU
诞生于书生-浦语的预训练过程中,我们将会集中精力解决科技文献中的符号转化问题,希望在大模型时代为科技发展做出贡献。 相比国内外知名商用产品MinerU
还很年轻,如果遇到问题或者结果不及预期请到issue提交问题,同时附上相关PDF。
2、demo网址
点击
导入pdf文件使用,有示例pdf效果还挺好
3、吸引点
也就是按照PDF全部转换过来,
- 保留原文档的结构,包括标题、段落、列表等
- 提取图像、图片标题、表格、表格标题
- 自动识别文档中的公式并将公式转换成latex
不足点
:表格数据还是以图片的方式转过来的
这篇关于MinerU 是一款将PDF转化如markdown、json工具的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!