深入源码,洞察迭代 8 年的 html 文本转换库

2024-08-26 11:36

本文主要是介绍深入源码,洞察迭代 8 年的 html 文本转换库,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

背景介绍

在前面 RAG 项目结构化文件解析方案比较 文章中对常见的 html 解析方案进行了比较,发现 html_text + python-readability 可以实现高质量的 html 内容提取。

在前一篇文章 迭代 14 年的高质量 html 提取方案 中对 python-readability 库进行了介绍,这篇文章就对剩下的 html_text 库进行介绍。

html_text 简介

html_text 是一个 html 文本提取库,可以将 html 内容转换为文本内容,但是与常规 html 解析库相比,html_text 转换出的文本更加格式化:

  • 忽略内联样式、javascript、注释和其他用户通常不可见的文本;
  • 空白内容标准化,在内联元素周围添加空格分隔内容;
  • 在合适的位置添加换行符,与浏览器呈现的效果保持一致;

整体而言,html_text 通过补充合适的空格和换行符,将解析出的文本更加接近浏览器呈现的效果。

在之前的测试中,对于下面的文本内容:

请添加图片描述

使用 unstructed 解析出的文本元素内容为:

请添加图片描述

但是 html_text 解析出的文本内容为:

请添加图片描述

这样可以为后续的处理提供一个更准确的文本内容,避免大量碎片化的无意义文本。

实现方案

html_text 库的源码比较精简,核心的代码不到 100 行。在开始介绍实现方案前,可以先大致了解下常规的 html 结构,类似如下所示:

<html><body><p><div>test</div></p></body>
</html>

可以看到常规的 html 元素一般都包含开始和结束部分,比如 <p> 代表段落开始,</p> 代表段落结束,因此依次遍历 html 元素时,一般会需要依次经历 html 元素的开始和结束事件。

整体流程

html_text 的主要解析流程就是依次遍历 html 元素的开始和结束事件,之后根据元素 tag 添加必要的换行符和空格,保证与浏览器呈现效果的一致性:

for event, el in lxml.etree.iterwalk(tree, events=('start', 'end')):# html 开始事件,在元素前添加换行符,之后添加 html 元素文本内容if event == 'start':add_newlines(el.tag)add_text(el.text)# html 结束事件,在元素后添加换行符,如果存在元素尾部文本,补充元素尾部文本elif event == 'end':add_newlines(el.tag)if el is not tree:add_text(el.tail)

可以看到,主要依赖 add_newlines() 为 html 元素前后添加换行符分隔元素内容,这样避免原始多行的元素内容被合并为单行。

add_text() 方法会在元素前添加必要的空格,从而保证内联元素的内容合理分隔。

换行符添加

换行符的添加主要根据 html 的 tag 进行判断,html_text 预先定义了不同元素对应的换行符的数量。部分元素会在内容前后添加两个换行符,比如 h1p, 部分元素则会添加一个换行符,比如 ddli。内联元素则不会添加换行符,比如 <span>

def add_newlines(tag):nonlocal previf prev is _DOUBLE_NEWLINE:  # don't output more than 1 blank linereturn# tag 对应需要添加两个换行符if tag in double_newline_tags:chunks.append('\n' if prev is _NEWLINE else '\n\n')prev = _DOUBLE_NEWLINE#  tag 对应需要添加一个换行符elif tag in newline_tags:if prev is not _NEWLINE:chunks.append('\n')prev = _NEWLINE

通过上面的设计,可以将转换的文本内容分隔为类似的 html 元素展现的形式。

空格添加

空格主要用于分隔内联元素,实际会根据当前元素与前一个内容确定是否需要补充空格,比如前一个内容是换行符,那么就不需要额外补充空格,如果前一个是内联元素的文本内容,那么就需要额外的空格进行分隔:

def add_text(text_content):nonlocal prevtext = _normalize_whitespace(text_content) if text_content else ''if not text:return# 判断是否需要补充空格space = get_space_between(text)chunks.extend([space, text])prev = text_content

强化方案

当前的 html_text 已经具备从 html 中提取类似浏览器呈现效果的文本内容的能力,但是转换生成的单个格式化文本依旧无法满足现在 RAG 高质量文本提取的需求。

在 RAG 服务中,需要具备按照文本结构进行切分的能力。常规情况下期望可以按照段落切分,同时可以获取段落不同层级的标题,方便后续作为元信息进行检索。因此需要在 html_text 中具备返回段落切片与层级标题的能力。下面就简单介绍下如何在 html_text 上增强现有能力:

段落切片

段落切片的实现比较简单,可以在处理遍历 html 元素时对段落 tag 进行额外处理,当开始新的段落时,截断返回前一个段落的分片即可。

实际需要处理的 tag 主要是 h1, h2, h3, h4 等格式,当然也可以支持用户自定义切片的 tag。

层级标题获取

层级标题的方案会更复杂一些,但是依旧是可行的,在遍历 html 元素过程中使用层级标题栈维护之前遍历的各个层级的标题,动态更新标题栈保证按照从高往低的顺序即可。实现简化如下所示:

def update_current_hierarchy_titles(tag=None, text=None):nonlocal current_hierarchy_titles# 每次将不超过当前栈层级的标题移出,保证栈中标题的有序性while (current_hierarchy_titlesand compare_html_tags(current_hierarchy_titles[-1][0], tag) <= 0):current_hierarchy_titles.pop()# 将当前标题入栈current_hierarchy_titles.append((tag.strip(), text.strip()))

总结

本文是对 html_text 文本提取库的一个简单介绍,主要包含了 html_text 文本转换的实现机制以及一些适用于 RAG 的强化方案,目前此方案已经在实践中进行了验证,从实际测试效果还不错,有需要的同学可以试试。完整的强化版本的 html_text 代码可以在 Github 中查看。

这篇关于深入源码,洞察迭代 8 年的 html 文本转换库的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1108452

相关文章

Vue3 的 shallowRef 和 shallowReactive:优化性能

大家对 Vue3 的 ref 和 reactive 都很熟悉,那么对 shallowRef 和 shallowReactive 是否了解呢? 在编程和数据结构中,“shallow”(浅层)通常指对数据结构的最外层进行操作,而不递归地处理其内部或嵌套的数据。这种处理方式关注的是数据结构的第一层属性或元素,而忽略更深层次的嵌套内容。 1. 浅层与深层的对比 1.1 浅层(Shallow) 定义

这15个Vue指令,让你的项目开发爽到爆

1. V-Hotkey 仓库地址: github.com/Dafrok/v-ho… Demo: 戳这里 https://dafrok.github.io/v-hotkey 安装: npm install --save v-hotkey 这个指令可以给组件绑定一个或多个快捷键。你想要通过按下 Escape 键后隐藏某个组件,按住 Control 和回车键再显示它吗?小菜一碟: <template

【 html+css 绚丽Loading 】000046 三才归元阵

前言:哈喽,大家好,今天给大家分享html+css 绚丽Loading!并提供具体代码帮助大家深入理解,彻底掌握!创作不易,如果能帮助到大家或者给大家一些灵感和启发,欢迎收藏+关注哦 💕 目录 📚一、效果📚二、信息💡1.简介:💡2.外观描述:💡3.使用方式:💡4.战斗方式:💡5.提升:💡6.传说: 📚三、源代码,上代码,可以直接复制使用🎥效果🗂️目录✍️

【前端学习】AntV G6-08 深入图形与图形分组、自定义节点、节点动画(下)

【课程链接】 AntV G6:深入图形与图形分组、自定义节点、节点动画(下)_哔哩哔哩_bilibili 本章十吾老师讲解了一个复杂的自定义节点中,应该怎样去计算和绘制图形,如何给一个图形制作不间断的动画,以及在鼠标事件之后产生动画。(有点难,需要好好理解) <!DOCTYPE html><html><head><meta charset="UTF-8"><title>06

深入探索协同过滤:从原理到推荐模块案例

文章目录 前言一、协同过滤1. 基于用户的协同过滤(UserCF)2. 基于物品的协同过滤(ItemCF)3. 相似度计算方法 二、相似度计算方法1. 欧氏距离2. 皮尔逊相关系数3. 杰卡德相似系数4. 余弦相似度 三、推荐模块案例1.基于文章的协同过滤推荐功能2.基于用户的协同过滤推荐功能 前言     在信息过载的时代,推荐系统成为连接用户与内容的桥梁。本文聚焦于

JAVA智听未来一站式有声阅读平台听书系统小程序源码

智听未来,一站式有声阅读平台听书系统 🌟&nbsp;开篇:遇见未来,从“智听”开始 在这个快节奏的时代,你是否渴望在忙碌的间隙,找到一片属于自己的宁静角落?是否梦想着能随时随地,沉浸在知识的海洋,或是故事的奇幻世界里?今天,就让我带你一起探索“智听未来”——这一站式有声阅读平台听书系统,它正悄悄改变着我们的阅读方式,让未来触手可及! 📚&nbsp;第一站:海量资源,应有尽有 走进“智听

Java ArrayList扩容机制 (源码解读)

结论:初始长度为10,若所需长度小于1.5倍原长度,则按照1.5倍扩容。若不够用则按照所需长度扩容。 一. 明确类内部重要变量含义         1:数组默认长度         2:这是一个共享的空数组实例,用于明确创建长度为0时的ArrayList ,比如通过 new ArrayList<>(0),ArrayList 内部的数组 elementData 会指向这个 EMPTY_EL

如何在Visual Studio中调试.NET源码

今天偶然在看别人代码时,发现在他的代码里使用了Any判断List<T>是否为空。 我一般的做法是先判断是否为null,再判断Count。 看了一下Count的源码如下: 1 [__DynamicallyInvokable]2 public int Count3 {4 [__DynamicallyInvokable]5 get

计算机毕业设计 大学志愿填报系统 Java+SpringBoot+Vue 前后端分离 文档报告 代码讲解 安装调试

🍊作者:计算机编程-吉哥 🍊简介:专业从事JavaWeb程序开发,微信小程序开发,定制化项目、 源码、代码讲解、文档撰写、ppt制作。做自己喜欢的事,生活就是快乐的。 🍊心愿:点赞 👍 收藏 ⭐评论 📝 🍅 文末获取源码联系 👇🏻 精彩专栏推荐订阅 👇🏻 不然下次找不到哟~Java毕业设计项目~热门选题推荐《1000套》 目录 1.技术选型 2.开发工具 3.功能

【C++高阶】C++类型转换全攻略:深入理解并高效应用

📝个人主页🌹:Eternity._ ⏩收录专栏⏪:C++ “ 登神长阶 ” 🤡往期回顾🤡:C++ 智能指针 🌹🌹期待您的关注 🌹🌹 ❀C++的类型转换 📒1. C语言中的类型转换📚2. C++强制类型转换⛰️static_cast🌞reinterpret_cast⭐const_cast🍁dynamic_cast 📜3. C++强制类型转换的原因📝