爬虫场景,可以使用TiDB替代HBase吗?

2024-06-08 19:32

本文主要是介绍爬虫场景,可以使用TiDB替代HBase吗?,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

爬虫场景是典型的写多读少,咱们先看看HBase和TiDB的架构,再做进一步判断。

一、 HBase主要分为Master Server,region Server的主服务,以及需要HDFS,ZooKeeper的支撑服务。
(1)Master Server用于协调Region Server,而Region Server对外提供自身大量Region单元和wals的读写访问,以及对Region的维护。一个region单元又对memstore,storefile的内存和磁盘中数据实现读写和数据结构维护。
(2)Region Server作为Hadoop HDFS的客户端,将写入自身的WAL HLog文件和HStore的 HFile文件保存在HDFS仓库中,并随时应用于查找。

HBase的主要优势就在两层:

第一层优势:Region可以不断被拆分,由master将其分配到不同Region Server上,形成均匀的数据分布,Region本质就是对HBase table的一个列簇进行分裂,可以类比成传统数据库的分表,那么再大的列族也会按照行键进行Region分裂,并分布在不同的服务节点上,这样就可以通过集群提升整体数据的读写性能。

第二层优势更为关键,Region实际上是个LSM-Tree的超大数据结构,也就是从客户端写进一个Region Server数据,会不经历任何特殊转换过程,也不经历任何分布式联合过程,数据直接进入Region的LSM-Tree,这点就与tidb大为不同,TiDB从客户端到最终写入要经历复杂的SQL语义转换和多节点协作。

HBase批次的写入都会现在LSM-Tree的Memestore中缓冲,大概128m就进行一次Flush,那么每次读取的过程又可以先从Memestore中查找,没有的情况再从Blockcache中查找,仍然没有才会在hfile中做类b树的查找和扫描。

这就极为突出写入过程中的巨大性能优势,而且对最近写入数据和经常访问数据,提供了更快的查找策略。这些特点都非常适合爬虫,爬虫首先就是并行,更迅速地抓取和写入,然后再配合spark做实时清洗,形成统计表或图处理。列族又能根据不同网站特征,增加无数种不同特征的字段类型,并形成超大稀疏表。

二、我们再反观TiDB,尽管集群中的tikv部分选择了Rockesdb,也是LSM-Tree结构,但这只是TiDB很小的一部分,TiDB的关键目的不是完成海量数据的写入,实时流处理和联机分析,它的关键目的在于分布式的环境下实现在线事务处理,为了达到这个目的它有前置集群TiDB来解决SQL的解析,优化和分布式事务,它有调度集群pd,实现对不同tikv节点的协调调度,它有tikv集群通过raft算法实现分布式数据访问的一致性操作,因此TiDB的主战场是联机事务场景,而它的次级战场才是因为其具有分布式kv特征的联机分析场景。

理解其架构特点,我想你就一定会明白,爬虫的业务场景更符合HBase的架构特长,大量采集数据的高性能写入和实时清洗以及借助HDFS的海量存储,并实现离线分析OLAP;

而对于TiDB强在对上层实时业务的SQL读写访问支撑,数据更新在分布式场景下的强一致性和事务处理能力,因此还是应该把它的重心放在分布式的OLTP应用上,同时可以兼备轻型OLAP的混合分析能力。

守护石 「技术创作」
关注领域:大数据技术、分布式架构 | 技术管理

这篇关于爬虫场景,可以使用TiDB替代HBase吗?的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1043102

相关文章

C语言中联合体union的使用

本文编辑整理自: http://bbs.chinaunix.net/forum.php?mod=viewthread&tid=179471 一、前言 “联合体”(union)与“结构体”(struct)有一些相似之处。但两者有本质上的不同。在结构体中,各成员有各自的内存空间, 一个结构变量的总长度是各成员长度之和。而在“联合”中,各成员共享一段内存空间, 一个联合变量

Tolua使用笔记(上)

目录   1.准备工作 2.运行例子 01.HelloWorld:在C#中,创建和销毁Lua虚拟机 和 简单调用。 02.ScriptsFromFile:在C#中,对一个lua文件的执行调用 03.CallLuaFunction:在C#中,对lua函数的操作 04.AccessingLuaVariables:在C#中,对lua变量的操作 05.LuaCoroutine:在Lua中,

Vim使用基础篇

本文内容大部分来自 vimtutor,自带的教程的总结。在终端输入vimtutor 即可进入教程。 先总结一下,然后再分别介绍正常模式,插入模式,和可视模式三种模式下的命令。 目录 看完以后的汇总 1.正常模式(Normal模式) 1.移动光标 2.删除 3.【:】输入符 4.撤销 5.替换 6.重复命令【. ; ,】 7.复制粘贴 8.缩进 2.插入模式 INSERT

Lipowerline5.0 雷达电力应用软件下载使用

1.配网数据处理分析 针对配网线路点云数据,优化了分类算法,支持杆塔、导线、交跨线、建筑物、地面点和其他线路的自动分类;一键生成危险点报告和交跨报告;还能生成点云数据采集航线和自主巡检航线。 获取软件安装包联系邮箱:2895356150@qq.com,资源源于网络,本介绍用于学习使用,如有侵权请您联系删除! 2.新增快速版,简洁易上手 支持快速版和专业版切换使用,快速版界面简洁,保留主

如何免费的去使用connectedpapers?

免费使用connectedpapers 1. 打开谷歌浏览器2. 按住ctrl+shift+N,进入无痕模式3. 不需要登录(也就是访客模式)4. 两次用完,关闭无痕模式(继续重复步骤 2 - 4) 1. 打开谷歌浏览器 2. 按住ctrl+shift+N,进入无痕模式 输入网址:https://www.connectedpapers.com/ 3. 不需要登录(也就是

亮相WOT全球技术创新大会,揭秘火山引擎边缘容器技术在泛CDN场景的应用与实践

2024年6月21日-22日,51CTO“WOT全球技术创新大会2024”在北京举办。火山引擎边缘计算架构师李志明受邀参与,以“边缘容器技术在泛CDN场景的应用和实践”为主题,与多位行业资深专家,共同探讨泛CDN行业技术架构以及云原生与边缘计算的发展和展望。 火山引擎边缘计算架构师李志明表示:为更好地解决传统泛CDN类业务运行中的问题,火山引擎边缘容器团队参考行业做法,结合实践经验,打造火山

Toolbar+DrawerLayout使用详情结合网络各大神

最近也想搞下toolbar+drawerlayout的使用。结合网络上各大神的杰作,我把大部分的内容效果都完成了遍。现在记录下各个功能效果的实现以及一些细节注意点。 这图弹出两个菜单内容都是仿QQ界面的选项。左边一个是drawerlayout的弹窗。右边是toolbar的popup弹窗。 开始实现步骤详情: 1.创建toolbar布局跟drawerlayout布局 <?xml vers

C#中,decimal类型使用

在Microsoft SQL Server中numeric类型,在C#中使用的时候,需要用decimal类型与其对应,不能使用int等类型。 SQL:numeric C#:decimal

探索Elastic Search:强大的开源搜索引擎,详解及使用

🎬 鸽芷咕:个人主页  🔥 个人专栏: 《C++干货基地》《粉丝福利》 ⛺️生活的理想,就是为了理想的生活! 引入 全文搜索属于最常见的需求,开源的 Elasticsearch (以下简称 Elastic)是目前全文搜索引擎的首选,相信大家多多少少的都听说过它。它可以快速地储存、搜索和分析海量数据。就连维基百科、Stack Overflow、

flask 中使用 装饰器

因为要完成毕业设计,我用到fountain code做数据恢复。 于是在github上下载了fountain code的python原代码。 github上的作者用flask做了fountain code的demo。 flask是面向python的一个网站框架。 里面有用到装饰器。 今天笔试的时候,我也被问到了python的装饰器。