Spark SQL Columnar模块源码分析

2023-10-11 10:10

本文主要是介绍Spark SQL Columnar模块源码分析,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

概述

本文介绍Spark SQL增加的Columnar模块代码实现。
首先介绍Columnar内的代码结构和实现,然后介绍在SqlContext里的使用方式。

Columnar

InMemoryColumnarTableScan

实现

InMemoryColumnarTableScan类是SparkPlan LeafNode的实现,即是一个物理执行计划。

private[sql] case class InMemoryColumnarTableScan(attributes: Seq[Attribute], child: SparkPlan)extends LeafNode {

传入的child是一个SparkPlan(确认了的物理执行计划)和一个属性序列。

行转列并cache的过程如下:

  lazy val cachedColumnBuffers = {val output = child.output// 遍历每个RDD的partiti	onval cached = child.execute().mapPartitions { iterator =>// 把属性Seq转换成为ColumnBuilder数组val columnBuilders = output.map { attribute =>// 都是基本ColumnBuilder,默认ByteBuffer大小ColumnBuilder(ColumnType(attribute.dataType).typeId, 0, attribute.name)}.toArrayvar row: Row = null// RDD每个Partition的Rows,每个Row的所有field信息存到ColumnBuilder里while (iterator.hasNext) {row = iterator.next()var i = 0while (i < row.length) {columnBuilders(i).appendFrom(row, i)i += 1}}Iterator.single(columnBuilders.map(_.build()))}.cache()cached.setName(child.toString)// Force the materialization of the cached RDD.cached.count()cached}

ColumnType类用于表示Column的类型,他的typeId变量用来区分数据类型,生成对应的ColumnBuilder(typeId, initialSize=0, columnName)。ColumnBuilder的生成如下:

  def apply(typeId: Int, initialSize: Int = 0, columnName: String = ""): ColumnBuilder = {val builder = (typeId match {case INT.typeId     => new IntColumnBuildercase LONG.typeId    => new LongColumnBuildercase FLOAT.typeId   => new FloatColumnBuildercase DOUBLE.typeId  => new DoubleColumnBuildercase BOOLEAN.typeId => new BooleanColumnBuildercase BYTE.typeId    => new ByteColumnBuildercase SHORT.typeId   => new ShortColumnBuildercase STRING.typeId  => new StringColumnBuildercase BINARY.typeId  => new BinaryColumnBuildercase GENERIC.typeId => new GenericColumnBuilder}).asInstanceOf[ColumnBuilder]builder.initialize(initialSize, columnName)builder}

他的继承结构如下,主要有三大体系:



这里涉及到的是Basic这个体系,继承结构如下:

BasicColumnBuilder里,initialSize = 0,指使用ByteBuffer的默认大小,即10*1024*104。然后在initialize()方法,会初始化ByteBuffer。

接下来,针对RDD每个partition,

      var row: Row = nullwhile (iterator.hasNext) {row = iterator.next()var i = 0while (i < row.length) {columnBuilders(i).appendFrom(row, i)i += 1}}

进行了appendFrom操作:

  override def appendFrom(row: Row, ordinal: Int) {val field = columnType.getField(row, ordinal)buffer = ensureFreeSpace(buffer, columnType.actualSize(field))columnType.append(field, buffer)}

用于把一个Row的每一个field,都存到一个ColumnBuilder里。在这里指BasicColumnBuilder这个类,维护了一个自己的ByteBuffer,把row里的各个field信息都存在了buffer里。


最后ColumnBuilders里的每个ColumnBuilder进行build(),即BasicColumnBuilder.build()方法,进行了一次ByteBuffer的rewind()方法。

这个方法的结果是一个RDD集合。由于在结束前调用了.count()方法,所以RDD的计算是被执行了的,返回的是新的RDD。

在Spark SQL里,外部调用cachedColumnBuffers方法只有在uncache table的时候,进行了unpersisit()操作。


下面看execute()方法:

  override def execute() = {
cachedColumnBuffers.mapPartitions { iterator =>// 在RDD partition里,iterator.next()返回的是一个ByteBuffer// 也就是说,cachedColumnBuffers返回的结果RDD,类型是ByteBufferval columnBuffers = iterator.next()assert(!iterator.hasNext)new Iterator[Row] {// 访问每一个ByteBuffer里的列信息val columnAccessors = columnBuffers.map(ColumnAccessor(_))val nextRow = new GenericMutableRow(columnAccessors.length)override def next() = {var i = 0// 把column里的信息再转到Row里while (i < nextRow.length) {columnAccessors(i).extractTo(nextRow, i)i += 1}nextRow}override def hasNext = columnAccessors.head.hasNext}}}

使用

在SqlContext里选择cache table的时候,会使用该类。

其实在cache的时候,首先去catalog里寻找这个table的信息和table的执行计划,然后会进行执行(执行到物理执行计划生成),然后把这个table再放回catalog里维护起来,这个时候的执行计划已经是最终要执行的物理执行计划了。但是此时Columner模块相关的转换等操作都是没有触发的。

真正的触发还是在execute()的时候,同其他SparkPlan的execute()方法触发场景是一样的。


ColumnBuilder 与 ColumnAccessor

一个包装Row的每个field成Column;一个访问column,然后可以转回Row


关于压缩

private[sql] abstract class NativeColumnBuilder[T <: NativeType](override val columnStats: NativeColumnStats[T],override val columnType: NativeColumnType[T])extends BasicColumnBuilder[T, T#JvmType](columnStats, columnType)with NullableColumnBuilderwith AllCompressionSchemeswith CompressibleColumnBuilder[T]private[sql] class BooleanColumnBuilder extends NativeColumnBuilder(new BooleanColumnStats, BOOLEAN)private[sql] class IntColumnBuilder extends NativeColumnBuilder(new IntColumnStats, INT)


从继承结构看,压缩的builder和Accessor都以trait的方式继承了ColumnBuilder,而子类比如IntColumnBuilder,不但继承了BaseColumnBuilder,同时也具备压缩处理能力。

具体压缩处理可以参考CompressibleColumnBuilder类里的实现。

是否压缩会做一次判断,压缩比在0.8以下才执行压缩。

在build()的时候实施压缩,并且按照以下结构存在bytebuffer内。

 *    .--------------------------- Column type ID (4 bytes)*    |   .----------------------- Null count N (4 bytes)*    |   |   .------------------- Null positions (4 x N bytes, empty if null count is zero)*    |   |   |     .------------- Compression scheme ID (4 bytes)*    |   |   |     |   .--------- Compressed non-null elements*    V   V   V     V   V*    +---+---+-----+---+---------+*    |   |   | ... |   | ... ... |*    +---+---+-----+---+---------+*    \-----------/ \-----------/*        header         body


CompressionScheme子类是不同的压缩实现

都是scala实现的,未借助第三方库。不同的实现,指定了支持的column data类型。在build()的时候,会比较每种压缩,选择压缩率最小的(若仍大于0.8就不压缩了)。

这里的估算能力,在子类实现里,好像是由gatherCompressibilityStats方法实现的。


SqlContext

分析SqlContext内目前cache和uncache table的实现细节与Columnar的关系。


Cache Table

  /** Caches the specified table in-memory. */def cacheTable(tableName: String): Unit = {// 得到的是一个logicalPlanval currentTable = catalog.lookupRelation(None, tableName)// 物理执行计划生成之后交给InMemoryColumnarTableScanval asInMemoryRelation =InMemoryColumnarTableScan(currentTable.output, executePlan(currentTable).executedPlan)// SparkLogicalPlan接受的Plan必须是已经确定plan好的SparkPlancatalog.registerTable(None, tableName, SparkLogicalPlan(asInMemoryRelation))}

从上面那段代码可以看到,cache之前,需要先把本次cache的table的物理执行计划生成出来。上述的currentTable其实是一个logicalPlan,来自catalog的lookupRelation。

最后注册表的时候,涉及到的SparkLogicalPlan类是LogicalPlan的实现类(但是本身其实是一个SparkPlan),它接受的是SparkPlan,并且是已经确定Plan好了的逻辑执行计划,目前接受两类:ExistingRdd和InMemoryColumnarTableScan。

在cache这个过程里,InMemoryColumnarTableScan并没有执行,但是生成了以InMemoryColumnarTableScan为物理执行计划的SparkLogicalPlan,并存成table的plan。


Uncache Table

在这一步,除了删除catalog里的table信息之外,还调用了InMemoryColumnarTableScan的cacheColumnBuffers方法,得到RDD集合,并进行了unpersist()操作。cacheColumnBuffers方法具体见Columner内,主要做了把RDD每个partition里的ROW的每个Field存到了ColumnBuilder内。




全文完 :)

这篇关于Spark SQL Columnar模块源码分析的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/187314

相关文章

MySQL 分区与分库分表策略应用小结

《MySQL分区与分库分表策略应用小结》在大数据量、复杂查询和高并发的应用场景下,单一数据库往往难以满足性能和扩展性的要求,本文将详细介绍这两种策略的基本概念、实现方法及优缺点,并通过实际案例展示如... 目录mysql 分区与分库分表策略1. 数据库水平拆分的背景2. MySQL 分区策略2.1 分区概念

MySQL高级查询之JOIN、子查询、窗口函数实际案例

《MySQL高级查询之JOIN、子查询、窗口函数实际案例》:本文主要介绍MySQL高级查询之JOIN、子查询、窗口函数实际案例的相关资料,JOIN用于多表关联查询,子查询用于数据筛选和过滤,窗口函... 目录前言1. JOIN(连接查询)1.1 内连接(INNER JOIN)1.2 左连接(LEFT JOI

MySQL 中查询 VARCHAR 类型 JSON 数据的问题记录

《MySQL中查询VARCHAR类型JSON数据的问题记录》在数据库设计中,有时我们会将JSON数据存储在VARCHAR或TEXT类型字段中,本文将详细介绍如何在MySQL中有效查询存储为V... 目录一、问题背景二、mysql jsON 函数2.1 常用 JSON 函数三、查询示例3.1 基本查询3.2

MySQL中动态生成SQL语句去掉所有字段的空格的操作方法

《MySQL中动态生成SQL语句去掉所有字段的空格的操作方法》在数据库管理过程中,我们常常会遇到需要对表中字段进行清洗和整理的情况,本文将详细介绍如何在MySQL中动态生成SQL语句来去掉所有字段的空... 目录在mysql中动态生成SQL语句去掉所有字段的空格准备工作原理分析动态生成SQL语句在MySQL

Qt spdlog日志模块的使用详解

《Qtspdlog日志模块的使用详解》在Qt应用程序开发中,良好的日志系统至关重要,本文将介绍如何使用spdlog1.5.0创建满足以下要求的日志系统,感兴趣的朋友一起看看吧... 目录版本摘要例子logmanager.cpp文件main.cpp文件版本spdlog版本:1.5.0采用1.5.0版本主要

MySQL中FIND_IN_SET函数与INSTR函数用法解析

《MySQL中FIND_IN_SET函数与INSTR函数用法解析》:本文主要介绍MySQL中FIND_IN_SET函数与INSTR函数用法解析,本文通过实例代码给大家介绍的非常详细,感兴趣的朋友一... 目录一、功能定义与语法1、FIND_IN_SET函数2、INSTR函数二、本质区别对比三、实际场景案例分

Python 迭代器和生成器概念及场景分析

《Python迭代器和生成器概念及场景分析》yield是Python中实现惰性计算和协程的核心工具,结合send()、throw()、close()等方法,能够构建高效、灵活的数据流和控制流模型,这... 目录迭代器的介绍自定义迭代器省略的迭代器生产器的介绍yield的普通用法yield的高级用法yidle

MySQL中的交叉连接、自然连接和内连接查询详解

《MySQL中的交叉连接、自然连接和内连接查询详解》:本文主要介绍MySQL中的交叉连接、自然连接和内连接查询,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、引入二、交php叉连接(cross join)三、自然连接(naturalandroid join)四

Mysql如何将数据按照年月分组的统计

《Mysql如何将数据按照年月分组的统计》:本文主要介绍Mysql如何将数据按照年月分组的统计方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录mysql将数据按照年月分组的统计要的效果方案总结Mysql将数据按照年月分组的统计要的效果方案① 使用 DA

Mysql表如何按照日期字段的年月分区

《Mysql表如何按照日期字段的年月分区》:本文主要介绍Mysql表如何按照日期字段的年月分区的实现方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、创键表时直接设置分区二、已有表分区1、分区的前置条件2、分区操作三、验证四、注意总结一、创键表时直接设置分区