头歌：Spark案例剖析 - 谷歌网页排名引擎PageRank实战

本文主要是介绍头歌：Spark案例剖析 - 谷歌网页排名引擎PageRank实战，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

第1关：海量数据导入：SparkSQL大数据导入处理

任务描述

工欲善其事必先利其器，大数据分析中最重要的是熟练掌握数据导入工具的使用方法。Spark SQL是Spark自带的数据库，本关你将应用Spark SQL的数据导入工具实现文本数据的导入。其中，graphx-wiki-vertices.txt文件中含有网页及其id数据，graphx-wiki-edges.txt文件中含有网页及其连接网页id数据。

初始化SparkSQL

利用Scala语言使用Spark SQL首先应该导入Spark SQL的相关包，如下例所示：

import org.apache.spark.SparkConf
import org.apache.spark.SparkContext
import org.apache.spark.sql._

也可通过bin/spark-sql命令，通过类似MySQL命令行交互的方式直接访问SparkSQL数据库。

查看使用数据库

在spark-sql中查询使用数据库和基本的关系数据库使用方法类似。

show databases;
use mydatabase；

通过上述命令即可查询现有数据库并使用数据库。

从文本文件中导入数据
CREATE TABLE vertices(ID BigInt,Title String) ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' LINES TERMINATED BY '\n';
LOAD DATA LOCAL IN PATH 'path/file.txt' INTO TABLE vertices;
上述命令行完成了两样事，创建表vertices并将本地的file.txt导入表中。表中数据按照tab缩进以及换行符进行区分。语句1创建表vertices并创建两个字段ID和Title,其中ID的字段属性为BigInt,Title属性为String。语句二将路径中的file.txt文件导入表中。

利用Scala语言进行数据库操作
val spark = SparkSession.builder.master("local").appName("tester").enableHiveSupport().getOrCreate()
spark.sql("use default")
上述代码通过SparkSession的enableHiveSupport()方法支持Hive数据库的基本使用。通过spark.sql()方法起到对数据库的操作。

编程要求

本关任务主要是利用Spark SQL创建表vertices以及edges，并将本地graphx-wiki-vertices.txt和graphx-wiki-edges.txt两个文件的数据分别导入到表中。

评测说明

评测耗时说明
本实训目前是基于Spark单机模式的运行方式，完成以上评测流程所需时间较长（全过程耗时约118秒），请耐心等待

补全下述代码，使之编译通过。

import org.apache.spark.SparkConf
import org.apache.spark.SparkContext
import org.apache.spark.sql._
object SparkSQLHive {
    def main(args: Array[String]) = {
        val sparkConf = new SparkConf().setAppName("PageRank")
        val sc = new SparkContext(sparkConf)
        val spark = SparkSession.builder.master("local").appName("tester").enableHiveSupport().getOrCreate()
        spark.sql("use default")
        import spark.implicits._
        //drop table if it exists
        spark.sql("DROP TABLE IF EXISTS vertices") 
        spark.sql("DROP TABLE IF EXISTS edges")
        //create table here
        spark.sql("CREATE TABLE IF NOT EXISTS vertices(ID BigInt,Title String)ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' LINES TERMINATED BY '\n&

这篇关于头歌：Spark案例剖析 - 谷歌网页排名引擎PageRank实战的文章就介绍到这儿，希望我们推荐的文章对编程师们有所帮助！