0101模板生成任务与shell命令执行任务-datax-python工具

2024-03-30 17:36

本文主要是介绍0101模板生成任务与shell命令执行任务-datax-python工具,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

    • 一、前言
    • 二、分析
      • 2.1 mysql工具
      • 2.2 模板
      • 2.2 执行shell命令
    • 三、代码实现
    • 四、演示
    • 五、待优化
    • 结语

一、前言

最近在学习数仓相关内容,需要把mysql业务数据库gmall中的数据全量同步到hdfs中。使用的工具是datax,虽然datax可以在一个job内放置多个表,但是考虑每个表中数据可能处置方式,存放位置等不同,我们一个表安排一个任务job。最后执行这些job。

gmall库中有几十张表,如果手动创建job的json文件,很费事费力,容易出错;而且通过观察,除了表元数据和存放位置不同外,其他是相同的,那么我们考虑通过模板来生成job。语言选择python。通过subprocess来执行shell命令:datax任务。

下面为相关的环境信息:

软件版本描述
hadoop3.3.4大数组生态基础组件
datax同步异构数据源数据
python3.9python语言
mysql8.x关系型数据库

二、分析

2.1 mysql工具

从mysql读取数据,我们不在重复造轮子了,参考下面链接2和3,工具类代码如下:

# -*- encoding: utf-8 -*-
"""
mysql工具类,主要功能如下:
1. 构造连接mysql
2. 获取设置基础信息:选择数据库、查询数据库版本
3. 查询:查询一条数据、查询多条数据
4. 新增、修改、删除
"""import pymysqlclass MySQLUtil:def __init__(self, host="127.0.0.1", user=None, passwd=None, db=None, charset="utf8", *args, **kwargs):"""构造函数:param host: 主机地址 :param user: 用户名:param passwd: 密码:param db: 数据库名:param charset: 字符集:param args: 参数:param kwargs: """self.__host = hostself.__user = userself.__passwd = passwdself.__db = dbself.__conn = pymysql.connect(host=host, user=user, passwd=passwd, db=db, charset=charset, *args, **kwargs)self.__cursor = self.__conn.cursor()def __del__(self):"""析构函数"""self.__cursor.close()self.__conn.close()def get_conn(self):"""获取连接"""return self.__conndef get_cursor(self, cursor=None):"""获取游标"""return self.__conn.cursor(cursor)def select_db(self, db):"""选择数据库:param db: 数据库名 :return: """self.__conn.select_db(db)def list_databases(self, args=None):"""查询所有数据库"""self.__cursor.execute("SHOW DATABASES", args)dbs = []for db in self.__cursor.fetchall():dbs.append(db[0])return dbsdef list_tables(self, args=None):"""查询所有表"""self.__cursor.execute("SHOW TABLES", args)tables = []for table in self.__cursor.fetchall():tables.append(table[0])return tablesdef execute(self, sql, args=None):"""获取SQL执行结果"""self.__cursor.execute(sql, args)return self.__cursor.fetchall()def get_version(self, args=None):"""获取MySQL版本"""self.__cursor.execute("SELECT VERSION()", args)version = self.__cursor.fetchone()print("MySQL Version : %s" % version)return versiondef list_table_metadata(self, args=None):"""查询所有表的元数据信息"""sql = "SELECT * FROM information_schema.TABLES WHERE TABLE_TYPE !='SYSTEM VIEW' AND TABLE_SCHEMA NOT IN ('sys','mysql','information_schema','performance_schema')"self.__cursor.execute(sql, args)return self.__cursor.fetchall()def get_table_fields(self, db, table, args=None):"""获取表字段信息"""sql = 'SELECT COLUMN_NAME FROM information_schema.COLUMNS WHERE table_schema="' + db + '" AND table_name="' + table + '"'self.__cursor.execute(sql, args)fields = []for field in self.__cursor.fetchall():fields.append(field[0])return fieldsdef table_metadata(self, db, table, args=None):"""查询表字段的元数据信息"""db = "'" + db + "'"table = "'" + table + "'"sql = """SELECT column_name,data_type,ordinal_position,column_comment,column_default FROM information_schema.COLUMNS WHERE table_schema = %s AND table_name = %s;""" % (db, table)self.__cursor.execute(sql, args)return self.__cursor.fetchall()def query_one(self, sql, args=None):"""查询单条数据"""result = Nonetry:self.cursor.execute(sql, args)result = self.cursor.fetchone()except Exception as e:print(e)return resultdef query_all(self, sql, args=None):"""查询多条数据"""list_result = ()try:self.cursor.execute(sql, args)list_result = self.cursor.fetchall()except Exception as e:print(e)return list_resultdef insert(self, sql):"""新增数据"""return self.__edit(sql)def update(self, sql):"""更新数据"""return self.__edit(sql)def delete(self, sql):"""删除数据"""return self.__edit(sql)def __edit(self, sql):count = 0try:count = self.cursor.execute(sql)except Exception as e:print(e)return countif __name__ == "__main__":mysqlUtil = MySQLUtil(host='node1', user="root", passwd="123456", db="gmall")mysqlUtil.get_version()dbs = mysqlUtil.list_databases()print(dbs)conn = mysqlUtil.get_conn()mysqlUtil.select_db("gmall")# print(type(conn.db), conn.db)# databases = mysqlUtil.list_databases()# print(type(databases), databases)# tables = mysqlUtil.list_tables()# print(type(tables), tables)# sql = "SELECT * FROM activity_info"# result = mysqlUtil.execute(sql)# for i in result:#     print(i)result = mysqlUtil.table_metadata("gmall", "activity_info")for i in result:print(i[0],'==',i[1],'===', type(i))# result = mysqlUtil.get_table_fields("gmall", "activity_info")# for i in result:#     print(i)

2.2 模板

datax任务为从mysql读取数据同步到hdfs,可以在datax官网查看相应的示例,这里直接给出我们的模板文件mysql2hdfs.tpl

{"job": {"content": [{"reader": {"name": "mysqlreader","parameter": {"column": ["*"],"connection": [{"jdbcUrl": ["jdbc:mysql://node1:3306/gmall?useUnicode=true&allowKeyRetrieval=tru&characterEncoding=utf-8"],"table": ["$table_name"]}],"password": "123456","splitPk": "","username": "root"}},"writer": {"name": "hdfswriter","parameter": {"column": [$COLUMN],"compress": "gzip","defaultFS": "hdfs://node1:8020","fieldDelimiter": "\t","fileName": "$table_name","fileType": "text","path": "/origin_data/gmall/db/$DIRNAME","writeMode": "append"}}}],"setting": {"speed": {"channel": 1}}}
}

变量说明:

  • $table_name:填充对应的表名
  • $COLUMN:填充表对应的列名和数据类型(hdfs类型)
  • $DIRNAME:填充对应表存储在hdfs中的父路径名称

tips: 模板中相关的配置参数值改成自己的,包括数据库连接相关参数,hdfs连接参数,存储路径等等。

实现使用string中的Template。

2.2 执行shell命令

python执行shell命令,参考最后链接5,这里我们使用subprocess

三、代码实现

完整结构和主要代码,如下所示:

在这里插入图片描述

主要逻辑代码mysql2hdfs.py:

"""
读取mysql元数据,通过模板生成datax任务job:同步全量mysql数据到hdfs,调用shell执行领料
1. 基础配置信息1.1 mysql与hdfs数据类型对应map
2. 读取mysql元数据信息,通过模板文件生成job文件
3. 执行shell命令,运行datax任务
"""import os
import pathlib
import subprocess
from string import Template
from time import sleepimport MySQLUtil as util# mysql与hdfs数据类型对应map
type_mysql_hdfs = {'tinyint': 'tinyint','smallint': 'smallint','int': 'int','bigint': 'bigint','float': 'float','double': 'double','varchar': 'string','bool': 'boolean','timestamp': 'timestamp','datetime': 'string','date': 'date','decimal': 'double','text': 'string'
}def tmp2job(db_util, tmp_file):"""读取mysql数据,用任务模板生成datax 任务job:全量同步mysql数据到hdfs:param db_util: 数据库工具:param tmp_file: 模板文件:return:"""# 获取模版文件tmp_file = pathlib.Path(__file__).parent.joinpath(tmp_file)# 生成文件路径target_dir = pathlib.Path(__file__).parent.joinpath('gmall')# 获取全部表名db_util.select_db("gmall")tables = db_util.list_tables()# tables= [tables[0]]for table in tables:if table == 'z_log':continuetarget_file = target_dir.joinpath(table + '.json')with open(tmp_file, mode="r", encoding="utf-8") as r_f, open(target_file, mode="w", encoding="utf8") as w_f:template_content = r_f.read()# print(f"template_content:{template_content}")template = Template(template_content)columns = db_util.table_metadata(db='gmall', table=table)column_str = ''# 拼接hdfswriter columnfor column in columns:# print(column)type1 = type_mysql_hdfs.get(column[1])# print(type1)column_str += '{\"name\":\"' + column[0] + '\",\"type\":\"' + type1 + '\"},'column_str = column_str[:-1]# print(os.path.split(table)[0])# 替换模板中的文件名,hdfswriter中的column,及hdfs文件存储路径data = template.substitute(table_name=table, COLUMN=column_str, DIRNAME=os.path.splitext(table)[0])w_f.write(data)# 执行job脚本
def execute_shell(db_util):"""执行shell命令:运行datax任务:param db_util: 数据库工具:return:"""# cmd_ls = 'ls /export/server/datax/job/gmall'# name = subprocess.check_output(cmd_ls, shell=True)# names = str(name, encoding='utf-8').split('\n')[:-1]db_util.select_db("gmall")names = db_util.list_tables()# tables= [tables[0]]for name in names:if name == 'z_log':continue# 确保hdfs父路径存在hdfs_mkdir = 'hdfs dfs -mkdir -p /origin_data/gmall/db/' + os.path.splitext(name)[0]# print('-'*5, hdfs_mkdir,'-'*5,name)ret = subprocess.check_call(hdfs_mkdir, shell=True)# print('---ret--',ret)# 执行datax job任务commond = "python /export/server/datax/bin/datax.py  /export/server/datax/job/gmall/" + name + '.json'# print(commond)subprocess.call(commond, shell=True)sleep(1)if __name__ == '__main__':db_util = util.MySQLUtil(host="node1", user="root", passwd="123456", db="gmall")tmp2job(db_util, tmp_file='mysql2hdfs.tpl')execute_shell(db_util)

完整在下面源代码仓库

四、演示

在这里插入图片描述

把相关代码放置在datax的job目录下,创建gmall存放模板生成的任务。

昨天执行过,这里不再执行,我们去web端查看hdfs同步文件,如下图所示:

在这里插入图片描述

五、待优化

  • 我们的数据库名、存储位置写死了,可以改为传参。
  • mysqlreader中column把*改为具体的表中列名。
  • 空值校验,在获取表名、列名等地方进行空值校验,避免生成无意义的文件或者路径。
  • 执行效率:如果硬件配置可以,可以考虑并行执行,每个任务可独立运行,提高效率。

结语

如果小伙伴什么问题或者指教,欢迎交流。

❓QQ:806797785

⭐️源代码仓库地址:https://gitee.com/gaogzhen/smart-utilities

参考链接:

[1]数仓视频-模拟数据生成[CP/OL].2023-12-12.p98.

[2]python3连接MySQL的工具类

[3]python-mysql数据库连接工具类封装

[4]datax 官方文档

[5]python执行shell脚本的几种方法

这篇关于0101模板生成任务与shell命令执行任务-datax-python工具的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/862131

相关文章

nginx -t、nginx -s stop 和 nginx -s reload 命令的详细解析(结合应用场景)

《nginx-t、nginx-sstop和nginx-sreload命令的详细解析(结合应用场景)》本文解析Nginx的-t、-sstop、-sreload命令,分别用于配置语法检... 以下是关于 nginx -t、nginx -s stop 和 nginx -s reload 命令的详细解析,结合实际应

C#连接SQL server数据库命令的基本步骤

《C#连接SQLserver数据库命令的基本步骤》文章讲解了连接SQLServer数据库的步骤,包括引入命名空间、构建连接字符串、使用SqlConnection和SqlCommand执行SQL操作,... 目录建议配合使用:如何下载和安装SQL server数据库-CSDN博客1. 引入必要的命名空间2.

使用Python删除Excel中的行列和单元格示例详解

《使用Python删除Excel中的行列和单元格示例详解》在处理Excel数据时,删除不需要的行、列或单元格是一项常见且必要的操作,本文将使用Python脚本实现对Excel表格的高效自动化处理,感兴... 目录开发环境准备使用 python 删除 Excphpel 表格中的行删除特定行删除空白行删除含指定

mybatis执行insert返回id实现详解

《mybatis执行insert返回id实现详解》MyBatis插入操作默认返回受影响行数,需通过useGeneratedKeys+keyProperty或selectKey获取主键ID,确保主键为自... 目录 两种方式获取自增 ID:1. ​​useGeneratedKeys+keyProperty(推

Python通用唯一标识符模块uuid使用案例详解

《Python通用唯一标识符模块uuid使用案例详解》Pythonuuid模块用于生成128位全局唯一标识符,支持UUID1-5版本,适用于分布式系统、数据库主键等场景,需注意隐私、碰撞概率及存储优... 目录简介核心功能1. UUID版本2. UUID属性3. 命名空间使用场景1. 生成唯一标识符2. 数

Linux系统性能检测命令详解

《Linux系统性能检测命令详解》本文介绍了Linux系统常用的监控命令(如top、vmstat、iostat、htop等)及其参数功能,涵盖进程状态、内存使用、磁盘I/O、系统负载等多维度资源监控,... 目录toppsuptimevmstatIOStatiotopslabtophtopdstatnmon

Python办公自动化实战之打造智能邮件发送工具

《Python办公自动化实战之打造智能邮件发送工具》在数字化办公场景中,邮件自动化是提升工作效率的关键技能,本文将演示如何使用Python的smtplib和email库构建一个支持图文混排,多附件,多... 目录前言一、基础配置:搭建邮件发送框架1.1 邮箱服务准备1.2 核心库导入1.3 基础发送函数二、

Python包管理工具pip的升级指南

《Python包管理工具pip的升级指南》本文全面探讨Python包管理工具pip的升级策略,从基础升级方法到高级技巧,涵盖不同操作系统环境下的最佳实践,我们将深入分析pip的工作原理,介绍多种升级方... 目录1. 背景介绍1.1 目的和范围1.2 预期读者1.3 文档结构概述1.4 术语表1.4.1 核

PowerShell中15个提升运维效率关键命令实战指南

《PowerShell中15个提升运维效率关键命令实战指南》作为网络安全专业人员的必备技能,PowerShell在系统管理、日志分析、威胁检测和自动化响应方面展现出强大能力,下面我们就来看看15个提升... 目录一、PowerShell在网络安全中的战略价值二、网络安全关键场景命令实战1. 系统安全基线核查

基于Python实现一个图片拆分工具

《基于Python实现一个图片拆分工具》这篇文章主要为大家详细介绍了如何基于Python实现一个图片拆分工具,可以根据需要的行数和列数进行拆分,感兴趣的小伙伴可以跟随小编一起学习一下... 简单介绍先自己选择输入的图片,默认是输出到项目文件夹中,可以自己选择其他的文件夹,选择需要拆分的行数和列数,可以通过