基于seatunnel实现mysql同步clickhouse验证

2024-01-06 10:28

本文主要是介绍基于seatunnel实现mysql同步clickhouse验证,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

场景:

需求想要实现mysql同步到clickhouse,seatunnel部署见前面文档linux环境seatunnel安装运行-CSDN博客。

官方说明文档

Clickhouse | Apache SeaTunnel

mysql同步配置

server-id=1
log_bin=/var/lib/mysql/bin.log
binlog_format=ROW
#binlog-do-db 具体要同步的数据库
binlog-do-db=gisqbpm
gtid-mode=on
enforce-gtid-consistency=on

验证MYSQL同步clckhouse

mysql数据库测试表

CREATE TABLE `test` (
  `id_` varchar(255) NOT NULL,
  `name` varchar(255) DEFAULT NULL,
  PRIMARY KEY (`id_`)
) ENGINE=InnoDB DEFAULT CHARSET=utf8mb4;

clikhouse库测试表

-- gisqbpm.test definition

CREATE TABLE gisqbpm.test
(

    `id_` String,

    `name` Nullable(String),

    `_sign` Int8 MATERIALIZED 1,

    `_version` UInt64 MATERIALIZED 1,

    INDEX _version _version TYPE minmax GRANULARITY 1
)
ENGINE = ReplacingMergeTree(_version)
ORDER BY tuple(id_)
SETTINGS index_granularity = 8192;

在config中创建mysqltoclickhouse.conf

touch  mysqltoclickhouse.conf配置如下

env {
        execution.parallelism = 1
        job.mode = "STREAMING"
        checkpoint.interval = 2000
}
source {
        MySQL-CDC {
                base-url = "jdbc:mysql://192.168.85.128:3307/gisqbpm"
                username = "root"
                password = "wxy123456"
                table-names = ["gisqbpm.test"]
   }
}

sink {
    Clickhouse {
                host = "192.168.85.128:8123"
                database = "gisqbpm"
                table = "test"
                username = "default"
                password = "wxy123456“
    }
}

验证一:INSERT

mysql添加一条数据

INSERT INTO `gisqbpm`.`test`(`id_`, `name`) VALUES ('1', '李淳风');

select * from gisqbpm.test;
 

在clickhouse中也同步添加一条数据

验证二:UPDATE

mysql修改一条数据

update  test set name='李淳风1' where id_='1';
select * from gisqbpm.test;

clickhouse显示如下,而是新增一个数据

验证三:DELETE

mysql删除一条数据

clickhouse发现是添加了一个数据

结论一:

这个是网上常见的案列,但都是往往写了一个添加操作就没了,奶奶个腿啊,这么多的坑竟然不说,妈的这放到生产环境不要气死人?同步时修改和删除变成添加和实际逻辑不一样。咨询了社区大佬,给我提供了一些意见,好吧那我就再验证一下

经过大佬点播,又看了一下官方文档确实有写,要通过主键去删除和更新!!!!

二:修改配置再次验证

env {
        execution.parallelism = 1
        job.mode = "STREAMING"
        checkpoint.interval = 2000
}
source {
        MySQL-CDC {
                base-url = "jdbc:mysql://192.168.85.128:3307/gisqbpm"
                username = "root"
                password = "wxy123456"
                table-names = ["gisqbpm.test"]
   }
}

sink {
    Clickhouse {
                host = "192.168.85.128:8123"
                database = "gisqbpm"
                table = "test"
                username = "default"
                password = "wxy123456"
                primary_key="id_"
                support_upsert=true
      }
}

验证一:INSERT

mysql插入一条数据

clickhouse也同步显示添加一条数据

验证二:DELETE

mysql删除一条数据

clickhouse也同步删除一条数据

验证三:UPDATE

mysql修改一条数据

clickhouse没有变化,服务此时也挂了

错误一:

错误如下 Caused by: org.apache.seatunnel.connectors.seatunnel.clickhouse.exception.ClickhouseConnectorException: ErrorCode:[COMMON-10], ErrorDescription:[Flush data operation that in sink connector failed] - Clickhouse execute batch statement error

重启后再次执行修改操作

mysql修改一条数据

clickhouse显示是新增一条数据

结论二:

这种方式同样也是不能完美解决同步问题,修改变成了添加,而且中途服务还挂了,稳定性也有风险。

三:修改配置再次验证

env {
        execution.parallelism = 1
        job.mode = "STREAMING"
        checkpoint.interval = 2000
}
source {
        MySQL-CDC {
                base-url = "jdbc:mysql://192.168.85.128:3307/gisqbpm"
                username = "root"
                password = "wxy123456"
                table-names = ["gisqbpm.test"]
   }
}

sink {
    Clickhouse {
                host = "192.168.85.128:8123"
                database = "gisqbpm"
                table = "test"
                username = "default"
                password = "wxy123456"
                primary_key="id_"
                support_upsert=true
                allow_experimental_lightweight_delete = true
    }
}
 

 这个是官方文档提供的配置测试一下

错误二:

Caused by: java.sql.BatchUpdateException: Code: 62. DB::Exception: Syntax error: failed at position 1 ('DELETE'): DELETE FROM "test" WHERE "id_" = '1' settings allow_experimental_lightweight_delete = true. Expected one of: Query, Query

结论三

经测试在mysql中添加一条数据,clickhouse也同步添加一条数据,但是mysql中通过主键修改一条数据,clickhouse变成添加一条数据,mysql删除一条数据,clickhosue直接报错且服务挂掉

总结: 

1.seatunel同步mysql到clickhouse中存在很大的问题,生产环境如果有修改和删除操作同步到clickhouse时趁早换方案!!!

2.从操作来看seatunel对全库同步的场景也不是很友好,我100张表那就要创建100个sink对应的表非常麻烦!!

3.MaterializeMySQL的方式都比这个靠谱,至少服务不会挂!!!

这篇关于基于seatunnel实现mysql同步clickhouse验证的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/576064

相关文章

MySQL中比较运算符的具体使用

《MySQL中比较运算符的具体使用》本文介绍了SQL中常用的符号类型和非符号类型运算符,符号类型运算符包括等于(=)、安全等于(=)、不等于(/!=)、大小比较(,=,,=)等,感兴趣的可以了解一下... 目录符号类型运算符1. 等于运算符=2. 安全等于运算符<=>3. 不等于运算符<>或!=4. 小于运

虚拟机Centos7安装MySQL数据库实践

《虚拟机Centos7安装MySQL数据库实践》用户分享在虚拟机安装MySQL的全过程及常见问题解决方案,包括处理GPG密钥、修改密码策略、配置远程访问权限及防火墙设置,最终通过关闭防火墙和停止Net... 目录安装mysql数据库下载wget命令下载MySQL安装包安装MySQL安装MySQL服务安装完成

使用zip4j实现Java中的ZIP文件加密压缩的操作方法

《使用zip4j实现Java中的ZIP文件加密压缩的操作方法》本文介绍如何通过Maven集成zip4j1.3.2库创建带密码保护的ZIP文件,涵盖依赖配置、代码示例及加密原理,确保数据安全性,感兴趣的... 目录1. zip4j库介绍和版本1.1 zip4j库概述1.2 zip4j的版本演变1.3 zip4

MySQL进行数据库审计的详细步骤和示例代码

《MySQL进行数据库审计的详细步骤和示例代码》数据库审计通过触发器、内置功能及第三方工具记录和监控数据库活动,确保安全、完整与合规,Java代码实现自动化日志记录,整合分析系统提升监控效率,本文给大... 目录一、数据库审计的基本概念二、使用触发器进行数据库审计1. 创建审计表2. 创建触发器三、Java

MySQL逻辑删除与唯一索引冲突解决方案

《MySQL逻辑删除与唯一索引冲突解决方案》本文探讨MySQL逻辑删除与唯一索引冲突问题,提出四种解决方案:复合索引+时间戳、修改唯一字段、历史表、业务层校验,推荐方案1和方案3,适用于不同场景,感兴... 目录问题背景问题复现解决方案解决方案1.复合唯一索引 + 时间戳删除字段解决方案2:删除后修改唯一字

Zabbix在MySQL性能监控方面的运用及最佳实践记录

《Zabbix在MySQL性能监控方面的运用及最佳实践记录》Zabbix通过自定义脚本和内置模板监控MySQL核心指标(连接、查询、资源、复制),支持自动发现多实例及告警通知,结合可视化仪表盘,可有效... 目录一、核心监控指标及配置1. 关键监控指标示例2. 配置方法二、自动发现与多实例管理1. 实践步骤

MySQL 主从复制部署及验证(示例详解)

《MySQL主从复制部署及验证(示例详解)》本文介绍MySQL主从复制部署步骤及学校管理数据库创建脚本,包含表结构设计、示例数据插入和查询语句,用于验证主从同步功能,感兴趣的朋友一起看看吧... 目录mysql 主从复制部署指南部署步骤1.环境准备2. 主服务器配置3. 创建复制用户4. 获取主服务器状态5

SpringBoot中六种批量更新Mysql的方式效率对比分析

《SpringBoot中六种批量更新Mysql的方式效率对比分析》文章比较了MySQL大数据量批量更新的多种方法,指出REPLACEINTO和ONDUPLICATEKEY效率最高但存在数据风险,MyB... 目录效率比较测试结构数据库初始化测试数据批量修改方案第一种 for第二种 case when第三种

python生成随机唯一id的几种实现方法

《python生成随机唯一id的几种实现方法》在Python中生成随机唯一ID有多种方法,根据不同的需求场景可以选择最适合的方案,文中通过示例代码介绍的非常详细,需要的朋友们下面随着小编来一起学习学习... 目录方法 1:使用 UUID 模块(推荐)方法 2:使用 Secrets 模块(安全敏感场景)方法

MySql基本查询之表的增删查改+聚合函数案例详解

《MySql基本查询之表的增删查改+聚合函数案例详解》本文详解SQL的CURD操作INSERT用于数据插入(单行/多行及冲突处理),SELECT实现数据检索(列选择、条件过滤、排序分页),UPDATE... 目录一、Create1.1 单行数据 + 全列插入1.2 多行数据 + 指定列插入1.3 插入否则更