MySQL实时同步到Elasticsearch实现方案 —— canal(兼容ES5.X)

本文主要是介绍MySQL实时同步到Elasticsearch实现方案 —— canal(兼容ES5.X),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

首先看一下canal的实现原理:

 

 

  • canal 模拟 MySQL slave 的交互协议,伪装自己为 MySQL slave ,向 MySQL master 发送dump 协议
  • MySQL master 收到 dump 请求,开始推送 binary log 给 slave (即 canal )
  • canal 解析 binary log 对象(原始为 byte 流)

怎么使用

这里只记录需要使用过程中需要注意的地方,具体用法不在此赘述,可以参考canal的wiki:https://github.com/alibaba/canal

一、数据库配置:

  • 需要先开启 Binlog 写入功能,配置 binlog-format 为 ROW 模式,my.cnf 中配置如下

log-bin=mysql-bin # 开启 binlog

 

binlog-format=ROW # 选择 ROW 模式 server_id=1 # 配置 MySQL replaction 需要定义,不要和 canal 的 slaveId 重复

  • 授权 canal 链接 MySQL 账号具有作为 MySQL slave 的权限, 如果已有账户可直接 grant

CREATE USER canal IDENTIFIED BY 'canal'

GRANT SELECT, REPLICATION SLAVE, REPLICATION CLIENT ON *.* TO 'canal'@'%';

-- GRANT ALL PRIVILEGES ON *.* TO 'canal'@'%' ;

FLUSH PRIVILEGES;

二、canal server端:

1. conf/canal.properties下修改端口

 

2.  可以配置destinations(默认为example,多个以逗号隔开),这个对应conf下面的文件夹order

 

3. order文件夹中的instance.properties,可以进行消费通道的配置:

 

三、canal client端:

canal 1.1.1版本之后,自带了适配器,不用写任何java代码,只需要写几个SQL脚本就可以直接实现同步,简单同步逻辑的可以考虑使用,比如单表同步、多表简单关联,友情提醒请看文章末尾

canal adapter 的 Elasticsearch 版本支持6.x.x以上,但是目前公司使用的es为5.3.3,官方宣称可以通过更改依赖即可适配低版本的es,但是还有一个地方需要调整,具体改动如下:

  1. 先将client-adapter中elasticsearch下的pom文件中依赖的elasticsearch相关组件的版本号降至5.X
  2. com.alibaba.otter.canal.client.adapter.es.ESAdapter类中

    transportClient.addTransportAddress(new TransportAddress(InetAddress.getByName(host.substring(0, i)),

        Integer.parseInt(host.substring(i + 1))));

    修改成:
     

    transportClient.addTransportAddress(new InetSocketTransportAddress(InetAddress.getByName(host.substring(0, i)),

        Integer.parseInt(host.substring(i + 1))));

    3. 重新编译

    mvn clean install -Dmaven.test.skip -Denv=release

另外在同步SQL上面也有很多限制,下面是官方文档的:

  1. 主表不能为子查询语句
  2. 只能使用left outer join即最左表一定要是主表
  3. 关联从表如果是子查询不能有多张表
  4. 主sql中不能有where查询条件(从表子查询中可以有where条件但是不推荐, 可能会造成数据同步的不一致, 比如修改了where条件中的字段内容)
  5. 关联条件只允许主外键的'='操作不能出现其他常量判断比如: on a.role_id=b.id and b.statues=1
  6. 关联条件必须要有一个字段出现在主查询语句中比如: on a.role_id=b.id 其中的 a.role_id 或者 b.id 必须出现在主select语句中


除此之外,在使用过程中,还发现了一些其它未说明的限制和问题

1. _index只支持索引名称,不支持alias,在索引需要重构修改名称的时候,这里也需要进行修改。

2. 查询语句的字段大小写必须跟数据库中一致,如图中的ORDER_ID,如不指定,不会报错,但是查不出数据。

3. 在某一个表的数据时,会删除整个文档,比如删除了order_payment,那么会整个order_header文档。

5. 更新时查询不支持非数字类型主键,这个是由于拼接SQL字符串导致,已通过修改拼接代码解决。

6. 有一种业务场景,就是修改供应商或者维修厂的名称时,会涉及大量的文档更新,看了下原来的代码的代码中使用了批处理,但是速度奇慢,后续把代码注释掉之后,速度却得到了质的提升,无解。

注意:

对于官方提供的canal adapter,个人建议酌情使用,在非常简单的单表同步或者多表简单关联,可以考虑使用,能够很大程度的节省开发时间

在订单查询优化过程中,早期一直在使用canal adapter,但是因为订单的业务同步关联比较复杂,在对源码进行了多次修改才适配了订单数据的同步,另外,canal adapter在大多数场景下都会进行回表查询,这对同步效率也会有一定的影响。

在后面演示环境的DTS数据订阅处理时,发现有些代码完全可以为测试环境的canal同步所用,考虑到后续同步的灵活性,决定放弃了官方的adapter,自己写一套adapter。

这篇关于MySQL实时同步到Elasticsearch实现方案 —— canal(兼容ES5.X)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1129873

相关文章

SQL中的外键约束

外键约束用于表示两张表中的指标连接关系。外键约束的作用主要有以下三点: 1.确保子表中的某个字段(外键)只能引用父表中的有效记录2.主表中的列被删除时,子表中的关联列也会被删除3.主表中的列更新时,子表中的关联元素也会被更新 子表中的元素指向主表 以下是一个外键约束的实例展示

基于MySQL Binlog的Elasticsearch数据同步实践

一、为什么要做 随着马蜂窝的逐渐发展,我们的业务数据越来越多,单纯使用 MySQL 已经不能满足我们的数据查询需求,例如对于商品、订单等数据的多维度检索。 使用 Elasticsearch 存储业务数据可以很好的解决我们业务中的搜索需求。而数据进行异构存储后,随之而来的就是数据同步的问题。 二、现有方法及问题 对于数据同步,我们目前的解决方案是建立数据中间表。把需要检索的业务数据,统一放到一张M

服务器集群同步时间手记

1.时间服务器配置(必须root用户) (1)检查ntp是否安装 [root@node1 桌面]# rpm -qa|grep ntpntp-4.2.6p5-10.el6.centos.x86_64fontpackages-filesystem-1.41-1.1.el6.noarchntpdate-4.2.6p5-10.el6.centos.x86_64 (2)修改ntp配置文件 [r

如何去写一手好SQL

MySQL性能 最大数据量 抛开数据量和并发数,谈性能都是耍流氓。MySQL没有限制单表最大记录数,它取决于操作系统对文件大小的限制。 《阿里巴巴Java开发手册》提出单表行数超过500万行或者单表容量超过2GB,才推荐分库分表。性能由综合因素决定,抛开业务复杂度,影响程度依次是硬件配置、MySQL配置、数据表设计、索引优化。500万这个值仅供参考,并非铁律。 博主曾经操作过超过4亿行数据

无人叉车3d激光slam多房间建图定位异常处理方案-墙体画线地图切分方案

墙体画线地图切分方案 针对问题:墙体两侧特征混淆误匹配,导致建图和定位偏差,表现为过门跳变、外月台走歪等 ·解决思路:预期的根治方案IGICP需要较长时间完成上线,先使用切分地图的工程化方案,即墙体两侧切分为不同地图,在某一侧只使用该侧地图进行定位 方案思路 切分原理:切分地图基于关键帧位置,而非点云。 理论基础:光照是直线的,一帧点云必定只能照射到墙的一侧,无法同时照到两侧实践考虑:关

hdu1043(八数码问题,广搜 + hash(实现状态压缩) )

利用康拓展开将一个排列映射成一个自然数,然后就变成了普通的广搜题。 #include<iostream>#include<algorithm>#include<string>#include<stack>#include<queue>#include<map>#include<stdio.h>#include<stdlib.h>#include<ctype.h>#inclu

性能分析之MySQL索引实战案例

文章目录 一、前言二、准备三、MySQL索引优化四、MySQL 索引知识回顾五、总结 一、前言 在上一讲性能工具之 JProfiler 简单登录案例分析实战中已经发现SQL没有建立索引问题,本文将一起从代码层去分析为什么没有建立索引? 开源ERP项目地址:https://gitee.com/jishenghua/JSH_ERP 二、准备 打开IDEA找到登录请求资源路径位置

MySQL数据库宕机,启动不起来,教你一招搞定!

作者介绍:老苏,10余年DBA工作运维经验,擅长Oracle、MySQL、PG、Mongodb数据库运维(如安装迁移,性能优化、故障应急处理等)公众号:老苏畅谈运维欢迎关注本人公众号,更多精彩与您分享。 MySQL数据库宕机,数据页损坏问题,启动不起来,该如何排查和解决,本文将为你说明具体的排查过程。 查看MySQL error日志 查看 MySQL error日志,排查哪个表(表空间

高效+灵活,万博智云全球发布AWS无代理跨云容灾方案!

摘要 近日,万博智云推出了基于AWS的无代理跨云容灾解决方案,并与拉丁美洲,中东,亚洲的合作伙伴面向全球开展了联合发布。这一方案以AWS应用环境为基础,将HyperBDR平台的高效、灵活和成本效益优势与无代理功能相结合,为全球企业带来实现了更便捷、经济的数据保护。 一、全球联合发布 9月2日,万博智云CEO Michael Wong在线上平台发布AWS无代理跨云容灾解决方案的阐述视频,介绍了

【C++】_list常用方法解析及模拟实现

相信自己的力量,只要对自己始终保持信心,尽自己最大努力去完成任何事,就算事情最终结果是失败了,努力了也不留遗憾。💓💓💓 目录   ✨说在前面 🍋知识点一:什么是list? •🌰1.list的定义 •🌰2.list的基本特性 •🌰3.常用接口介绍 🍋知识点二:list常用接口 •🌰1.默认成员函数 🔥构造函数(⭐) 🔥析构函数 •🌰2.list对象