问题

https://github.com/alibaba/canal

binlog 同步组件,canal 使用是比较广泛的,canal 逻辑架构如图:

部署架构如图:

canal 基于主从模式,任务都运行在 master 中,client 从 master 拉取数据。在使用 canal server 的过程中,我们遇到了一些问题,例如扩展性不足,默认情况下,当任务流量变多变大时,单机无法支持大流量,要么增加主从集群,要么增加机器配置。

相关讨论:https://github.com/alibaba/canal/issues/147

增加主从集群的问题:slave 机器很浪费。官方建议手动修改 running 配置,将 instance 平均分散。这样可以避免机器浪费。手工操作,不太友好,当流量突然变大时,无法应对。另外,操作麻烦,需要将任务从 a 集群迁移到 b 集群。

增加机器配置的问题:需要重启机器,重启前,需要转移任务到其他的机器,升级成功后,再手动转移回来(通过修改 zk

running 配置)这个对线上操作,不太友好。如果是临时流量,那就更危险了。

部署不太友好,基于 ECS 的部署方式很麻烦,不符合目前 k8s 动态扩缩容的设计。

不支持全量同步 + 增量同步,限流等逻辑。

设计

基于以上问题,我们想设计出一种支持以下特性的架构。

  1. canal 任务可自动均匀分散在集群中,且集群机器互为主备。此需求解决大量任务运行+资源浪费+ 手动操作风险

  2. 该架构支持 k8s 集群,可快速扩容,升配。此需求解决大流量问题。

  3. 能够将指定的 canal 任务移动到指定机器。(虽然大部分任务流量不大,但需要考虑部分任务流量很大,需要单独高性能机器)

  4. 支持限流,暂停等操作。

如上图所示,我们定义了几个角色:

  1. Manager,表示这个集群的管理者,用于调度 worker,并接收 worker 心跳

  2. worker,用于执行 task 任务

  3. task,包含 canal Server,canal client,binlog handler,能够连接 MySQL 服务器,拉取 binlog,并交给 binlog handler 处理,例如直接插入目标 MySQL,投递 Kafka,RocketMQ ,ES 等等。

高可用?

如何保证高可用?

当一个 worker 挂掉了,manager 收不到心跳,会将这个 worker 上任务,转移到其他的 worker 上(manager 会有一个 30s 间隔的定时任务扫描心跳),注意:task 有状态,状态保存在 Zookeeper 上。worker 宕机后,manager 会在其他的 worker 上启动 task,此时 task 会从 Zookeeper 上读取状态,这块逻辑和 canal 自身几乎相同。

扩展性?

当任务较多时,基于 k8s 基础之上,可立刻扩容机器,新机器会向 manager 发送心跳,manager 收到心跳后,则会将其他 worker 的任务,转移部分到新的 worker 上。

升配时,可先启动高配置 worker,manager 会将任务转移到高配置 worker,然后,k8s 系统会自动销毁低配置机器。此时,系统逻辑会回到高可用系统中。

部署?

worker 和 manager 本身基于 springCloud,无状态,可快速扩展。

增量 + 全量?

manager 系统已经实现该逻辑,当全量任务同步前,会先开启增量任务并暂时保存,然后开启全量任务,当全量任务结束时,会自动触发增量数据回放,回放结束后,则会回到纯增量逻辑

指定部署

指定将某个任务部署到指定机器,这个比较简单,manager 系统支持将指定任务名,分配到指定 ip 启动。

效果

上图显示了我们的系统,首页中,显示 worker 节点 8 个。task 35 个,qps 241, 下面的 running worker list 显示了 worker 工作详情(QPS,task 数量),每个worker 的 task 数量基本相同,但也支持手动调节。

上图显示了 manager 支持自动重新负载所有 task。目的是让所有 task 均匀分布在运行的 worker 上。

下面的手动,显示了可以将某个指定 task 转移到指定 机器 上。

上图显示了如何创建一个任务。

上图显示了任务列表,可配置 QPS 进行限流,可早操作界面停止子任务。

目前,我司大部分同步任务,包括全量任务,增量任务,全量+增量任务,基本都使用该系统。业务场景包括,同步 MySQL 到 ES,数据库迁移,数据库同步,全链路压测影子库数据同步等。效果很好。

最后

感谢 canal 团队提供优秀的产品,使我们在 canal 基础上,开发了该系统。

基于 Canal 设计可扩展、高可用 binlog 同步集群的更多相关文章

  1. 基于MySQL+MHA+Haproxy部署高可用负载均衡集群

    一.MHA 概述 MHA(Master High Availability)是可以在MySQL上使用的一套高可用方案.所编写的语言为Perl 从名字上我们可以看到.MHA的目的就是为了维护Master ...

  2. LVS+Keepalived搭建MyCAT高可用负载均衡集群

    LVS+Keepalived 介绍 LVS LVS是Linux Virtual Server的简写,意即Linux虚拟服务器,是一个虚拟的服务器集群系统.本项目在1998年5月由章文嵩博士成立,是中国 ...

  3. Dubbo入门到精通学习笔记(二十):MyCat在MySQL主从复制的基础上实现读写分离、MyCat 集群部署(HAProxy + MyCat)、MyCat 高可用负载均衡集群Keepalived

    文章目录 MyCat在MySQL主从复制的基础上实现读写分离 一.环境 二.依赖课程 三.MyCat 介绍 ( MyCat 官网:http://mycat.org.cn/ ) 四.MyCat 的安装 ...

  4. LVS+Keepalived 实现高可用负载均衡集群

    LVS+Keepalived  实现高可用负载均衡集群     随着网站业务量的增长,网站的服务器压力越来越大?需要负载均衡方案!商业的硬件如 F5 ,Array又太贵,你们又是创业型互联公司如何有效 ...

  5. 1.还不会部署高可用的kubernetes集群?看我手把手教你使用二进制部署v1.23.6的K8S集群实践(上)

    公众号关注「WeiyiGeek」 设为「特别关注」,每天带你玩转网络安全运维.应用开发.物联网IOT学习! 本章目录: 0x00 前言简述 0x01 环境准备 主机规划 软件版本 网络规划 0x02 ...

  6. K8S 使用Kubeadm搭建高可用Kubernetes(K8S)集群 - 证书有效期100年

    1.概述 Kubenetes集群的控制平面节点(即Master节点)由数据库服务(Etcd)+其他组件服务(Apiserver.Controller-manager.Scheduler...)组成. ...

  7. 企业运维实践-还不会部署高可用的kubernetes集群?使用kubeadm方式安装高可用k8s集群v1.23.7

    关注「WeiyiGeek」公众号 设为「特别关注」每天带你玩转网络安全运维.应用开发.物联网IOT学习! 希望各位看友[关注.点赞.评论.收藏.投币],助力每一个梦想. 文章目录: 0x00 前言简述 ...

  8. keepalived工作原理和配置说明 腾讯云VPC内通过keepalived搭建高可用主备集群

    keepalived工作原理和配置说明 腾讯云VPC内通过keepalived搭建高可用主备集群 内网路由都用mac地址 一个mac地址绑定多个ip一个网卡只能一个mac地址,而且mac地址无法改,但 ...

  9. Haproxy+Keepalived搭建Weblogic高可用负载均衡集群

    配置环境说明: KVM虚拟机配置 用途 数量 IP地址 机器名 虚拟IP地址 硬件 内存3G  系统盘20G cpu 4核 Haproxy keepalived 2台 192.168.1.10 192 ...

  10. 高可用的MongoDB集群

    1.序言 MongoDB 是一个可扩展的高性能,开源,模式自由,面向文档的数据库. 它使用 C++编写.MongoDB 包含一下特点: l  面向集合的存储:适合存储对象及JSON形式的数据. l ...

随机推荐

  1. 带你掌握利用Terraform不同数据源扩展应用场景

    本文分享自华为云社区<利用Terraform不同数据源扩展应用场景>,作者: kaliarch . 一 背景 在生产环境中使用Terraform进行基础设施编排,通常又一些信息是通过其他外 ...

  2. MIT 6.5840 Raft Implementation(2A, Leader Election)

    Raft实现思路+细节 2A 任务分解 总体来说,2A中主要的任务就是选出领导人,在选出领导人的时候,我们要遵循下图. 在2A中,由于并没有出现日志复制,所以我们只需要考察两者的任期是否相等,以及接收 ...

  3. Typescript:基础语法学习(尚硅谷 李立超)

    官方文档:https://www.tslang.cn/docs/handbook/typescript-in-5-minutes.html 搭建开发环境 npm i -g typescript安装完成 ...

  4. JDV背后的技术-助力618

    一.项目介绍 JDV(可视化大屏)是京东内部搭建可视化大屏的数据工具平台,内置10+种模版特效,40+种风格各异的图表.导航等组件.与集团其他数据工具打通,支持一站式.自助化.拖拽式搭建大屏,实现数据 ...

  5. 《CUDA编程:基础与实践》读书笔记(2):CUDA内存

    1. 全局内存 核函数中的所有线程都能够访问全局内存(global memory).全局内存的容量是所有设备内存中最大的,但由于它没有放在GPU芯片内部,因此具有相对较高的延迟和较低的访问速度,cud ...

  6. 8.0 Python 使用进程与线程

    python 进程与线程是并发编程的两种常见方式.进程是操作系统中的一个基本概念,表示程序在操作系统中的一次执行过程,拥有独立的地址空间.资源.优先级等属性.线程是进程中的一条执行路径,可以看做是轻量 ...

  7. CF939F Cutlet 题解

    题意简述 有一个正反面都为 \(0\) 的卡片,每过 \(1\) 分朝下那一面的数值就会增加 \(1\),你可以在几个区间的时间内翻转卡片,求经过 \(2n\) 秒后能否让这个卡片的正反面的数都为 \ ...

  8. The database operation was expected to affect 1 row(s), but actually affected 0 row(s); 解决乐观并发

    The database operation was expected to affect 1 row(s), but actually affected 0 row(s); 解决乐观并发 1.乐观并 ...

  9. 使用API数据接口获取商品详情数据的流程

    API数据接口是开发者获取第三方平台数据的一种方式,使用API接口可以快速地获取海量的商品详情数据,相比其他方式更加高效.实时.下面将介绍使用API数据接口获取商品详情数据的主要流程和步骤: 申请AP ...

  10. shopee商品详情接口的应用

    Shopee是东南亚和台湾地区最大的电子商务平台之一,成立于2015年,目前覆盖6个国家和地区.作为一家新兴电商平台,Shopee拥有快速增长的销售额和庞大的用户群体,为开发者提供了丰富的商业机会.其 ...