Flume组件

1、什么是Flume：apache顶级项目，主要用来做数据采集。分布式、高可用，将海量日志进行采集、聚合、传输的系统。能够对数据进行简单处理在发送到接收方。

2、Flume组件：source、channel、sink，一个Flume可以有一个source，多个channel、多个sink

（1）source：数据收集组件，将日志从不同的client中收集过来。

（2）channel：数据缓冲区。临时存储从source传过来的Event。

（3）sink：将event从channel中读取出来并移除，传输至数据接收方，或者连接下一个agent的线管中。

source、channel、sink共同组成了一个agent，一个agent就是一个JVM，一个angent运行在一台服务器上。

event是一个数据单元，由消息头和消息体组成，可以是日志记录、avro对象。

3、source常见的源：spooling directory、exec、syslog、JMS Source、Avro Source

三种可监控文件或目录的source：

spooling directory source：监控一个目录，并同步目录下的新文件到sink，被同步完的文件可被立即删除或打上标记。适用于同步新文件，不适用于实时追加日志的文件进行监听和同步。可改进解决。

exec source：可以通过tail -f 命令tail住一个文件，然后将日志文件追加的内容实时同步到sink中。但是存在的问题就是agent挂了，再次重启，会有数据重复读取的问题。可通过添加uuid来解决，或改进。

taildir source：可以实时监控一批文件，并记录每个文件最新消费的位置。agent重启后不会有重复消费的问题。

JMS Source：java 消息中间件。

Avro Source：数据序列化系统。

补充：这里的source组件可以自定义：例如项目需要监控mysql中的数据，实时的从mysql中拉取数据，这时我们可以自己实现MysqlSource。参考官方文档，需要继承AbstractSource并实现其中的方法。

4、双层Flume：双层Flume主要用来做负载均衡、容灾

第一层Flume做数据采集，第二层Flume做数据聚合和sink。两层之间采用sinkGroup实现负载均衡。

第一层某个代理失败，那么可以考虑由第一层的其他节点来接管故障节点。如果是第二层代理停止运行，则为了防止数据丢失，只能让每一个第一层代理具有多个冗余的Avro sink，然后把这些sink安排到同一个sink组中，如果第二层代理中的某个代理出现问题，则该事件会被传递给该层sink组的其他代理来完成，以此来实现故障转移和负载均衡。

Flume多层代理防止数据丢失：

https://blog.csdn.net/qq_26442553/article/details/79042603

https://blog.csdn.net/huonan_123/article/details/88421847

参考博客：https://www.cnblogs.com/frankdeng/p/9067102.html

Flume组件的更多相关文章

【Hadoop】10、Flume组件
目录 Flume组件安装配置 1.下载和解压 Flume 2.Flume 组件部署 3.使用 Flume 发送和接受信息 Flume组件安装配置 1.下载和解压 Flume # 传Flume安装包 [ ...
Flume 组件安装配置
下载和解压 Flume 实验环境可能需要回至第四,五,六章(hadoop和hive),否则后面传输数据可能报错(猜测)! 可以从官网下载 Flume 组件安装包 , 下载地址 ...
flume组件汇总 source、sink、channel
Flume Source Source类型说明 Avro Source 支持Avro协议(实际上是Avro RPC),内置支持 Thrift Source 支持Thrift协议,内置支持 Exec ...
Flume组件source，channel，sink源码分析
LifeCycleState: IDLE, START, STOP, ERROR [Source]: org.apache.flume.Source 继承LifeCycleAware{stop() + ...
Flume组件汇总2
Component Interface Type Alias Implementation Class org.apache.flume.Channel memory org.apache.flume ...
flume常用组件
Flume组件 1. Source NetCat Source:绑定的端口(tcp.udp),将流经端口的每一个文本行数据作为Event输入: type:source的类型,必须是netcat. ...
数据采集组件：Flume基础用法和Kafka集成
本文源码:GitHub || GitEE 一.Flume简介 1.基础描述 Flume是Cloudera提供的一个高可用的,高可靠的,分布式的海量日志采集.聚合和传输的系统,Flume支持在日志系统中 ...
Flume官方文档翻译——Flume 1.7.0 User Guide （unreleased version）（二）
Flume官方文档翻译--Flume 1.7.0 User Guide (unreleased version)(一) Logging raw data(记录原始数据) Logging the raw ...
《OD学Flume》20160806Flume和Kafka
一.Flume http://flume.apache.org/FlumeUserGuide.html Flume是一个分布式的,可靠的,可用的,非常有效率的对大数据量的日志数据进行收集.聚集.移动信 ...

随机推荐

laravel中一些非常常用的php artisan命令
php artisan 命令在开发laravel项目中非常常用,下面是一些总结 composer config -g repo.packagist composer https://mirrors.a ...
面试题：在一个文件中有 10G 个整数,乱序排列,要求找出中位数(内存限制为2G)
假设整数为32bit,4个字节存储这种题目,首先想到的是分而治之.将文件中数字分组.然后遍历文件中的数字,按分组进行计数.最后找到中位数所在的分组区间 1.如果10G个整数都为同一个,那么10G整数 ...
【scratch3.0教程】1.1 走进编程世界
第一章认识Scratch 第1课走进编程世界大家认识下图中的人物吗? 史蒂夫·乔布斯比尔·盖茨 ●Elon Musk,特斯拉.Space X火箭公司创始人,9岁学习 ...
GOF 的23种JAVA常用设计模式总结 03 面向对象七大设计原则
在软件开发中,为了提高软件系统的可维护性和可复用性,增加软件的可扩展性和灵活性,程序员要尽量根据 7 条原则来开发程序,从而提高软件开发效率.节约软件开发成本和维护成本. 各位代码界的大佬们总结出的七 ...
Windows中的消息与消息队列
消息在Windows中,消自由MSG结构体表示 typedef struct tagMSG { HWND hwnd; UINT message; WPARAM wParam; LPARAM lPar ...
js计算结果不精确问题解决--math.js的使用
最近在做订单相关的一个功能,涉及到金额的计算,有人建议,将计算全部抛给后端来做吧,前端就不需要再维护一套算法了,话说的在理,但是呢,想想用户体验,单价*数量=金额,当用户改变一个数量时,用户都口算出来 ...
cxx11emu.h 和 logprint.h
cxx11emu.h 和 logprint.h /* Start of cxx11emu.h */ #ifndef STDBP_CXX11EMU_H_ #define STDBP_CXX11EMU_H ...
Java调用WebService方法总结(4)--Axis调用WebService
Axis是比较常用的WebService框架,该项目在2006实现了最终版,后面就没有更新了.文中demo所使用到的软件版本:Java 1.8.0_191.Axis 1.4. 1.准备参考Java调 ...
pycharm从本地离线添加模块
豆瓣的源: http://pypi.douban.com/simple pip install matplotlib -i http://pypi.douban.com/simple --truste ...
MySql注释的写法
每一种语言都有它的注释方式,代码量少的时候还可以,随着代码量越来越多,代码注释的重要性也越发凸显. 在mysql中主要有三种方式: 1.常用的方式,跟在css中那些注释一样 :/* 内容 */ /* ...

Flume组件

Flume组件的更多相关文章

随机推荐

热门专题