Hadoop之Flume详解

1、日志采集框架Flume
　　1.1 Flume介绍
　　　　Flume是一个分布式、可靠、和高可用的海量日志采集、聚合和传输的系统。
　　　　Flume可以采集文件，socket数据包等各种形式源数据，又可以将采集到的数据输出到HDFS、hbase、hive、
　　　　kafka等众多外部存储系统中
　　　　一般的采集需求，通过对flume的简单配置即可实现
　　　　Flume针对特殊场景也具备良好的自定义扩展能力，因此，flume可以适用于大部分的日常数据采集场景

　　1.2 运行机制
　　　　1、 Flume分布式系统中最核心的角色是agent，flume采集系统就是由一个个agent所连接起来形成
　　　　2、每一个agent相当于一个数据传递员（Source 到 Channel 到 Sink之间传递数据的形式是Event事件；
　　　　　　Event事件是一个数据流单元。），内部有三个组件：
　　　　　　a) Source：采集源，用于跟数据源对接，以获取数据
　　　　　　b) Sink：下沉地，采集数据的传送目的，用于往下一级agent传递数据或者往最终存储系统传递数据
　　　　　　c) Channel：angent内部的数据传输通道，用于从source将数据传递到sink

　　1.3 采集案例
　　　　1、采集目录到HDFS
　　　　　　采集需求：某服务器的某特定目录下，会不断产生新的文件，每当有新文件出现，就需要把文件采集到HDFS中去
　　　　　　根据需求，首先定义以下3大要素
　　　　　　1) 采集源，即source——监控文件目录 : spooldir
　　　　　　2) 下沉目标，即sink——HDFS文件系统 : hdfs sink
　　　　　　3) source和sink之间的传递通道——channel，可用file channel 也可以用内存channel
　　　　配置文件编写：
　　　　　　# 配置source组件
　　　　　　agent1.sources.source1.type = spooldir
　　　　　　agent1.sources.source1.spoolDir = /home/hadoop/logs/
　　　　　　# 配置sink组件
　　　　　　agent1.sinks.sink1.type = hdfs
　　　　　　agent1.sinks.sink1.hdfs.path =hdfs://hdp-node-01:9000/weblog/flume-collection/%y-%m-%d/%H-%M
　　　　　　agent1.sinks.sink1.hdfs.filePrefix = access_log

　　Channel参数解释：
　　　　capacity：默认该通道中最大的可以存储的event数量
　　　　trasactionCapacity：每次最大可以从source中拿到或者送到sink中的event数量
　　　　keep-alive：event添加到通道中或者移出的允许时间

2、采集文件到HDFS
　　采集需求：比如业务系统使用log4j生成的日志，日志内容不断增加，需要把追加到日志文件中的数据实时采集到hdfs
　　根据需求，首先定义以下3大要素
　　　　1）采集源，即source——监控文件内容更新 : exec ‘tail -F file’
　　　　2）下沉目标，即sink——HDFS文件系统 : hdfs sink
　　　　3） Source和sink之间的传递通道——channel，可用file channel 也可以用内存channel

　　　　# Describe/configure tail -F source1
　　　　agent1.sources.source1.type = exec
　　　　agent1.sources.source1.command = tail -F /home/hadoop/logs/access_log
　　　　agent1.sources.source1.channels = channel1
　　　　# Describe sink1
　　　　agent1.sinks.sink1.type = hdfs
　　　　#a1.sinks.k1.channel = c1
　　　　agent1.sinks.sink1.hdfs.path =hdfs://hdp-node-01:9000/weblog/flume-collection/%y-%m-%d/%H-%M
　　　　agent1.sinks.sink1.hdfs.filePrefix = access_log

Hadoop之Flume详解的更多相关文章

【转载】Hadoop历史服务器详解
免责声明: 本文转自网络文章,转载此文章仅为个人收藏,分享知识,如有侵权,请联系博主进行删除. 原文作者:过往记忆(http://www.iteblog.com/) 原文地址: ...
hadoop hdfs uri详解
body{ font-family: "Microsoft YaHei UI","Microsoft YaHei",SimSun,"Segoe UI& ...
hadoop基础-SequenceFile详解
hadoop基础-SequenceFile详解作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.SequenceFile简介 1>.什么是SequenceFile 序列文件 ...
Hadoop RPC机制详解
网络通信模块是分布式系统中最底层的模块,他直接支撑了上层分布式环境下复杂的进程间通信逻辑,是所有分布式系统的基础.远程过程调用(RPC)是一种常用的分布式网络通信协议,他允许运行于一台计算机的程序调用 ...
hadoop之mapreduce详解（进阶篇）
上篇文章hadoop之mapreduce详解(基础篇)我们了解了mapreduce的执行过程和shuffle过程,本篇文章主要从mapreduce的组件和输入输出方面进行阐述. 一.mapreduce ...
hadoop之yarn详解（框架进阶篇）
前面在hadoop之yarn详解(基础架构篇)这篇文章提到了yarn的重要组件有ResourceManager,NodeManager,ApplicationMaster等,以及yarn调度作业的运行 ...
Hadoop之WordCount详解
花了好长时间查找资料理解.学习.总结这应该是一篇比较全面的MapReduce之WordCount文章了耐心看下去 1,创建本地文件在hadoop-2.6.0文件夹下创建一个文件夹data,在其中 ...
hadoop Shell命令详解
调用文件系统(FS)Shell命令应使用bin/hadoop fs <args>的形式.所有的的FS shell命令使用URI路径作为参数.URI路径详解点击这里. 1.cat说明:将路径 ...
hadoop之mapreduce详解（基础篇）
本篇文章主要从mapreduce运行作业的过程,shuffle,以及mapreduce作业失败的容错几个方面进行详解. 一.mapreduce作业运行过程 1.1.mapreduce介绍 MapRed ...

随机推荐

[学习笔记]Senparc.CO2NET 缓存使用笔记
>笔记1:如果需要调用远程的Redis,那么您需要2步步骤1: 在项目的web.config文件中配置  <add key=& ...
linu触摸屏幕
一..前提知识 1.Linux输入子系统(Input Subsystem): 在Linux中,输入子系统是由输入子系统设备驱动层.输入子系统核心层(Input Core)和输入子系统事件处理层(Eve ...
C++自带栈与队列_stack_queue_C++
栈和队列我们可以用C++里自带的函数使用,就不必手写了 1.栈,需要开头文件 #include<stack> 定义一个栈s:stack<int> s; 具体操作: s.emp ...
SQL Server 及 Visual Studio的离线帮助文档
1>Sql Server帮助文档下载:地址 2>Visual Studion帮助文档下载:地址 3>安装Help Viewer 4>浏览到刚才下载的文件处进行安装 4>设 ...
gdb 打印内存 x
GNU gdb (Ubuntu -0ubuntu1~ Copyright (C) Free Software Foundation, Inc. License GPLv3+: GNU GPL vers ...
cocos2d-iphone心得
源码下载地址: http://code.google.com/p/cocos2d-iphone/downloads/list https://github.com/cocos2d/cocos2d-ip ...
Jquery Dom节点常用操作
select 标签 form提交的时候提交select标签选中的value值 1. 添加项 $("#select_id").append("<option val ...
安装戴尔OMSA
设置变量versionum=`cat /etc/redhat-release | awk '{print $3}' | awk -F '.' '{print $1}'`versionname=`cat ...
JavaWeb响应下载（包含工具类）
纸上得来终觉浅,绝知此事要躬行!今天博主分享是关于javaweb的响应(response)下载以下是我的Demo: 页面我就粘主要部分的代码 <a href = "${pageCon ...
shell 练习（免密钥登陆脚本）
脚本说明本地服务器ip 10.0.0.5 远程服务器地址 10.0.0.223 #!/bin/bashremote_ip=$ if [ ! -n "$1" ] ;then ech ...

Hadoop之Flume详解

Hadoop之Flume详解的更多相关文章

随机推荐

热门专题