1.采集日志文件时一个很常见的现象采集需求：比如业务系统使用log4j生成日志，日志内容不断增加，需要把追加到日志文件中的数据实时采集到hdfs中。 1.1.根据需求，首先定义一下3大要素：采集源，即source—监控日志文件内容更新：exec ‘tail -F file’ 下沉目标，即sink—HDFS文件系统：hdfs sink Source和sink之间

1.采集日志文件时一个很常见的现象

采集需求：比如业务系统使用log4j生成日志，日志内容不断增加，需要把追加到日志文件中的数据实时采集到hdfs中。

1.1.根据需求，首先定义一下3大要素：

采集源，即source—监控日志文件内容更新：exec ‘tail -F file’
下沉目标，即sink—HDFS文件系统：hdfs sink
Source和sink之间的传递通道—-channel,可用file channel也可以用内存channel。

1.2.进入/home/tuzq/software/apache-flume-1.6.0-bin/agentconf，编写配置文件tail-hdfs.conf，文件内容如下：

# Name the components on this agent

a1.sources = r1

a1.sinks = k1

a1.channels = c1

# Describe/configure the source

## exec表示flume回去调用给的命令，然后从给的命令的结果中去拿数据

a1.sources.r1.type = exec

## 使用tail这个命令来读数据

a1.sources.r1.command = tail -F /home/tuzq/software/flumedata/test.log

a1.sources.r1.channels = c1

# Describe the sink

## 表示下沉到hdfs，类型决定了下面的参数

a1.sinks.k1.type = hdfs

## sinks.k1只能连接一个channel，source可以配置多个

a1.sinks.k1.channel = c1

## 下面的配置告诉用hdfs去写文件的时候写到什么位置，下面的表示不是写死的，而是可以动态的变化的。表示输出的目录名称是可变的

a1.sinks.k1.hdfs.path = /flume/tailout/%y-%m-%d/%H%M/

##表示最后的文件的前缀

a1.sinks.k1.hdfs.filePrefix = events-

## 表示到了需要触发的时间时，是否要更新文件夹，true:表示要

a1.sinks.k1.hdfs.round = true

## 表示每隔1分钟改变一次

a1.sinks.k1.hdfs.roundValue = 1

## 切换文件的时候的时间单位是分钟

a1.sinks.k1.hdfs.roundUnit = minute

## 表示只要过了3秒钟，就切换生成一个新的文件

a1.sinks.k1.hdfs.rollInterval = 3

## 如果记录的文件大于20字节时切换一次

a1.sinks.k1.hdfs.rollSize = 20

## 当写了5个事件时触发

a1.sinks.k1.hdfs.rollCount = 5

## 收到了多少条消息往dfs中追加内容

a1.sinks.k1.hdfs.batchSize = 10

## 使用本地时间戳

a1.sinks.k1.hdfs.useLocalTimeStamp = true

#生成的文件类型，默认是Sequencefile，可用DataStream：为普通文本

a1.sinks.k1.hdfs.fileType = DataStream

# Use a channel which buffers events in memory

##使用内存的方式

a1.channels.c1.type = memory

a1.channels.c1.capacity = 1000

a1.channels.c1.transactionCapacity = 100

# Bind the source and sink to the channel

a1.sources.r1.channels = c1

a1.sinks.k1.channel = c1

1.3.编写完成之后，启动flume,执行的命令是：

[root@hadoop1 flumedata]#cd /home/tuzq/software/apache-flume-1.6.0-bin/agentconf

[root@hadoop1 flumedata]#bin/flume-ng agent -c conf -f agentconf/tail-hdfs.conf -n a1

1.4.通过写一个死循环往test.log中写数据的方式模式日志文件增长

编写shell脚本，模拟日志增长变化。

[root@hadoop1 flumedata]# cd /home/tuzq/software/flumedata

[root@hadoop1 flumedata]# while true

>do

> date >> test.log

> sleep 2

> done

查看日志变化

[root@hadoop1 ~]# cd /home/tuzq/software/flumedata/

[root@hadoop1 flumedata]# ls

access.log  error.log  test.log

[root@hadoop1 flumedata]# tail -f test.log

2017年 06月 13日 星期二 22:02:22 CST

2017年 06月 13日 星期二 22:02:24 CST

2017年 06月 13日 星期二 22:02:26 CST

2017年 06月 13日 星期二 22:02:28 CST

2017年 06月 13日 星期二 22:02:30 CST

2017年 06月 13日 星期二 22:02:32 CST

通过上面的文件，可以看到test.log在不停的追加数据。

到hdfs中进行查看，效果如下：

[root@hadoop1 ~]# hdfs dfs -ls /

Found 5 items

drwxr-xr-x   - root supergroup          0 2017-06-13 12:01 /40000

drwxr-xr-x   - root supergroup          0 2017-06-13 22:01 /flume

-rw-r--r--   3 root supergroup       3719 2017-06-10 12:11 /kms.sh

drwxrwxrwx   - root supergroup          0 2017-06-10 22:06 /tmp

drwxr-xr-x   - root supergroup          0 2017-06-10 22:27 /user

[root@hadoop1 ~]# hdfs dfs -ls /flume

Found 1 items

drwxr-xr-x   - root supergroup          0 2017-06-13 22:01 /flume/tailout

[root@hadoop1 ~]# hdfs dfs -ls /flume/tailout

Found 1 items

drwxr-xr-x   - root supergroup          0 2017-06-13 22:03 /flume/tailout/17-06-13

[root@hadoop1 ~]# hdfs dfs -ls /flume/tailout/17-06-13

Found 4 items

drwxr-xr-x   - root supergroup          0 2017-06-13 22:01 /flume/tailout/17-06-13/2201

drwxr-xr-x   - root supergroup          0 2017-06-13 22:03 /flume/tailout/17-06-13/2202

drwxr-xr-x   - root supergroup          0 2017-06-13 22:04 /flume/tailout/17-06-13/2203

drwxr-xr-x   - root supergroup          0 2017-06-13 22:04 /flume/tailout/17-06-13/2204

[root@hadoop1 ~]# hdfs dfs -ls /flume/tailout/17-06-13

Found 5 items

drwxr-xr-x   - root supergroup          0 2017-06-13 22:01 /flume/tailout/17-06-13/2201

drwxr-xr-x   - root supergroup          0 2017-06-13 22:03 /flume/tailout/17-06-13/2202

drwxr-xr-x   - root supergroup          0 2017-06-13 22:04 /flume/tailout/17-06-13/2203

drwxr-xr-x   - root supergroup          0 2017-06-13 22:05 /flume/tailout/17-06-13/2204

drwxr-xr-x   - root supergroup          0 2017-06-13 22:05 /flume/tailout/17-06-13/2205

[root@hadoop1 /]# hdfs dfs -ls /flume/tailout/17-06-13

Found 6 items

drwxr-xr-x   - root supergroup          0 2017-06-13 22:01 /flume/tailout/17-06-13/2201

drwxr-xr-x   - root supergroup          0 2017-06-13 22:03 /flume/tailout/17-06-13/2202

drwxr-xr-x   - root supergroup          0 2017-06-13 22:04 /flume/tailout/17-06-13/2203

drwxr-xr-x   - root supergroup          0 2017-06-13 22:05 /flume/tailout/17-06-13/2204

drwxr-xr-x   - root supergroup          0 2017-06-13 22:06 /flume/tailout/17-06-13/2205

drwxr-xr-x   - root supergroup          0 2017-06-13 22:06 /flume/tailout/17-06-13/2206

[root@hadoop1 /]

通过上面的案例可以知道，增加的日志文件已经被写入到HDFS中。

flume 增量上传日志文件到HDFS中的更多相关文章

利用Java API通过路径过滤上传多文件至HDFS
在本地文件上传至HDFS过程中,很多情况下一个目录包含很多个文件,而我们需要对这些文件进行筛选,选出符合我们要求的文件,上传至HDFS.这时就需要我们用到文件模式. 在项目开始前,我们先掌握文件模式 ...
【转】Java IOUtils方式上传下载文件 on HDFS
[From]https://www.cnblogs.com/areyouready/p/9795442.html package com.css.hdfs04; import java.io.File ...
xutils工具上传日志文件--后台服务器的搭建
在上一篇文章中使用xutils将手机上保存的日志上传到后台服务器中,现在我们来讲后台服务器是如何搭建的后台服务器采用jsp+sevlet+mysql的框架首先讲mysql数据库的表的建立在fil ...
Azure IoT Hub 十分钟入门系列（4）- 实现从设备上传日志文件/图片到 Azure Storage
本文主要分享一个案例: 10分钟内通过Device SDK上传文件到IoTHub B站视频:https://www.bilibili.com/video/av90224073/ 本文主要有如下内容: ...
hadoop学习笔记（十）：hdfs在命令行的基本操作命令（包括文件的上传和下载和hdfs中的文件的查看等）
hdfs命令行 ()查看帮助 hdfs dfs -help ()查看当前目录信息 hdfs dfs -ls / ()上传文件 hdfs dfs -put /本地路径 /hdfs路径 ()剪切文件 hd ...
xutils工具上传日志文件--使用https并且带进度条显示
package logback.ecmapplication.cetcs.com.myapplication; import android.app.Activity; import android. ...
xutils工具上传日志文件
首先下载xutils java包: 添加到项目的工程中: 第二在新建一个类继承application package logback.ecmapplication.cetcs.com.myapplic ...
上传本地文件到HDFS
源代码: import java.io.IOException; import org.apache.hadoop.conf.Configuration; import org.apache.hado ...
Hadoop Shell命令（基于linux操作系统上传下载文件到hdfs文件系统基本命令学习）
Apache-->hadoop的官网文档命令学习:http://hadoop.apache.org/docs/r1.0.4/cn/hdfs_shell.html FS Shell 调用文件系统( ...

随机推荐

C++客户端访问Java服务端发布的SOAP模式的WebService接口
gSOAP是一个绑定SOAP/XML到C/C++语言的工具,使用它可以简单快速地开发出SOAP/XML的服务器端和客户端 Step1 使用gsoap-2.8\gsoap\bin\win32\wsdl ...
主流HTML5游戏框架的分析和对比
本文主要选取了Construct2.ImactJS.LimeJS.GameMaker.CreateJS.lycheeJS.Crafty.three.js.melonJS.Turbulenz.Quint ...
java IO【转】
Java 流在处理上分为字符流和字节流.字符流处理的单元为 2 个字节的 Unicode 字符,分别操作字符.字符数组或字符串,而字节流处理单元为 1 个字节,操作字节和字节数组. Java 内用 U ...
【LINUX】——gvim中如何配置字体和背景
打开你的.vimrc文件,添加如下内容: set gfn=Tlwg\ Typist\ 16 colorscheme desert 然后保存退出,source .vimrc.如此,每次打开gvim时,加 ...
Linux 文件编码格式转换
如果需要在Linux 中操作windows下的文件,那么经常遇到文件编码转换的问题. Windows中默认的文件格式是GBK(gb2312),而Linux一般都是UTF-. 查看文件编码在vim 中 ...
Three ways to make your WPF images pop out on MouseOver
There are a couple of ways in WPF to make an image pop out when moving mouse over it. Of course we w ...
远程操作与端口转发 SSH原理与运用
SSH不仅可以用于远程主机登录,还可以直接在远程主机上执行操作. 上一节的操作,就是一个例子: $ ssh user@host 'mkdir -p .ssh && cat >&g ...
苹果Mac OS系统修改Hosts文件的方法
使用苹果Mac OS X系统的用户有很多,近期也有不少童鞋问我Mac怎么修改hosts,修改hosts的方式有很多,下面我就整理两种比较方便的方法吧,希望能够帮到大家. 在某些时候可能遇到了需要修改系 ...
用OpenGL进行立方体表面纹理贴图
一.目的掌握OpenGL中纹理对象的创建.绑定与使用方法. 二.简单介绍 1,连接静态库 #pragma comment(lib, "glut32.lib") #pragma c ...
windows下mysql密码忘了怎么办？【转】
前两天在windows的command命令行下,用mysqladmin导入过一些站上数据结果悲催了,mysql.user的内容被改了,root上不了了,权限也变了. 结合了网络上的集中方法,终于成了 ...

flume 增量上传日志文件到HDFS中