Strom实现单词统计代码

 import java.io.File;

 import java.io.IOException;

 import java.util.Collection;

 import java.util.HashMap;

 import java.util.List;

 import java.util.Map;

 import java.util.Map.Entry;

 import org.apache.commons.io.FileUtils;

 import backtype.storm.Config;

 import backtype.storm.LocalCluster;

 import backtype.storm.spout.SpoutOutputCollector;

 import backtype.storm.task.OutputCollector;

 import backtype.storm.task.TopologyContext;

 import backtype.storm.topology.OutputFieldsDeclarer;

 import backtype.storm.topology.TopologyBuilder;

 import backtype.storm.topology.base.BaseRichBolt;

 import backtype.storm.topology.base.BaseRichSpout;

 import backtype.storm.tuple.Fields;

 import backtype.storm.tuple.Tuple;

 import backtype.storm.tuple.Values;

 import backtype.storm.utils.Utils;

 /**

  * 单词计数

  * 监控d:\\test目录下面的文件，统计单词出现的总次数

  * 当有新文件出现的时候，也要能解析出来

  *

  * @author Administrator

  *

  */

 public class LocalTopologyWordCount {

     /**

      * spout需要继承baserichspout，实现未实现的方法

      * @author Administrator

      *

      */

     public static class DataSourceSpout extends BaseRichSpout{

         private Map conf;

         private TopologyContext context;

         private SpoutOutputCollector collector;

         /**

          * 初始化方法，只会执行一次

          * 在这里面可以写一个初始化的代码

          * Map conf：其实里面保存的是topology的一些配置信息

          * TopologyContext context：topology的上下文，类似于servletcontext

          * SpoutOutputCollector collector：发射器，负责向外发射数据(tuple)

          */

         @Override

         public void open(Map conf, TopologyContext context,

                 SpoutOutputCollector collector) {

             this.conf = conf;

             this.context = context;

             this.collector = collector;

         }

         /**

          * 这个方法是spout中最重要的方法，

          * 这个方法会被storm框架循环调用，可以理解为这个方法是在一个while循环之内

          * 每调用一次，会向外发射一条数据

          */

         @Override

         public void nextTuple() {

             //获取指定目录下面的新文件，

             Collection<File> listFiles = FileUtils.listFiles(new File("d:\\test"), new String[]{"txt"}, true);

             //分别读取每个文件

             for (File file : listFiles) {

                 try {

                     List<String> readLines = FileUtils.readLines(file);

                     for (String line : readLines) {

                         //把每一行封装成一个tuple，发射出去

                         this.collector.emit(new Values(line));

                     }

                     FileUtils.moveFile(file, new File(file.getAbsolutePath()+System.currentTimeMillis()));//给文件该名字,否则会一直处理这个文件.

                 } catch (IOException e) {

                     e.printStackTrace();

                 }

             }

         }

         /**

          * 声明输出字段

          */

         @Override

         public void declareOutputFields(OutputFieldsDeclarer declarer) {

             //给values中的数据起个名字，方便后面的bolt从这个values中取数据

             //fields中定义的参数和values中传递的数值是一一对应的

             declarer.declare(new Fields("line"));

         }

     }

     /**

      * 自定义bolt需要实现baserichbolt

      * @author Administrator

      *

      */

     public static class SplitBolt extends BaseRichBolt{

         private Map stormConf;

         private TopologyContext context;

         private OutputCollector collector;

         /**

          * 和spout中的open方法意义一样

          */

         @Override

         public void prepare(Map stormConf, TopologyContext context,

                 OutputCollector collector) {

             this.stormConf = stormConf;

             this.context = context;

             this.collector = collector;

         }

         /**

          * 是bolt中最重要的方法，当spout发射一个tuple出来，execute也会被调用，需要对spout发射出来的tuple进行处理

          */

         @Override

         public void execute(Tuple input) {

             //获取每一行数据进行切割

             String line = input.getStringByField("line");

             String[] splits = line.split("\t");

             //把切割出来的单词一个一个发射出去

             for (String word : splits) {

                 this.collector.emit(new Values(word));

             }

         }

         //在这没必要定义了，因为execute方法中没有向外发射tuple，所以就不需要声明了。

         //如果nextTuple或者execute方法中向外发射了tuple，那么declareOutputFields必须要声明，否则不需要声明

         /**

          * 声明输出字段

          */

         @Override

         public void declareOutputFields(OutputFieldsDeclarer declarer) {

             declarer.declare(new Fields("word"));

         }

     }

     /**

      * 自定义bolt需要实现baserichbolt

      * @author Administrator

      *

      */

     public static class CountBolt extends BaseRichBolt{

         private Map stormConf;

         private TopologyContext context;

         private OutputCollector collector;

         /**

          * 和spout中的open方法意义一样

          */

         @Override

         public void prepare(Map stormConf, TopologyContext context,

                 OutputCollector collector) {

             this.stormConf = stormConf;

             this.context = context;

             this.collector = collector;

         }

         HashMap<String, Integer> hashMap = new HashMap<String, Integer>();

         /**

          * 是bolt中最重要的方法，当spout发射一个tuple出来，execute也会被调用，需要对spout发射出来的tuple进行处理

          */

         @Override

         public void execute(Tuple input) {

             //获取每一个单词

             String word = input.getStringByField("word");

             //在map中进行统计

             Integer integer = hashMap.get(word);

             if(integer==null){

                 integer=0;

             }

             integer++;

             hashMap.put(word, integer);

             //把这个统计结果打印到控制台

             Utils.sleep(1000);

             System.out.println("=========================================");

             for (Entry<String, Integer> entry : hashMap.entrySet()) {

                 System.out.println(entry);

             }

         }

         //在这没必要定义了，因为execute方法中没有向外发射tuple，所以就不需要声明了。

         //如果nextTuple或者execute方法中向外发射了tuple，那么declareOutputFields必须要声明，否则不需要声明

         /**

          * 声明输出字段

          */

         @Override

         public void declareOutputFields(OutputFieldsDeclarer declarer) {

         }

     }

     /**

      * 注意：在组装topology的时候，组件的id在定义的时候，名称不能以__开头。__是系统保留的

      * @param args

      */

     public static void main(String[] args) {

         //组装topology

         TopologyBuilder topologyBuilder = new TopologyBuilder();

         topologyBuilder.setSpout("spout1", new DataSourceSpout());

         //.shuffleGrouping("spout1"); 表示让MyBolt接收MySpout发射出来的tuple

         topologyBuilder.setBolt("bolt1", new SplitBolt()).shuffleGrouping("spout1");

         topologyBuilder.setBolt("bolt2", new CountBolt()).shuffleGrouping("bolt1");

         //创建本地storm集群

         LocalCluster localCluster = new LocalCluster();

         localCluster.submitTopology("wordCountTopology", new Config(), topologyBuilder.createTopology());

     }

 }

Strom实现单词统计代码的更多相关文章

Storm实现单词统计代码
import java.io.File; import java.io.IOException; import java.util.Collection; import java.util.HashM ...
2、 Spark Streaming方式从socket中获取数据进行简单单词统计
Spark 1.5.2 Spark Streaming 学习笔记和编程练习 Overview 概述 Spark Streaming is an extension of the core Spark ...
Storm基础概念与单词统计示例
Storm基本概念 Storm是一个分布式的.可靠地.容错的数据流处理系统.Storm分布式计算结构称为Topology(拓扑)结构,顾名思义,与拓扑图十分类似.该拓扑图主要由数据流Stream.数据 ...
java课程课后作业190502之单词统计续集
第1步:输出单个文件中的前 N 个最常出现的英语单词. 功能1:输出文件中所有不重复的单词,按照出现次数由多到少排列,出现次数同样多的,以字典序排列. 功能2: 指定文件目录,对目录下每一个文件执行统 ...
Spark入门（三）--Spark经典的单词统计
spark经典之单词统计准备数据既然要统计单词我们就需要一个包含一定数量的文本,我们这里选择了英文原著<GoneWithTheWind>(<飘>)的文本来做一个数据统计,看 ...
java源码——文件读写和单词统计
本文要解决的问题:"键盘输入一段英语语句,将这段话写入content.txt中,然后输出这段话,并且统计语句中英文单词的数目以及各个单词出现的次数." 分析问题知,核心是文件读写和 ...
Java实现单词统计
原文链接: https://www.toutiao.com/i6764296608705151496/ 单词统计的是统计一个文件中单词出现的次数,比如下面的数据源其中,最终出现的次数结果应该是下面的 ...
MapReduce 单词统计案例编程
MapReduce 单词统计案例编程一.在Linux环境安装Eclipse软件 1. 解压tar包下载安装包eclipse-jee-kepler-SR1-linux-gtk-x86_64.ta ...
VS2010统计代码行数 [转]
按CTRL+SHIFT+F (Find in files),勾上支持正则表达式,然后输入搜索内容: ^:b*[^:b#/]+.*$ 以上表达式的统计可做到:#开头和 /开头或者空行都不计入代 ...

随机推荐

创建可执行的JAR包
创建可执行的JAR文件包,需要使用带cvfm参数的jar命令,命令如下:JAR cvfm test.jar manifest.mf testtest.jar和manifest.mf为两个文件,分别对应 ...
关于表格中td自动换行做法
两个条件一是给table中第一个tr(也就是表头)下的td或者th宽度,代码如下而是让文字碰到边界自动换行 css属性 style="word-wrap:break-word;word- ...
C：进制
进制.C语言内存分配 1.对于进制 10进制 (0 - 9)16进制 (0——9 A B C D E F)硬件中的高低电平(0 和 1表示)所以计算机用二进制机器语言就是由 0 和 1 组成的一 ...
html5 的缓存应用 manifest="filename.appcache"
启动html5的应用缓存 <!DOCTYPE HTML> <html manifest="filename.appcache"> </html> ...
pat 1055 区间前k个
http://pat.zju.edu.cn/contests/pat-a-practise/1055 第二组数据比较大,如果单纯排序直接检索会超时,因为每次都是对所有数据进行遍历. N/200=500 ...
XHTML标签的嵌套规则--很基础很重要
XHTML的标签有许多:div.ul.li.dl.dt.dd.h1~h6.p.a.addressa.span. strong……我们在运用这些标签搭建页面结构的时候,是可以将它们无限嵌套的,但是,嵌套 ...
由实现JavaScript中的Map想到的
项目中要用到JavaScript中的Map数据类型,它不像JDK那样有自带的,怎么办?搜了找到一个不错的(http://darkmasky.iteye.com/blog/454749).用这个可以满足 ...
UVA 12897 Decoding Baby Boos 暴力
Decoding Baby Boos Time Limit: 20 Sec Memory Limit: 256 MB 题目连接 http://acm.hust.edu.cn/vjudge/contes ...
(高精度运算4.7.27)UVA 10494 If We Were a Child Again(大数除法&&大数取余)
package com.njupt.acm; import java.math.BigInteger; import java.util.Scanner; public class UVA_10494 ...
HTML5 修改浏览器url而不刷新页面
嘛,起因是黑子大叔在微博上的一条@信息,找起了这个的实现,看了一圈google的中文信息内似乎还没有怎么提到这个的内容,就发表上来. 详细效果就是类似于用Firefox4+/Chrome 5+/Saf ...

Strom实现单词统计代码

Strom实现单词统计代码的更多相关文章

随机推荐

热门专题