最近特别喜欢用Pig，拥有能满足大部分需求的内置函数（built-in functions），支持自定义函数（user defined functions, UDF），能load 纯文本、avro等格式数据；illustrate看pig执行步骤的结果，describe看alias的schema；以轻量级脚本形式跑MapReduce任务，各种爽爆。

1. Word Count

较于中文，英文比较工整，可以根据空格、标点符号进行分词。

A = load '/user/.*/req-temp/text.txt' as (text:chararray);

B = foreach A generate flatten(TOKENIZE(text)) as word;

C = group B by word;

D = foreach C generate COUNT(B), group;

Pig的内置函数TOKENIZE用StringTokenizer来对英文文本进行分词（代码参看这里），继承于抽象类EvalFunc<T>，返回DataBag词组。为了能统计单个词词频，需要用函数flatten对词组进行打散。抽象类EvalFunc<T>为用于pig语句foreach .. generate ..中的基类，以实现对数据字段的转换操作，其中exec()方法在pig运行期间被调用。

public class TOKENIZE extends EvalFunc<DataBag> {

    TupleFactory mTupleFactory = TupleFactory.getInstance();

    BagFactory mBagFactory = BagFactory.getInstance();

    @Override

    public DataBag exec(Tuple input) throws IOException {

        ...

        DataBag output = mBagFactory.newDefaultBag();

        ...

        String delim = " \",()*";

        ...

        StringTokenizer tok = new StringTokenizer((String)o, delim, false);

        while (tok.hasMoreTokens()) {

            output.add(mTupleFactory.newTuple(tok.nextToken()));

        }

        return output;

        ...

    }

}

2. Ansj中文分词

为了写Pig的UDF，需要添加maven依赖：

<dependency>

	<groupId>org.apache.hadoop</groupId>

	<artifactId>hadoop-common</artifactId>

	<version>${hadoop.version}</version>

	<scope>provided</scope>

</dependency>

<dependency>

	<groupId>org.apache.pig</groupId>

	<artifactId>pig</artifactId>

	<version>${pig.version}</version>

	<scope>provided</scope>

</dependency>

<dependency>

	<groupId>org.ansj</groupId>

	<artifactId>ansj_seg-all-in-one</artifactId>

	<version>3.0</version>

</dependency>

输入命令hadoop version得到hadoop的版本，输入pig -i得到pig的版本。务必要保证与集群部署的pig版本一致，要不然会报错：

ERROR org.apache.pig.tools.grunt.Grunt - ERROR 1066: Unable to open iterator for alias D

然后依葫芦画瓢，根据TOKENIZE.java修改，得到中文分词Segment.java：

package com.pig.udf;

public class Segment extends EvalFunc<DataBag> {

	TupleFactory mTupleFactory = TupleFactory.getInstance();

    BagFactory mBagFactory = BagFactory.getInstance();

    @Override

    public DataBag exec(Tuple input) throws IOException {

        try {

            if (input==null)

                return null;

            if (input.size()==0)

                return null;

            Object o = input.get(0);

            if (o==null)

                return null;

            DataBag output = mBagFactory.newDefaultBag();

            if (!(o instanceof String)) {

            	int errCode = 2114;

            	String msg = "Expected input to be chararray, but" +

                " got " + o.getClass().getName();

                throw new ExecException(msg, errCode, PigException.BUG);

            }

            // filter punctuation

            FilterModifWord.insertStopNatures("w");

            List<Term> words = ToAnalysis.parse((String) o);

            words = FilterModifWord.modifResult(words);

            for(Term word: words) {

            	output.add(mTupleFactory.newTuple(word.getName()));

            }

            return output;

        } catch (ExecException ee) {

            throw ee;

        }

    }

    @SuppressWarnings("deprecation")

    @Override

    public Schema outputSchema(Schema input) {

    ...

    }

    ...

ansj支持设置词性的停用词FilterModifWord.insertStopNatures("w");，如此可以去掉标点符号的词。将源代码打包后放在hdfs上，然后通过register jar包调用该UDF：

REGISTER ../piglib/udf-0.0.1-SNAPSHOT-jar-with-dependencies.jar

A = load '/user/.*/renmin.txt' as (text:chararray);

B = foreach A generate flatten(com.pig.udf.Segment(text)) as word;

C = group B by word;

D = foreach C generate COUNT(B), group;

截取人民日报社论的一段：

树好家风，严管才是厚爱。古人说：“居官所以不能清白者，率由家人喜奢好侈使然也。”要看到，好的家风，能系好人生的“第一粒扣子”。“修身、齐家”，才能“治国、平天下”，领导干部首先要“正好家风、管好家人、处好家事”，才能看好“后院”、堵住“后门”。“父母之爱子，则为之计深远”，与其冒着风险给子女留下大笔钱财，不如给子女留下好家风、好作风，那才是让子女受益无穷的东西，才是真正的“为之计深远”。

统计词频如下：

...

(3,能)

(2,要)

(2,计)

(1,与其)

(1,作风)

(1,使然)

(1,修身)

(1,厚爱)

(1,受益)

...

可见，ansj在不加载用户自定义词表的情况下，分词效果并不理想，不能对成语等词正确地分词。

Pig + Ansj 统计中文文本词频的更多相关文章

ChineseCounter.cs 统计中文文本中常用字占比
http://www.tuicool.com/articles/qmMba2 1 using System; using System.IO; using System.Collections.Gen ...
Hadoop的改进实验（中文分词词频统计及英文词频统计）（4/4）
声明: 1)本文由我bitpeach原创撰写,转载时请注明出处,侵权必究. 2)本小实验工作环境为Windows系统下的百度云(联网),和Ubuntu系统的hadoop1-2-1(自己提前配好).如不 ...
用jieba库统计文本词频及云词图的生成
一.安装jieba库 :\>pip install jieba #或者 pip3 install jieba 二.jieba库解析 jieba库主要提供提供分词功能,可以辅助自定义分词词典. j ...
[转]python进行中文文本聚类（切词以及Kmeans聚类）
简介查看百度搜索中文文本聚类我失望的发现,网上竟然没有一个完整的关于Python实现的中文文本聚类(乃至搜索关键词python 中文文本聚类也是如此),网上大部分是关于文本聚类的Kmeans聚类的原 ...
『TensotFlow』RNN中文文本_下_暨研究生开学感想
承前接上节代码『TensotFlow』RNN中文文本_上, import numpy as np import tensorflow as tf from collections import Co ...
『TensotFlow』RNN中文文本_上
中文文字预处理流程文本处理读取+去除特殊符号按照字段长度排序辅助数据结构生成生成 {字符:出现次数} 字典生成按出现次数排序好的字符list 生成 {字符:序号} 字典生成序号list ...
自然语言处理--中文文本向量化counterVectorizer()
1.载入文档 #!/usr/bin/python # -*- coding: utf-8 -*- import pandas as pd import re import jieba from skl ...
word2vec词向量训练及中文文本类似度计算
本文是讲述怎样使用word2vec的基础教程.文章比較基础,希望对你有所帮助! 官网C语言下载地址:http://word2vec.googlecode.com/svn/trunk/ 官网Python ...
万字总结Keras深度学习中文文本分类
摘要:文章将详细讲解Keras实现经典的深度学习文本分类算法,包括LSTM.BiLSTM.BiLSTM+Attention和CNN.TextCNN. 本文分享自华为云社区<Keras深度学习中文 ...

随机推荐

如何重载delegate
在写delegate的时候遇到一个问题,在已有一个不带参数的delegate基础上,试图再增加一个带参数的delegate,结果VS报了“already contains a definition f ...
计划参照mysql-proxy编写mssql-proxy
目前使用haproxy做了mssql多个读库的负载均衡,在生产环境中运行得不错. 不过,这个方案有缺点:客户端需要选择是使用读库,还是写库.这样还是不够方便,如果能够实现自动路由就更好了,即让hapr ...
Hadoop Pig简介、安装、试用
相比Java的MapReduce api,Pig为大型数据集的处理提供了更高层次的抽象,与MapReduce相比,Pig提供了更丰富的数据结构,一般都是多值和嵌套的数据结构.Pig还提供了一套更强大的 ...
动态绑定HTML
在Web前端开发中,我们经常会遇见需要动态的将一些来自后端或者是动态拼接的HTML字符串绑定到页面DOM显示,特别是在内容管理系统(CMS:是Content Management System的缩写) ...
Java提高配（三七）-----Java集合细节（三）：subList的缺陷
我们经常使用subString方法来对String对象进行分割处理,同时我们也可以使用subList.subMap.subSet来对List.Map.Set进行分割处理,但是这个分割存在某些瑕疵. 一 ...
一天一小段js代码（no.2）
(一)可以用下面js代码来检测弹出窗口是否被屏蔽: var blocked = false ; try { /*window.open()方法接受4个参数window.open(要加载的url,窗口目 ...
Redis Geo: Redis新增位置查询功能
转载于:http://www.itxuexiwang.com/a/shujukujishu/redis/2016/0216/144.html 移动互联网增进了人与人之间的联系,其中基于位置信息的服务( ...
MVVM架构~knockoutjs系列之扩展ajax验证~验证输入数据是否与后台数据相等
返回目录在看这篇文章之前,你有必要先看我之前的文章,之前文章是将一个方法以参数的形式传给KO,然后返回一个真假值,去做验证,这类似于面向对象语言里的委托,在JS里我们叫它回调方法,本篇文章与前一文章 ...
iOS 和 Android 测试托管平台 FIR.im 的注册与常用功能
FIR.im 作为专业的 iOS 和 Android 测试包发布网站, 注册超简单,支持输入网址直接下载和二维码扫描下载.功能类似 TestFlight ,但又比它强大,支持游客访问密码,iOS 和 ...
ASP.NET MVC 异常Exception拦截器Fillter
异常信息的处理在程序中非常重要, 在asp.net mvc中提供异常属性拦截器进行对异常信息的处理,异常拦截器也没有什么的,只是写一个类,继承另一个类(System.Web.Mvc.FilterAtt ...

Pig + Ansj 统计中文文本词频

1. Word Count

2. Ansj中文分词

Pig + Ansj 统计中文文本词频的更多相关文章

随机推荐

热门专题