java读取中文分词工具(一)

import java.io.BufferedReader;

import java.io.File;

import java.io.FileInputStream;

import java.io.IOException;

import java.io.InputStreamReader;

import java.io.RandomAccessFile;

import java.util.StringTokenizer;

/*

 * 文本格式：已分词的中文文本，空格切割。有若干行。每行为一个段落。

 * 功能：遍历文档，逐个返回词语。

 * 两种模式：

 * 1 到文档末尾后，结束

 * 2 到文档末尾后。从头再读。

/

public class WordReader

{

	static final int normalMode = 0;

	static final int againMode = 1;

	int currentMode = 0;

	//BufferedReader br=null;

	RandomAccessFile raf= null;

	StringTokenizer tokenizer = null;

	String nextWord=null;

	int currentLine = 0;

	int allCounts = 0;

	public  WordReader(String fileName) throws IOException

	{

		File file=new File(fileName);

		//br=new BufferedReader(new InputStreamReader(new FileInputStream(file),"utf-8"));

		raf = new RandomAccessFile(file,"r") ;

	}	

	private boolean hasNextWord() throws IOException

	{

		if( tokenizer!=null && tokenizer.hasMoreTokens())

		{

			nextWord = tokenizer.nextToken();

			return true;

		}

		else

		{

			String line=raf.readLine();

			if(line == null)

			{

				if(currentMode == normalMode)

					return false;

				else //从头再来

				{

					raf.seek(0);

					return hasNextWord();//递归

				}

			}

			tokenizer = null;

			line = new String(line.getBytes("iso8859-1"),"utf-8");

			tokenizer= new StringTokenizer(line," ");

			return hasNextWord();//递归

		}

	}

	private String getNextWord() throws IOException

	{

		if(nextWord != null)

		{

			String word = nextWord;

			nextWord = null;

			allCounts ++;

			return word;

		}

		else if(hasNextWord())

		{

			return getNextWord();

		}

		else return null;

	}

	public static void main(String[] args) throws IOException

	{

		// TODO Auto-generated method stub

		WordReader wordReader = new WordReader("/home/linger/sources/ParaModel/electronic_seg.txt");

		wordReader.currentMode = WordReader.againMode;

		//while(wordReader.hasNextWord())//共10329309个词

		for(int i=0;i<10329319;i++)//文本从头读

		{

			System.out.println(wordReader.getNextWord());

		}

		System.out.println(wordReader.allCounts);

	}

}

用randomaccessfile类非常easy操作文件指针。

可是遇到中文乱码问题。參考了这里http://blog.chinaunix.net/uid-15490606-id-211958.html。攻克了。

line = new String(line.getBytes("iso8859-1"),"utf-8");

对编码不是非常精通。有时见看看这个http://blog.sina.com.cn/s/blog_673c81990100t1lc.html。

java读取中文分词工具(一)的更多相关文章

Java实现敏感词过滤 - IKAnalyzer中文分词工具
IKAnalyzer 是一个开源的,基于java语言开发的轻量级的中文分词工具包. 官网: https://code.google.com/archive/p/ik-analyzer/ 本用例借助 I ...
11大Java开源中文分词器的使用方法和分词效果对比，当前几个主要的Lucene中文分词器的比较
本文的目标有两个: 1.学会使用11大Java开源中文分词器 2.对比分析11大Java开源中文分词器的分词效果本文给出了11大Java开源中文分词的使用方法以及分词结果对比代码,至于效果哪个好,那 ...
中文分词工具探析（一）：ICTCLAS (NLPIR)
1. 前言 ICTCLAS是张华平在2000年推出的中文分词系统,于2009年更名为NLPIR.ICTCLAS是中文分词界元老级工具了,作者开放出了free版本的源代码(1.0整理版本在此). 作者在 ...
开源中文分词工具探析（三）：Ansj
Ansj是由孙健(ansjsun)开源的一个中文分词器,为ICTLAS的Java版本,也采用了Bigram + HMM分词模型(可参考我之前写的文章):在Bigram分词的基础上,识别未登录词,以提高 ...
开源中文分词工具探析（四）：THULAC
THULAC是一款相当不错的中文分词工具,准确率高.分词速度蛮快的:并且在工程上做了很多优化,比如:用DAT存储训练特征(压缩训练模型),加入了标点符号的特征(提高分词准确率)等. 1. 前言 THU ...
开源中文分词工具探析（五）：FNLP
FNLP是由Fudan NLP实验室的邱锡鹏老师开源的一套Java写就的中文NLP工具包,提供诸如分词.词性标注.文本分类.依存句法分析等功能. [开源中文分词工具探析]系列: 中文分词工具探析(一) ...
开源中文分词工具探析（五）：Stanford CoreNLP
CoreNLP是由斯坦福大学开源的一套Java NLP工具,提供诸如:词性标注(part-of-speech (POS) tagger).命名实体识别(named entity recognizer ...
开源中文分词工具探析（七）：LTP
LTP是哈工大开源的一套中文语言处理系统,涵盖了基本功能:分词.词性标注.命名实体识别.依存句法分析.语义角色标注.语义依存分析等. [开源中文分词工具探析]系列: 开源中文分词工具探析(一):ICT ...
开源中文分词工具探析（六）：Stanford CoreNLP
CoreNLP是由斯坦福大学开源的一套Java NLP工具,提供诸如:词性标注(part-of-speech (POS) tagger).命名实体识别(named entity recognizer ...

随机推荐

你真的知道GET和POST两种基本请求方法的区别吗？
GET和POST是HTTP请求的两种基本方法,要说它们的区别,接触过WEB开发的人都能说出一二. 最直观的区别就是GET把参数包含在URL中,POST通过request body传递参数. 你可能自己 ...
DropDownList 数据源绑定和获取
前台代码: <td>账户名称:</td> <td> <asp:DropDownList ID="DropDownListAccount" ...
关于linux下的.a文件与 .so 文件
连续几天终于将一个又一个问题解决了,这里说其中一个问题描述问题:使用多线程pthread的时候,(我用的IDE,CODEBOLCKS)编译后发现直接弹出窗口,程序还没有被Build..巴拉巴拉,然后 ...
【转】Linux GCC常用命令
转自:http://www.cnblogs.com/ggjucheng/archive/2011/12/14/2287738.html 1简介 2简单编译 2.1预处理 2.2编译为汇编代码(Comp ...
MVC系列学习(三)-EF的延迟加载
1.什么叫延迟加载字面上可以理解为,一个动作本该立即执行的动作,没有立即执行 2.从代码上理解 static void Main(string[] args) { //执行该语句的时候,查看sql监 ...
netty学习：UDP服务器与Spring整合（2）
上一篇文章中,介绍了netty实现UDP服务器的栗子. 本文将会对UDP服务器与spring boot整合起来,并使用RedisTemplate的操作类访问Redis和使用Spring DATA JP ...
TCP协议滑动窗口(一)——控制大批量数据传输速率
窗口大小:TCP头中一个16位的域,表示当前可用接受缓冲区大小.在每个TCP对等段连接初始化时,告诉对方自己的窗口大小(不一定是满额,假如满额65201字节,可能暂时通告5840字节).若客户端接受数 ...
JS——缓慢动画封装
在知道如何获取内嵌式和外链式的标签属性值之后,我们再次封装缓慢动画: 单个属性 <!DOCTYPE html> <html> <head lang="en&qu ...
Android获取SD卡路径/内存的几种方法
Android获取SD卡路径本篇将会带领大家学习如何获取android路径的几种常见用法,但在我开始bb之前需要大家清楚android中内存和外存之间的区别,下面进行简短介绍:android中的内存 ...
Python 模块的导入 day5
一.模块 1.标准模块 python自带的 2.第三方模块需要自己安装的模块 3.自己写的python文件一个python文件,就是一个模块 (1)导入模块的实质就是把你导入的模块运行了一遍 ( ...

java读取中文分词工具(一)

java读取中文分词工具(一)的更多相关文章

随机推荐

热门专题