使用hash拆分文件

package readImgUrl;

import java.io.BufferedInputStream;

import java.io.BufferedReader;

import java.io.BufferedWriter;

import java.io.File;

import java.io.FileInputStream;

import java.io.FileOutputStream;

import java.io.FileReader;

import java.io.FileWriter;

import java.io.InputStream;

import java.io.InputStreamReader;

import java.io.OutputStreamWriter;

import java.net.URL;

import java.util.ArrayList;

import java.util.Arrays;

import java.util.Collections;

import java.util.Comparator;

import java.util.List;

public class ClassifyUrl {

	private static int HASHLEN = 100;

	private static String file_dir = "D:\\学习\\实验室项目\\ImageNet图片爬取\\classify_url\\";

	private static String src_file = "D:\\学习\\实验室项目\\ImageNet图片爬取\\fall11_urls.txt";

	public static void main(String[] args) throws Exception {

		// TODO Auto-generated method stub

		classify_url("D:\\学习\\实验室项目\\ImageNet图片爬取\\fall11_urls.txt");

//		rank_filedata("2");

//		String s = judgeFileCode(src_file);

//		String s = codeString(src_file);

//		System.out.println(s);

	}

	/**

	 * 对一个文件进行排序

	 */

	public static void rank_filedata(String filename){

		String path1 = file_dir+filename+".txt";

		String path2 = file_dir+filename+"_"+".txt";

		List<String> list = reader_list(path1);

		System.out.println(list.size());

		// 排序,通过泛型和匿名类来实现

        Collections.sort(list, new Comparator<String>() {

            public int compare(String s1, String s2) {

            	String h1 = s1.split("	")[1];

            	String h2 = s2.split("	")[1];

            	return h1.compareTo(h2);

            }

        });

		writer_list(list, path2);

	}

	/**

	 * 读取文件，返回list

	 * @param path

	 * @return

	 */

	public static List reader_list(String path){

		List<String> lineList = new ArrayList();

		try {

			BufferedReader reader = new BufferedReader(new FileReader(path));

			String line = reader.readLine();

			while(null != line){

				lineList.add(line);

				line = reader.readLine();

			}

			reader.close();

			return lineList;

		} catch (Exception e) {

			// TODO: handle exception

			e.printStackTrace();

		}

		return null;

	}

	/**

	 * 将List写入文件

	 * @param line

	 */

	public static void writer_list(List list, String path){

		try {

			BufferedWriter writer = new BufferedWriter(new FileWriter(path));

			for(int i=0; i<list.size(); i++){

				String line = (String)list.get(i);

				writer.write(line+"\r\n");

			}

			writer.close();

		} catch (Exception e) {

			// TODO: handle exception

			e.printStackTrace();

		}

	}

	/**

	 * 从文件中逐行读取数据，分类写入0-99个文件

	 */

	public static void classify_url(String path){

		try {

			BufferedReader reader ;

			String filecode = judgeFileCode(path);

			reader = new BufferedReader(new InputStreamReader(new FileInputStream(path),filecode));

//			BufferedReader reader = new BufferedReader(new FileReader(path));

			String line = reader.readLine();

			int line_num = 0;

//			while(line_num<4101000){

//				reader.readLine();

//				line_num++;

//			}

			while(null != line){

				try {

					String host = new URL(line.split("	")[1]).getHost();

					int type = hash(host.toCharArray());

//					writer(type+"", line);

				} catch (Exception e) {

					// TODO: handle exception

					e.printStackTrace();

				}

				line = reader.readLine();

				line_num++;

				if(line_num%100==0){

//					System.out.println(line_num);

					char [] cc = line.toCharArray();

					for(char c: cc){

						if(isCnorEn(c)){

							System.out.println(line);

							break;

						}

					}

//					break;

				}

			}

			reader.close();

		} catch (Exception e) {

			// TODO: handle exception

			e.printStackTrace();

		}

	}

	/**

	 * 判断是中文还是英文字符

	 */

	static boolean isCnorEn(char c) {

		if ((c >= 0x0391 && c <= 0xFFE5) // 中文字符

				|| (c >= 0x0000 && c <= 0x00FF)) // 英文字符

			return true;

		return false;

//		if ((c >= 0x0391 && c <= 0xFFE5) // 英文字符

//				) //

//			return true;

//		return false;

	}

	/**

	 * 给定一个字符串，返回hash后的int值

	 * @param word

	 * @return

	 */

	public static int hash(char[] word) {

		int index = 0;

	    int i=0;

	    while(i<word.length) {

	        index += index * 31 + word[i];

	        i++;

	    }

	    return Math.abs(index % HASHLEN);

	}

	/**

	 * 将line写入filename中（文件不存在则先建立）

	 * @param filename

	 * @param line

	 */

	public static void writer(String filename, String line){

		String path = file_dir+filename+".txt";

		try {

			File file = new File(path);

			if(!file.isFile()){

				file.createNewFile();

			}

			String filecode = judgeFileCode(src_file);

			OutputStreamWriter writer = new OutputStreamWriter(new FileOutputStream(path, true), "GBK");

//			BufferedWriter writer = new BufferedWriter(new FileWriter(path, true));

			if(null != line){

				writer.write(line+"\r\n");

			}

			writer.close();

		} catch (Exception e) {

			// TODO: handle exception

			e.printStackTrace();

		}

	}

	public static String judgeFileCode(String path){

		try {

			File file = new File(path);

			InputStream in= new java.io.FileInputStream(file);

			byte[] b = new byte[3];

			in.read(b);

			in.close();

			if (b[0] == -17 && b[1] == -69 && b[2] == -65)  {

//				System.out.println(file.getName() + "：编码为UTF-8");

				return "UTF-8";

			}

			else{

//				System.out.println(file.getName() + "：可能是GBK，也可能是其他编码");

				return "GBK";

			}

		} catch (Exception e) {

			// TODO: handle exception

		}

		return null;

	}

	/**

     * 判断文件的编码格式

     * @param fileName :file

     * @return 文件编码格式

     * @throws Exception

     */

    public static String codeString(String fileName) throws Exception{

        BufferedInputStream bin = new BufferedInputStream(new FileInputStream(fileName));

        int p = (bin.read() << 8) + bin.read();

        String code = null;

        //其中的 0xefbb、0xfffe、0xfeff、0x5c75这些都是这个文件的前面两个字节的16进制数

        switch (p) {

            case 0xefbb:

                code = "UTF-8";

                break;

            case 0xfffe:

                code = "Unicode";

                break;

            case 0xfeff:

                code = "UTF-16BE";

                break;

            case 0x5c75:

                code = "ANSI|ASCII" ;

                break ;

            default:

                code = "GBK";

        }

        return code;

    }

}

使用hash拆分文件的更多相关文章

Linux split拆分文件
200 ? "200px" : this.width)!important;} --> 介绍 split可以将一个大文件拆分成指定大小的多个文件,并且拆分速度非常的快,拆分一 ...
linux_shell_拆分文件_多进程脚本
[需求场景]:一个10000w行的文件处理 ,多进程处理比如启动100个进程同时处理. [方法]:拆分文件(split) ,制作shell脚本执行后台进程 [demo]: 假设处理程序为 ...
linux 拆分文件
split [OPTION]... [INPUT [PREFIX]] :根据行或者大小拆分文件 split file_name :默认把文件file_name拆分成xaa,xab,xac,...... ...
linux拆分文件
1.先看下文件总的行数: wc -l filename 我们现在来看看它具体的参数该怎么用: split支持自定义输出文件大小和输出文件行数两种模式,此外还可以定义每一行最大的值. -l 按输出文件行 ...
split - 拆分文件
拆分文件 # 每个文件的行数为1000行 split -l 1000 test.txt # 将test文件拆分,20M一个文件 split -b 20M test.txt test文件拆分,并且文件名 ...
casperjs在拆分文件后的中文乱码问题的解决
windows环境. capserjs的中文乱码使用phantom.outputEncoding="GBK";即可解决. 但当我们脚本很大,需要拆分时(参考http://docs. ...
java 按内容拆分文件
文件内容为: BC************* **************** *************** BC************* **************** *********** ...
python_基础学习_02_拆分文件（spilt）
做爬虫经常会有这样的引用场景 ,原始网页存储格式为 url+\t+ html php 有个explode的拆分文本行方法,比较方便直接接收列值 list($url,$html)=explode(& ...
RandomAccessFile拆分合并文件
import java.io.FileInputStream; import java.io.IOException; import java.io.InputStream; import java. ...

随机推荐

v-bind:value="diy" 添加到 <input type="button" /> 中可以,添加到<button />中不可以,diy是data中的数据
v-bind:value="diy" 添加到 <input type="button" /> 中可以, 添加到<button />中不可 ...
Linux 配置：Xmanager连接Linux图形界面
想要在远程终端使用用图形界面来操作和控制Linux服务器,就在windows下像使用MSTSC一样.linux通过XDMCP来提供这种支持,我们只要用一个终端仿真软件如:xmanager就可以实现,但 ...
mysql统计表中条目个数的方法举例
说明:以下标红且加大括号的均需要替换为实际待查询的表名或数据库名. [1].统计某张或某几张表的数据量: select count(*) from {TABLE_NAME}; #or select c ...
openxlsx模块
import openpyxl #创建工作簿 wb = openpyxl.Workbook()#获取当前活跃的工作表 ws = wb.active#删除工作表 remove_sheet(wb.get_ ...
c++ easyX的学习
画象棋盘来浅显学习了解easyx 了解象棋盘的构成: 如图就为一个基本的象棋棋盘我们下面就用esayx来画出这个棋盘,我的感觉这个棋盘大概分为两个部分:第一部分就是棋盘的大致布局,第二个就是棋盘的细节 ...
用户模式构造-简单自旋锁（SpinLock）
internal sealed class SimpleSpinLock { //0等于false(默认),1等于true ; public void Enter() { while (true) { ...
magento简化url多级分类去掉父目录
在Magento模板开发中,有时候需要将多级分类的url简化,Magento的URL默认是显示多级分类的http://afish.cnblogs.com/分类1/分类2/分类3现在需要简化为:分类2的 ...
执行dlsym()函数出现： undefined symbol
执行dlsym()函数出现: undefined symbol 执行dlsym()函数出现: undefined symbol 当这个问题出现的时候,可以检查产生so文件的cpp文件,看看是否已经用 ...
redis发布与订阅的实现
转自:https://blog.csdn.net/xiaoyu411502/article/details/51596477
hivesql之str_to_map函数
str_to_map(字符串参数, 分隔符1, 分隔符2) 使用两个分隔符将文本拆分为键值对. 分隔符1将文本分成K-V对,分隔符2分割每个K-V对.对于分隔符1默认分隔符是 ',',对于分隔符2默认 ...

使用hash拆分文件

使用hash拆分文件的更多相关文章

随机推荐

热门专题