(2.1)windows下Nutch1.7的安装
酒店评论情感分析系统(二)——Nutch安装
一、需求部分
- Nutch是Java开发的所以需要下载Java JDK。
下载地址http://java.sun.com/javase/downloads/index.jsp
2. Nutch的演示搜索页面是Jsp的,需要Tomcat做服务器。
下载地址:http://jakarta.apache.org/tomcat/
3. Nutch的脚本都是用Linux的Shell写的,所以在Windows平台需要一个Shell解释程序。Cygwin是一个在Windows下的模拟Linux系统程序。(注Linux下不需要下载此程序)
下载地址:http://www.cygwin.com/
4. Nutch下载地址:http://lucene.apache.org/nutch/
二、环境
- 操作系统:windows7,X86,32位
- Java JDK1.6
- Tomcat 7.0
- Cygwin2.850
- Nutch1.7
三、安装步骤
1. Java JDK安装
注意:路径名称不要带中文,建议所选择的路径不要有空格,我第一次选择的路径带有空格C:\Program Files,执行crawl命令的时候产生了错误:
提示找不到C:\Program目录,出现这个问题的原因是因为:C:\Program Files\ 中间有一个空格,这样导致进入不到Program Files ,而只能进入Program中,但是C盘中没有Program文件夹。
安装完成后设置环境变量,win7下设置环境变量和XP不同,在系统变量或者用户变量都行。假定你的jdk安装在c:\jdk1.6,则做如下配置:
JAVA_HOME=c:\jdk1.6
classpath=. ;%JAVA_HOME%\lib\dt.jar;%JAVA_HOME%\lib\tools.jar;(.;一定不能少,因为它代表当前路径)
path=%JAVA_HOME%\bin
变量安装完成后,在运行里输入“cmd”打开命令行,分别输入“java”,“java –version”若显示具体信息而没有报错,则安装成功,如下图:如果没有打印出这句话,你需要仔细检查一下你的配置情况。
2. Tomcat免安装
这里需要注意一个问题:
你需要下载与JDK相配的Tomcat的版本,如下图:
我的jdk版本是1.6,然后之前装Tomcat8.0的时候,配置完路径,点startup.bat的时候出现闪退现象。
将Tomcat解压缩在没有中文的目录下,设置环境变量:
(1) 变量名: TOMCAT_HOME 变量值:
H:\tomcat7.0(Tomcat解压到的目录)
(2) 变量名: CATALINA_HOME 变量值:
H:\tomcat7.0
(3)修改变量: Path 变量值:
在末尾添加如下内容 ;%CATALINA_HOME%\bin;%CATALINA_HOME%\lib
运行Tomcat7.0,“开始”->“运行”->输入cmd,进入如下路径
在命令提示符中输入 startup.bat,之后会弹出tomcat命令框,输出启动日志;
然后打开浏览器输入http://localhost:8080/ ,如果进入tomcat欢迎界面,那么恭喜你,配置成功。
Tomcat的运行和停止的文件分别是startup.bat和shutdown.bat。
3. Cygwin安装
运行安装程序后出现如下图:
可以随便选择一个网址:
这一步,我们选择需要下载安装的组件包,为了使我们安装的Cygwin能够编译程序,我们需要安装gcc编译器,默认情况下,gcc并不会被安装,我们需要选中它来安装。为了安装gcc,我们用鼠标点开 组件列表中的“Devel”分支,在该分支下,有很多组件,我们必须的是:
binutils 、gcc 、gcc-mingw 、gdb
Binutils组件:
Gcc组件:
Gdb组件:
Gcc-mingw组件:
选完之后,选择下一步:
安装的时间依据你选择的组件以及网络情况而定。
4. Nutch安装
Nutch是一个Java实现的web爬虫,爬取的结果存储到database(指定文件路径下的一系列文件及目录)供Solr或Lucene索引和检索。
常见搜索相关的框架的基本功能列表:
|
爬取 |
索引 |
检索 |
|
|
Nutch |
√ |
||
|
Solr |
√ |
√ |
|
|
Lucene |
√ |
√ |
下载安装apache-nutch-1.7-bin.zip并设置。下载地址:http://archive.apache.org/dist/nutch/
下载完成后解压缩Nutch二进制分发包,(我解压缩在:H:\nutch\nutch1.7)目录如下:
l bin目录,只包含一个可执行文件nutch
l conf目录,nutch命令执行的配置参数
l docs目录,JavaDoc帮助
l lib目录,相关Jar类库
l plugins目录,相关插件库
设置环境变量:
变量名 NUTCH_JAVA_HOME
变量值 %JAVA_HOME% 【其值设为JDK的安装目录】
运行Cygwin,进入到nutch1.7所在的解压缩路径下,在输入bin/nutch,如图:
Nutch安装成功。
(2.1)windows下Nutch1.7的安装的更多相关文章
- 2分钟 windows下sublime text 3安装git插件:
12:35 2015/11/182分钟 windows下sublime text 3安装git插件:推荐博客:http://blog.csdn.net/naola2001/article/detail ...
- 纯windows下制作变色龙引导安装U盘教程
原创教程:纯windows下制作变色龙引导安装U盘教程 支持Mavericks和Yosemite 支持白苹果 目标:windows下制作带 Chamelon变色龙引导的黑苹果安装U盘,支持PC机引导安 ...
- Windows下Oracle 11g的安装
Windows下Oracle 11g的安装 Windows下Oracle 11g的安装: Windows:64位, Oracle 11g版本:win64_11gR2_database_1of2(安装包 ...
- windows下,下载pip安装
windows下,下载pip安装 https://pypi.python.org/pypi/pip#downloads 找到source那个压缩文件,下载下来解压. 参考: windows下面安装Py ...
- Lua在Windows下的配置、安装、运行
Windows下安装.运行Lua! 本文提供全流程,中文翻译.Chinar坚持将简单的生活方式,带给世人!(拥有更好的阅读体验 -- 高分辨率用户请根据需求调整网页缩放比例) 1↓ 进入Lua官网:h ...
- Windows下openssl的下载安装和使用
Windows下openssl的下载安装和使用 安装openssl有两种方式,第一种直接下载安装包,装上就可运行:第二种可以自己下载源码,自己编译.下面对两种方式均进行详细描述. 一.下载和安装ope ...
- Windows下Apache2.2+PHP5安装步骤
Windows下Apache2.2+PHP5安装 初学者在学习PHP的时候可能都会遇到安装Apache和PHP不成功的问题,于是很多开发者便选择了集成包,一键安装好Apache+PHP+MySQL.但 ...
- python学习:Windows 下 Python easy_install 的安装
Windows 下 Python easy_install 的安装 下载安装python安装工具下载地址:http://pypi.python.org/pypi/setuptools 可以找到 ...
- Windows下的Linux子系统安装,WSL 2下配置docker
Windows下的Linux子系统安装,WSL 2下配置docker 前提条件: 安装WSL 2需要Windows 10版本是Build 18917或更高,首先先确认系统版本已升级. 在“启用或关闭W ...
随机推荐
- Beta结束感想
我得到的: 管理一个9人团队的经验 与组内成员(大部分一开始并不认识)共同向同一个目标努力的宝贵经历 学会使用Github的organization来管理整个团队的代码 学会使用leangoo这样的协 ...
- Spring学习(七)——增强类
Spring 切点 什么是切点?切点(Pointcut),每个程序类都拥有多个连接点,如一个拥有两个方法的类,这两个方法都是连接点,即连接点是程序类中客观存在的事物.但在这为数从多的连接点中,如何定位 ...
- Alpha-6
前言 失心疯病源6 团队代码管理github 站立会议 队名:PMS 530雨勤(组长) 今天完成了那些任务 18:30~20:30 完成blob类下关于预测车辆下一个位置的函数 代码签入github ...
- vs2015关于_CRT_SECURE_NO_WARNINGS警告说明
vs2015关于_CRT_SECURE_NO_WARNINGS警告说明 在VS中调用 strcpy.strcat 等函数时会提示 _CRT_SECURE_NO_WARNINGS 警告,原因是这些函数不 ...
- MySQL 查询缓存机制(MySQL数据库调优)
查询缓存机制:缓存的是查询语句的整个查询结果,是一个完整的select语句的缓存结果 哪些查询可能不会被缓存 :查询中包含UDF.存储函数.用户自定义变量.临时表.mysql库中系统表.或者包含列级别 ...
- <问吧>调查问卷心得体会
<问吧>调查问卷心得与体会 在这之前,我们已经组成了一个六个人的小团队---“走廊奔跑队”,我们这次做的这个项目的名称是:问吧.在项目实施之前,我们必做的一步就是需求分析,目的就是充分了解 ...
- jQuery的滚动监听
jQuery的滚动监听 1.当前滚动的地方的窗口顶端到整个页面顶端的距离: var winPos = $(window).scrollTop(); 2.获取指定元素的页面位置: $(val).offs ...
- docker 开启远程
# vi /etc/init.d/docker 在start()中加入:$exec -H tcp://0.0.0.0:2375 -H unix://var/run/docker.sock -d & ...
- 转---秒杀多线程第八篇 经典线程同步 信号量Semaphore
阅读本篇之前推荐阅读以下姊妹篇: <秒杀多线程第四篇一个经典的多线程同步问题> <秒杀多线程第五篇经典线程同步关键段CS> <秒杀多线程第六篇经典线程同步事件Event& ...
- SQL 临时表或表变量替代游标(转)
1.如果表没有自动增长的标识列(int) 使用临时表 SELECT IDENTITY(int) NewID ,.. INTO #tmp FROM YouTable 2.表有标识列 使用表变量 INSE ...