Hadoop自学系列集(四) ---- Hadoop集群

　　久等了，近期公司比较忙，学习的时间都没有啊，到今日才有时间呢！！！好了，下面就跟着笔者开始配置Hadoop集群吧。

　　hosts文件和SSH免密码登录配置好了之后，现在进入Hadoop安装目录，修改一些配置文件，修改配置还是相对简单的，一下是需要修改的文件内容(当然这里只是学习时的配置，更加深入的配置笔者也不会了，嘿嘿嘿)，四台机相同配置，以下是一些修改的文件(红色为修改部分)：

　　conf/hadoop-env.sh:

　　export JAVA_HOME=/usr/local/java/jdk1.6.0_45 ##原本是注释的，解开注释，修改一下路径即可

　　conf/core-site.xml:

　　　<?xml version="1.0"?>

　　<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

<name>fs.default.name</name>
　　　　　　<value>hdfs://hadoop.master:9000</value>
　　　　</property>
　　　　<property>
　　　　　　<name>hadoop.tmp.dir</name>
　　　　　　<value>/usr/local/temp</value>
　　　　</property>
　　</configuration>

　　conf/hdfs-site.xml：

　　<?xml version="1.0"?>

　　<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

<configuration>
　　　　<property>
　　　　　　
　　　　　　<name>dfs.replication</name>
　　　　　　<value>3</value>
　　　　</property>
　　</configuration>

　　conf/mapred-site.xml(配置JobTracker):

　　<?xml version="1.0"?>

　　<?xml-stylesheet type="text/xsl" href="configuration.xsl"?>

　　<configuration>
　　　　<property>
　　　　　　<name>mapred.job.tracker</name>
　　　　　　<value>hadoop.master:9001</value>
　　　　</property>
　　</configuration>

　　conf/masters(填写主节点主机名即可):

　　hadoop.master

　　conf/slaves(填写从节点主机名，一行一个):

　　hadoop.slave1

　　hadoop.slave2

　　hadoop.slave3

　　至此，配置已经修改完了，接下来是启动。在首次启动之前，先格式化NameNode，之后启动就不需要格式化了，命令如下：

　　hadoop namenode -format

　　接下来，启动Hadoop集群：

　　start-all.sh

　　启动后截图如下：

　　在启动过程中由于配置了SSH免密码登录，是不会询问slaves机器上的密码的。

　　集群测试：

　　接下来我们运行一下hadoop-example.jar中自带的wordCount程序，用户统计单词出现次数，步骤如下：

　　1.新建一个test.txt,内容可自行填写:

　　2.在HDFS系统中创建一个文件夹input，命令如下：

　　　　hadoop fs -mkdir /user/hadoop/input1

　　3.上传刚刚创建的test.txt至HDFS系统中的input文件夹，命令如下：
　　　　hadoop fs -put /usr/local/hadoop/test.txt /user/hadoop/input1/

　　4.查看文件是否已经上传至HDFS中，命令如下:

　　　　hadoop fs -ls /user/hadoop/input1/

　　5.运行hadoop-example.jar，命令如下：

　　　　cd /usr/local/hadoop

　　　　hadoop -jar hadoop-example-1.2.1.jar wordcount /user/hadoop/input1/test.txt /user/hadoop/output1

　　6.过程截图：

　　　7.运行完毕后，可以查看结果了，键入以下命令，结果截图也在下面：

　　　　hadoop fs -text /user/hadoop/output1/part-r-00000

　　　　OK！至此Hadoop集群就安装结束了，而且也测试过了，就先写到这里了。

Hadoop自学系列集(四) ---- Hadoop集群的更多相关文章

golang 自学系列（四）——debug for vscode
golang 自学系列(四)--(调试)VSCode For Debug 这里如何装 vscode 我就不说了这里如何在 vscode 正常写代码我也不说了在能正常用 vscode 写 go 语言 ...
Hadoop自学系列集(三) ---- Hadoop安装
这节就开始讲述Hadoop的安装吧.在这之前先配置下SSH免密码登录,为什么需要配置这个呢?大家都知道Hadoop集群中可能有几十台机器甚至是上千台机器,而每次启动Hadoop都需要输入密码才能够登录 ...
Hadoop概念学习系列之谈hadoop/spark里为什么都有，YARN呢？（四十一）
在Hadoop集群里,有三种模式: 1.本地模式 2.伪分布模式 3.全分布模式在Spark集群里,有四种模式: 1.local单机模式结果xshell可见: ./bin/spark-submit ...
Hadoop自学系列集(二) ---- CentOS下安装JDK
上篇我们讲述了如何使用VMware安装CentOS系统,接下来就看如何安装我们最为熟悉的jdk吧!安装前先看看系统上有没有安装过jdk,输入java -version,如果查询出了其他版本的jdk版本 ...
Hadoop自学系列集(一) ---- 使用VMware安装CentOS
1.概述笔者的学习环境--在VMware虚拟机下安装四个CentOS系统(搭建Hadoop集群用),其中一个为Master,三个为Slave,Master作为Hadoop集群中的NameNode, ...
Hadoop概念学习系列之谈hadoop/spark里分别是如何实现容错性？（四十二）
Hadoop使用数据复制来实现容错性(I/O高) Spark使用RDD数据存储模型来实现容错性. RDD是只读的.分区记录的集合.如果一个RDD的一个分区丢失,RDD含有如何重建这个分区的相关信息. ...
Hadoop概念学习系列之谈hadoop/spark里为什么都有，键值对呢？（四十）
很少有人会这样来自问自己?只知道,以键值对的形式处理数据并输出结果,而没有解释为什么要以键值对的形式进行. 包括hadoop的mapreduce里的键值对,spark里的rdd里的map等. 这是为什 ...
Hadoop笔记系列一用Hadoop进行分布式数据处理(1)
学习资料参考地址: 1.http://blog.csdn.net/zhoudaxia/article/details/8801769 1.先说说什么是Hadoop? 个人理解:一个分布式文件存储系统+ ...
Hadoop概念学习系列之为什么hadoop/spark执行作业时，输出路径必须要不存在？（三十九）
很多人只会,但没深入体会和想为什么要这样? 拿Hadoop来说,当然,spark也一样的道理. 输出路径由Hadoop自己创建,实际的结果文件遵守part-nnnn的约定. 如何指定一个已有目录作为H ...

随机推荐

jvm(4)---垃圾回收（哪些对象可以被回收）
1.java堆中几乎放着所有对象的实例,那么什么样子的对象才是可以被回收的呢? 1.1.引用计数法: 给对象添加一个引用计数器,当有地方引用的时候,计数器就+1,引用失效就-1:任何时候当计数器为0, ...
移动IM开发指南1：如何进行技术选型
<移动IM开发指南>系列文章将会介绍一个IM APP的方方面面,包括技术选型.登陆优化等.此外,本文作者会结合他在网易云信多年iOS IM SDK开发的经验,深度分析实际开发中的各种常见问 ...
JVM 参数类型
标准参数 -help -server -client -version -showversion -cp -classpath X参数非标准化参数(在各个JDK版本中可能会变,但是变动比较小) -X ...
【Dubbo】Dubbo+ZK基础入门以及简单demo
参考文档: 官方文档:http://dubbo.io/ duboo中文:https://dubbo.gitbooks.io/dubbo-user-book/content/preface/backgr ...
Docker中使用CentOS7镜像
因后面会将操作系统从CentOS6.4升级到CentOS7,先试用下CentOS7. 启动容器服务 systemctl start docker.service 下载CentOS7 镜像 [roo ...
委托在Smobiler自定义控件中运用
委托(Delegate) C# 中的委托(Delegate)类似于 C 或 C++ 中函数的指针.委托(Delegate) 是存有对某个方法的引用的一种引用类型变量.可以将方法当作另一个方法的参数来进 ...
ORA-06502:at "WMSYS.WM_CONCAT_IMPL",line 30 解决方法整理
之前数据量少的时候,用:select wm_concat(字段) from 表拼接数据量小的话,没有问题,数据量超出4000个就会爆以下错误信息: 解决方法(Oracle 函数xmlagg拼接): ...
003-python基础-字符类型
基本数据类型(int,bool,str) 1.基本数据数据类型: int 整数 str 字符串. 一般不存放大量的数据 bool 布尔值. 用来判断. True, False list 列表.用来存放 ...
HDU 4812：D Tree（树上点分治+逆元）
题目链接题意给一棵树,每个点上有一个权值,问是否存在一条路径(不能是单个点)上的所有点相乘并对1e6+3取模等于k,输出路径的两个端点.如果存在多组答案,输出字典序小的点对. 思路首先,(a * ...
Modbus RTU新版本指令介绍
Modbus RTU新版本指令介绍 TIA V13 SP1版本软件中提供了2个版本的Modbus RTU指令: 图1. 两个版本Modbus RTU指令早期版本的Modbus RTU指令(图1. 中 ...

Hadoop自学系列集(四) ---- Hadoop集群

Hadoop自学系列集(四) ---- Hadoop集群的更多相关文章

随机推荐

热门专题