前面两篇介绍了一下tajo,下面就说一下安装和使用吧。

一、分布式安装

前提:hadoop2中的hdfs和yarn已经安装并运行正常。

1、下载source并build源码

$git clone https://git-wip-us.apache.org/repos/asf/incubator-tajo.git tajo

$ cd tajo

$ mvn clean package -DskipTests -Pdist -Dtar

$ ls tajo-dist/target/tajo-x.y.z-SNAPSHOT.tar.gz

2、将tag.gz解压到需要安装的地方

 $ tar xzvf tajo-0.2.-SNAPSHOT.tar.gz

3、配置tajo-site.xml

 <property>

     <name>tajo.rootdir</name>

     <value>hdfs://hostname:9000/tajo</value>

   </property>

   <property>

     <name>tajo.worker.tmpdir.locations</name>

     <value>/home/ds/clouderaCDH/tajoTmp</value>

   </property>

 <property>

     <name>tajo.master.umbilical-rpc.address</name>

     <value>hostname:</value>

   </property>

   <property>

     <name>tajo.catalog.client-rpc.address</name>

     <value>hostname:</value>

   </property>

  <property>

     <name>tajo.master.client-rpc.address</name>

     <value>hostname:</value>

   </property>

 <property>

     <name>tajo.worker.parallel-execution.max-num</name>

     <value></value>

   </property>

4、 配置tag-env.sh

# Hadoop home. Required

export HADOOP_HOME=/home/ds/clouderaCDH/hadoop-2.0.-cdh4.2.1

# The java implementation to use.  Required.

export JAVA_HOME=/usr/lib/jvm/java--sun

# The maximum amount of heap to use, in MB. Default is .

export TAJO_MASTER_HEAPSIZE=

# The maximum amount of heap to use, in MB. Default is .

export TAJO_WORKER_HEAPSIZE=

5、 配置workers文件

worker01
worker02

6、 将配置好的tajo同步到其他节点并启动

scp -r tajo02 worker01:/home/ds/clouderaCDH/

bin/start-tajo.sh

7、 查看进程是否启动

jps
TajoMaster
TajoWorker

二、SQL交互

创建表

1、 从hdfs上得csv文件创建外部表

test文件夹下放一个data.csv文件,内容:

|abc|1.1|a
|def|2.3|b
|ghi|3.4|c
|jkl|4.5|d
|mno|5.6|e

创建表并load数据

create external table table1 (id int, name text, score float, type text) using csv with ('csvfile.delimiter'='|') location 'hdfs://hostname:9000/tajo/warehouse/test’

查询交互

支持绝大部分的SQL92。

1、使用limit查询

$ select * from table1 limit ;

id,  name,  score,  type
-------------------------------
, abc, 1.1, a
, def, 2.3, b

三、参考资料

[1]     http://wiki.apache.org/tajo

[2]     http://tajo.incubator.apache.org/

[3]     https://issues.apache.org/jira/browse/TAJO

[4]     http://www.slideshare.net/hyunsikchoi/tajo-intro

[5]     http://vdisk.weibo.com/s/xpJ29

Tajo--一个分布式数据仓库系统(分布式环境安装试用)的更多相关文章

  1. Ubuntu15.10下Hadoop2.6.0伪分布式环境安装配置及Hadoop Streaming的体验

    Ubuntu用的是Ubuntu15.10Beta2版本,正式的版本好像要到这个月的22号才发布.参考的资料主要是http://www.powerxing.com/install-hadoop-clus ...

  2. Hadoop Yarn(一)—— 单机伪分布式环境安装

    HamaWhite(QQ:530422429)原创作品,转载请注明出处:http://write.blog.csdn.net/postedit/40556267. 本文是依据Hadoop官网安装教程写 ...

  3. Hadoop 3.1.3伪分布式环境安装Hive 3.1.2的异常总结

    背景:hadoop版本为3.1.3, 且以伪分布式形式安装,hive版本为3.1.2,hive为hadoop的一个客户端. 1. 安装简要步骤 (1) 官网下载apache-hive-3.1.2-bi ...

  4. Hadoop伪分布式环境安装

    一.环境准备 阿里云ECS(Centos7).已预装JDK8 Hadoop安装包 hadoop-2.7.7.tar.gz 二. 安装步骤 1.确认JDK环境的安装位置 命令 echo $JAVA_HO ...

  5. Hbase 分布式环境安装部署

    Hbase分布式集群搭建--安装步骤 这一步如果没有deploy.sh脚本的可以使用scp命令分别分发到其他节点去 到集群里看看安装好的hbase 使用脚本启动所有节点的zookeeper 启动HDF ...

  6. hadoop分布式环境安装

    1. 下载hadoop和jdk安装包到指定目录,并安装java环境. 2.解压hadoop到指定目录,配置环境变量.vim /etc/profile export JAVA_HOME=/home/xi ...

  7. hadoop 分布式环境安装

    centos 多台机器免密登录 hadoop学习笔记(五)--全分布模式下SSH免密码登陆的实现 参考安装教程 Hadoop-2.7.4 集群快速搭建 启动hadoop cd /opt/soft/ha ...

  8. Hadoop完全分布式环境搭建(四)——基于Ubuntu16.04安装和配置Hadoop大数据环境

    [系统环境] [安装配置概要] 1.上传hadoop安装文件到主节点机器 2.给文件夹设置权限 3.解压 4.拷贝到目标文件夹 放在/opt文件夹下,目录结构:/opt/hadoop/hadoop-2 ...

  9. Tajo--一个分布式数据仓库系统(概述)

    前言:一直对OS X比较仰慕,刚工作送给自己的第一件大礼就是mac pro,嘿嘿.最近在看一个叫tajo得分布式数据仓库,需要依赖protoc 2.4.1,2.5.0都不work,不知道为啥,我在装2 ...

随机推荐

  1. HBase第三章 过滤器

    1  列值过滤器 SingleColumnValueFilter 对列值进行过滤. @Test public void scanDataByFilter() throws IOException { ...

  2. 用phpcms如何将静态页面制作成企业网站(上)

    首先,先要准备好这个静态网页的源文件,如图 bs里面是一些css和js的文件,img则是放图片的,文件中的index是网页的首页 运行一下,看看 是这样的 然后打开phpcms文件,上篇博客中有提到, ...

  3. Javascript格式化并高亮xml字符串

    Javascript格式化并高亮xml字符串 两个关键点 使用DOMParser解析xml 递归遍历xml树,按格式输出每一个节点 关于使用DOMParser 此方法目前在IE9以上和其它浏览器里都是 ...

  4. GitHub 多人协作开发 三种方式:

    GitHub 多人协作开发 三种方式: 一.Fork 方式 网上介绍比较多的方式(比较大型的开源项目,比如cocos2d-x) 开发者 fork 自己生成一个独立的分支,跟主分支完全独立,pull代码 ...

  5. 《零基础学JavaScript(全彩版)》学习笔记

    <零基础学JavaScript(全彩版)>学习笔记 二〇一九年二月九日星期六0时9分 前期: 刚刚学完<零基础学HTML5+CSS3(全彩版)>,准备开始学习JavaScrip ...

  6. java.util.MissingResourceException: Can't find bundle for base name init, locale zh_CN问题的处理

    一.问题描述 项目开发使用的是SSM框架,项目那个正常运行,开发一个新功能后,添加了一些配置文件,再重新运行项目抛出异常,找不到name为init的bean. 二.异常信息详细 六月 30, 2018 ...

  7. 4星|《亿万》:FBI大战华尔街对冲基金大鳄

    亿万:围剿华尔街大白鲨 全书尝试还原2008-2013年前后FBI指控赛克资本老板科恩通过内幕交易盈利的案件细节. 作者花了数年时间,采访了200多位当事人,阅读了海量的相关资料.书中交代了科恩的发家 ...

  8. JAVA学习笔记--匿名内部类

    匿名内部类,即没有名字的内部类. 我们在编写JAVA程序时,往往要创建很多类,类是可以被重复使用的.但有时,我们创建了一个类,却只需要使用该类一次,那么单独为其编写一个类就显得有些麻烦,这时可以使用匿 ...

  9. 如何理解IPD+CMMI+Scrum一体化研发管理解决方案之IPD篇

    如何快速响应市场的变化,如何推出更有竞争力的产品,如何在竞争中脱颖而出,是国内研发企业普遍面临的核心问题,为了解决这些问题,越来越多的企业开始重视创新与研发管理,加强研发过程的规范化,集成产品开发(I ...

  10. 《Linux内核分析》学习总结与学习心得

    一.目录列表 第一周:计算机是如何工作的? http://www.cnblogs.com/dvew/p/5224866.html 第二周:操作系统是如何工作的? http://www.cnblogs. ...