最近我在思考的一件事情:如何帮助团队 SQL 开发快速掌握大数据相关技术呢?面对疯狂暴涨的数据,SQL Server 存储成本越来越高了,日志的增长量也极大超过预期,隔三差五总有空间不足导致的应用异常。而且各种多样化的查询需求,在海量数据环境中,响应也越发慢了。

打开Google ,开始琢磨起来,找到两个工具: HDP, CDH.

Hortonwork Hadoop 与 Cloudera Hadoop 是两大 Hadoop 实施商。

Cloudera 是老牌的 Hadoop 供应商,除了定制化的 Hadoop 还提供培训以及支持。

Hortonworks 是新兴的 Hadoop 供应商,与 Cloudear 最大的不同,他是免费的。但同样也提供培训与支持,培训与支持是收费的。

https://www.springpeople.com/blog/hortonworks-or-cloudera-which-one-is-better

文章针对 hortonworks hadoop(HDP) , Cloudera hadoop(CDH) 的优缺点做了详细的阐述,给我们选型 Hadoop 供应商提供了参考

之所以对 Hortonworks 的 Hadoop 进行研究,纯碎是因为它开源。因为你研究透了它,你自己就可以定制 Hadoop 套件,成立自己的大数据咨询公司,这么想,是不是有些许动心了呢?

Hortonworks 旨在用 Apache 开源组件搭建 Hadoop 平台,这些组件都是属于 Apache 旗下,全部开源。包括三大产品: Horton Data Platform, HDP;Apache Ambai ; SmartSense

Hortonworks Hadoop 提供了VMWare, Virtual box 以及 Docker 容器等快速安装的镜像,这些镜像基于单个节点,用来快速体验 HDP 的使用,这是台一体机,下载的文件后缀名是.ova. 这才是本文的重点。完完全全从一个扣 SQL 的开发者,摇身一变,操盘 10 个亿的大数据工程师。这段时间不会超过 2 小时!

就看你 In Or Not , 来不来?下载地址在这里,只帮你到这儿了:

https://hortonworks.com/downloads/#data-platform

这不是替他们打广告,我不持有他们公司的任何股票!

介绍这款软件,来源于曾经的一个失败的想法:我想用 http://asp.net 搭建一个学习环境,让所有的使用者都可以在不用安装 SQL Server 环境下就可以学会 SQL。基于种种原因,这个项目破产了。而如今有这么好的资源,可以帮大家快速上手大数据的学习,我当然愿意推荐了!

回到正题,我们来走一遍 Hortonworks Hadoop 的玩法。

在整个不到 2 小时的使用中,我大概体验了这些操作:

1 在 Hive 中创建表
2 学会了 Hive 基本的 DML 语句,比如: SELECT, WHERE,GROUP BY, SORT,Join
3 使用 Pig Latin1, 做了一次 ETL 的实现

比起纯粹使用 Apache Hadoop, Hive 来构建分布式系统, 使用套件可以更形象的帮我们建立直观感受,加深对概念的理解。

在 HDP 中,Ambari 是作为开发者与 Hadoop 底层交互的界面,非常友好,拿出一照片,领略下界面的风格(保证看了之后,想自己开公司做咨询的,至少在底层封装方向上,可以放弃了):

这是 HDP 的 Dashboard, 通过它我们可以连接到其他组件的控制台,比如 HDFS, Hive, Pig, Spark 等

Hive 作为分布式数据仓库,在支持 SQL 基本语法的同时,帮我们开发者封装了 MapReduce 底层编程实现,使得我们不需要重复开发 Java 程序来实现常见的数据库操作,亦可操作 T/P/E 级的数据量。

1 我们只需要在 Ambari 中找到 Hive 2 View 就可以像 SQL Server Management Studio 管理SQL Server 一样来操作 Hive.

如此清晰的编辑界面,简洁的 SQL 风格,SQL 开发者们可谓分分钟上手

2 使用 Pig 实现 ETL: 我们平时用的最多的ETL 工具,有 SSIS, Informatic 等, 而在大数据环境下,使用 Pig Latin 一样可以实现 ETL 的功能。遇上特别复杂的计算,Pig 还可以扩展,调用 Java, Python 的方法。

是不是够简单,想要跃跃欲试,超级方便,下载他的一体机打开运行即可!

唯一的条件,内存要超级强悍,我的内存 8G, 大家看图感受下我当时的心情。

本文转载自:https://blog.csdn.net/wujiandao/article/details/80558759

Hortonworks,快速上手 Hadoop 的套件的更多相关文章

  1. 用Docker在一台笔记本电脑上搭建一个具有10个节点7种角色的Hadoop集群(上)-快速上手Docker

    如果想在一台电脑上搭建一个多节点的Hadoop集群,传统的方式是使用多个虚拟机.但这种方式占用的资源比较多,一台笔记本能同时运行的虚拟机的数量是很有限的.这个时候我们可以使用Docker.Docker ...

  2. 使用Ambari快速部署Hadoop大数据环境

    使用Ambari快速部署Hadoop大数据环境   发布于2013-5-24   前言 做大数据相关的后端开发工作一年多来,随着Hadoop社区的不断发展,也在不断尝试新的东西,本文着重来讲解下Amb ...

  3. 快速上手pandas(上)

      pandas is a fast, powerful, flexible and easy to use open source data analysis and manipulation to ...

  4. 【Microsoft Azure 的1024种玩法】一.一分钟快速上手搭建宝塔管理面板

    简介 宝塔Linux面板是提升运维效率的服务器管理软件,其支持一键LAMP/LNMP/集群/监控/网站/FTP/数据库/JAVA等100多项服务器管理功能.今天带大家一起学习的内容为一分钟快速上手搭建 ...

  5. 【Python五篇慢慢弹】快速上手学python

    快速上手学python 作者:白宁超 2016年10月4日19:59:39 摘要:python语言俨然不算新技术,七八年前甚至更早已有很多人研习,只是没有现在流行罢了.之所以当下如此盛行,我想肯定是多 ...

  6. 快速上手Unity原生Json库

    现在新版的Unity(印象中是从5.3开始)已经提供了原生的Json库,以前一直使用LitJson,研究了一下Unity用的JsonUtility工具类的使用,发现使用还挺方便的,所以打算把项目中的J ...

  7. [译]:Xamarin.Android开发入门——Hello,Android Multiscreen快速上手

    原文链接:Hello, Android Multiscreen Quickstart. 译文链接:Hello,Android Multiscreen快速上手 本部分介绍利用Xamarin.Androi ...

  8. [译]:Xamarin.Android开发入门——Hello,Android快速上手

    返回索引目录 原文链接:Hello, Android_Quickstart. 译文链接:Xamarin.Android开发入门--Hello,Android快速上手 本部分介绍利用Xamarin开发A ...

  9. 快速上手seajs——简单易用Seajs

    快速上手seajs——简单易用Seajs   原文  http://www.cnblogs.com/xjchenhao/p/4021775.html 主题 SeaJS 简易手册 http://yslo ...

随机推荐

  1. Android驱动之设备树简介

    目录 一.    设备树简介    2 1.    问题一:为什么需要设备树?    2 ①名词解释:    2 ②DT详细介绍:    2 ③DTS是DT的源文件,描述Device Tree中的设备 ...

  2. 分布式session的几种实现方式

    在搭建完集群环境后,不得不考虑的一个问题就是用户访问产生的session如何处理.如果不做任何处理的话,用户将出现频繁登录的现象,比如集群中存在A.B两台服务器,用户在第一次访问网站时,Nginx通过 ...

  3. tcpdump命令及输出详解

    一. 使用方法 1. 指定类型 host:指定主机 tcpdump host 192.168.100.1 tcpdump host 192.168.100.1 and !192.168.100.2 t ...

  4. 15 Windows编程——系统内置窗口子类型之button

    button子类型BS_3STATE.BS_AUTO3STATE.BS_AUTOCHECKBOX 源码 #include<Windows.h> #include<Windowsx.h ...

  5. windows RabbitMQ Server 环境配置中的一些坑

    原文:https://blog.csdn.net/lindonglian/article/details/55805637 RabbitMQ的服务端基于Erlang语言编写,要在机器上安装Rabbit ...

  6. 13. 请看TED 的演讲, 谈谈你对压力的看法,以及怎么和别人合作, 帮助别人,把压力转化为动力,在互相帮助的环境中成长。------------答题者:徐潇瑞

    看了ted的演讲,我觉得压力就像一根弹簧,有多大的压力,它就有多大的弹力:现实中只要你学会用一种永远不服输的顽强精神,去对待人生和社会中遇到的一切困难与挫折,宠辱不惊的看云卷云舒,悟潮起潮落.可是存在 ...

  7. 用Xcode配置完美ACMer环境

    用Xcode配置完美ACMer环境 前言 ​ 作为\(ACMer\),需求大致为强大的文本编辑功能\((VIM)\),便捷的文件模版功能以及多文件编译功能.\(vscode\)虽然强大,但是与集成\( ...

  8. SVN安装配置教程

    第一步:安装Apache LInux centos6.5 ​ (备注:为了方便可以把linux防火墙关掉,这样就不需要一个一个开端口了,建议开发测试可以这样,正式环境不推荐) ​ 第二步:安装SVN服 ...

  9. psql主主复制

    主主是mysql的概念,通常在mysql中为保证事务一致也是一台主写,一台做读.pg主从可以互为切换 之前没做数据库部署这部分,一个同事离职暂时没人,接受过来的!mysql做的是主主复制,我理解是可以 ...

  10. python 操作 MySQL 即相关问题

    导入pymysql import pymysql # 创建connect()对象 conn = pymysql.connect( host = '127.0.0.1', port = 3306, us ...