欢迎转载，转载请注明出处，徽沪一郎。

概要

前提

假设当前已经安装好如下软件

jdk
sbt
git
scala

安装cassandra

以archlinux为例，使用如下指令来安装cassandra

yaourt -S cassandra

启动cassandra

cassandra -f

创建keyspace和table, 运行/usr/bin/cqlsh进入cql console，然后执行下述语句创建keyspace和table

CREATE KEYSPACE test WITH replication = {'class': 'SimpleStrategy', 'replication_factor': 1 };

CREATE TABLE test.kv(key text PRIMARY KEY, value int);

添加记录，继续使用cql console

INSERT INTO test.kv(key, value) VALUES ('key1', 1);

INSERT INTO test.kv(key, value) VALUES ('key2', 2);

验证记录已经插入成功，执行如下cql

select * from test.kv;

下载编译spark-cassandra-connector

下载最新的spark-cassandra-connector源码

git clone https://github.com/datastax/spark-cassandra-connector.git

编译

sbt package

这中间要等待比较长的时间，请保持足够的耐心

运行spark-shell

首先请确保cassandra已经正常安装和运行，如有问题请返回开始的章节安装cassandra

如何添加相应的library来支持spark-cassandra-connector，并没有一个明确的文档说明，折腾了一个下午，终于弄出了一个最简的配置

bin/spark-shell --driver-class-path /root/working/spark-cassandra-connector/spark-cassandra-connector/target/scala-2.10/spark-cassandra-connector_2.10-1.1.0-SNAPSHOT.jar:

/root/.ivy2/cache/org.apache.cassandra/cassandra-thrift/jars/cassandra-thrift-2.0.9.jar:

/root/.ivy2/cache/org.apache.thrift/libthrift/jars/libthrift-0.9.1.jar:

/root/.ivy2/cache/org.apache.cassandra/cassandra-clientutil/jars/cassandra-clientutil-2.0.9.jar:

/root/.ivy2/cache/com.datastax.cassandra/cassandra-driver-core/jars/cassandra-driver-core-2.0.4.jar:

/root/.ivy2/cache/io.netty/netty/bundles/netty-3.9.0.Final.jar:

/root/.ivy2/cache/com.codahale.metrics/metrics-core/bundles/metrics-core-3.0.2.jar:

/root/.ivy2/cache/org.slf4j/slf4j-api/jars/slf4j-api-1.7.7.jar:

/root/.ivy2/cache/org.apache.commons/commons-lang3/jars/commons-lang3-3.3.2.jar:

/root/.ivy2/cache/org.joda/joda-convert/jars/joda-convert-1.2.jar:

/root/.ivy2/cache/joda-time/joda-time/jars/joda-time-2.3.jar:

/root/.ivy2/cache/org.apache.cassandra/cassandra-all/jars/cassandra-all-2.0.9.jar:

/root/.ivy2/cache/org.slf4j/slf4j-log4j12/jars/slf4j-log4j12-1.7.2.jar

上述指令假设spark-cassandra-connector的源码是下载在$HOME/working目录下，请根据自己的情况作适当修改

我是如何猜测到需要指定这些包依赖的呢？说白了，也很简单，就是执行以下指令，然后再查看相就的java进程中的运行参数

#运行spark-cassandra-connector测试集

sbt test

sbt it:test

当上述指令还在运行的时候，使用ps来查看java运行的参数，这样就反过来知道所需要的包依赖了

ps -ef|grep -i java

测试程序

由于spark-shell会默认创建sc,所以首先需要停止掉默认的sc，然后利用新的配置来创建可以连接到cassandra的sc,示例代码如下

sc.stop

import com.datastax.spark.connector._

import org.apache.spark._

val conf = new SparkConf()

conf.set("spark.cassandra.connection.host", "127.0.0.1")

val sc = new SparkContext("local[2]", "Cassandra Connector Test", conf)

val table = sc.cassandraTable("test", "kv")

table.count

如果一切正常会显示出如下结果

res3: Long = 2

小结

进入实战阶段，挑战会越来越多，保持足够的信心和耐心很重要。

本篇内容和实战一中的kafka cluster组织在一起的话，就会形成一个从前台到后台存储的完整处理链条。

Apache Spark技术实战之3 -- Spark Cassandra Connector的安装和使用的更多相关文章

Apache Spark技术实战之6 --Standalone部署模式下的临时文件清理
问题导读 1.在Standalone部署模式下,Spark运行过程中会创建哪些临时性目录及文件? 2.在Standalone部署模式下分为几种模式? 3.在client模式和cluster模式下有什么 ...
Apache Spark技术实战之4 -- 利用Spark将json文件导入Cassandra
欢迎转载,转载请注明出处. 概要本文简要介绍如何使用spark-cassandra-connector将json文件导入到cassandra数据库,这是一个使用spark的综合性示例. 前提条件假 ...
Spark入门实战系列--1.Spark及其生态圈简介
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .简介 1.1 Spark简介年6月进入Apache成为孵化项目,8个月后成为Apache ...
Spark入门实战系列--4.Spark运行架构
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 1. Spark运行架构 1.1 术语定义 lApplication:Spark Appli ...
Spark入门实战系列--7.Spark Streaming（上）--实时流计算Spark Streaming原理介绍
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .Spark Streaming简介 1.1 概述 Spark Streaming 是Spa ...
Spark入门实战系列--8.Spark MLlib（上）--机器学习及SparkMLlib简介
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .机器学习概念 1.1 机器学习的定义在维基百科上对机器学习提出以下几种定义: l“机器学 ...
Spark入门实战系列--8.Spark MLlib（下）--机器学习库SparkMLlib实战
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .MLlib实例 1.1 聚类实例 1.1.1 算法说明聚类(Cluster analys ...
Spark入门实战系列--2.Spark编译与部署（上）--基础环境搭建
[注] 1.该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取: 2.Spark编译与部署将以CentOS 64位操作系统为基础,主要是考虑到实际应用 ...
Spark入门实战系列--2.Spark编译与部署（中）--Hadoop编译安装
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .编译Hadooop 1.1 搭建环境 1.1.1 安装并设置maven 1. 下载mave ...

随机推荐

Android实现全屏的三种方式
一.通过代码 requestWindowFeature(Window.FEATURE_NO_TITLE);// 隐藏标题栏 getWindow().setFlags(WindowManager.Lay ...
ACM ICPC 2015 Moscow Subregional Russia, Moscow, Dolgoprudny, October, 18, 2015 I. Illegal or Not?
I. Illegal or Not? time limit per test 1 second memory limit per test 512 megabytes input standard i ...
word 批量修改表格格式
For i = 1 To ActiveDocument.Tables.Count ActiveDocument.Tables(i).Cell(1, 1).Select With Selection . ...
HDU - Travel
Problem Description Jack likes to travel around the world, but he doesn’t like to wait. Now, he is t ...
chrome快捷键，让开发更快捷:
9:18 2015/12/9chrome快捷键,让开发更快捷:部分:按住 Ctrl 键,然后点击链接从后台在新标签页中打开链接,但您仍停留在当前标签页中按住 Ctrl+Shift 键,然后点击链 ...
Ubuntu Gnome 14.04.2 lts 折腾笔记
unity感觉不爽,于是来折腾gnome3 = = 首先去官网下载ubuntu gnome 14.04.2 lts的包(种子:http://cdimage.ubuntu.com/ubuntu-gnom ...
Android -- TabHost
TabHost 也就相当于Windows下的选项框有两种实现方式 1. 继承TabActivity (已经废弃):从TabActivity中用getTabHost()方法获取TabHost 2. ...
PHP面向对象学习三类的抽象方法和类
一个类中至少有一个方法是抽象的,我们称之为抽象类. 所以如果定义抽象类首先定义抽象方法. 1.类中至少有一个抽象方法 2.抽象方法不允许有{ } 3.抽象方法前面必须要加abstract 抽象类的几个 ...
本地C代码中创建Java对象
作者:唐老师,华清远见嵌入式学院讲师. 创建Java域的对象就是创建Java类的实例,再调用Java类的构造方法. 以Bitmap的构建为例,Bitmap中并没有Java对象创建的代码及外部能访问的构 ...
Oracle 新手问答
存储过程中,return后,如果没有写明提交(commit)或回滚(rollback),会默认提交吗?答:不会.如果修改了数据,又没有写明,则会将数据锁定在那里! 存储过程中,调用子存储过程异常时,在 ...

Apache Spark技术实战之3 -- Spark Cassandra Connector的安装和使用

概要

前提