java及spark2.X连接mongodb3.X单机或集群的方法（带认证及不带认证）

首先，我们明确的是访问Mongos和访问单机Mongod并没有什么区别。接下来的方法都是既可以访问mongod又可以访问Mongos的。

另外，读作java写作scala，反正大家都看得懂......大概？

1、不带认证集群的连接方法（JAVAscala）：

　　首先是创建连接的方法，我们先声明一个client，然后指定访问的DB和collection：

    private lazy val mongo = new MongoClient("192.168.2.51", 27017)

    private lazy val db = mongo.getDatabase("test")

    private lazy val dbColl = db.getCollection("origin2")

　然后我们读取数据：

import com.mongodb.client.model.Filters.{eq => eqq}

val docs = dbColl.find(eqq("basiclabel.procedure", "second")).iterator()

　　额。。上面那段代码是带filter过滤的读取数据。首先Import com.mongodb.client.model.Filters.eq并把eq重命名为eqq，然后通过dbColl.find(Bson)方法读取指定数据。剩下的就是正常的迭代器的使用方法了，docs获取出来的数据是Iterator[Document]。

　　然后我们更新数据：

dbColl.updateOne(eqq("_id", x.get("_id")), set("segdata", fenduan(str, name)))

　　上面这段代码是说找到_id对应的数据，并将其中一个字段set为一个新的值，这个值可以为Document，String，Int，List等一系列数据结构。我这里fenduan方法返回的是一个Document，做了一层嵌套。

　　至于插入数据更为简单：　

dbColl.insertOne(doc)

2、不带认证的spark读取方法（scala，理直气壮）

　　两种方式，其一是在创建sparksession的时候（SparkContext可以使用第二种方法，醒醒兄弟，2017年了），直接指定"spark.mongodb.input.uri"。然后使用正常的MongoSpark来读取数据。（pipeline里面是过滤条件，愿意尝试的各位可以自己试试filter下的其他方法）。使用rdd是因为rdd更适合进行map和flatmap等一系列精细的转换操作，如果只需要读数据，可以使用MongoSpark.read(spark)方法，直接获取DataFrameReader。

val spark = SparkSession.builder()

        .master("spark://192.168.2.51:7077")

        .config(new SparkConf().setJars(Array("hdfs://192.168.2.51:9000/mongolib/mongo-spark-connector_2.11-2.0.0.jar",

                "hdfs://192.168.2.51:9000/mongolib/bson-3.4.2.jar",

                "hdfs://192.168.2.51:9000/mongolib/mongo-java-driver-3.4.2.jar",

                "hdfs://192.168.2.51:9000/mongolib/mongodb-driver-3.4.2.jar",

                "hdfs://192.168.2.51:9000/mongolib/mongodb-driver-core-3.4.2.jar",

                "hdfs://192.168.2.51:9000/mongolib/commons-io-2.5.jar",

                "hdfs://192.168.2.51:9000/segwithorigin2.jar")))

        .config("spark.cores.max", 80)

        .config("spark.executor.cores", 16)

        .config("spark.executor.memory", "32g")

        .config("spark.mongodb.input.uri", "mongodb://192.168.2.51:27017/test.origin2")

 //       .config("spark.mongodb.output.uri", "mongodb://192.168.12.161:27017/test.origin2")

        .getOrCreate()
val rdd = MongoSpark.builder().sparkSession(spark).pipeline(Seq(`match`(eqq("basiclabel.procedure", "second")))).build.toRDD()

　　第二种方式也较为简单，创建一个ReadConfig，这个是connector提供的一个单例类，可以设置很多参数，例如（此时不必指定"spark.mongodb.input.uri"），如下所示是通过sparkcontext和通过sparksession两种方式读取数据的方法：

      val readConfig = ReadConfig(Map(

              "uri" -> "mongodb://192.168.2.48:27017/",

              "database" -> "test",

              "collection" -> "test"

              ))

　　　　val r2 = MongoSpark.load(spark, readConfig).rdd

//　　　　val r2 = MongoSpark.load(spark.sparkContext, readConfig)

3、带认证的Java读取方法：

　　带认证的需要先创建一个MongoURI，在URI里把用户名，密码和认证库都指定清楚。这种方法通用性比较强，因为spark也这么用，如果使用其他方式认证要么是必须使用库等于认证库，要么是没有通用性。这种方法可以在admin认证然后去读test的数据，就很好。

//带认证的需要先创建一个MongoURI，在URI里把用户名，密码和认证库都指定清楚，至于为什么需要指定库建议看上一篇博客
val mongoURI = new MongoClientURI("mongodb://gaoze:gaolaoban@192.168.2.48:27017/?authSource=admin")

    //val mongoURI = new MongoClientURI("mongodb://192.168.2.48:27017/");

    lazy val mongo = new MongoClient(mongoURI)

    private lazy val db = mongo.getDatabase("test")

    private lazy val dbColl = db.getCollection("test")
//然后和1一样

4、带认证的Spark读取方法：

　　同3一样，在URI里加入用户名密码和库就行了：

val spark = SparkSession.builder()

        .master("spark://192.168.2.51:7077")

        .config(new SparkConf().setJars(Array("hdfs://192.168.2.51:9000/mongolib/mongo-spark-connector_2.11-2.0.0.jar",

                "hdfs://192.168.2.51:9000/mongolib/bson-3.4.2.jar",

                "hdfs://192.168.2.51:9000/mongolib/mongo-java-driver-3.4.2.jar",

                "hdfs://192.168.2.51:9000/mongolib/mongodb-driver-3.4.2.jar",

                "hdfs://192.168.2.51:9000/mongolib/mongodb-driver-core-3.4.2.jar",

                "hdfs://192.168.2.51:9000/mongolib/commons-io-2.5.jar",

                "hdfs://192.168.2.51:9000/segwithorigin2.jar")))

        .config("spark.cores.max", 80)

        .config("spark.executor.cores", 16)

        .config("spark.executor.memory", "32g")
//这里这个配置项指定了用户名gaoze，密码gaolaoban，认证库admin

        .config("spark.mongodb.input.uri", "mongodb://gaoze:gaolaoban@192.168.2.51:27017/test.origin2?authSource=admin")

        .getOrCreate()

val rdd = MongoSpark.builder().sparkSession(spark).pipeline(Seq(`match`(eqq("basiclabel.procedure", "second")))).build.toRDD()

或者：

//这里指定了用户名rw，密码1，认证库test
val readConfig = ReadConfig(Map(

              "uri" -> "mongodb://rw:1@192.168.2.48:27017/?authSource=test",

              "database" -> "test",

              "collection" -> "test"

              ))

val rdd = MongoSpark.builder().sparkSession(spark).readConfig(readConfig).build().toRDD()
//val r2 = MongoSpark.load(spark.sparkContext, readConfig)

java及spark2.X连接mongodb3.X单机或集群的方法（带认证及不带认证）的更多相关文章

【运维技术】Zookeeper单机以及集群搭建教程
Zookeeper单机以及集群搭建教程单机搭建单机安装以及启动安装zookeeper的前提是必须有java环境 # 选择目录进行下载安装 cd /app # 下载zk,可以去官方网站下载,自己上 ...
java架构之路（MQ专题）kafka集群配置和简单使用
前面我们说了RabbitMQ和RocketMQ的安装和简单的使用,这次我们说一下Kafka的安装配置,后面我会用几个真实案例来说一下MQ的真实使用场景.天冷了,不愿意伸手,最近没怎么写博客了,还请见谅 ...
Redis 5.0.7 讲解，单机、集群模式搭建
Redis 5.0.7 讲解,单机.集群模式搭建一.Redis 介绍不管你是从事 Python.Java.Go.PHP.Ruby等等... Redis都应该是一个比较熟悉的中间件.而大部分经常写业 ...
Zookeeper集群搭建（多节点，单机伪集群，Docker集群）
Zookeeper介绍原理简介 ZooKeeper是一个分布式的.开源的分布式应用程序协调服务.它公开了一组简单的原语,分布式应用程序可以在此基础上实现更高级别的同步.配置维护.组和命名服务.它的设 ...
备忘zookeeper(单机+伪集群+集群)
#下载: #单机模式解压到合适目录. 进入zookeeper目录下的conf子目录, 复制zoo_sample.cfg-->zoo.cfg(如果没有data和logs就新建):tickTime ...
Greenplum源码编译安装（单机及集群模式）完全攻略
公司有个项目需要安装greenplum数据库,让我这个gp小白很是受伤,在网上各种搜,结果找到的都是TMD坑货帖子,但是经过4日苦战,总算是把greenplum的安装弄了个明白,单机及集群模式都部署成 ...
zookeeper安装和配置(单机+伪集群+集群)
#单机模式解压到合适目录. 进入zookeeper目录下的conf子目录, 复制zoo_sample.cfg-->zoo.cfg(如果没有data和logs就新建):tickTime=2000 ...
redis在Windows下以后台服务一键搭建集群(单机--伪集群)
redis在Windows下以后台服务一键搭建集群(单机--伪集群) 一.概述此教程介绍如何在windows系统中同一台机器上布置redis伪集群,同时要以后台服务的模式运行.布置以脚本的形式,一键 ...
Spark Tachyon编译部署（含单机和集群模式安装）
Tachyon编译部署编译Tachyon 单机部署Tachyon 集群模式部署Tachyon 1.Tachyon编译部署 Tachyon目前的最新发布版为0.7.1,其官方网址为http://tac ...

随机推荐

python练习题-day1
1.使用while循环输入 1 2 3 4 5 6 8 9 10 count=0 while count<10: count+=1 if count==7: continue print ...
Hibernate的状态
最新的Hibernate文档中为Hibernate对象定义了四种状态(原来是三种状态,面试的时候基本上问的也是三种状态),分别是:瞬时态(new, or transient).持久态(managed, ...
轻量级ORM工具Simple.Data
今天推举的这篇文章,本意不是要推举文章的内容,而是据此介绍一下Simple.Data这个很有意思的类ORM工具. 现在大家在.NET开发中如果需要进行数据访问,那么基本都会使用一些ORM工具,比如微软 ...
centos7部署fabric-ca错误解决
1.fabric-ca 编译错误:ltdl.h: no such file 在fabric-ca目录中使用make编译时,会出现如下错误: 解决方案: 如果在ubunt操作系统中,只需安装:apt i ...
（转）以太坊(Ethereum)全零地址(0x000000...)揭秘
最近,一位小伙伴向我咨询问题,说他发现了一个诡异的现象.以太坊的区块链中居然有全是0的地址:0x0000000000000000000000000000000000000000 这究竟是怎么回事儿呢? ...
Laravel中路由怎么写（一）
1.路由基本使用示例 1.1 默认示例 Laravel中所有路由定义在/app/Http/routes.php文件中,该文件默认定义了应用的首页路由: Route::get('/', function ...
git push 提交某一个commit
(以下情况是我们的一位开发小哥哥遇到了提交失败,来找我,我给他解决的过程,以前我也没遇到,所以记录下来) 我们会遇到这样的情况,在develop分支上,第一天修改的文件,已经执行了git commit ...
[LeetCode] questions conlusion_InOrder, PreOrder, PostOrder traversal
Pre: node 先, Inorder: node in, Postorder: node 最后 PreOrder Inorde ...
vue2.3时使用手机调试，提示媒体已断开的解决方案
参考链接:http://www.xitonghe.com/jiaocheng/windows7-9623.html 1.在当前版本vue下开发,发现只能在localhost时调试,不能使用电脑的ip, ...
Response.Redirect & window.location.href
对接中信的微信H5支付时,对方(其实是微信)需要对我们的域名进行授权,即,我方需向渠道报备支付域名,微信只认可由此域名发起的支付交易. 支付中心只提供了一套支付接口供下游系统访问.因为给渠道报备的域名 ...

java及spark2.X连接mongodb3.X单机或集群的方法（带认证及不带认证）

java及spark2.X连接mongodb3.X单机或集群的方法（带认证及不带认证）的更多相关文章

随机推荐

热门专题