在linux系统上安装solrCloud
  
  1.依赖:
  
  JRE solr7.3 需要 java1.8
  
  独立的zookeeper服务 ,zookeeper安装请参考:
  
  http://zookeeper.apache.org/doc/current/zookeeperStarted.html
  
  2.上传solr安装包
  
  3.从安装包中解出安装脚本
  
  tar xzf solr-7.3.0.tgz solr-7.3.0/bin/install_solr_service.sh --strip-components=2
  
  安装脚本可用于:CentOS, Debian, Red Hat, SUSE and Ubuntu Linux distributions
  
  4.安装脚本参数说明:
  
  ./install_solr_service.sh -help
  
  -i 指定软件安装目录。默认 /opt
  
  -d 指定数据目录(solr主目录):内核存储目录 。默认 /var/solr
  
  -u 指定要创建的拥有solr的用户名,出于安全考虑,不应以root来运行。默认 solr
  
  -s 指定系统服务名。默认 solr
  
  -p 指定端口。默认 8983
  
  5.目录规划
  
  6.以root身份运行安装脚本进行安装
  
  ./install_solr_service.sh solr-7.3.0.tgz
  
  等同:
  
  ./install_solr_service.sh solr-7.3.0.tgz -i /opt -d /var/solr -u solr -s solr -p 8983
  
  配置solr服务实例
  
  1.认识solr服务的配置文件
  
  问:如何启动一个solr服务实例?
  
  1,系统服务脚本: /etc/init.d/solr 请查看该脚本内容,看系统启动时是如何启动solr服务实例的。 可看到使用了如下三个变量:
  
  2.环境参数配置文件(官方叫法:include file)。它将覆盖 bin/solr启停控制脚本中的配置参数。我们通过该文件来配置修改solr服务实例的运行配置。
  
  请查看 /etc/default/solr.in.sh ,看我们可以在该文件中进行哪些配置。
  
  在 /etc/default/solr.in.sh 中可看到它配置了如下参数:
  
  map将RDD的元素一个个传入call方法,经过call方法的计算之后,逐个返回,生成新的RDD,计算之后,记录数不会缩减。示例代码,将每个数字加10之后再打印出来, 代码如下
  
  import java.util.Arrays;
  
  import org.apache.spark.SparkConf;
  
  import org.apache.spark.api.java.JavaRDD;
  
  import org.apache.spark.api.java.JavaSparkContext;
  
  import org.apache.spark.api.java.function.Function;
  
  import org.apache.spark.api.java.function.VoidFunction;
  
  public class Map {
  
  public static void main(String[] args) {
  
  SparkConf conf = new SparkConf(www.yongshiyule178.com/).setAppName( www.dfgjpt.com"spark map").setMaster("local[*]");
  
  JavaSparkContext javaSparkContext www.michenggw.com new JavaSparkContext(conf);
  
  JavaRDD<Integer> listRDD = javaSparkContext.parallelize(Arrays.asList(1, 2, 3, 4));
  
  JavaRDD<Integer> numRDD www.yongshi123.cn =www.tiaotiaoylzc.com listRDD.map(new Function<Integer, Integer>() {
  
  @Override
  
  public Integer call(Integer num) throws Exception {
  
  return num + 10;
  
  numRDD.foreach(new VoidFunction<Integer>(www.cmeidi.cn) {
  
  @Override
  
  public void call(Integer num) throws Exception {
  
  System.out.println(num);
  
  执行结果:
  
  2、flatMap
  
  flatMap和map的处理方式一样,都是把原RDD的元素逐个传入进行计算,但是与之不同的是,flatMap返回值是一个Iterator,也就是会一生多,超生
  
  import java.util.Arrays;
  
  import java.util.Iterator;
  
  import org.apache.spark.SparkConf;
  
  import org.apache.spark.api.java.JavaRDD;
  
  import org.apache.spark.api.java.JavaSparkContext;
  
  import org.apache.spark.api.java.function.FlatMapFunction;
  
  import org.apache.spark.api.java.function.VoidFunction;
  
  public class FlatMap {
  
  public static void main(String[] args) {
  
  SparkConf conf = new SparkConf().setAppName(www.mhylpt.com"spark map"www.ycjszpgs.com).setMaster("local[*]");
  
  JavaSparkContext javaSparkContext = new JavaSparkContext(conf);
  
  JavaRDD<String> listRDD = javaSparkContext
  
  .parallelize(Arrays.asList("hello wold", "hello java", "hello spark"));
  
  JavaRDD<String> rdd = listRDD.flatMap(new FlatMapFunction<String, String>() {
  
  private static final long serialVersionUID = 1L;
  
  @Override
  
  public Iterator<String>www.myzx1.com call(String input) throws Exception {
  
  return Arrays.asList(input.split()).iterator();
  
  rdd.foreach(new VoidFunction<String>() {
  
  private static final long serialVersionUID = 1L;
  
  @Override
  
  public void call(String num) throws Exception {
  
  System.out.println(num);

Spark RDD操作之Map系算子的更多相关文章

  1. Spark RDD操作(1)

    https://www.zybuluo.com/jewes/note/35032 RDD是什么? RDD是Spark中的抽象数据结构类型,任何数据在Spark中都被表示为RDD.从编程的角度来看,RD ...

  2. Spark RDD 操作

    1. Spark RDD 创建操作 1.1 数据集合   parallelize 可以创建一个能够并行操作的RDD.其函数定义如下: ) scala> sc.defaultParallelism ...

  3. spark RDD操作的底层实现原理

    RDD操作闭包外部变量原则 RDD相关操作都需要传入自定义闭包函数(closure),如果这个函数需要访问外部变量,那么需要遵循一定的规则,否则会抛出运行时异常.闭包函数传入到节点时,需要经过下面的步 ...

  4. Spark RDD API详解(一) Map和Reduce

    RDD是什么? RDD是Spark中的抽象数据结构类型,任何数据在Spark中都被表示为RDD.从编程的角度来看,RDD可以简单看成是一个数组.和普通数组的区别是,RDD中的数据是分区存储的,这样不同 ...

  5. Spark RDD API具体解释(一) Map和Reduce

    本文由cmd markdown编辑.原始链接:https://www.zybuluo.com/jewes/note/35032 RDD是什么? RDD是Spark中的抽象数据结构类型,不论什么数据在S ...

  6. Spark RDD API详解之:Map和Reduce

    RDD是什么? RDD是Spark中的抽象数据结构类型,任何数据在Spark中都被表示为RDD.从编程的角度来看, RDD可以简单看成是一个数组.和普通数组的区别是,RDD中的数据是分区存储的,这样不 ...

  7. Spark RDD Operations(1)

    以上是对应的RDD的各中操作,相对于MaoReduce只有map.reduce两种操作,Spark针对RDD的操作则比较多 ************************************** ...

  8. Apache Spark 2.2.0 中文文档 - Spark RDD(Resilient Distributed Datasets)论文 | ApacheCN

    Spark RDD(Resilient Distributed Datasets)论文 概要 1: 介绍 2: Resilient Distributed Datasets(RDDs) 2.1 RDD ...

  9. Apache Spark RDD(Resilient Distributed Datasets)论文

    Spark RDD(Resilient Distributed Datasets)论文 概要 1: 介绍 2: Resilient Distributed Datasets(RDDs) 2.1 RDD ...

随机推荐

  1. Codechef MGCHGYM Misha and Gym 容斥、背包、Splay

    VJ传送门 简化题意:给定一个长度为\(N\)的数列,\(Q\)个操作: \(1\,x\,a\).将数列中第\(x\)个元素改为\(a\) \(2\,l\,r\).反转子序列\([l,r]\) \(3 ...

  2. java,javascript中的url编码

    真实场景 url示例如下 http://localhost:31956/Login/Auto?Token=e8a67a9f-c062-4964-b703-d79f29c8b64e&Return ...

  3. DataWorks使用小结(二)——功能面板使用指南

    一.数据开发 1.任务开发 新建表 野路子可以直接新建一个任务,粘贴DDL,手动运行任务即可完成建表 正常应当是在“数据管理”->数据表管理中建表: 支持可视化建表和DDL建表(配合之前的宏,建 ...

  4. POI Sax 事件驱动解析Excel2003文件

    POI事件驱动解析Excel文件 package com.boguan.bte.util.excel; import java.io.FileInputStream; import java.io.I ...

  5. HDU3062&&HDU1814

    Preface 两道2-SAT模板题. HDU3062 看题目就一眼2-SAT.一对夫妻看成一个变量,之间的矛盾可以看成限制. 考虑不同席的限制,相当于选了\(i\)就不选\(j\),即必选\(j'\ ...

  6. LOJ #6074. 「2017 山东一轮集训 Day6」子序列

    #6074. 「2017 山东一轮集训 Day6」子序列 链接 分析: 首先设f[i][j]为到第i个点,结尾字符是j的方案数,这个j一定是从i往前走,第一个出现的j,因为这个j可以代替掉前面所有j. ...

  7. 渐进式 JavaScript 框架--Vue

      前  言   灵活 不断繁荣的生态系统,可以在一个库和一套完整框架之间自如伸缩. 高效 20kB min+gzip 运行大小超快虚拟 DOM 最省心的优化 1 计算属性 计算属性关键词: comp ...

  8. Linux下分布式系统以及CAP理论分析

    CAP理论被很多人拿来作为分布式系统设计的金律,然而感觉大家对CAP这三个属性的认识却存在不少误区,那么什么是CAP理论呢?CAP原本是一个猜想,2000年PODC大会的时候大牛Brewer提出的,他 ...

  9. Jumpserver双机高可用环境部署笔记

    之前在IDC部署了Jumpserver堡垒机环境,作为登陆线上服务器的统一入口.后面运行一段时间后,发现Jumpserver服务器的CPU负载使用率高达80%以上,主要是python程序对CPU的消耗 ...

  10. 如何新增一个ssh-key文件

    前言 由于在公司有一个sshkey 在用,用于绑定公司的git code 仓库.那么在家要连上git hub 仓库,就也需要一个 ssh key .为了避免公司信息外露,所以还是新增一个ssh key ...