【原创】大数据基础之Spark（1）Spark Submit即Spark任务提交过程

【【原创】大数据基础之Spark（1）Spark Submit即Spark任务提交过程】的更多相关文章

【原创】大数据基础之Zookeeper（2）源代码解析

核心枚举 public enum ServerState { LOOKING, FOLLOWING, LEADING, OBSERVING; } zookeeper服务器状态:刚启动LOOKING,follower是FOLLOWING,leader是LEADING,observer是OBSERVING: public enum LearnerType { PARTICIPANT, OBSERVER; } 简单来说,zookeeper启动的核心类是QuorumPeerMain,启动之后会加载配置,…

【原创】大数据基础之Spark（6）Spark Rdd Sort实现原理

spark 2.1.1 spark中可以通过RDD.sortBy来对分布式数据进行排序,具体是如何实现的?来看代码: org.apache.spark.rdd.RDD /** * Return this RDD sorted by the given key function. */ def sortBy[K]( f: (T) => K, ascending: Boolean = true, numPartitions: Int = this.partitions.length) (implic…

【原创】大数据基础之Spark（2）Spark on Yarn：container memory allocation容器内存分配

spark 2.1.1 最近spark任务(spark on yarn)有一个报错 Diagnostics: Container [pid=5901,containerID=container_1542879939729_30802_01_000001] is running beyond physical memory limits. Current usage: 11.0 GB of 11 GB physical memory used; 12.2 GB of 23.1 GB virtual…

【原创】大数据基础之Spark（1）Spark Submit即Spark任务提交过程

Spark2.1.1 一 Spark Submit本地解析 1.1 现象提交命令: spark-submit --master local[10] --driver-memory 30g --class app.package.AppClass app-1.0.jar 进程: hadoop 225653 0.0 0.0 11256 364 ? S Aug24 0:00 bash /$spark-dir/bin/spark-class org.apache.spark.deploy.SparkS…

【原创】大数据基础之Hive（5）hive on spark

hive 2.3.4 on spark 2.4.0 Hive on Spark provides Hive with the ability to utilize Apache Spark as its execution engine. set hive.execution.engine=spark; 1 version Hive on Spark is only tested with a specific version of Spark, so a given version of Hi…

【原创】大数据基础之Spark（9）spark部署方式yarn/mesos

1 下载解压 https://spark.apache.org/downloads.html $ wget http://mirrors.shu.edu.cn/apache/spark/spark-2.4.0/spark-2.4.0-bin-hadoop2.7.tgz $ tar xvf spark-2.4.0-bin-hadoop2.7.tgz$ cd spark-2.4.0-bin-hadoop2.7 2 配置环境变量SPARK_HOME $ export SPARK_HOME=/path/…

大数据基础知识问答----spark篇，大数据生态圈

Spark相关知识点 1.Spark基础知识 1.Spark是什么? UCBerkeley AMPlab所开源的类HadoopMapReduce的通用的并行计算框架 dfsSpark基于mapreduce算法实现的分布式计算,拥有HadoopMapReduce所具有的优点:但不同于MapReduce的是Job中间输出和结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的map reduce的算法. 2.Spark与Hadoop的对比(Spar…

【【原创】大数据基础之Spark（1）Spark Submit即Spark任务提交过程】的更多相关文章

【原创】大数据基础之Zookeeper（2）源代码解析

【原创】大数据基础之Spark（6）Spark Rdd Sort实现原理

【原创】大数据基础之Spark（2）Spark on Yarn：container memory allocation容器内存分配

【原创】大数据基础之Spark（1）Spark Submit即Spark任务提交过程

【原创】大数据基础之Hive（5）hive on spark

【原创】大数据基础之Spark（9）spark部署方式yarn/mesos

大数据基础知识问答----spark篇，大数据生态圈

大数据与可靠性会碰撞出什么样的Spark？

【原创】大数据基础之词频统计Word Count

【原创】大数据基础之Flink（1）简介、安装、使用