Spark GraphX图计算简单案例【代码实现，源码分析】

一.简介

　　参考：https://www.cnblogs.com/yszd/p/10186556.html

二.代码实现　　

 package big.data.analyse.graphx

 import org.apache.log4j.{Level, Logger}

 import org.apache.spark.graphx._

 import org.apache.spark.rdd.RDD

 import org.apache.spark.sql.SparkSession

 class VertexProperty()

 case class UserProperty(val name: String) extends VertexProperty

 case class ProductProperty(val name: String, val price: Double) extends VertexProperty

 /*class Graph[VD, ED]{

   val vertices: VertexRDD[VD]

   val edges: EdgeRDD[ED]

 }*/

 /**

   * Created by zhen on 2019/10/4.

   */

 object GraphXTest {

   /**

     * 设置日志级别

     */

   Logger.getLogger("org").setLevel(Level.WARN)

   def main(args: Array[String]) {

     val spark = SparkSession.builder().appName("GraphXTest").master("local[2]").getOrCreate()

     val sc = spark.sparkContext

     /**

       * 创建vertices的RDD

       */

     val users : RDD[(VertexId, (String, String))] = sc.parallelize(

       Array((3L, ("Spark", "GraphX")), (7L, ("Hadoop", "Java")),

             (5L, ("HBase", "Mysql")), (2L, ("Hive", "Mysql"))))

     /**

       * 创建edges的RDD

       */

     val relationships: RDD[Edge[String]] = sc.parallelize(

       Array(Edge(3L, 7L, "Fast"), Edge(5L, 3L, "Relation"),

       Edge(2L, 5L, "colleague"), Edge(5L, 7L, "colleague")))

     /**

       * 定义默认用户

       */

     val defualtUser = ("Machical", "Missing")

     /**

       * 构建初始化图

       */

     val graph = Graph(users, relationships, defualtUser)

     /**

       * 使用三元组视图呈现顶点之间关系

       */

     val facts : RDD[String] = graph.triplets.map(triplet =>

       triplet.srcAttr._1 + " is the " + triplet.attr + " with " + triplet.dstAttr._1)

     facts.collect().foreach(println)

     graph.vertices.foreach(println) //顶点

     graph.edges.foreach(println) //边

     graph.ops.degrees.foreach(println) // 各顶点的度

     graph.triplets.foreach(println) // 顶点，边，关系

     println(graph.ops.numEdges) // 边的数量

     println(graph.ops.numVertices) // 顶点的数量

   }

 }

三.结果

　　1.三元组视图

　　2.顶点

　　3.边

　　4.各顶点的度

　　5.三元组视图

　　6.边/顶点数量

四.源码分析

 class Graph[VD, ED] {

    // Information about the Graph

 　　val numEdges: Long

 　　val numVertices:Long

 　　val inDegrees: VertexRDD[Int]

 　　val outDegrees: VertexRDD[Int]

 　　val degrees: VertexRDD[Int]

 　　

    // Views of the graph as collections

 　　val vertices: VertexRDD[VD]

 　　val edges: EdgeRDD[ED]

 　　val triplets: RDD[EdgeTriplet[VD,ED]]

 　

  　//Functions for caching graphs

 　　def persist(newLevel1:StorageLevel = StorageLevel.MEMORY_ONLY): Graph[VD, ED]//默认存储级别为MEMORY_ONLY

 　　def cache(): Graph[VD, ED]

 　　def unpersistVertices(blocking: Boolean = true): Graph[VD, ED]

 　　// Change the partitioning heuristic

 　　def partitionBy(partitionStrategy: PartitionStrategy)

 　　// Transform vertex and edge attributes

 　　def mapVertices[VD2](map: (VertexId, VD) => VD2): Graph[VD2, ED]

 　　def mapEdges[ED2](map: Edge[ED] => ED2): Graph[VD, ED2]

 　　def mapEdges[ED2](map: (PartitionID, Iterator[Edge[ED]]) => Iterator[ED2]): Graph[VD, ED2]

 　　def mapTriplets[ED2](map: EdgeTriplet[VD, ED] => ED2): Graph[VD, ED2]

 　　def mapTriplets[ED2](map: (PartitionID, Iterator[EdgeTriplet[VD, ED]]) => Iterator[ED2]): Graph[VD, ED2]

 　　// Modify the graph structure

 　　def reverse: Graph[VD, ED]

 　　def subgraph(epred: EdgeTriplet[VD,ED] => Boolean,vpred: (VertexId, VD) => Boolean): Graph[VD, ED]

 　　def mask[VD2, ED2](other: Graph[VD2, ED2]): Graph[VD, ED] // 返回当前图和其它图的公共子图

 　　def groupEdges(merge: (ED, ED) => ED): Graph[VD,ED]

 　　// Join RDDs with the graph　　

 　　def joinVertices[U](table: RDD[(VertexId, U)])(mapFunc: (VertexId, VD, U) => VD): Graph[VD, ED]

 　　def outerJoinVertices[U, VD2](other: RDD[(VertexId, U)])(mapFunc: (VertexId, VD, Option[U]))

 　　

 　　// Aggregate information about adjacent triplets

 　　def collectNeighborIds(edgeDirection: EdgeDirection): VertexRDD[Array[VertexId]]

 　　def collectNeighbors(edgeDirection: EdgeDirection): VertexRDD[Array[(VertexId, VD)]]

 　　def aggregateMessages[Msg: ClassTag](sendMsg: EdgeContext[VD, ED, Msg] => Unit, merageMsg: (Msg, Msg) => Msg, tripletFields: TripletFields: TripletFields = TripletFields.All): VertexRDD[A]

 　　

 　　//Iterative graph-parallel computation

 　　def pregel[A](initialMsg: A, maxIterations: Int, activeDirection: EdgeDiection)(vprog: (VertexId, VD, A) => VD, sendMsg: EdgeTriplet[VD, ED] => Iterator[(VertexId, A)], mergeMsg: (A, A) => A): Graph[VD, ED]

 　　

 　　// Basic graph algorithms

 　　def pageRank(tol: Double, resetProb: Double = 0.15): Graph[Double, Double]

 　　def connectedComponents(): Graph[VertexId, ED]

 　　def triangleCount(): Graph[Int, ED]

 　　def stronglyConnectedComponents(numIter: Int): Graph[VertexId, ED]

 }

Spark GraphX图计算简单案例【代码实现，源码分析】的更多相关文章

Spark GraphX图计算核心源码分析【图构建器、顶点、边】
一.图构建器 GraphX提供了几种从RDD或磁盘上的顶点和边的集合构建图形的方法.默认情况下,没有图构建器会重新划分图的边:相反,边保留在默认分区中.Graph.groupEdges要求对图进行重新 ...
Spark技术内幕：Stage划分及提交源码分析
http://blog.csdn.net/anzhsoft/article/details/39859463 当触发一个RDD的action后,以count为例,调用关系如下: org.apache. ...
5.Spark Streaming流计算框架的运行流程源码分析2
1 spark streaming 程序代码实例代码如下: object OnlineTheTop3ItemForEachCategory2DB { def main(args: Array[Str ...
仿爱奇艺视频，腾讯视频，搜狐视频首页推荐位轮播图（二）之SuperIndicator源码分析
转载请把头部出处链接和尾部二维码一起转载,本文出自逆流的鱼:http://blog.csdn.net/hejjunlin/article/details/52510431 背景:仿爱奇艺视频,腾讯视频 ...
Spark大师之路：广播变量（Broadcast）源码分析
概述最近工作上忙死了……广播变量这一块其实早就看过了,一直没有贴出来. 本文基于Spark 1.0源码分析,主要探讨广播变量的初始化.创建.读取以及清除. 类关系 BroadcastManager类 ...
史上最简单的的HashTable源码分析
HashTable源码分析 1.前言 Hashtable 一个元老级的集合类,早在 JDK 1.0 就诞生了 1.1.摘要在集合系列的第一章,咱们了解到,Map 的实现类有 HashMap.Link ...
65、Spark Streaming：数据接收原理剖析与源码分析
一.数据接收原理二.源码分析入口包org.apache.spark.streaming.receiver下ReceiverSupervisorImpl类的onStart()方法 ### overr ...
struts2 paramsPrepareParamsStack拦截器简化代码（源码分析）
目录一.在讲 paramsPrepareParamsStack 之前,先看一个增删改查的例子. 1. Dao.java准备数据和提供增删改查 2. Employee.java 为model 3. E ...
Spark GraphX图计算核心算子实战【AggreagteMessage】
一.简介参考博客:https://www.cnblogs.com/yszd/p/10186556.html 二.代码实现 package graphx import org.apache.log4j ...

随机推荐

【Spring IoC】IoC容器初始化（二）
Ioc容器的初始化是由refresh()方法来启动的,这个方法标志着Ioc容器的正式启动. 具体来说这个启动过程包括三个基本过程: BeanDefinition的Resource定位 BeanDefi ...
[笔记] nice-upload 与 nice-static-server
1.request 支持流模式,管道流pipe,抓取图片并保存就很方便了 request('https://s.gravatar.com/avatar/184a1f14c759795b94ae1d01 ...
5 Ways AI is Transforming the Finance Industry
https://marutitech.com/ways-ai-transforming-finance/ As global technology has evolved over the years ...
论文阅读笔记六十二:RePr: Improved Training of Convolutional Filters(CVPR2019)
论文原址:https://arxiv.org/abs/1811.07275 摘要一个训练好的网络模型由于其模型捕捉的特征中存在大量的重叠,可以在不过多的降低其性能的条件下进行压缩剪枝.一些skip/ ...
求职-DB相关职位常见face题
数据分析是个通用技能,适合各行各业,比如运营.产品.分析等职位都会要求会数据分析. 一.考察对数据分析岗位的理解与职业规划数据分析师与数据工程师的区别在哪里? 为什么转行, 为什么没在公司内部转岗? ...
JAVA基础概念（三）
JAVA方法入参和返回类型方法入参基础数据类型引用数据类型修饰符返回类型方法名(参数类型参数名,参数类型参数名...){//方法体return} 方法返回类型 return xxx 具 ...
数据结构——顺序队列（sequence queue）
/* sequenceQueue.c */ /* 顺序队列 */ #include <stdio.h> #include <stdlib.h> #include <std ...
Linux性能优化实战学习笔记：第五十一讲
一.上节回顾上一节,我带你一起学习了常见的动态追踪方法.所谓动态追踪,就是在系统或者应用程序正常运行的时候,通过内核中提供的探针,来动态追踪它们的行为,从而辅助排查出性能问题的瓶颈. 使用动态追踪, ...
[LeetCode] 454. 4Sum II 四数之和之二
Given four lists A, B, C, D of integer values, compute how many tuples (i, j, k, l) there are such t ...
区间DP（超详细！！！）
一.问题给定长为n的序列a[i],每次可以将连续一段回文序列消去,消去后左右两边会接到一起,求最少消几次能消完整个序列,n≤500. f[i][j]表示消去区间[i,j]需要的最少次数. 则; 若a ...

Spark GraphX图计算简单案例【代码实现，源码分析】

一.简介

二.代码实现

三.结果

四.源码分析

Spark GraphX图计算简单案例【代码实现，源码分析】的更多相关文章

随机推荐

热门专题

二.代码实现