S2X环境搭建与示例运行
S2X环境搭建与示例运行
http://dbis.informatik.uni-freiburg.de/forschung/projekte/DiPoS/S2X.html
环境
- Maven project
- Built in Eclipse
- Eclipse 3.8/4.2/4.3 (Juno & Kepler)
- Juno https://www.eclipse.org/downloads/packages/release/juno/sr2
- Kepler https://www.eclipse.org/downloads/packages/release/kepler/sr2
- The Eclipse Plug-Ins M2E (Version 1.5.0)
- Scala plugin from scala-ide.org (Version 3.0.3v-2_10...)
- The 3.0.3 release is the third maintenance release of the 3.0 version.
- It is available for Scala 2.10, on Eclipse 3.8/4.2/4.3 (Juno & Kepler).
依赖
根据 pom.xml 文件,S2X 主要有以下六个依赖包
- https://mvnrepository.com/artifact/org.apache.spark/spark-core_2.10/1.2.0-cdh5.3.0
- https://mvnrepository.com/artifact/org.apache.spark/spark-graphx_2.10/1.2.0-cdh5.3.0
- https://mvnrepository.com/artifact/org.apache.hadoop/hadoop-client/2.5.0-mr1-cdh5.3.0
- https://mvnrepository.com/artifact/org.apache.jena/jena-arq/2.11.2
- https://mvnrepository.com/artifact/com.esotericsoftware.kryo/kryo/2.24.0
- https://mvnrepository.com/artifact/junit/junit/4.11
结构
| java文件名 | 引用包 | 功能 |
|---|---|---|
| QueryExecutor.java | log4j:一个打日志的包 spark:操作spark的包 jena:用于操作sparql的包 |
1. 将args交给 ArgumentParser 解析 2. 使用SparkFacade创建spark上下文 3. 使用SparkFacade加载 HDFS (实例层)文件 4. 处理查询语句 - 使用IntermediateResultsModel清理中间值 - 使用jena.query.QueryFactory解析并生成query对象、处理前缀、编译query - 使用AlgebraTranslator从opRoot开始对query进行重写,并获得可执行序列 - 通过SparkOp.execute()开始执行顺序序列中元素 |
| ArgumentParser.java | cls:一个处理命令行的包 log4j:一个打日志的包 de.tf.uni.freiburg.sparkrdf.constants.Const:工程内另一个包 |
1. 解析命令行参数 2. 将参数传递至de.tf.uni.freiburg.sparkrdf.constants.Const中 |
环境搭建步骤
安装并配置好 jdk1.7 或 jdk1.8
访问网站,下载并安装
Eclipse Kepler Package并解压,建议选择 JavaEE 并使用国内镜像下载配置 Maven 环境
- 访问 http://maven.apache.org/download.cgi 下载 Maven
- 新建环境变量
MAVEN_HOME,并将%MAVEN_HOME%\bin加入path - 修改
%MAVEN_HOME%\conf\settings.xml- 添加本地仓库:请选择一个非管理员目录
- 添加远程仓库:可选择国内阿里镜像或其他可访问镜像
- 配置 Eclipse 中 Maven
- Window->preference->Maven->installations :选择上一步安装的 Maven
- Window->preference->Maven->user settings :配置 Maven 设置
- 选择 settings.xml
- 更新 Local Repository
- 可参考
配置scala环境
- 访问 https://www.scala-lang.org/download/2.10.6.html 下载
Scala 2.10.6- 可下载 scala.msi 或 scala-2.10.6.zip ,但我还没弄明白这两个有什么区别
- 配置 Eclipse 中 Scala
- 访问 http://scala-ide.org/download/prev-stable.html
- 选择对应版本 http://download.scala-ide.org/sdk/helium/e38/scala210/stable/site (我没弄明白应该用哪个版本,然后选了2.10.4的)
- Help->Install New Software->粘贴->Add->下载安装
- 下载 Scalastyle 插件
- 访问 https://www.scala-lang.org/download/2.10.6.html 下载
配置spark环境
- 根据
pom.xml中的信息,理论上应该下载基于Scala 2.10的Spark 1.2-CDH5.3.0版本,然而我并找不到。。暂时下载了spark-1.6.0-bin-hadoop2.6.tgz - 解压,并将 bin 目录加入 path
- 根据
配置hadoop环境
- 根据上一步,下载hadoop2.6.0
- 解压,新建环境变量
HADOOP_HOME,并填入解压目录(很关键) - 将 bin 目录加入 path
- 开启 cmd,运行
spark-shell,若出现"java.lang.NullPointerException, not found: value sqlContext",请参考连接:https://blog.csdn.net/u011242657/article/details/53968135 - 最后新建 cmd 窗口,运行
spark-shell,出现以下两句话,视为 spark 与 hadoop 环境配置成功,参考:Spark在Windows下的环境搭建- Spark context available as sc.
- SQL context available as sqlContext.
关于 5、6 两步,官方推荐使用
Cloudera's Distribution of Hadoop CDH,我暂时也没有弄明白CDH是什么
运行项目
从 github 仓库 clone 项目
打开Eclipse Kepler,File->import->Existing Maven Project->选择仓库中src文件夹,一路确定,等待 Maven 自行下载所有包
准备好数据,我使用的是里海大学提供的可自动生成的数据集 LUBM1.nt 约包含 13 万条三元组数据。
如果是在windows上运行代码,需要修改几行代码:
修改
args参数由于在 Spark 上运行代码,需要将代码整理为 jar 包的形式,在测试时需要提前设置命令行参数,或者直接在
QueryExecutor.java的main函数中第一行中修改args变量(-l参数很关键 ):args=new String("-i c:/Users/chenyanji/Downloads/S2X_DATA/lubm1.nt " +
"-mem 2g " +
"-q c:/Users/chenyanji/Downloads/S2X_DATA/query3.new " +
"-t c:/Users/chenyanji/Downloads/S2X_DATA/Record.txt " +
"-p -l -jn chenyanjiTest").split(" ");
修改
SparkFacade.java- 程序开始运行后,首先通过
SparkFacade.LoadGraph()加载图,LoadGraph 需要先判断路径(父目录与参数目录进行拼接)下是否存在图(看起来使用的是相对父目录的路径),随后根据上一步的参数选择使用哪种方式读取图,这里将路径进行修改 - 删去
fs.getHomeDirectory().toString()
- 程序开始运行后,首先通过
运行结果:
...
18/10/23 10:00:43 INFO run.QueryExecutor: Started Graph loading
18/10/23 10:00:56 INFO run.QueryExecutor: Finished Graph Loading in 12958 ms
18/10/23 10:00:56 INFO run.QueryExecutor: Started query file: c:/Users/chenyanji/Downloads/S2X_DATA/query3.new
18/10/23 10:00:56 INFO run.QueryExecutor: Started BGP
18/10/23 10:01:05 INFO run.QueryExecutor: Finished BGP in 8713 ms
18/10/23 10:01:05 INFO run.QueryExecutor: Started Result
18/10/23 10:01:06 INFO run.QueryExecutor: Finished Result in 798 ms
18/10/23 10:01:06 INFO run.QueryExecutor: Started Projection
18/10/23 10:01:06 INFO run.QueryExecutor: Finished Projection in 6 ms
18/10/23 10:01:07 INFO run.QueryExecutor: Result count 6
?x
<http://www.Department0.University0.edu/AssistantProfessor0/Publication4>
?x
<http://www.Department0.University0.edu/AssistantProfessor0/Publication2>
?x
<http://www.Department0.University0.edu/AssistantProfessor0/Publication0>
?x
<http://www.Department0.University0.edu/AssistantProfessor0/Publication5>
?x
<http://www.Department0.University0.edu/AssistantProfessor0/Publication1>
?x
<http://www.Department0.University0.edu/AssistantProfessor0/Publication3>
待解决的问题
-so参数- GraphLoader 在加载图时,如果命令中存在
-so参数,则最后将生成vertice与edge信息对应的 object 文件,但是文件路径会有一个问题:操作系统中不能存在同名文件与文件夹,因此以本地模式运行代码时不能在参数中添加-so
- GraphLoader 在加载图时,如果命令中存在
S2X环境搭建与示例运行的更多相关文章
- Appium(JAVA)Windows 7系统搭建及示例运行
Appium(JAVA)Windows 7系统搭建及示例运行 分类: Appium 2014-11-14 17:44 4323人阅读 评论(2) 收藏 举报 1.搭建Android环境 http:// ...
- vue前端+java后端 vue + vuex + koa2开发环境搭建及示例开发
vue + vuex + koa2开发环境搭建及示例开发 https://segmentfault.com/a/1190000012918518 vue前端+java后端 https://blog.c ...
- HHvm Apache 2.4 Nginx建站环境搭建方法安装运行WordPress博客
HHvm Apache 2.4 Nginx建站环境搭建方法安装运行WordPress博客 VPS主机 2014年06月02日 17:20 评论» 文章目录 Debian上安装 Ce ...
- 【Java学习系列】第1课--Java环境搭建和demo运行
本文地址 分享提纲: 1. java环境的搭建 2. java demo代码运行 3.参考文档 本人是PHP开发者,一直感觉Java才是程序的王道(应用广,科班出身),所以终于下决心跟一跟. 主要是给 ...
- RocketMQ4.5.1环境搭建及示例
一.Windows环境搭建RocketMQ 1. 下载RocketMQ Binary压缩包,并解压缩,我的安装目录为E:\programs\rocketmq\rocketmq-all-4.5.1 2. ...
- react介绍、环境搭建、demo运行实例
React官网:https://reactjs.org/docs/create-a-new-react-app.html cnpm网址:http://npm.taobao.org/ 1.react介绍 ...
- github上DQN代码的环境搭建,及运行(Human-Level Control through Deep Reinforcement Learning)conda配置
最近师弟在做DQN的实验,由于是强化学习方面的东西,正好和我现在的研究方向一样于是我便帮忙跑了跑实验,于是就有了今天的这个内容. 首先在github上进行搜寻,如下图: 发现第一个星数最多,而且远高于 ...
- ionic —— 开发环境搭建并编译运行第一个APP
其实类似的环境已经玩了很多次了,最开始玩还是微信刚刚出来,那会儿没有智能机.只好安装一个模拟器,却只是为了注册一个微信.想想也就是够了~ 前前后后折腾了很多次,可是每一次都给人不一样的感觉,也许是这个 ...
- Appium环境搭建——安装以及运行appium server失败点总结
一.运行Appium失败:未安装.Net Framework 4.5 之前安装AppScan安全测试工具时,就要求.Net 4.5以上环境,我其中一台电脑的系统是Win7-32bit的,安装.Net ...
随机推荐
- 3.7Python数据处理篇之Numpy系列(七)---Numpy的统计函数
目录 目录 前言 (一)函数一览表 (二)统计函数1 (三)统计函数2 目录 前言 具体我们来学Numpy的统计函数 (一)函数一览表 调用方式:np.* .sum(a) 对数组a求和 .mean(a ...
- activiti5.14版本在线流程设计器的国际化中文支持
参考了前辈的一些国际化支持做法,加上自己对流程的一些理解,做了activiti5.14版本的国际化支持.发现有若干bug,比如属性设置弹出窗口里的grid里的下拉列表不支持显示中文(要修改oryx.d ...
- jquery的自定义事件通过on绑定trigger触发
jquery绑定自定义事件,可以实现预先绑定好一个处理方法,当需要使用的时候利用jquery trigger来触发自定义事件,以达到方便快捷的目的.我们来假设一个这样的场景,一个textarea中的字 ...
- 使用with open语句(未完)
来源链接 https://blog.csdn.net/testcs_dn/article/details/45719357 读文件 读写文件是最常见的IO操作.Python内置了读写文件的函数,用法和 ...
- eclipse中xml下Namespaces显示不全的解决办法
1.问题描述: 如图,有时候编写spring相关的xml文件时,使用namepace中显示不全或者完全不显示 2.解决方法: Window —— Spring —— Beans Support ...
- ARDUINO 中断
设置中断函数 attachInterrupt() attachInterrupt(interrupt, function, mode) 描述: 当发生外部中断时,调用一个指定函数.当中断发生时,该 ...
- Qt+QGIS二次开发:QGIS中使用QgsRubberBand类创建临时图形
1 概述 临时图形Rubberband主要用于高亮显示.交互绘制等情况下.2 原理 临时图形是在一个底色透明的图层(顶层)上,添加已有的几何元素或者创建一个几何元素(临时图形),可以设置相应的样式, ...
- VMware虚拟机将英文改成中文的方法
由于之前安装的虚拟机和老师要求的不同,我安装的是VMware,所以没有安装教程,没能修改系统语言,用了几次发现英文的不太方便,特别是出错的时候,看不懂系统的出错提示. 我从网上参考了https://b ...
- 深入浅出的webpack构建工具---ParallelUglifyPlugin优化压缩(十)
webpack默认提供了UglifyJS插件来压缩JS代码,但是它使用的是单线程压缩代码,也就是说多个js文件需要被压缩,它需要一个个文件进行压缩.所以说在正式环境打包压缩代码速度非常慢(因为压缩JS ...
- PAT A1132 Cut Integer (20 分)——数学题
Cutting an integer means to cut a K digits lone integer Z into two integers of (K/2) digits long int ...