neo4j - 查询效率的几种优化思路

最近在公司实习做的就是优化neo4j图形数据库查询效率的事，公司提供的是一个在Linux上搭建且拥有几亿个节点的数据库。开始一段时间主要是熟悉该数据库的一些基本操作，直到上周才正式开始步入了优化数据库查询效率的阶段，然而庆幸的是在这周就已经把数据库的查询效率优化的可以商用了。

刚开始时，在公司的neo4j数据库中进行关联查询时，有些查询指令甚至长达两小时都未返回待查结果，以致无法满足一般的商业需求。后来经过查阅相关资料，获得了如下几种优化思路：

1：增加索引
2：优化neo4j配置文件
3：增加服务器内存
4：增加ssd固态硬盘
一、增加索引

经查阅相关资料可知，neo4j数据库的索引一般分为三类。

① 手动索引：Neo4j数据库若采用手动方式创建索引，则索引并不会随着数据的改变而自动更新。虽然该种方法可以手动创建和维护索引，但由于较为麻烦，所以一般不采用。

② 自动索引：自动索引是一种通过修改配置文件来创建索引的方法，但是在目前的neo4j 3.x版本中已经摒弃了用该方法来创建索引，并建议使用模式索引代替之。

③ 模式索引：模式索引和关系数据库中的索引很相似, 每一个索引会对应一个标签和一组属性,无论是更新还是删除节点，索引都会自动更新或者删除，因此该种创建索引的方式更适用。

很显然采用模式索引会更简单方便，而建立模式索引，需要使用Cypher语句：CREATE INDEX ON: 标签(待查字段)。一般在浏览器http://172.18.34.25:7474/browser/网页上，可分别为待查字段建立模式索引。然而实验结果表明，建立索引后的查询时间虽有减少但不足以满足实际需求。另外有一点非常重要，索引建立后只是Populating状态，一定要一定要一定要重启数据库并关闭http://172.18.34.25:7474/browser/网页让索引ONLINE生效，否则刚刚建的索引是无效的，望大家切记。若不知道待查字段是否已有索引，可用“:schema”指令查看当前数据库中已建好的所有索引和索引是否ONLINE。

二、优化neo4j配置文件

① 先明确neo4j的安装路径，然后执行“cd /home/public/Software/neo4j-community-3.3.7/conf/”指令进入指定目录下。由于要对neo4j配置文件进行修改，为了保险起见建议在对neo4j.conf文件进行修改之前，先备份一份neo4j.conf文件。

② 用“vim neo4j.conf”指令打开neo4j.conf文件并进行相应修改。经过查阅一些资料得知，通过添加jvm虚拟环境可以提高数据库的查询速度，即取消neo4j配置文件中关于dbms.memory.heap.initial_size=512m；dbms.memory.heap.max_size=512m两行的注释，并做合适的修改（最大堆内存越大越好，但是要小于机器的物理内存）。

三、增加服务器内存（未实施）

四、增加ssd固态硬盘（未实施）

由于“增加索引”和“优化neo4j配置文件”已经可以让neo4j数据库的查询时间得到了较大的缩减，并能满足一般的商业需求，所以暂时还未进行“增加服务器内存”和“增加ssd固态硬盘”的优化操作。

心得体会：

①：在测试前一定要为待查字段分别建立模式索引，建与不建的查询速度是非常显著的哈；

②：索引创建后一定要ONLINE才会生效，这点把我坑的好惨啊！

③：测试查询语句时，一定要尽可能将在一类标签中（其实相当于一张表）靠后或靠中间的节点属性作为查询条件，这样才能遍历更多的节点，故所得的测试结果才会真实可信；

④：增加WHERE语句、配合使用AND、OR等加大查询复杂度，另外还可以通过使用错误的范围语句来进行测试，如 "2020-10"<= P1.paper_publish_date <= "2017-10"；

⑤：测试语句也要将不存在的节点的属性作为查询条件，看返回空的时间如何；

⑥：学会优化Cypher查询语句，如

MATCH (a:Author)-[:author_is_in_field]->(f:Field)

WHERE f.field_level = "L3"

RETURN a.auhtor_name,f.field_name,f.field_reference_count

LIMIT 10

可以优化成

MATCH (a:Author)-[:author_is_in_field]->(f:Field{field_level:"L3"})

RETURN a.auhtor_name,f.field_name,f.field_reference_count

LIMIT 10

⑦：测试过程中，要想尽一切用户可能使用的场景来进行测试，切不可有意回避某些使用场景，否则不过是自欺欺人而已。

给大家推荐几个neo4j数据库学习网站：

【1】https://www.zhihu.com/question/45401120

【2】https://www.cnblogs.com/justcooooode/p/8182376.html

【3】https://blog.csdn.net/qq_37242224/article/details/81325625

【4】https://www.cnblogs.com/qianguyihao/category/587723.html

【5】https://www.cnblogs.com/loveis715/p/5277051.html

【6】https://blog.csdn.net/u011697278/article/details/52462420

【7】https://www.w3cschool.cn/neo4j/neo4j_need_for_graph_databses.html

【8】https://blog.csdn.net/u013946356/article/details/81739079
————————————————
版权声明：本文为CSDN博主「Vensmallzeng」的原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接及本声明。
原文链接：https://blog.csdn.net/Vensmallzeng/article/details/89299687

neo4j - 查询效率的几种优化思路的更多相关文章

提高SQL查询效率的30种方法
转载:提高SQL查询效率的30种方法内容摘录如下: 1.对查询进行优化,应尽量避免全表扫描,首先应考虑在 where 及 order by 涉及的列上建立索引. 2.应尽量避免在 where 子句中 ...
MySQL 查询语句优化思路
query 语句的优化思路和原则主要提现在以下几个方面:1. 优化更需要优化的Query:2. 定位优化对象的性能瓶颈:3. 明确的优化目标:4. 从 Explain 入手:5. 多使用profile ...
sqlserver 数据查询效率优化
首先优化是具体情况具体分析,从硬件.改进表结构.索引.改进sql查询语句.存储方式都有关系等多方面入手比如单表数据量(100w-200w条)不大的情况下,查询效率慢可以从优化sql语句.对多个排序 ...
mysql简单优化思路
mysql简单优化思路作为开发人员,数据库知识掌握的可能不是很深入,但是一些基本的技能还是要有时间学习一下的.作为一个数据库菜鸟,厚着脸皮来总结一下 mysql 的基本的不能再基本的优化方法. 为了 ...
SQL 提高查询效率
1.关于SQL查询效率,100w数据,查询只要1秒,与您分享: 机器情况p4: 2.4内存: 1 Gos: windows 2003数据库: ms sql server 2000目的: 查询性能测试, ...
关于SQL查询效率，100w数据，查询只要1秒
1.关于SQL查询效率,100w数据,查询只要1秒,与您分享:机器情况p4: 2.4内存: 1 Gos: windows 2003数据库: ms sql server 2000目的: 查询性能测试,比 ...
作为开发也要了解的 mysql 优化思路
作为开发人员,数据库知识掌握的可能不是很深入,但是一些基本的技能还是要有时间学习一下的.作为一个数据库菜鸟,厚着脸皮来总结一下 mysql 的基本的不能再基本的优化方法. 为了更好的说明,我假想出来了 ...
关于SQL查询效率主要针对sql server
1.关于SQL查询效率,100w数据,查询只要1秒,与您分享:机器情况p4: 2.4内存: 1 Gos: windows 2003数据库: ms sql server 2000目的: 查询性能测试,比 ...
Spring配置表友好性优化思路
Spring配置表需要尽量保证对程序员的友好性,一下提供一种优化思路. 中途未保存,心态炸了,只贴图了,fuuuuuuuuuuuuuck 第一种(最烂,最不友好):以Json的格式保存在配置表中,程序 ...

随机推荐

【C#-读取XML文件】XMLReader读取XML文档
使用 XmlReader.Create("文件路径") 加载xml文件 XmlReader使用流的方式来读取. //使用XMLReader读取XML数据 XmlReader ...
Python 模块Ⅲ
globals() 和 locals() 函数根据调用地方的不同,globals() 和 locals() 函数可被用来返回全局和局部命名空间里的名字. 如果在函数内部调用 locals(),返回的 ...
28.数组中出现次数超过长度一半的数字(python)
题目描述数组中有一个数字出现的次数超过数组长度的一半,请找出这个数字.例如输入一个长度为9的数组{1,2,3,2,2,2,5,4,2}.由于数字2在数组中出现了5次,超过数组长度的一半,因此输出2. ...
Java-Shiro（五）：Shiro Realm讲解（二）IniRealm的用法、JdbcRelam的用法、自定义Realm
引入上一篇在讲解Realm简介时,介绍过Realm包含大概4类缺省的Realm,本章主要讲解: 1)IniRealm的用法: 2)JdbcRealm基于mysql 默认表及查询语句实现认证.授权 ...
windows10禁止系统更新
CSS3 的动画属性
通过 CSS3,我们能够创建动画,这可以在许多网页中取代动画图片.Flash 动画以及 JavaScript. ㈠@keyframes 规则 ⑴浏览器支持 Firefox 支持替代的 @-moz-ke ...
socket认证客户端链接合法性
服务器端: #_*_coding:utf-8_*_ __author__ = 'Linhaifeng' from socket import * import hmac,os secret_key=b ...
HDU 6438 Buy and Resell ( 2018 CCPC 网络赛 && 贪心 )
题目链接题意 : 给出一些数.你可以从左到右对这些数进行三种操作花费 Ai 买入东西.以 Ai 价格卖出你当前有的东西.或者什么都不做.现在问你可以获取的最大利益是多少? 分析 : 和 CF 867 ...
dependencies和devDependencies的区别？
当我们项目需要下载一个模块的时候,我们安装npm包(在项目目录下面npm install module_name)的时候,很多时候我们会在后面加上–save-dev 或 –save.这两个参数代表什么 ...
Linux高级调试与优化——进程管理和调度
进程管理进程和文件是Linux操作系统的两个最基本的抽象. 进程是处于执行期的程序,进程不仅仅局限于一段可执行程序代码,通常还包含其他资源,如打开的文件.挂起的信号.内核内部数据.处理器状态.进程地 ...

neo4j - 查询效率的几种优化思路

neo4j - 查询效率的几种优化思路的更多相关文章

随机推荐

热门专题