如何通过Elasticsearch Scroll快速取出数据，构造pandas dataframe

首先，python 多线程不能充分利用多核CPU的计算资源（只能共用一个CPU），所以得用多进程。笔者从3.7亿数据的索引，取200多万的数据，从取数据到构造pandas dataframe总共大概用时14秒左右。每个分片用一个进程查询数据，最后拼接出完整的结果。

由于返回的json数据量较大，每次100多万到200多万，如何快速根据json构造pandas 的dataframe是个问题 — 笔者测试过read_json()、json_normalize()、DataFrame(eval(pandas_json))及DataFrame.from_dict()，from_dict()速度最快

转载请注明出处：https://www.cnblogs.com/NaughtyCat/p/how-to-get-all-results-from-es-by-scroll-python-version.html

Elasticsearch scroll取数据— python版

源码如下：

def es_scroll(index, min_timestamp, max_timestamp, slice_no):

    es = Elasticsearch('http://localhost:9200', timeout = 30, max_retries=10, retry_on_timeout=True)

    page = es.search(

            index = index,

            doc_type = "tls_book",

            scroll = '1m',

            body={

            "slice": {

                "id": slice_no,

                "max": SLICES

            },

            "_source": [

            "SrcIP"

            ],

            "sort": [

            "_doc"

            ],

            "query": {

                    "range" : {

                        "@timestamp" : {

                            "gte" : min_timestamp,

                            "lte" : max_timestamp,

                            "boost" : 2.0

                        }

                    }

                }

            },

            version = False,

            size = 10000)

    sid = page['_scroll_id']

    scroll_size = page['hits']['total']

    # Start scrolling

    df = pd.DataFrame()

    appended_data = []

    while (scroll_size > 0):

        frame = pd.DataFrame.from_dict([document['_source'] for document in page["hits"]["hits"]])

        appended_data.append(frame)

        page = es.scroll(scroll_id = sid, scroll = '1m', request_timeout = 30)

        # Update the scroll ID

        sid = page['_scroll_id']

        # Get the number of results that we returned in the last scroll

        scroll_size = len(page['hits']['hits'])

    if len(appended_data) > 0:

        df = pd.concat(appended_data, ignore_index=True, sort = False)

    del appended_data

    gc.collect()

    es.clear_scroll(body={'scroll_id': sid})

    return df

注：

（1）通过 "_source" 关键字，指定要取的字段，可减少不必要的字段，提高查询速度

（2）官方文档指出，通过 "sort": [ "_doc"] —即按照_doc排序，可提高查询效率

（3）根据自己的环境，测试合理的 size ，效率会有数倍的差距。笔者环境（128G, 32核）一次取10000性能最好，网上大多测试，size取2000或者1000似乎较佳

（4）clear_scroll及时清理用完的scroll_id

（5）如果数据量较大，设置超时和重试次数（默认是10秒，否则超时会取不到数据），具体如下

 timeout = 30, max_retries=10, retry_on_timeout=True

（6）Sliced scroll

如果返回的数据量特别大，可通过slice让多个分片独自来处理请求，如下（id从0开始）：

            "slice": {

                "id": slice_no,

                "max": SLICES

            },

参考： https://www.elastic.co/guide/en/elasticsearch/reference/5.1/search-request-scroll.html#sliced-scroll

python 多进程如何个函数传多个参数

python多进程或者多线程要向调用的函数传递多个参数，需要构造参数元组集合，代码如下（本示例每个进程不同的只有es的slice_id）：

def build_parameters(index, min_timestamp, max_timestamp):

    parmeters =[]

    for num in range(0, SLICES):

        tuple_paremeter = (index, min_timestamp, max_timestamp, num)

        parmeters.append(tuple_paremeter)

    return parmeters

python多进程实例

示例使用进程池，及starmap 传递调用的函数及参数（with相当于try, excepion, finallly的集合，会自动做资源的释放或关闭等）

            with multiprocessing.Pool(processes = SLICES) as pool:

                result = pool.starmap(es_scroll, parameters)

然后，拼接返回的dataframe 集合即可构造一个完整的dataframe，如下：

frame = pd.concat(result, ignore_index=True, sort = False)

*******************************************************************************************

精力有限，想法太多，专注做好一件事就行

我只是一个程序猿。5年内把代码写好，技术博客字字推敲，坚持零拷贝和原创
写博客的意义在于打磨文笔，训练逻辑条理性，加深对知识的系统性理解；如果恰好又对别人有点帮助，那真是一件令人开心的事

*******************************************************************************************

如何通过Elasticsearch Scroll快速取出数据，构造pandas dataframe — Python多进程实现的更多相关文章

Elasticsearch写入数据的过程是什么样的？以及是如何快速更新索引数据的？
前言最近面试过程中遇到问Elasticsearch的问题不少,这次总结一下,然后顺便也了解一下Elasticsearch内部是一个什么样的结构,毕竟总不能就只了解个倒排索引吧.本文标题就是我遇到过的 ...
使用logstash+elasticsearch+kibana快速搭建日志平台
日志的分析和监控在系统开发中占非常重要的地位,系统越复杂,日志的分析和监控就越重要,常见的需求有: * 根据关键字查询日志详情 * 监控系统的运行状况 * 统计分析,比如接口的调用次数.执行时间.成功 ...
转：SQL SERVER数据库中实现快速的数据提取和数据分页
探讨如何在有着1000万条数据的MS SQL SERVER数据库中实现快速的数据提取和数据分页.以下代码说明了我们实例中数据库的“红头文件”一表的部分数据结构: CREATE TABLE [dbo]. ...
logstash+elasticsearch+kibana快速搭建日志平台
使用logstash+elasticsearch+kibana快速搭建日志平台日志的分析和监控在系统开发中占非常重要的地位,系统越复杂,日志的分析和监控就越重要,常见的需求有: 根据关键字查询日 ...
Elasticsearch【快速入门】
前言:毕设项目还要求加了这个做大数据搜索,正好自己也比较感兴趣,就一起来学习学习吧! Elasticsearch 简介 Elasticsearch 是一个分布式.RESTful 风格的搜索和数据分析引 ...
第三百六十七节，Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)scrapy写入数据到elasticsearch中
第三百六十七节,Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)scrapy写入数据到elasticsearch中前面我们讲到的elasticsearch( ...
四十六 Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)scrapy写入数据到elasticsearch中
前面我们讲到的elasticsearch(搜索引擎)操作,如:增.删.改.查等操作都是用的elasticsearch的语言命令,就像sql命令一样,当然elasticsearch官方也提供了一个pyt ...
【转载】使用logstash+elasticsearch+kibana快速搭建日志平台
原文链接:http://www.cnblogs.com/buzzlight/p/logstash_elasticsearch_kibana_log.html 日志的分析和监控在系统开发中占非常重要的地 ...
实际使用Elasticdump工具对Elasticsearch集群进行数据备份和数据还原
文/朱季谦目录一.Elasticdump工具介绍二.Elasticdump工具安装三.Elasticdump工具使用最近在开发当中做了一些涉及到Elasticsearch映射结构及数据导出导 ...

随机推荐

Chisel3 - 运算符和位宽推断
https://mp.weixin.qq.com/s/rI-CJM6GyI6EUHPZ3uYiFg 如同Verilog中的众多运算符,Chisel也针对自身的数据类型,提供了很多运算符. Ch ...
Java实现 LeetCode 747 至少是其他数字两倍的最大数（暴力）
747. 至少是其他数字两倍的最大数在一个给定的数组nums中,总是存在一个最大元素 . 查找数组中的最大元素是否至少是数组中每个其他数字的两倍. 如果是,则返回最大元素的索引,否则返回-1. 示例 ...
Java实现 LeetCode 678 有效的括号字符串(暴力+思路转换)
678. 有效的括号字符串给定一个只包含三种字符的字符串:( ,) 和 *,写一个函数来检验这个字符串是否为有效字符串.有效字符串具有如下规则: 任何左括号 ( 必须有相应的右括号 ). 任何右括号 ...
Java实现蓝桥杯算法训练字符串合并
试题算法训练字符串合并资源限制时间限制:1.0s 内存限制:256.0MB 问题描述输入两个字符串,将其合并为一个字符串后输出. 输入格式输入两个字符串输出格式输出合并后的字符串样例 ...
Java实现最大连续子数组和
1 问题描述给定一个整数数组,数组里可能有正数.负数和零.数组中连续的一个或多个整数组成一个子数组,每个子数组都有一个和.求所有子数组的和的最大值.例如,如果输入的数组为{1,-2,3,10,-4, ...
TZOJ 公交车
描述公交车在一条笔直的道路(道路宽度忽略,设为X轴)上行驶,按顺序路上有若干个站点(X坐标值),crq的家也在道路旁某个位置h(X坐标值),现在crq想知道哪个站点下车离家最近. 输入输入数据的第 ...
Windows10开启Ubuntu子系统并搭建Docker环境
前言很早就听说微软有个基于Ubuntu的子系统,一直也没机会尝试一下,之前也只是用VMware安装,但是还要单独安装软件,安装镜像,一点都不fit,所以就瞎折腾下(也是因为最近有空). 搭建Ubun ...
Python之Flask框架二
今天接着上一篇继续写一篇关于flask的随笔. 本文大纲: 1.获取请求参数 2.一个函数处理多个请求方式 3.重定向 4.错误响应 5.全局错误处理 6.返回json格式数据 7.自定义返回内容状态 ...
来看看阿里架构师Java 代码打日志姿势！你也是这样写的吗
使用slf4j 使用门面模式的日志框架,有利于维护和各个类的日志处理方式统一. 实现方式统一使用: Logback框架打日志的正确方式什么时候应该打日志当你遇到问题的时候,只能通过debug功能 ...
【华为云技术分享】数据库开发：MySQL Seconds_Behind_Master简要分析
[摘要]对于mysql主备实例,seconds_behind_master是衡量master与slave之间延时的一个重要参数.通过在slave上执行"show slave status;& ...

如何通过Elasticsearch Scroll快速取出数据，构造pandas dataframe — Python多进程实现

如何通过Elasticsearch Scroll快速取出数据，构造pandas dataframe — Python多进程实现的更多相关文章

随机推荐

热门专题