Python从MongoDB中按天读取数据并格式化日志

#$cat SpeechMongoHandle.py

from pymongo import Connection

import time

import datetime

# CTRL_A='\x01'

# CTRL_B='\x02'

CTRL_A='--'

def getEveryDay(begin_date,end_date):

    date_list = []

    begin_date = datetime.datetime.strptime(begin_date, "%Y-%m-%d")

    end_date = datetime.datetime.strptime(end_date,"%Y-%m-%d")

    while begin_date < end_date:

        # date_str = begin_date.strftime("%Y-%m-%d")

        mid_date = begin_date + datetime.timedelta(days=1)

        tup = (str(begin_date),str(mid_date))

        date_list.append(tup)

        begin_date = mid_date

    return date_list

days = getEveryDay('2017-01-01','2017-01-02')

# MongoDB Connect

client = Connection('syslog-1',27017)

db_name = 'service'

db = client[db_name]

collection = db.speech

for day in days:

    tmpArray0 = time.strptime(str(day[0]), "%Y-%m-%d %H:%M:%S")

    tmpArray1 = time.strptime(str(day[1]), "%Y-%m-%d %H:%M:%S")

    timestamp0 = int(time.mktime(tmpArray0)*1000)

    timestamp1 = int(time.mktime(tmpArray1)*1000)

    print day

    print (timestamp0,timestamp1)

    results = collection.find({"time":{'$gte':timestamp0,'$lt':timestamp1}})

    for res in results:

        keys = res.keys()

        if "time" in keys:

            unixtimestamp = str(int(res["time"]))

            timetemp = time.localtime(int(unixtimestamp)/1000)

            thedate = time.strftime("%Y-%m-%d %H:%M:%S", timetemp)

        if "id" in keys:

            sn = res["id"]

        if "asr" in keys:

            asr = res["asr"]

        if "nlp" in keys:

            nlp = res["nlp"]

        if "domain" in keys:

            domain = res["domain"]

        if "intent" in keys:

            intent = res["intent"]

        print thedate + CTRL_A + sn + CTRL_A + asr + CTRL_A + nlp + CTRL_A + domain + CTRL_A + intent

应对场景为：MongoDB中历史数据巨多接近一年多，需要想办法将数据读出并且格式化上传到集群上。就想出了按天读取数据

或许还有最优解。。。

Python从MongoDB中按天读取数据并格式化日志的更多相关文章

python之从文件中按行读取数据
#!/usr/bin/env python3 # -*- coding: utf-8 -*- __author__ = 'jiangwenwen' # 从文件中按行读取数据 file = open(& ...
struts2中从后台读取数据到<s:select>
看到网上好多有struts2中从后台读取数据到<s:select>的,但都不太详细,可能是我自己理解不了吧!所以我自己做了一个,其中可能有很多不好的地方,望广大网友指出结果如图 p ...
python操作MONGODB数据库，提取部分数据再存储
目标:从一个数据库中提取几个集合中的部分数据,组合起来一共一万条.几个集合,不足一千条数据的集合就全部提取,够一千条的就用一万减去不足一千的,再除以大于一千的集合个数,得到的值即为所需提取文档的个数. ...
使用aggregate在MongoDB中查找重复的数据记录
我们知道,MongoDB属于文档型数据库,其存储的文档类型都是JSON对象.正是由于这一特性,我们在Node.js中会经常使用MongoDB进行数据的存取.但由于Node.js是异步执行的,这就导致我 ...
Python（Redis 中 Set/Zset 类型数据和其他操作）
1.redis 基本操作命令 Set 操作 Set 集合就是不允许重复的列表无序集合 sadd(name,values) 给 name 对应的集合中添加 1 个或多个元素 import redis ...
gin中从reader读取数据数据
package main import ( "fmt" "github.com/gin-gonic/gin" "net/http" &quo ...
Python学习笔记_从CSV读取数据写入Excel文件中
本示例特点: 1.读取CSV,写入Excel 2.读取CSV里具体行.具体列,具体行列的值一.系统环境 1. OS:Win10 64位英文版 2. Python 3.7 3. 使用第三方库:csv. ...
python 去除Excel中的重复行数据
导入pandas import pandas as pd 1.读取excel中的数据: frame = pd.DataFrame(pd.read_csv('excel的绝对路径.csv'', 'She ...
Node.js向MongoDB中插入并查询数据
首先必须要保持Node.js与MongoDB保持连接具体教程见:Node.js连接MongoDB数据库步骤插入数据步骤如下 node项目文件如下:在routes文件夹下新建insert.js文件, ...

随机推荐

类的专有方法(__getitem__和__setitem__)
# -*- coding: utf-8 -*- #python 27 #xiaodeng #http://www.imooc.com/code/6252 #类的专有方法(__getitem__和__s ...
解决Android 4.0以上版本中OptionsMenu菜单不显示ICON图标的问题
在Android4.0系统中,创建菜单Menu,通过setIcon方法给菜单添加图标是无效的,图标没有显出来,2.3系统中是可以显示出来的.这个问题的根本原因在于4.0系统中,涉及到菜单的源码类 Me ...
快速搭建Seeddms文档管理系统
Seddms文档管理系统是开源的环境: Redhat6.5 lamp 01.LAMP的安装安装请看:http://www.cnblogs.com/xiaochina/p/6442337.html ...
How to forcefully delete a daemonset or a pod in kubernetes cluster
I have setup a kubernetes cluster which is working fine. I created deployment with type as daemonset ...
使用CXF实现基于Rest方式的WebService(转)
转自:https://www.cnblogs.com/zjm701/p/6845813.html原文更清晰本文介绍使用CXF实现基于Rest方式的WebService(CXF的版本是3.0.0) 一 ...
leetcode719:直线上的第k近点对
问题描述给定数组a[N],可以确定C(N,2)个点对,也就确定了C(N,2)个距离,求这些距离中第k小的距离(k<C(N,2)). 思路看到第k小.第k大这种问题,首先想到二分法. 把求值问 ...
为Github 托管项目的访问添加SSH keys
为了便于访问远程仓库,各个协作者将自己的本地的项目内容推送到远程仓库中,使用 SSH keys 验证github的好处:不用每次提交代码时都输入用户名和密码. 如果SSH key没有添加到github ...
xp看系统位数
运行cmd,看打开的cmd窗口标题一般c:\windows\system32代表32位操作系统,64位就是system64,详细系统信息运行命令“systeminfo”
分布式缓存技术memcached学习系列（三）——memcached内存管理机制
几个重要概念 Slab memcached通过slab机制进行内存的分配和回收,slab是一个内存块,它是memcached一次申请内存的最小单位,.在启动memcached的时候一般会使用参数-m指 ...
SQL Server 2005/2008遍历所有表更新统计信息
DECLARE UpdateStatisticsTables CURSOR READ_ONLY FOR 02 SELECT sst.name, 03 Schema_name(ss ...

Python从MongoDB中按天读取数据并格式化日志

Python从MongoDB中按天读取数据并格式化日志的更多相关文章

随机推荐

热门专题