用Python提取XML里的内容，存到Excel中

最近做一个项目是解析XML文件，提取其中的chatid和lt、timestamp等信息，存到excel里。

1.解析xml，提取数据

使用python自带的xml.dom中的minidom（也可以用lxml）

xml文件如下：

minidom.parse()#解析文件，返回DOM对象

_get_documentElement()DOM是树形结构，获得了树形结构的根节点

getElementsByTagName()根据name查找根目录下的子节点

getAttribute()获取DOM节点的属性的值

提取的代码如下：

class get_xml():
    #加载获取xml的文档对象
    def __init__(self,address):
        #解析address文件，返回DOM对象，address为文件地址
        self.doc = minidom.parse(address)
        #DOM是树形结构，_get_documentElement()获得了树形结构的根节点
        self.root = self.doc._get_documentElement()
        #.getElementsByTagName()，根据name查找根目录下的子节点
        self.httpSample_nodes = self.root.getElementsByTagName('httpSample')

    def getxmldata(self):

        data_list=[]
        j = -1
        responseData_node = self.root.getElementsByTagName("responseData")
        for i in self.httpSample_nodes:
            j = j+1
            #getAttribute()，获取DOM节点的属性的值
            if i.getAttribute("lb") == "发送信息":
                a = 'chatId":"(.*?)"'
            elif i.getAttribute("lb") == "接收信息":
                # a = "chatId%3A%22(.*?)%22"
                a = "info%3A%22(.*?)%22"
            if (i.getAttribute("lb") == "发送信息" or i.getAttribute("lb") == "接收信息") and i.getAttribute("rc") == "200":
                try:
                    #使用re包里面的方法，通过正则表达式提取数据
                    b = re.search(a, responseData_node[j].firstChild.data)
                    if b is not None:
                        d = b.group(1)
                        print("d:",d)
                        data_list.append((d, i.getAttribute("ts"), i.getAttribute("lt"),i.getAttribute("lb")))
                except:
                    pass
        return data_list

2.存储为Excel，导出数据到Excel

用到的包openpyxl，openpyxl.workbook下的Workbook()用来在内存里创建文件，最后写进磁盘的

wb = load_workbook(filename = XXXX.xlsx)：读取Excel文件，文件地址为XXXX.xlsx

wb = Workbook()：创建一个Workbook对象

ew = ExcelWriter(workbook = wb)：新建一个excelWriter，最后用来保存

wb.create_sheet(0, 'XXX')：新建一个sheet，位置是0，sheet名字是XXX

ws = wb.worksheets[0]：打开一个sheet，sheet位置是0，即第1个sheet

ws.cell(row=1,column=1).value = XXX：在1行1列的位置加入数据XXX

ew.save(filename = XXXX.xlsx)：将数据导出到本地，本地文件地址为XXXX.xlsx

一个导出Excel的例子如下：

import openpyxl
from openpyxl import writer,load_workbook
# Workbook用来在内存里创建文件最后写进磁盘的
from openpyxl.workbook import workbook, Workbook
from openpyxl.writer.excel import ExcelWriter

from openpyxl.cell import get_column_letter
# if __name__ == "__main__":
def importexcel(match,dest_filename):
    if(os.path.exists(dest_filename)):
        wb = load_workbook(filename=dest_filename)
    else:
        wb = Workbook()
    ew = ExcelWriter(workbook = wb)
    #创建一个新sheet
    wb.create_sheet(0, '聊聊发送接收请求')
    # 打开已存在的第一个sheet，也可以用get_sheet_names获得所有的sheet的名字
    ws = wb.worksheets[0]
    ws.title = "聊聊发送接收请求"
    ws.cell('A1').value = "chartid"
    ws.cell('B1').value = "接收时间戳"
    ws.cell('C1').value = "发送时间戳"
    ws.cell('D1').value = "时间戳差"
    ws.cell('E1').value = "接收lt"
    ws.cell('F1').value = "发送到接收的响应时间"

    l = 2
    for i in match:
        ws.cell(row=l,column=1).value = i['chatId']
        ws.cell(row=l,column=2).value = i['accept_timestamp']
        ws.cell(row=l,column=3).value = i['send_timestamp']
        ws.cell(row=l,column=4).value = i['timestamp_gap']
        ws.cell(row=l,column=5).value = i['accept_lt']
        ws.cell(row=l,column=6).value = i['response_time']
        print(i,l)
        l = l+1
    ew.save(filename = dest_filename)

用Python提取XML里的内容，存到Excel中的更多相关文章

table内容保存到Excel中
@{ Layout = null; } <html> <head> <title></title> </head> <body> ...
VBA读取word中的内容到Excel中
原文:VBA读取word中的内容到Excel中 Public Sub Duqu() Dim myFile As String Dim docApp As Word.Applicati ...
用python提取xml里面的链接源码
因群里朋友需要提取xml地图里面的链接,就写了这个程序. 代码: #coding=utf-8 import urllib import urllib.request import re url='ht ...
python爬取数据保存到Excel中
# -*- conding:utf-8 -*- # 1.两页的内容 # 2.抓取每页title和URL # 3.根据title创建文件,发送URL请求,提取数据 import requests fro ...
用python实现批量获取Linux主机简要信息并保存到Excel中 unstable 1.1
#!/usr/bin/env python3 # -*- coding: utf-8 -*- #filename get_linux_info.py #获取Linux主机的信息 # titles=[' ...
「拉勾网」薪资调查的小爬虫，并将抓取结果保存到excel中
学习Python也有一段时间了,各种理论知识大体上也算略知一二了,今天就进入实战演练:通过Python来编写一个拉勾网薪资调查的小爬虫. 第一步:分析网站的请求过程我们在查看拉勾网上的招聘信息的时候 ...
python提取xml属性导入Mysql
xml文档来自ganglia-gmond端telnet localhost 8649产生出来的文档,由于ganglia每隔一段时间就更新数据,为了永久保存数据到MySQL中,就用python写了最开始 ...
python从XML里取数，遍历等
#coding=utf-8 #通过minidom解析xml文件 import xml.dom.minidom as xmldom import os ''' XML文件读取 <?xml vers ...
tomcat -web.xml里的内容
<?xml version="1.0" encoding="UTF-8"?> <Server port="8005" sh ...

随机推荐

Spring中的后置处理器BeanPostProcessor讲解
Spring中提供了很多PostProcessor供开发者进行拓展,例如:BeanPostProcessor.BeanFactoryPostProcessor.BeanValidationPostPr ...
js判断是android访问还是ios访问
原文地址:http://blog.csdn.net/wy978651775/article/details/9014039 该博主也是转载的,但是没有标明出处. 判断原理: JavaScript是前端 ...
H-Index II @python
Follow up for H-Index: What if the citations array is sorted in ascending order? Could you optimize ...
触屏设备上的多点触碰检测C++代码实现
转自:http://aigo.iteye.com/blog/2272698 代码还是参考自Epic官方的塔防项目:StrategyGame 看了下C++的API,现成的API中貌似只支持单点触碰检测, ...
HTML5中对于网络是否断开的检测.很有意思哦
//事件的封装 var EventUtil = { addHandler: function (element, type, handler) {//注册事件 if (element.addEvent ...
AFNetworkingErrorDomain 错误解决方法
首先我们来看一下错误信息: Error Domain=AFNetworkingErrorDomain Code=-1011 "Expected status code in (200-299 ...
php字符串类型讲解
PHP 支持八种原始类型(type). 四种标量类型: string(字符串) integer(整型) float(浮点型,也作 double ) boolean(布尔型) 两种复合类型: array ...
Django高级admin续
ModelAdmin对象 ModelAdmin类是模型在Admin界面中的表示形式定义:定义一个类,继承于admin.ModelAdmin,注册模型时使用这个类 class HeroAdmin(ad ...
aix-syslog
收集网络内路由器的日志信息,同时把本地日志信息与路由器信息分开. /etc/syslog.conf我写成: ## 本地日志处理 *.notice;*.err;*.warn<tab>;< ...
Jenkins自动打war包，并部署到tomcat服务器
由于每次修改完代码,都要手动打包部署,很麻烦.今天研究了一下Jenkins自动化部署,大概有以下几个步骤: 1.先配置tomcat 7的访问用户和密码.文件位于conf/tomcat-users.xm ...

用Python提取XML里的内容，存到Excel中

用Python提取XML里的内容，存到Excel中的更多相关文章

随机推荐

热门专题