从网页上抓取Windows补丁信息然后整型输出（Python）

Powershell实现：http://www.cnblogs.com/IvanChen/p/4488246.html

今天通过Python实现：

# coding=utf-8

import re

import requests

import csv

import sys

from lxml import etree

reload(sys)

sys.setdefaultencoding('utf8')

summaryurl = 'https://technet.microsoft.com/en-us/library/security/mt637763.aspx'

summarycontent = requests.get(summaryurl).content

selector = etree.HTML(summarycontent)

mslist = selector.xpath('//*[@id="mainBody"]/table/tr/td[2]/p/a/text()')

pattern_published_date = re.compile(r"[a-zA-Z]*?\s[0-9]*?,\s[0-9]*")

pattern_severity = re.compile(r"[a-zA-Z]*$")

pattern_kbnumber = re.compile(r"\d+")

pattern_vultype = re.compile(r"Information Disclosure|Remote Code Execution|Elevation of Privilege|Security Feature Bypass|Cumulative Security Update|Denial of Service|Tampering|Spoofing", re.I)

csvfile = file('eggs.csv', 'wb')

writer = csv.writer(csvfile, dialect="excel")

writer.writerow(['Date', 'MSRC', 'KB', 'Severity', 'Version', 'Summary', 'Type'])

for eachmsrc in mslist:

    msrcurl = "https://technet.microsoft.com/en-us/library/security/" + eachmsrc + ".aspx"

    msrc_content = requests.get(msrcurl).content

    msrc_selector = etree.HTML(msrc_content)

    published_date = msrc_selector.xpath('//*[@id="pubInfo"]/p[1]/text()')

    kbnumber = msrc_selector.xpath('//*[@id="mainBody"]/h2/text()')

    severity = msrc_selector.xpath('//*[@id="content"]/div[2]/h1/text()')

    version = msrc_selector.xpath('//*[@id="pubInfo"]/p[2]/text()')

    summary = msrc_selector.xpath('//*[@id="mainBody"]/div[3]/div/p[1]/text()')

    vultype = msrc_selector.xpath('string(//*[@id="mainBody"]/div[3]/div)')

    ft_published_date = re.search(pattern_published_date, published_date[0]).group()

    ft_kbnumber = re.search(pattern_kbnumber, kbnumber[0]).group()

    ft_severity = re.search(pattern_severity, severity[0].strip('\n ')).group()

    ft_version = version[1]

    ft_summary = summary[0]

    ft_vultype = re.search(pattern_vultype, vultype)

    if ft_vultype:

        writer.writerow([ft_published_date, eachmsrc, ft_kbnumber, ft_severity, ft_version, ft_summary, ft_vultype.group()])

    else:

        vultype = msrc_selector.xpath('string(//*[@id="mainBody"]/div[position()>3]/div/table)')

        ft_vultype = re.search(pattern_vultype, vultype)

        writer.writerow([ft_published_date, eachmsrc, ft_kbnumber, ft_severity, ft_version, ft_summary, ft_vultype.group()])

csvfile.close()

从网页上抓取Windows补丁信息然后整型输出（Python）的更多相关文章

从网页上抓取Windows补丁信息然后整型输出（PowerShell）
$report = [pscustomobject]@{'Date' = $null; 'MSRC' = $null; 'KB' = $null; 'Severity' = $null; 'Versi ...
python爬虫抓取哈尔滨天气信息（静态爬虫）
python 爬虫爬取哈尔滨天气信息 - http://www.weather.com.cn/weather/101050101.shtml 环境: windows7 python3.4(pip i ...
Android登录client，验证码的获取，网页数据抓取与解析，HttpWatch基本使用
大家好,我是M1ko.在互联网时代的今天,假设一个App不接入互联网.那么这个App一定不会有长时间的生命周期,因此Android网络编程是每个Android开发人员必备的技能.博主是在校大学生,自学 ...
Java广度优先爬虫示例(抓取复旦新闻信息)
一.使用的技术这个爬虫是近半个月前学习爬虫技术的一个小例子,比较简单,怕时间久了会忘,这里简单总结一下.主要用到的外部Jar包有HttpClient4.3.4,HtmlParser2.1,使用的开发 ...
爬虫---selenium动态网页数据抓取
动态网页数据抓取什么是AJAX: AJAX(Asynchronouse JavaScript And XML)异步JavaScript和XML.过在后台与服务器进行少量数据交换,Ajax 可以使网页 ...
Python爬虫实战---抓取图书馆借阅信息
Python爬虫实战---抓取图书馆借阅信息原创作品,引用请表明出处:Python爬虫实战---抓取图书馆借阅信息前段时间在图书馆借了很多书,借得多了就容易忘记每本书的应还日期,老是担心自己会违约 ...
教您使用java爬虫gecco抓取JD全部商品信息
gecco爬虫如果对gecco还没有了解可以参看一下gecco的github首页.gecco爬虫十分的简单易用,JD全部商品信息的抓取9个类就能搞定. JD网站的分析要抓取JD网站的全部商品信息, ...
python写的爬虫工具，抓取行政村的信息并写入到hbase里
python的版本是2.7.10,使用了两个第三方模块bs4和happybase,可以通过pip直接安装. 1.logger利用python自带的logging模块配置了一个简单的日志输出 2.get ...
FakeLogonScreen抓取Windows凭证
FakeLogonScreen抓取Windows凭证实践中使用的配置攻击者: 操作系统: Kali Linux 2020.1 IP: 192.168.1.13 目标: 作业系统: Windows ...

随机推荐

iOS如何跳到系统设置里的各种设置界面
最近项目需要授权时候跳转到相关的设置页面,自己总结了一下,想写到简书上来,和大家分享一下. 在本人测试后,iOS8和9都没有问题,直接跳转到各个页面,这可能苹果对这方面开放了吧.第一步修改plist文 ...
DPM算法源程序voc-release5在Windows中的配置修改过程
最近的<视频处理与分析>课程中有一个大作业,是有关DPM物体检测算法的.网上有DPM的源代码,但是原版只能在Linux或Mac上运行,而我的电脑是Windows系统,于是在网上搜了一下在怎 ...
@好友的EditText
类似微信聊天中的@好友功能,封装到一个EditText中,gist打不开了,直接贴代码到这里吧: /*** @好友的输入组件*/public class AtEditText extends Edit ...
Spring配置文件中使用表达式
在配置文件中使用Java类 <bean id="rememberMeManager" class="org.apache.shiro.web.mgt.CookieR ...
[转]MySQL 最基本的SQL语法/语句
MySQL 最基本的SQL语法/语句,使用mysql的朋友可以参考下. DDL-数据定义语言(Create,Alter,Drop,DECLARE) DML-数据操纵语言(Select,Delete ...
jQuery 名称冲突
jQuery 名称冲突 jQuery 使用 $ 符号作为 jQuery 的简介方式. 某些其他 JavaScript 库中的函数(比如 Prototype)同样使用 $ 符号. jQuery 使用名为 ...
Linux运维(3年以内)
1.精通shell编程,熟练应用awk,sed,grep,strace,tcpdump等常用命令; 2.精通windows server,linux,mssql,mysql,熟悉网络,cisco,ju ...
ASP.NET知识总结（3.HTTP协议详解）
引言 HTTP是一个属于应用层的面向对象的协议,由于其简捷.快速的方式,适用于分布式超媒体信息系统.它于1990年提出,经过几年的使用与发展,得到不断地完善和扩展.目前在WWW中使用的是HTTP/1. ...
数据库事务(Database Transaction)概述
事务概念事务可以用很多很多不同的方式去定义.事务是数据库操作执行的一个逻辑工作单元,是用户定义的一个数据库操作序列,这些操作要么全做要么全不做,是一个不可分割的工作单位.例如, 在关系数据库中, 一 ...
[JAVA]HTTP请求应答作输入输出
请求(需要发送数据给别人): URL url = new URL("需要请求的URL连接"); HttpURLConnection httpConnection = (HttpUR ...

从网页上抓取Windows补丁信息然后整型输出（Python）

从网页上抓取Windows补丁信息然后整型输出（Python）的更多相关文章

随机推荐

热门专题