BS4爬虫实例应用-CISP

爬取目前在官网可查询的CISP证书编号以及有效期并入库

也算是暴力破解，burp使用grep功能呢也可以实现。

下面是python的代码

#coding=utf-8

import requests

import sys

from bs4 import BeautifulSoup

#demourl='http://www.itsec.gov.cn/export/sites/itsec/person/peregester/CNITSEC2012CISE01098/'

counter = 1

for i in range(2000,2017):

    for t in ['CISE','CISA','CISO','CISM','CISE-E','CISO-E','CISM-E','CISA-E','CISP-Auditor']:

        for j in range(10000):

            SNum = "CNITSEC"+str(i)+t+""+str(j).zfill(4)

            url = "http://www.itsec.gov.cn/export/sites/itsec/person/peregester/%s/"% SNum

            print counter , SNum ,'  Checking .........'

            try:

                res = requests.get(url)

                res.encoding = 'utf-8'

                soup = BeautifulSoup(res.text,'html.parser')

                clength   = res.headers['content-length']

                if 200<= int(res.status_code) <=210 :

                    itsecid   = soup.select('.detail_title')[0].text.encode('gb2312','ignore').strip()

                    starttime = soup.select('.tdm')[0].text.encode('utf-8','ignore').strip().replace("\n","").replace("                ","")

                    endtime   = soup.select('.tdm')[1].text.encode('utf-8','ignore').strip().replace("\n","").replace("                ","")

                    username  = soup.select('.tdm')[2].text.encode('utf-8','ignore').strip()

                    authlevel = soup.select('.tdm')[3].text.encode('utf-8','ignore').strip()

                    print clength

                    print itsecid

                    print starttime

                    print endtime

                    print username

                    print authlevel

                    with open('cispall.txt','a') as f:

                        f.writelines("%s%s%s%s%s  %s\n"%(itsecid,starttime,endtime,username,authlevel,clength))

                else:

                    print SNum ,'Non-existent ########'

                counter+=1

            except:

                info=sys.exc_info()

                print 'except error'

                print info[0],":",info[1]

过程：

根据分割特点可入库存储

BS4爬虫实例应用-CISP的更多相关文章

Python爬虫实例：爬取猫眼电影——破解字体反爬
字体反爬字体反爬也就是自定义字体反爬,通过调用自定义的字体文件来渲染网页中的文字,而网页中的文字不再是文字,而是相应的字体编码,通过复制或者简单的采集是无法采集到编码后的文字内容的. 现在貌似不少网 ...
Python爬虫实例：爬取豆瓣Top250
入门第一个爬虫一般都是爬这个,实在是太简单.用了 requests 和 bs4 库. 1.检查网页元素,提取所需要的信息并保存.这个用 bs4 就可以,前面的文章中已经有详细的用法阐述. 2.找到下一 ...
python爬虫实例——爬取歌单
学习自<<从零开始学python网络爬虫>> 爬取酷狗歌单,保存入csv文件直接上源代码:(含注释) import requests #用于请求网页获取网页数据 from b ...
Python 多进程爬虫实例
Python 多进程爬虫实例 import json import re import time from multiprocessing import Pool import requests f ...
python3.4学习笔记(十三) 网络爬虫实例代码，使用pyspider抓取多牛投资吧里面的文章信息，抓取政府网新闻内容
python3.4学习笔记(十三) 网络爬虫实例代码,使用pyspider抓取多牛投资吧里面的文章信息PySpider:一个国人编写的强大的网络爬虫系统并带有强大的WebUI,采用Python语言编写 ...
python3.4学习笔记(十四) 网络爬虫实例代码，抓取新浪爱彩双色球开奖数据实例
python3.4学习笔记(十四) 网络爬虫实例代码,抓取新浪爱彩双色球开奖数据实例新浪爱彩双色球开奖数据URL:http://zst.aicai.com/ssq/openInfo/ 最终输出结果格 ...
Python 爬虫实例
下面是我写的一个简单爬虫实例 1.定义函数读取html网页的源代码 2.从源代码通过正则表达式挑选出自己需要获取的内容 3.序列中的htm依次写到d盘 #!/usr/bin/python import ...
Python爬虫实例：爬取B站《工作细胞》短评——异步加载信息的爬取
很多网页的信息都是通过异步加载的,本文就举例讨论下此类网页的抓取. <工作细胞>最近比较火,bilibili 上目前的短评已经有17000多条. 先看分析下页面右边 li 标签中的就是短 ...
Python 利用Python编写简单网络爬虫实例3
利用Python编写简单网络爬虫实例3 by:授客 QQ:1033553122 实验环境 python版本:3.3.5(2.7下报错实验目的获取目标网站“http://bbs.51testing. ...

随机推荐

Java 方法签名
方法签名格式: 方法名参数列表例如: public class A{ protected int method (int a, int b) { return 0; } } class B e ...
mysql的约束
SQL 约束约束用于限制加入表的数据的类型. 可以在创建表时规定约束(通过 CREATE TABLE 语句),或者在表创建之后也可以(通过 ALTER TABLE 语句). (1)NOT NULL约 ...
node的close
在http.ServerResponse对象的end方法被调用之前,如果连接被中断,将触发http.ServerResponse对象的close事件. var http=require("h ...
An Autofac Lifetime Primer
Or, “Avoiding Memory Leaks in Managed Composition” Understanding lifetime can be pretty tough when y ...
java 等额本金与等额本息
等额本金与等额本息等本等息的意思是,每月的本金相等,利息也相等. 等额本息的意思是,每月的本金+利息之和相等(其实每个月本金和利息都有变化,并不相等) 等本等息的意思是,每月的本金相等,利息不等. ...
面试宝典：Java面试中最高频的那20%知识点！
Java目前已经不仅仅是一门开发语言,而是一整套生态体系. 作为一个Java程序员,既是幸运的,也是不幸的.幸运的是我们有很多轮子可以拿过来用,不幸的是我们有太多的轮子需要学习. 但是,无论是日常工作 ...
VUE 初步学习
Vue 简单的总结一 Vue 简单的总结二 Vue 简单的总结三 Vue 简单的总结四(项目流程) Vue 简单的总结五 Vue(6)- Vue-router进阶.单页面应用(SPA)带来的问题 Vu ...
我的Linux之路——xshell连接linux虚拟机
出自:https://www.linuxidc.com/Linux/2016-08/134087.htm xshell 5登录本地虚拟机的具体操作步骤如下: 1.首先打开虚拟机,登录到操作系统; 2. ...
Shiro session和Spring session一样吗？
出自:https://yq.aliyun.com/articles/114167?t=t1 1. 疑问我们在项目中使用了spring mvc作为MVC框架,shiro作为权限控制框架,在使用过程中慢 ...
引用rtmp编译报错：rtmp.obj : error LNK2001: 无法解析的外部符号 __imp__timeGetTime@0
如题vs下引用librtmp的时候报错:rtmp.obj : error LNK2001: 无法解析的外部符号 __imp__timeGetTime@0 在link 里加入 winmm.lib 就可以 ...

BS4爬虫实例应用-CISP

BS4爬虫实例应用-CISP的更多相关文章

随机推荐

热门专题