Python 爬虫练习（二）爬取补天公益SRC厂商域名URL (2017年11月22日)

介绍下：

补天是国内知名的漏洞响应平台，旨在企业和白帽子共赢。

白帽子在这里提交厂商漏洞，获得库币和荣誉，厂商从这里发布众测、获取漏洞报告和修复建议。

在2017年3月份之前，补天的厂商域名URL是非常好爬取的，即使没有登陆到平台依然可以用轻松获取到批量的厂商URL地址，然后白帽子用大型漏洞扫描工具进行批量漏扫。

后来，补天平台可能为了尽可能的保护厂商的URL被滥用，采取了一些措施。

这些措施限定了：

1). 必须登陆到平台

2). 点击厂商名并进入提交漏洞页面

3). 只在提交页面显示厂商URL域名

下面，就以一段Python 代码来获取最新的补天厂商URL，之后如何利用就随读者个人意愿了。

介绍：

1. 先登陆补天平台，复制Cookie到代码中的位置

2. 这里只演示爬取前三页，每页30个厂商

3. 使用正则提取URL

4. 爬取结果保存在脚本同级目录的 'butian_company_url.txt' 文件，如果不够90个URL，可能是有的厂商没有填写(即空)

import requests,re,json,time

head = {'User-Agent': \

            'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/43.0.2357.130 Safari/537.36'}

cook = {"Cookie": "这里写你登陆补天后的Cookie"}

url = 'http://butian.360.cn/Reward/pub'

for page in range(1,3): #前三页

    data = {'s': '1', 'p': page, 'token': ''}

    html = requests.post(url, headers = head, data=data, cookies = cook).content

    jsCont = json.loads(html.decode())

    jsData = jsCont['data']

    for i in jsData['list']:

        linkaddr = 'http://butian.360.cn/Loo/submit?cid=' + i['company_id']

        print(linkaddr,end='\t')

        shtml = requests.get(linkaddr,headers = head, cookies = cook).content

        #正则模版<input class="input-xlarge" type="text" name="host" placeholder="请输入厂商域名" value="www.grgtest.com" />

        company_url = re.findall('<input class="input-xlarge" type="text" name="host" placeholder="请输入厂商域名" value="(.*)" />',shtml.decode())

        time.sleep(0.5)  # 控制爬取速度

        print(company_url[0])

        com_url = company_url[0]

        with open('butian_company_url.txt','a+') as f:

            f.write(com_url + '\n')

运行结果：

Python 爬虫练习（二）爬取补天公益SRC厂商域名URL (2017年11月22日)的更多相关文章

Python 爬虫入门(二)——爬取妹子图
Python 爬虫入门听说你写代码没动力?本文就给你动力,爬取妹子图.如果这也没动力那就没救了. GitHub 地址: https://github.com/injetlee/Python/blob ...
Python爬虫学习(二) ——————爬取前程无忧招聘信息并写入excel
作为一名Pythoner,相信大家对Python的就业前景或多或少会有一些关注.索性我们就写一个爬虫去获取一些我们需要的信息,今天我们要爬取的是前程无忧!说干就干!进入到前程无忧的官网,输入关键字&q ...
【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...
Python爬虫实例：爬取豆瓣Top250
入门第一个爬虫一般都是爬这个,实在是太简单.用了 requests 和 bs4 库. 1.检查网页元素,提取所需要的信息并保存.这个用 bs4 就可以,前面的文章中已经有详细的用法阐述. 2.找到下一 ...
Python 爬虫入门之爬取妹子图
Python 爬虫入门之爬取妹子图来源:李英杰链接: https://segmentfault.com/a/1190000015798452 听说你写代码没动力?本文就给你动力,爬取妹子图.如果 ...
Python爬虫实例：爬取B站《工作细胞》短评——异步加载信息的爬取
很多网页的信息都是通过异步加载的,本文就举例讨论下此类网页的抓取. <工作细胞>最近比较火,bilibili 上目前的短评已经有17000多条. 先看分析下页面右边 li 标签中的就是短 ...
Python爬虫实例：爬取猫眼电影——破解字体反爬
字体反爬字体反爬也就是自定义字体反爬,通过调用自定义的字体文件来渲染网页中的文字,而网页中的文字不再是文字,而是相应的字体编码,通过复制或者简单的采集是无法采集到编码后的文字内容的. 现在貌似不少网 ...
python爬虫-基础入门-爬取整个网站《3》
python爬虫-基础入门-爬取整个网站<3> 描述: 前两章粗略的讲述了python2.python3爬取整个网站,这章节简单的记录一下python2.python3的区别 python ...
python爬虫-基础入门-爬取整个网站《2》
python爬虫-基础入门-爬取整个网站<2> 描述: 开场白已在<python爬虫-基础入门-爬取整个网站<1>>中描述过了,这里不在描述,只附上 python3 ...

随机推荐

小白学Maven第二篇配置Ecilpse
Maven:里面提到了一个很重要的概念:中央仓库,本地仓库,私服: 中央仓库:是Maven通过一个地址索引去(http://mvnrepository.com/)下载需要的架包: 本地仓库:是Mave ...
作为前端Web开发者，这12个终端命令不可不会
对于开发人员来说,终端是最重要的工具之一.掌握终端,能够有效的提升开发人员的工作流程.使用终端,许多日常任务都被简化为了编写简单的命令并按下 Enter 按钮. 本文列举了一系列 Linux 命令,旨 ...
WPF popup置顶
在程序写一个popup发现他会在置顶,在网上找了两大神代码http://www.cnblogs.com/Leaco/p/3164394.html http://blog.csdn.net/baijin ...
table插件
//动态添加一行function addRow(){ var firstrow=document.getElementById('firstrow'); var firstCopy=firstrow. ...
ubuntu 下修改文件访问权限chmod 777 -R *血的教训！没事别乱开权限！用谁开谁的就行。。。最后不要用这个命令，文件操作全部改用终端
本文转自: 个人建议 Ubuntu下修改目录权限命令如下:chmod 600 name (只有所有者有读和写的权限)chmod 644 name (所有者有读和写的权限,组用户只有读的权限)chmod ...
用 Eclipse 创建一个简单的web项目
Eclipse neon 汉化版 ; 1;右击新建 --> 选择动态Web项目 2: 填写项目名项目位置 ; 选择 Dynamic web module version 和 tomca ...
yii2之DetailView小部件
DetailView小部件用于展示单条数据记录,可配置属性很少,使用也很简单,直接贴代码,一看就懂! yii小部件数据小部件DetailView的使用示例: <?= DetailView::wi ...
c++连接数据库在vc6.0
配置相关环境我的mysql安装路径为E:\mysql-5.5.28-win32所以要在VC中设置include路径和lib的路径. 添加MySql的include目录到VC工作台中Project-& ...
想成为一个高效的Web开发者吗？来看看大牛分享的经验吧~ #精选JAVASCRIPT前端开发
想成为一个高效的Web开发者吗?来看看大牛分享的经验吧~ 作为一个软(ku)件(bi)工(de)程(ma)师(nong),你有没有觉得做什么事都没时间?没时间学习新东西,没时间去回顾.整理原来写的烂代 ...
阿里JAVA开发手册零度的思考理解(二)
转载请注明原创出处,谢谢! 说在前面人生的大道上默默地走,就必须要有一盏灯亮着为你引导方向!而这盏灯抑或只是一句话,一句鼓励,一个赞美,一次承认,一次认可,一次相识一次交流-- 上篇文章:阿里JAV ...

Python 爬虫练习（二）爬取补天公益SRC厂商域名URL (2017年11月22日)

Python 爬虫练习（二）爬取补天公益SRC厂商域名URL (2017年11月22日)的更多相关文章

随机推荐

热门专题