python3 黑板客爬虫闯关游戏（四）

这关较第三关难度增加许多，主要多了并发编程

密码一共有100位，分布在13页，每页打开的时间在15秒左右，所以理所当然的想到要用并发，但是后来发现同IP访问间隔时间不能小于8秒，不然会返回404，所以最好是代理+并发。

目前没有做代理，以后有时间在重新写，由于密码位置上随机出现的，所以采集到页数要远远大于13，我把访问间隔控制在8秒，收集完100位密码一共耗时670s

import urllib.request as ur

import urllib.parse as up

import http.cookiejar as hc

from threading import Thread

import time

import urllib.error as ue

from bs4 import BeautifulSoup

#定义一个100位的空密码

pwd=['' for i in range(100)]

class GetPwdThread(Thread):

    def __init__(self,url,opener):

    	self.url=url

    	self.opener=opener

    	super(GetPwdThread,self).__init__()

    def run(self):

    	try:

    		start=time.time()

    		resp=self.opener.open(self.url).read().decode('utf-8')

    		print(self.url)

    		soup=BeautifulSoup(resp,'html.parser')

    		password_pos=soup.select('td[title="password_pos"]')

    		password_val=soup.select('td[title="password_val"]')

    		for i,j in zip(password_pos,password_val):

    			soup_pos=BeautifulSoup(str(i),'html.parser')

    			soup_val=BeautifulSoup(str(j),'html.parser')

    			pwd[int(soup_pos.td.string)-1]=soup_val.td.string

    		print(pwd,'pwd length:',len(''.join(pwd)),'use time:%s' %(time.time()-start))

    	except ue.URLError as e:

    		print(self.url,e.code)

url='http://www.heibanke.com/accounts/login/?next=/lesson/crawler_ex03/'

cookie=hc.MozillaCookieJar()

handler=ur.HTTPCookieProcessor(cookie)

opener=ur.build_opener(handler)

req=ur.Request(url)

res=opener.open(req)

#保存第一次cookies到本地

cookie.save('cookie.txt',ignore_discard=True, ignore_expires=True)

#提取csrfmiddlewaretoken值

for i in cookie:

	token=i.value

value={'csrfmiddlewaretoken':token,'username':'fangjun','password':'19870716'}

data=up.urlencode(value).encode('utf-8')

#加载cookies登录网站

cookie.load('cookie.txt',ignore_discard=True,ignore_expires=True)

handler=ur.HTTPCookieProcessor(cookie)

opener=ur.build_opener(handler)

req=ur.Request(url,data)

res=opener.open(req)

#登录成功，重新保存cookies到本地

cookie.save('cookie.txt',ignore_discard=True, ignore_expires=True)

#测试密码开始

cookie.load('cookie.txt',ignore_discard=True,ignore_expires=True)

handler=ur.HTTPCookieProcessor(cookie)

opener=ur.build_opener(handler)

url='http://www.heibanke.com/lesson/crawler_ex03/pw_list/?page='

starttime=time.time()

Threads=[]

#判断所有位置的密码是否都已找到

while('' in pwd):

	#由于密码位置是随机出现的，所以理论上只要一直刷新第一页就可以得到所有密码

	for i in range(1,3):

		newthread=GetPwdThread(url+str(i),opener)

		Threads.append(newthread)

		newthread.start()

		#访问间隔如果小于8秒，会返回404

		time.sleep(8)

	for t in Threads:

		t.join()

print('password:',''.join(pwd),'total time:%s' %(time.time()-starttime))

测试结果如下

#...
http://www.heibanke.com/lesson/crawler_ex03/pw_list/?page=2

['9', '3', '1', '4', '7', '7', '9', '2', '5', '5', '7', '9', '3', '0', '3', '3', '2', '6', '5', '3', '1', '4', '9', '0', '1', '6', '3', '6', '6', '8', '7', '7', '4', '5', '6', '6', '2', '8', '8', '1', '7', '3', '6', '1', '8', '5', '3', '8', '2', '5', '3', '6', '7', '5', '2', '6', '4', '9', '7', '2', '3', '3', '8', '1', '8', '3', '0', '8', '6', '7', '4', '4', '5', '1', '3', '5', '3', '5', '7', '7', '4', '8', '9', '5', '0', '6', '9', '5', '2', '4', '4', '3', '2', '9', '5', '4', '8', '9', '4', '6'] pwd length: 100 use time:15.125

password: 9314779255793033265314901636687745662881736185382536752649723381830867445135357748950695244329548946 total time:667.8639998435974

[Finished in 670.7s]

python3 黑板客爬虫闯关游戏（四）的更多相关文章

python3 黑板客爬虫闯关游戏（一）
这是学习python爬虫练习很好的网站,强烈推荐! 地址http://www.heibanke.com/lesson/crawler_ex00/ 第一关猜数字很简单,直接给出代码 import ur ...
python3 黑板客爬虫闯关游戏（三）
第三关,先登录,再猜密码,这关难度较第二关大幅增加,要先去注册一个登录账号,然后打开F12,多登录几次,观察headers数据的变化给出代码,里面注释很详细 import urllib.reques ...
python3 黑板客爬虫闯关游戏（二）
第二关猜登录密码,需要用到urllib.request和urllib.parse 也很简单,给代码 import urllib.request as ur import urllib.parse as ...
Python：黑板课爬虫闯关第四关
第四关地址:http://www.heibanke.com/lesson/crawler_ex03/ 一开始看到的时候有点蒙,不知道啥意思,说密码需要找出来但也没说怎么找啊. 别急,随便输了个昵称和密 ...
Python：黑板课爬虫闯关第一关
近日发现了[黑板课爬虫闯关]这个神奇的网页,练手爬虫非常的合适地址:http://www.heibanke.com/lesson/crawler_ex00/ 第一关非常的简单 get 请求网址,在响 ...
Python：黑板课爬虫闯关第五关
第五关是最后一关了,至此之后黑板课就没有更新过关卡了. 第五关地址:http://www.heibanke.com/lesson/crawler_ex04/ 可以看到,是在第三关的基础上加了验证码. ...
Python：黑板课爬虫闯关第三关
第三关开始才算是进入正题了. 输入网址 http://www.heibanke.com/lesson/crawler_ex02/,直接跳转到了 http://www.heibanke.com/acco ...
Python：黑板课爬虫闯关第二关
第二关依然是非常的简单地址:http://www.heibanke.com/lesson/crawler_ex01/ 随便输入昵称呢密码,点击提交,显示如下: 这样看来就很简单了,枚举密码循环 po ...
<爬虫>黑板爬虫闯关02
import requests from lxml import etree ''' 黑板爬虫闯关02 网址:http://www.heibanke.com/lesson/crawler_ex01/ ...

随机推荐

基于C/S架构的3D对战网络游戏C++框架_【不定期更新通知】
由于笔者最近有比赛项目要赶,这个基于C/S架构的3D对战网络游戏C++框架也遇到了一点瓶颈需要点时间沉淀,所以近一段时间不能保证每天更新了,会保持不定期更新.同时近期笔者也会多分享一些已经做过学过的C ...
SQLite源程序分析之sqlite3.c
/****************************************************************************** ** This file is an a ...
Power Management开发的一般流程
本文作为一个提纲挈领的介绍性文档,后面会以此展开,逐渐丰富. 开发流程针对一个PM feature进行开发,设计模型是第一步.模型设计好之后,还要保留参数接口,可以基于这些参数针对特殊个体进行优化. ...
关于GIT合并出错的记录
今天给美术解决GIT资源冲突时碰到的问题,搞了挺长时间终于解决了.参看下面这个网址:http://www.bujichong.com/m/68 今天git一小部分代码发现出错了, 上网查了一下, 大体 ...
如何理解卷积和pooling
转自:http://blog.csdn.net/malefactor/article/details/51078135 CNN是目前自然语言处理中和RNN并驾齐驱的两种最常见的深度学习模型.图1展示了 ...
使用css3做钟表
<!DOCTYPE html> <html> <head> <meta charset="UTF-8"> <title> ...
iOS之UITableView组头组尾视图/标题悬停
最近笔者在公司的iOS开发中,有一个iOS开发同事跑来问了两个问题:1.给UITableView设置了组头和组尾视图,但是一直显示不出来?2.UITableView的section的header和fo ...
bat转exe工具 Bat To Exe Converter v2.4.7 绿色版
一款非常小巧的工具,从它的名称便能知道它的功能:它能将BAT或CMD文件转换成 EXE 文件.使用它,你可以保护由自己开发的软件的软件代码,创建一个漂亮的图标,让软件看起来更专业. 下载地址: htt ...
java学习笔记之线程1
1.线程的概念线程是系统中最小的执行单元,同一进程有多个线程,多个线程共享进程的资源. 线程调用yield()方法使线程从运行状态转入可运行状态,让出资源: 线程调用sleep()方法使线程由运行状 ...
java第三周学习
这一周学习的是java数组面向对象数组中存放的数据的类型:既可以是基本数据类型也可以是引用数据类型. 数组的定义方式: 1 数据类型[] 数组名; 2 数据类型数组名[]; 数组的初始化: 1.静 ...

python3 黑板客爬虫闯关游戏（四）

python3 黑板客爬虫闯关游戏（四）的更多相关文章

随机推荐

热门专题