Python：黑板课爬虫闯关第四关

第四关地址：http://www.heibanke.com/lesson/crawler_ex03/

一开始看到的时候有点蒙，不知道啥意思，说密码需要找出来但也没说怎么找啊。

别急，随便输了个昵称和密码，提交一下，就能看到密码提示了。

进入到找密码的链接，显示如下：

注意那一行大字，提示网页加载速度很慢，这一关的意图很明显了，就是：多线程。

密码一共100位，这里虽然显示了翻页，但其实每一页显示的位置是随机的，可能会重复，所以并不是一页页翻到最后一页就可以获取到完整的密码了。

所以我们只要开个多线程，不停的刷第一页就可以了，直到100位全部获取到。

登录部分和第三关是一样的，链接：https://www.cnblogs.com/gl1573/p/9651027.html

代码如下：

import re

import threading

import time

import requests

from bs4 import BeautifulSoup

pwlist = [-1 for i in range(100)]

count = 0

lock = threading.Lock()

def main():

    url_login = 'http://www.heibanke.com/accounts/login/?next=/lesson/crawler_ex03/'

    url = 'http://www.heibanke.com/lesson/crawler_ex03/'

    session = requests.Session()

    session.get(url_login)

    token = session.cookies['csrftoken']

    # 登录

    session.post(url_login, data={'csrfmiddlewaretoken': token, 'username': 'xx', 'password': 'xx'})

    threadlist = [threading.Thread(target=getpw, args=(session,)) for i in range(2)]

    for thread in threadlist:

        thread.setDaemon(True)

        thread.start()

    for thread in threadlist:

        thread.join()

    psd = ''.join(pwlist)

    print(f'密码：{psd}')

    session.get(url)

    token = session.cookies['csrftoken']

    r = session.post(url, data={'csrfmiddlewaretoken': token, 'username': 'aa', 'password': psd})

    html = r.text

    if '密码错误' not in html:

        m = re.search('(?<=\<h3\>).*?(?=\</h3\>)', html)

        print(m.group())

def getpw(session):

    pw_url = 'http://www.heibanke.com/lesson/crawler_ex03/pw_list/'

    global count, pwlist

    while count < 100:

        try:

            html = session.get(pw_url).text

        except:

            time.sleep(1)

            continue

        if '404 Not Found' in html:

            continue

        soup = BeautifulSoup(html, 'lxml')

        pos = soup.find_all('td', {'title': 'password_pos'})

        val = soup.find_all('td', {'title': 'password_val'})

        for i in range(len(pos)):

            p = int(pos[i].string)

            v = val[i].string

            lock.acquire()

            if pwlist[p - 1] == -1:

                pwlist[p - 1] = v

                count += 1

            lock.release()

if __name__ == '__main__':

    main()

这里有一点需要注意，开了很多个线程以后，会发现返回一堆的404，这是黑板课做的一个限制，服务器15秒内最多返回两个请求，否则返回404，所以，开20个线程和开2个线程是一样的。

Python：黑板课爬虫闯关第四关的更多相关文章

Python：黑板课爬虫闯关第一关
近日发现了[黑板课爬虫闯关]这个神奇的网页,练手爬虫非常的合适地址:http://www.heibanke.com/lesson/crawler_ex00/ 第一关非常的简单 get 请求网址,在响 ...
Python：黑板课爬虫闯关第五关
第五关是最后一关了,至此之后黑板课就没有更新过关卡了. 第五关地址:http://www.heibanke.com/lesson/crawler_ex04/ 可以看到,是在第三关的基础上加了验证码. ...
Python：黑板课爬虫闯关第三关
第三关开始才算是进入正题了. 输入网址 http://www.heibanke.com/lesson/crawler_ex02/,直接跳转到了 http://www.heibanke.com/acco ...
Python：黑板课爬虫闯关第二关
第二关依然是非常的简单地址:http://www.heibanke.com/lesson/crawler_ex01/ 随便输入昵称呢密码,点击提交,显示如下: 这样看来就很简单了,枚举密码循环 po ...
python3 黑板客爬虫闯关游戏（四）
这关较第三关难度增加许多,主要多了并发编程密码一共有100位,分布在13页,每页打开的时间在15秒左右,所以理所当然的想到要用并发,但是后来发现同IP访问间隔时间不能小于8秒,不然会返回404,所以 ...
python3 黑板客爬虫闯关游戏（一）
这是学习python爬虫练习很好的网站,强烈推荐! 地址http://www.heibanke.com/lesson/crawler_ex00/ 第一关猜数字很简单,直接给出代码 import ur ...
python3 黑板客爬虫闯关游戏（三）
第三关,先登录,再猜密码,这关难度较第二关大幅增加,要先去注册一个登录账号,然后打开F12,多登录几次,观察headers数据的变化给出代码,里面注释很详细 import urllib.reques ...
python3 黑板客爬虫闯关游戏（二）
第二关猜登录密码,需要用到urllib.request和urllib.parse 也很简单,给代码 import urllib.request as ur import urllib.parse as ...
嵩天老师python网课爬虫实例1的问题和解决方法
一,AttributeError: 'NoneType' object has no attribute 'children', 网页'tbody'没有子类很明显,报错的意思是说tbody下面没有c ...

随机推荐

获取具有指定扩展数据的所有实体的Id，并存入Id数组中
AcDbObjectIdArray ObtainEntId(){ //获取块表 AcDbBlockTable *pBlkTbl; acdbHostApplicationServices()->w ...
noip2011 玛雅游戏大模拟
深搜+模拟需要剪枝:同一移动向右移了就不需要向左移了 #include<cstdio> #include<cstring> #include<iostream> ...
GT工具中用到的英文词解释
p.p1 { margin: 0.0px 0.0px 0.0px 0.0px; font: 12.0px ".PingFang SC"; color: #454545 } p.p2 ...
Android之微信朋友圈UI实现--ExpandableListView+GridView
PS:我们都知道微信,更是知道朋友圈,很多人在朋友圈里卖起了化妆品,打入广告等为自己做一下推广,里面会附带一写好看的图片,上面有标题,有描述,整体布局每场的美观,那么这是怎么实现的呢,有些人可能会单个 ...
Error Code: 1044. Access denied for user 'root'@'%' to database
mysql> SELECT host,user,password,Grant_priv,Super_priv FROM mysql.user; +--------------+--------- ...
聊聊真实的 Android TV 开发技术栈
智能电视越来越普及了,华为说四月发布智能电视跳票了,一加也说今后要布局智能电视,在智能电视方向,小米已经算是先驱了.但是还有不少开发把智能电视简单的理解成手机屏幕的放大,其实这两者并不一样. 一.序 ...
Spring Boot 入门教程 | 图文讲解
目录一.Spring Boot 是什么二.为什么要使用 Spring Boot 三.快速入门 3.1 创建 Spring Boot 项目 3.2 项目结构 3.3 引入 Web 依赖 3.4 编写 ...
Android中一个经典理解误区的剖析
今天,在Q群中有网友(@广州-包晴天)发出了网上的一个相对经典的问题,问题具体见下图. 本来是无意写此文的,但群里多个网友热情不好推却,于是,撰此文予以分析. 从这个问题的陈述中,我们发现,提问者明显 ...
Android拦截并获取WebView内部POST请求参数
起因: 有些时候自家APP中嵌入的H5页面并不是自家的.但是很多时候又想在H5不知情的情况下获取H5内部请求的参数,这应该怎么做到呢? 带着这个疑问,就有了这篇博客. 实现过程: 方案一: 最开始想到 ...
SQL学习（1）初学实验：SQL Server基本配置及基本操作
网络配置.远程连接配置: 防火墙设置: SQL Server的默认端口号是1433. 网络配置: SQLServer Configuration Manager中的客户端协议,众多IP中随便选一个,比 ...

Python：黑板课爬虫闯关第四关

Python：黑板课爬虫闯关第四关的更多相关文章

随机推荐

热门专题