Python：黑板课爬虫闯关第三关

第三关开始才算是进入正题了。

输入网址 http://www.heibanke.com/lesson/crawler_ex02/，直接跳转到了 http://www.heibanke.com/accounts/login/?next=/lesson/crawler_ex02/，显示如下

仔细看一下这个网址，显然，这是一个登陆网址，next参数应该是登录成功后跳转网页的地址。注册登录后，显示第三关：

　　首先可以肯定的是，必须要先登录，并保持登录状态，否则是爬不过关的。界面提示有两层保护，这应该就是第一层。

　　先注册了一个账号，然后用代码尝试登录，post 用户名密码之后，print 一下响应的 html，发现并不是我看到的第三关的内容，说明登录没有成功。看一下里面有一句话：You are seeing this message because this site requires a CSRF cookie when submitting forms. This cookie is required for security reasons, to ensure that your browser is not being hijacked by third parties.

　　简单的说，就是为了防止CSRF攻击（其实就是黑板课设的障碍），需要一个cookie。

　　退出登录，回到登录界面，打开开发者工具（我用的是谷歌浏览器），追踪一下网络请求，发现登录的时候，除了用户名密码，还有一个 csrfmiddlewaretoken 参数，而 csrfmiddlewaretoken 参数来自于 cookie 中的 csrftoken。

先 get 一下登录页面，从返回的 session 中获取 cookie 值中获取 csrftoken 值，连同用户名密码一起 post，print 响应的 html，结果正确。

然后就是跟第二关一样，暴力破解密码了。保险起见，也追踪了下请求，发现机制跟登录是一样的，也需要csrfmiddlewaretoken 参数，一样处理就好了。

这样思路就理清了，每次 post 用户名密码之前，先 get 请求一下，从服务器发给你的 cookie 中获取 csrftoken 的值作为 post 时的 csrfmiddlewaretoken 参数即可。

代码如下：

import re

import requests

import time

def main():

    url_login = 'http://www.heibanke.com/accounts/login/?next=/lesson/crawler_ex02/'

    url = 'http://www.heibanke.com/lesson/crawler_ex02/'

    session = requests.Session()

    # 获取cookie

    session.get(url_login)

    token = session.cookies['csrftoken']

    # 登录

    session.post(url_login, data={'csrfmiddlewaretoken': token, 'username': '', 'password': ''})

    for psd in range(30):

        print(f'test password {psd}')

        session.get(url)

        token = session.cookies['csrftoken']

        r = session.post(url, data={'csrfmiddlewaretoken': token, 'username': 'aa', 'password': psd})

        html = r.text

        if '密码错误' not in html:

            m = re.search('(?<=\<h3\>).*?(?=\</h3\>)', html)

            print(m.group())

            m = re.search('(\<).*?href="([^"]*?)".*?(\>下一关\</a\>)', html)

            print(f'下一关 http://www.heibanke.com{m.group(2)}')

            return

        else:

            time.sleep(1)

if __name__ == '__main__':

    main()

Python：黑板课爬虫闯关第三关的更多相关文章

Python：黑板课爬虫闯关第一关
近日发现了[黑板课爬虫闯关]这个神奇的网页,练手爬虫非常的合适地址:http://www.heibanke.com/lesson/crawler_ex00/ 第一关非常的简单 get 请求网址,在响 ...
Python：黑板课爬虫闯关第五关
第五关是最后一关了,至此之后黑板课就没有更新过关卡了. 第五关地址:http://www.heibanke.com/lesson/crawler_ex04/ 可以看到,是在第三关的基础上加了验证码. ...
Python：黑板课爬虫闯关第四关
第四关地址:http://www.heibanke.com/lesson/crawler_ex03/ 一开始看到的时候有点蒙,不知道啥意思,说密码需要找出来但也没说怎么找啊. 别急,随便输了个昵称和密 ...
Python：黑板课爬虫闯关第二关
第二关依然是非常的简单地址:http://www.heibanke.com/lesson/crawler_ex01/ 随便输入昵称呢密码,点击提交,显示如下: 这样看来就很简单了,枚举密码循环 po ...
python3 黑板客爬虫闯关游戏（一）
这是学习python爬虫练习很好的网站,强烈推荐! 地址http://www.heibanke.com/lesson/crawler_ex00/ 第一关猜数字很简单,直接给出代码 import ur ...
python3 黑板客爬虫闯关游戏（四）
这关较第三关难度增加许多,主要多了并发编程密码一共有100位,分布在13页,每页打开的时间在15秒左右,所以理所当然的想到要用并发,但是后来发现同IP访问间隔时间不能小于8秒,不然会返回404,所以 ...
python3 黑板客爬虫闯关游戏（三）
第三关,先登录,再猜密码,这关难度较第二关大幅增加,要先去注册一个登录账号,然后打开F12,多登录几次,观察headers数据的变化给出代码,里面注释很详细 import urllib.reques ...
python3 黑板客爬虫闯关游戏（二）
第二关猜登录密码,需要用到urllib.request和urllib.parse 也很简单,给代码 import urllib.request as ur import urllib.parse as ...
<爬虫>黑板爬虫闯关02
import requests from lxml import etree ''' 黑板爬虫闯关02 网址:http://www.heibanke.com/lesson/crawler_ex01/ ...

随机推荐

MySQL 在线更改 Schema 工具
MySQL在线更改schema的工具很多,如Percona的pt-online-schema-change. Facebook的 OSC 和 LHM 等,但这些都是基于触发器(Trigger)的,今天 ...
laravel 请求request 接收参数
获取请求输入获取所有输入值你可以使用 all 方法以数组格式获取所有输入值: $input = $request->all(); 获取单个输入值使用一些简单的方法,就可以从 Illumin ...
利用css+原生js制作简易钟表
利用css+原生js制作简单的钟表.效果如下所示实现该效果,分三大块:html.javascript.css html部分html部分比较简单,定义一个clock的div,内部有原点.时分秒针.日期 ...
Hadoop配置第2节-JDK的安装
Hadoop配置-JDK的安装总体目标:完成zookeeper+Hadoop+Hbase 整合平台搭建进度:1:集群网络属性配置2:集群免密码登陆配置3:JDK的安装4:Zookeeper的安 ...
eShopOnContainers 知多少[8]：Ordering microservice
1. 引言 Ordering microservice(订单微服务)就是处理订单的了,它与前面讲到的几个微服务相比要复杂的多.主要涉及以下业务逻辑: 订单的创建.取消.支付.发货库存的扣减 2. 架 ...
从壹开始前后端分离 40 || 完美基于AOP的接口性能分析
旁白音:本文是不定时更新的.net core,当前主线任务的Nuxt+VueAdmin教程的 nuxt.js 之 tibug项目已上线,大家可以玩一玩:http://123.206.33.109:70 ...
轻量级原生 ajax 函数，支持 get/array post/array post/json
原生js封装 function ajaxRequest(type, url, data, callback, failCallBack, header, dataType) { var url_enc ...
Html5知识点
学习资料:http://how2j.cn/p/1036 周期:3天 github:https://github.com/BenCoper/Html5欢迎大家去Star以及Fork 总结:采用的都是ht ...
Android路由框架-ARouter详解
文章大纲一.页面路由基本介绍1.什么是页面路由2.为什么要使用页面路由二.页面路由框架ARouter介绍1.常用功能介绍2.常见应用场景三.源码下载四.参考文章一.页面路由基本介绍 1.什么是 ...
003-005：Java平台相关的面试题
本文首发于公众号:javaadu 003:字节码是什么? 在Java中,字节码存放于以.class结尾的二进制文件. 字节码之于Java,类似于汇编语言之于C/C++.对于C/C++语言来说,不同的平 ...

Python：黑板课爬虫闯关第三关

Python：黑板课爬虫闯关第三关的更多相关文章

随机推荐

热门专题