Python Scrapy 验证码登录处理

一、Form表单分析

　　以豆瓣登录页面为例分析，豆瓣登录页是：https://accounts.douban.com/login，浏览器打开之后查看源码，查找登录的form表单HTML结构。如下：

　　包括了form_email、form_password、captcha-solution四个表单参数，需要注意之处是name，而不是id。

二、验证码图片处理

　　1、分析验证码参数图片的构建如下图，获取id为captcha_image的src图片即可。可以采用人工输入，或第三方图片验证码识别API获得。

　　2、点击该url，图片是：

　获取url之后，使用urllib.request.urlretrieve(url,filename="d:/captcha.jpg")下载图片

　　3、接下来通过python脚本获取该图片，保存在本地，在python命令行中采用input()方式，人工识别后输入该验证码：captcha_value = credit。

三、登录参数构建

　　通过预先注册的用户名、密码，获得验证码，构建表单参数如下：

data={
    "form_email":"XXXXX",
    "form_password":"******",
    "captcha-solution":captcha_value,
}

四、Session参数存储

1、cookiejar学习：http://cuiqingcai.com/968.html

2、在request参数中指定cookiejar，如下：

首次访问目标网站：

构建登录参数后，开始登录。

五、登录后数据爬取

　　通过formdata认证通过后，在回调函数crawlerdata中处理爬取的网页，通过response对象进行数据解析。

六、主要代码

import scrapy
from scrapy.http import Request,FormRequest
import urllib.request
class DoubanSpider(scrapy.Spider):
    name = "Douban"
    allowed_domains = ["douban.com"]

    UserAgent = {"User-Agent:":"Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/53.0.2785.104 Safari/537.36 Core/1.53.2050.400 QQBrowser/9.5.10169.400"}

    def start_requests(self):
        return [Request("https://accounts.douban.com/login",callback=self.Login,meta={"cookiejar":1})]

    def Login(self, response):
        captcha = response.xpath("//img[@id='captcha_image']/@src").extract()
        url = "https://accounts.douban.com/login"
        print("正在保存验证码图片")
        captchapicfile = "F:/20_Python/2000_PythonData/SelfStudy/douban/douban/captcha.png"
        urllib.request.urlretrieve(captcha[0],filename = captchapicfile)
        print("打开图片文件，查看验证码，输入单词......")
        captcha_value = input()

        data = {
            "form_email":"XXXX",
            "form_password":"XXXX",
            "captcha-solution":captcha_value,
        }
        print("正在登陆中……")
        return [FormRequest.from_response(response,
                                              meta={"cookiejar":response.meta["cookiejar"]},
                                              headers = self.UserAgent,
                                              formdata = data,
                                              callback=self.crawlerdata,
                                              )]

    def crawlerdata(self,response):
        print("完成登录.........")
        title = response.xpath("/html/head/title/text()").extract()
        content2 = response.xpath("//meta[@name='description']/@content").extract()
        print(title[0])
        print(content2[0])

Python Scrapy 验证码登录处理的更多相关文章

scrapy爬取验证码登录网页
scrapy 验证码登录程序, https://accounts.douban.com/login # -*- coding: utf-8 -*- import scrapy import urlli ...
python爬虫之scrapy模拟登录
背景: 初来乍到的pythoner,刚开始的时候觉得所有的网站无非就是分析HTML.json数据,但是忽略了很多的一个问题,有很多的网站为了反爬虫,除了需要高可用代理IP地址池外,还需要登录.例如知乎 ...
python爬虫scrapy之登录知乎
下面我们看看用scrapy模拟登录的基本写法: 注意:我们经常调试代码的时候基本都用chrome浏览器,但是我就因为用了谷歌浏览器(它总是登录的时候不提示我用验证码,误导我以为登录时不需要验证码,其实 ...
Python - WebDriver 识别登录验证码
Python - WebDriver 识别登录验证码没什么可说的直接上代码! #-*-coding:utf-8-*- # Time:2017/9/29 7:16 # Author:YangYangJ ...
Python 实现简单图片验证码登录
朋友说公司要在测试环境做接口测试,登录时需要传入正确的图片的验证码,本着懒省事的原则,推荐他把测试环境的图片验证码写死,我们公司也是这么做的^_^.劝说无果/(ㄒoㄒ)/~~,只能通过 OCR 技术来 ...
python接口自动化（Cookie_绕过验证码登录）
python接口自动化(Cookie_绕过验证码登录) 有些登录的接口会有验证码,例如:短信验证码,图形验证码等,这种登录的验证码参数可以从后台获取(或者最直接的可查数据库) 获取不到也没关系,可以 ...
python自动化实现验证码登录过程
(自动化实现验证码登录,这里内容是入坑后,整合了几个文档的内容)|以下模块是使用时需要用到的首先:安装pillow库,它的作用是对图片进行简单的处理,在pytharm中使用pip install pi ...
Python验证码登录(Tesseract安装配置)
1.安装py库:pytesseract,PIL pip install pytesseract pip install PILLOW 如果安装时,出现权限不足: pip install --user ...
python scrapy版极客学院爬虫V2
python scrapy版极客学院爬虫V2 1 基本技术使用scrapy 2 这个爬虫的难点是 Request中的headers和cookies 尝试过好多次才成功(模拟登录),否则只能抓免费课 ...

随机推荐

Python-类属性与对象属性之间的关系
只要对象的属性未被指定赋值过, 不论类的属性怎么改变, 对象的属性都会跟随改变, 若对象属性被赋值过, 则不跟随类的属性而改变
LibRec：一个实现推荐系统的Java库包
LibRec是一个用于实现推系统 RS 的Java库包,实现推荐系统的两个经典问题: rating prediction(评分排行预测) 和 item ranking (项目排行),其内置了经典的机器 ...
【LeetCode】111. Minimum Depth of Binary Tree (2 solutions)
Minimum Depth of Binary Tree Given a binary tree, find its minimum depth. The minimum depth is the n ...
OGNL表达式中的#、%和$
$是el表达式 % #是ognl表达式. http://devilkirin.iteye.com/blog/427375 OGNL表达式非常强大-其中#.%.$这三个符号在OGNL表达式中经常出现 ...
实现简单容器模板类Vec（vector capacity 增长问题、allocator 内存分配器）
首先,vector 在VC 2008 中的实现比较复杂,虽然vector 的声明跟VC6.0 是一致的,如下: C++ Code 1 2 template < class _Ty, cl ...
powerdesigner 画PDM
一.PDM概述 PDM(物理数据模型-Physical Data Modal),通俗地理解,就是在PowerDesigner中以图形化的方式展示和设计数据库. PDM中涉及到的基本概念包括: 表: 列 ...
centos Permission denied: make_sock: could not bind to address
CentOS 下启动Httpd 失败,报 (13)Permission denied: make_sock: could not bind to address [::]:8000 因为小于1024 ...
xdebug安装教程
自动分析应该下载的文件: http://xdebug.org/wizard.php
Linux iptables常用命令
iptables 是 Linux 中重要的访问控制手段,是俗称的 Linux 防火墙系统的重要组成部分.这里记录了iptables 防火墙规则的一些常用的操作指令. 下面的操作以 CentOS 为基础 ...
linux kill 关闭进程命令
杀死进程最安全的方法是单纯使用kill命令,不加修饰符,不带标志. 首先使用ps -ef命令确定要杀死进程的PID,然后输入以下命令: # kill -pid 注释:标准的kill命令通常都能达到目的 ...

Python Scrapy 验证码登录处理

Python Scrapy 验证码登录处理的更多相关文章

随机推荐

热门专题