scrapy基础知识之 scrapy 三种模拟登录策略：

注意：模拟登陆时，必须保证settings.py里的 `COOKIES_ENABLED` (Cookies中间件) 处于开启状态

COOKIES_ENABLED = True或 # COOKIES_ENABLED = False

策略一：直接POST数据（比如需要登陆的账户信息)

# -*- coding: utf-8 -*-

import scrapy

class Renren1Spider(scrapy.Spider):

    name = "renren1"

    allowed_domains = ["renren.com"]

    def start_requests(self):

        url = 'http://www.renren.com/PLogin.do'

        # FormRequest 是Scrapy发送POST请求的方法

        yield scrapy.FormRequest(

                url = url,

                formdata = {"email" : "xx", "password" : "xx"},

                callback = self.parse_page)

    def parse_page(self, response):

        with open("mao2.html", "wb") as filename:

            filename.write(response.body)

策略二：标准的模拟登陆步骤

1.首先发送登录页面的get请求，获取到页面里的登录必须的参数（比如说zhihu登陆界面的 _xsrf）

2.然后和账户密码一起post到服务器，登录成功

# -*- coding: utf-8 -*-

import scrapy

class Renren2Spider(scrapy.Spider):

    name = "renren2"

    allowed_domains = ["renren.com"]

    start_urls = (

        "http://www.renren.com/PLogin.do",

    )

 # 处理start_urls里的登录url的响应内容，提取登陆需要的参数（如果需要的话)

    def parse(self, response):

        # 提取登陆需要的参数

        #_xsrf = response.xpath("//_xsrf").extract()[0]

        # 发送请求参数，并调用指定回调函数处理

        yield scrapy.FormRequest.from_response(

                response,

                formdata = {"email" : "xxx", "password" : "xxxxxxx"},#, "_xsrf" = _xsrf},

                callback = self.parse_page

            )

 # 获取登录成功状态，访问需要登录后才能访问的页面

    def parse_page(self, response):

        url = "http://www.renren.com/422167102/profile"

        yield scrapy.Request(url, callback = self.parse_newpage)

    # 处理响应内容

    def parse_newpage(self, response):

        with open("xiao.html", "wb") as filename:

            filename.write(response.body)

策略三：直接使用保存登陆状态的Cookie模拟登陆

如果实在没办法了，可以用这种方法模拟登录，虽然麻烦一点，但是成功率100%

# -*- coding: utf-8 -*-

import scrapy

class RenrenSpider(scrapy.Spider):

    name = "renren"

    allowed_domains = ["renren.com"]

    start_urls = (

        'http://www.renren.com/111111',

        'http://www.renren.com/222222',

        'http://www.renren.com/333333',

    )

    cookies = {

    "anonymid" : "ixrna3fysufnwv",

    "_r01_" : "1",

    "ap" : "327550029",

    "JSESSIONID" : "abciwg61A_RvtaRS3GjOv",

    "depovince" : "GW",

    "springskin" : "set",

    "jebe_key" : "f6fb270b-d06d-42e6-8b53-e67c3156aa7e%7Cc13c37f53bca9e1e7132d4b58ce00fa3%7C1484060607478%7C1%7C1486198628950",

    "t" : "691808127750a83d33704a565d8340ae9",

    "societyguester" : "691808127750a83d33704a565d8340ae9",

    "id" : "327550029",

    "xnsid" : "f42b25cf",

    "loginfrom" : "syshome"

    }

    # 可以重写Spider类的start_requests方法，附带Cookie值，发送POST请求

    def start_requests(self):

        for url in self.start_urls:

            yield scrapy.FormRequest(url, cookies = self.cookies, callback = self.parse_page)

    # 处理响应内容

    def parse_page(self, response):

        with open("deng.html", "wb") as filename:

            filename.write(response.body)

scrapy基础知识之 scrapy 三种模拟登录策略：的更多相关文章

scrapy基础知识之 Scrapy 和 scrapy-redis的区别：
Scrapy 和 scrapy-redis的区别 Scrapy 是一个通用的爬虫框架,但是不支持分布式,Scrapy-redis是为了更方便地实现Scrapy分布式爬取,而提供了一些以redis为基础 ...
JAVA基础知识之多线程——三种实现多线程的方法及区别
所有JAVA线程都必须是Thread或其子类的实例. 继承Thread类创建线程步骤如下, 定义Thead子类并实现run()方法,run()是线程执行体创建此子类实例对象,即创建了线程对象调用 ...
scrapy基础知识之scrapy自动下载图片pipelines
需要在settings.py配置: ITEM_PIPELINES = { 'scrapy.pipelines.images.ImagesPipeline': 1, }import os IMAGES_ ...
0.Python 爬虫之Scrapy入门实践指南（Scrapy基础知识）
目录 0.0.Scrapy基础 0.1.Scrapy 框架图 0.2.Scrapy主要包括了以下组件: 0.3.Scrapy简单示例如下: 0.4.Scrapy运行流程如下: 0.5.还有什么? 0. ...
[SQL] SQL 基础知识梳理（三） - 聚合和排序
SQL 基础知识梳理(三) - 聚合和排序 [博主]反骨仔 [原文]http://www.cnblogs.com/liqingwen/p/5926689.html 序这是<SQL 基础知识梳理 ...
Go基础知识梳理（三）
Go基础知识梳理(三) 结构 type Person struct { name string sex int } func main() { //推荐写法 person := Person{ nam ...
ASP.NET MVC：多语言的三种技术处理策略
ASP.NET MVC:多语言的三种技术处理策略背景本文介绍了多语言的三种技术处理策略,每种策略对应一种场景,这三种场景是: 多语言资源信息只被.NET使用. 多语言资源信息只被Javascrip ...
scrapy基础知识之 CrawlSpiders爬取lagou招聘保存在mysql（分布式）：
items.py import scrapy class LagouItem(scrapy.Item): # define the fields for your item here like: # ...
Java基础知识学习（三）
面向对象部分首先要了解面向对象的思想,与C#一致,都是面向对象的语言访问修饰符 public 共有的,对所有类可见. protected 受保护的,对同一包内的类和所有子类可见. private ...

随机推荐

windows下启动redis
解决方案使用现成的基于windows的redis程序 github上有许多封装好的基于windows的redis程序,可以直接使用,但是版本更新不及时比如: https://github.com/M ...
abp.message
abp.message.success(app.localize('SomeMessage'), app.localize('Title')) .done(function() { //do some ...
NUGET源不存在，安装Nuget包提示“本地源不存在”
困扰了两天的问题,终于找到原因了.因此来这里记录一下~ 前两天写项目时,要从NUGET上安装个第三方库,但不管是从可视化的管理器还是管理器控制台安装,都提示“本地源‘*******’不存在”.然后到网 ...
iOS 自定义UIButton
工作中有一个点击button更新button上文案的需求,用自定义了button可以很简单的实现的这个需求首先写个自定义的button CustomButton.h #import <UIKi ...
图像滤镜艺术---球面(Spherize)滤镜
原文:图像滤镜艺术---球面(Spherize)滤镜球面(Spherize)滤镜球面滤镜是通过极坐标变换实现图像的球面特效. 代码如下: // /// ...
FreeNAS 11.0 正式发布，提供 S3 兼容的对象存储服务
FreeNAS 11.0 正式版已发布,该版本带来了新的虚拟化和对象存储功能.FreeNAS 11.0 将 bhyve 虚拟机添加到其受欢迎的 SAN / NAS.Jail 和插件中,让用户可以在 F ...
Win8Metro(C#)数字图像处理--2.28图像乘法运算
原文:Win8Metro(C#)数字图像处理--2.28图像乘法运算 [函数名称] 图像乘法函数MultiplicationProcess(WriteableBitmap src, Writea ...
指定Qt程序运行的style，比如fusion（以前没见过QStyleFactory）
转载请注明文章:指定Qt程序运行的style,比如fusion 出处:多客博图代码很简单,如下: #include <QtWidgets/QApplication> #include ...
什么是YAML？
YAML是"YAML不是一种标记语言"的外语缩写 [1] (见前方参考资料原文内容):但为了强调这种语言以数据做为中心,而不是以置标语言为重点,而用返璞词重新命名.它是一种直观的能 ...
nginx 负载均衡，多站点共享Session
原文:nginx 负载均衡,多站点共享Session nginx 负载均衡,多站点共享Session 多站点共享Session常见的作法有: 使用.net自动的状态服务(Asp.net State S ...

scrapy基础知识之 scrapy 三种模拟登录策略：

注意：模拟登陆时，必须保证settings.py里的 COOKIES_ENABLED (Cookies中间件) 处于开启状态

策略一：直接POST数据（比如需要登陆的账户信息)

策略二：标准的模拟登陆步骤

策略三：直接使用保存登陆状态的Cookie模拟登陆

scrapy基础知识之 scrapy 三种模拟登录策略：的更多相关文章

随机推荐

热门专题

注意：模拟登陆时，必须保证settings.py里的 `COOKIES_ENABLED` (Cookies中间件) 处于开启状态