scrapy中使用 IP 代理

在 scrapy 中使用 ip 代理需要借助中间件的功能

首先在settings 中设置好中间件，中间件优先级数字越小越先被执行

'DOWNLOADER_MIDDLEWARES':{      
         'spider.spider.middlewares.ProxyMiddleWare':,   
         'spider.spider.middlewares.SelenuimDownloaderMiddleware':     
   }

然后编写中间件，拦截请求设置代理

class ProxyMiddleWare(object):

    def process_request(self, request, spider):

        """ 对 request 加上proxy"""

        proxy = RedisClient().pop_proxy().decode('utf-8')

        print('---------this is request ip ----------:'+ proxy)

        request.meta['proxy'] = proxy

    def process_response(self, request, response, spider):

        """ 对返回的 response 处理"""

        # 如果返回的 response 状态不是 ， 重新生成当前的 request对象

        if response.status != :

            proxy = RedisClient().pop_proxy().decode('utf-8')

            print('this is response ip:'+ proxy)

            # 对当前 request 加上代理

            return request

        return response

scrapy中使用 IP 代理的更多相关文章

python爬虫中的ip代理设置
设置ip代理是爬虫必不可少的技巧: 查看本机ip地址:打开百度,输入“ip地址”,可以看到本机的IP地址: 本文使用的是goubanjia.com里面的免费ip: 使用时注意要注意传输协议是http还 ...
在Scrapy中使用IP池或用户代理更新版（python3）
middlewares.py # -*- coding: utf-8 -*- # 导入随机模块 import random # 导入有关IP池有关的模块 from scrapy.downloaderm ...
在Scrapy中使用IP池或用户代理（python3）
一.创建Scrapy工程 scrapy startproject 工程名二.进入工程目录,根据爬虫模板生成爬虫文件 scrapy genspider -l # 查看可用模板 scrapy gensp ...
python使用ip代理抓取网页
在抓取一个网站的信息时,如果我们进行频繁的访问,就很有可能被网站检测到而被屏蔽,解决这个问题的方法就是使用ip代理 .在我们接入因特网进行上网时,我们的电脑都会被分配一个全球唯一地ip地址供我们使用, ...
scrapy实战9动态设置ip代理从数据库中随机获取一个可用的ip：
在目录下创建tools(python package) 在tools中创建crawl_xici_ip.py文件写入代码如下: #coding=utf-8 import requests from sc ...
selenium在scrapy中的使用、UA池、IP池的构建
selenium在scrapy中的使用流程重写爬虫文件的构造方法__init__,在该方法中使用selenium实例化一个浏览器对象(因为浏览器对象只需要被实例化一次). 重写爬虫文件的closed ...
Scrapy学习篇（十二）之设置随机IP代理（IPProxy）
当我们需要大量的爬取网站信息时,除了切换User-Agent之外,另外一个重要的方式就是设置IP代理,以防止我们的爬虫被拒绝,下面我们就来演示scrapy如何设置随机IPProxy. 设置随机IPPr ...
python爬虫实战（三）--------搜狗微信文章（IP代理池和用户代理池设定----scrapy）
在学习scrapy爬虫框架中,肯定会涉及到IP代理池和User-Agent池的设定,规避网站的反爬. 这两天在看一个关于搜狗微信文章爬取的视频,里面有讲到ip代理池和用户代理池,在此结合自身的所了解的 ...
Scrapy中的UA池，代理池，以及selenium的应用
UA池代理池 selenium在Scrapy中的应用 UA池 - 下载中间件: - 下载中间件(Downloader Middlewares) 位于scrapy引擎和下载器之间的一层组件. - 作用 ...

随机推荐

Day1 面向对象编程与Java核心类
this变量在方法内部,可以使用一个隐含的变量this,它始终指向当前实例.如果没有命名冲突,可以省略this. 但是,如果有局部变量和字段重名,那么局部变量优先级更高,就必须加上this. 构造方 ...
go基础_数组
数组有2种赋值方式一种明确指定长度,另一种从赋值数目指定长度 package main import "fmt" func main() { //数组赋值方式1,指定长度 arr ...
awk基本介绍
AWK 是一种用于处理文本的编程语言工具.awk经过改进生成的新的版本nawk,gawk,现在默认linux系统下日常使用的是gawk,用命令可以查看正在应用的awk的来源(ls -l /bin/aw ...
python-线程池的两种实现方式【转载】
#!/usr/bin/env python # -*- coding:utf-8 -*- import queue import threading import contextlib import ...
git密码相关问题
一.解决:每次都需要输入账号密码 git config --global credential.helper store 二.后期git密码更改后,重置密码操作 git config --system ...
js判断是横屏还是竖屏
1通过在html中分别引用横屏和竖屏的样式: <link rel="stylesheet" media="all and (orientation:portrait ...
Django--模型管理器
参考https://blog.csdn.net/qq_34788903/article/details/87889451 可参考视频 : https://www.bilibili.com/video ...
STM32F103_外部RAM用作运存---IS62WV51216
https://www.cnblogs.com/lilto/p/9548736.html STM32F103_外部RAM用作运存概述 SRAM的简介折腾过电脑的朋友都知道,当电脑运行比较卡的时 ...
JenKins docker 集群
//tag 桉树有时间来搞 **阿斯蒂啊阿斯蒂
MYSQL 传汉字获取拼音首字母
--获取单个汉字首字母拼音 --CREATE DEFINER=`by`@`%` FUNCTION `fun_first_pinyin`(`P_NAME` VARCHAR(5)) RETURNS var ...

scrapy中使用 IP 代理

scrapy中使用 IP 代理的更多相关文章

随机推荐

热门专题