Scrapy中间件user-agent和ip代理使用

一、定义实现随机User-Agent的下载中间件

1.在middlewares.py中完善代码

 import random

 from Tencent.settings import USER_AGENTS_LIST # 注意导入路径,请忽视pycharm的错误提示

 class UserAgentMiddleware(object):

     def process_request(self, request, spider):

         user_agent = random.choice(USER_AGENTS_LIST)

         request.headers['User-Agent'] = user_agent

         # 不写return

 class CheckUA:

     def process_response(self,request,response,spider):

         print(request.headers['User-Agent'])

         return response # 不能少！

2.在settings中设置开启自定义的下载中间件，设置方法同管道

 DOWNLOADER_MIDDLEWARES = {

    'Tencent.middlewares.UserAgentMiddleware': 543, # 543是权重值

    'Tencent.middlewares.CheckUA': 600, # 先执行543权重的中间件，再执行600的中间件

 }

3.在settings中添加UA的列表

 USER_AGENTS_LIST = [

     "Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN) AppleWebKit/523.15 (KHTML, like Gecko, Safari/419.3) Arora/0.3 (Change: 287 c9dfb30)",

     "Mozilla/5.0 (X11; U; Linux; en-US) AppleWebKit/527+ (KHTML, like Gecko, Safari/419.3) Arora/0.6",

     "Mozilla/5.0 (Windows; U; Windows NT 5.1; en-US; rv:1.8.1.2pre) Gecko/20070215 K-Ninja/2.1.1",

     "Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN; rv:1.9) Gecko/20080705 Firefox/3.0 Kapiko/3.0",

     "Mozilla/5.0 (X11; Linux i686; U;) Gecko/20070322 Kazehakase/0.4.5"

 ]

二、代理ip的使用

1.在middlewares.py中完善代码

 class RandomProxy(object):

     def process_request(self, request, spider):

         proxy = random.choice(PROXY_LIST)

         print(proxy)

         if 'user_passwd' in proxy:

             # 对账号密码进行编码，基础认证,python3中需要是bytes类型的数据才能编码

             b64_up = base64.b64encode(proxy['user_passwd'].encode())

             # 进行代理认证

             request.headers['Proxy-Authorization'] = 'Basic ' + b64_up.decode()

             # 设置代理

             request.meta['proxy'] = proxy['ip_port']

         else:

             #设置代理

             request.meta['proxy'] = proxy['ip_port']

2.检测代理ip是否可用

在使用了代理ip的情况下可以在下载中间件的process_response()方法中处理代理ip的使用情况，如果该代理ip不能使用可以替换其他代理ip

 class ProxyMiddleware(object):

     ......

     def process_response(self, request, response, spider):

         if response.status != '':

             request.dont_filter = True # 重新发送的请求对象能够再次进入队列

             return requst

3.在settings中添加代理ip的列表

 PROXY_LIST = [

     {"ip_port": "139.199.121.163:16818", "user_passwd": "user:password"},#收费代理

     # {"ip_port": "114.234.81.72:9000"} # 免费代理

 ]

三. 在中间件中使用selenium

以github登陆为例

1. 完成爬虫代码

 import scrapy

 class Login4Spider(scrapy.Spider):

     name = 'login4'

     allowed_domains = ['github.com']

     start_urls = ['https://github.com/returnes'] # 直接对验证的url发送请求

     def parse(self, response):

         with open('check.html', 'w') as f:

             f.write(response.body.decode())

2.在middlewares.py中使用selenium获取cookie信息

 import time

 from selenium import webdriver

 def getCookies():

     # 使用selenium模拟登陆，获取并返回cookie

     username = input('输入github账号:')

     password = input('输入github密码:')

     options = webdriver.ChromeOptions()

     options.add_argument('--headless')

     options.add_argument('--disable-gpu')

     driver = webdriver.Chrome('/home/worker/Desktop/driver/chromedriver',

                               chrome_options=options)

     driver.get('https://github.com/login')

     time.sleep(1)

     driver.find_element_by_xpath('//*[@id="login_field"]').send_keys(username)

     time.sleep(1)

     driver.find_element_by_xpath('//*[@id="password"]').send_keys(password)

     time.sleep(1)

     driver.find_element_by_xpath('//*[@id="login"]/form/div[3]/input[3]').click()

     time.sleep(2)

     cookies_dict = {cookie['name']: cookie['value'] for cookie in driver.get_cookies()}

     driver.quit()

     return cookies_dict

 class LoginDownloaderMiddleware(object):

     def process_request(self, request, spider):

         cookies_dict = getCookies()

         print(cookies_dict)

         request.cookies = cookies_dict # 对请求对象的cookies属性进行替换

3.在middlewares.py中使用selenium获取指定页面渲染后的html源码

 class SelMiddleWare(object):

     def process_request(self, request, spider):

         url = request.url

         # 过滤需要渲染的请求对象

         if 'daydata' in url:

             driver = webdriver.Chrome()

             driver.get(url)

             time.sleep(3)

             data = driver.page_source

             driver.close()

             res = HtmlResponse(

                 url=url,

                 body=data,

                 encoding='utf-8',

                 request=request

             )

             return res

Scrapy中间件user-agent和ip代理使用的更多相关文章

scrapy实战9动态设置ip代理从数据库中随机获取一个可用的ip：
在目录下创建tools(python package) 在tools中创建crawl_xici_ip.py文件写入代码如下: #coding=utf-8 import requests from sc ...
Scrapy加Redis加IP代理池实现音乐爬虫
音乐爬虫关注公众号"轻松学编程"了解更多. 目的:爬取歌名,歌手,歌词,歌曲url. 一.创建爬虫项目创建一个文件夹,进入文件夹,打开cmd窗口,输入: scrapy star ...
写一个scrapy中间件--ip代理池
middleware文件 # -*- coding: utf-8 -*- # Define here the models for your spider middleware # See docum ...
下载中间件--随机IP代理以及随机User_Agent
下载中间件随机IP代理以及随机User_Agent 1.在settings.py中设置开启代理功能 # 设置下载中间件 DOWNLOADER_MIDDLEWARES = { # 随机的 User-Ag ...
Scrapy学习篇（十二）之设置随机IP代理（IPProxy）
当我们需要大量的爬取网站信息时,除了切换User-Agent之外,另外一个重要的方式就是设置IP代理,以防止我们的爬虫被拒绝,下面我们就来演示scrapy如何设置随机IPProxy. 设置随机IPPr ...
scrapy中使用 IP 代理
在 scrapy 中使用 ip 代理需要借助中间件的功能首先在settings 中设置好中间件,中间件优先级数字越小越先被执行 , } 然后编写中间件,拦截请求设置代理 class ProxyMid ...
python爬虫实战（三）--------搜狗微信文章（IP代理池和用户代理池设定----scrapy）
在学习scrapy爬虫框架中,肯定会涉及到IP代理池和User-Agent池的设定,规避网站的反爬. 这两天在看一个关于搜狗微信文章爬取的视频,里面有讲到ip代理池和用户代理池,在此结合自身的所了解的 ...
Scrapy学习-13-使用DownloaderMiddleware设置IP代理池及IP变换
设置IP代理池及IP变换方案方案一: 使用国内免费的IP代理 http://www.xicidaili.com # 创建一个tools文件夹,新建一个py文件,用于获取代理IP和PORT from ...
scrapy中间件中使用selenium切换ip
scrapy抓取一些需要js加载页面时一般要么是通过接口直接获取数据,要么是js加载,但是我通过selenium也可以获取动态页面但是有个问题,容易给反爬,因为在scrapy中间件mid中使用sel ...
scrapy中间件之下载中间件使用（网易新闻爬取）
scrapy项目中的middlewarse.py中间件爬虫中间件:目前先不介绍下载中间件(需要在settings.py中开启) (1)请求处理函数:process_request(self, re ...

随机推荐

【HNOI 2017】影魔
Problem Description 影魔,奈文摩尔,据说有着一个诗人的灵魂.事实上,他吞噬的诗人灵魂早已成千上万.千百年来,他收集了各式各样的灵魂,包括诗人.牧师.帝王.乞丐.奴隶.罪人,当然,还 ...
mybatis第一次搭建出错
### Error building SqlSession. ### The error may exist in com/test/pojo/UserMapper.xml ### Cause: or ...
【php】单例模式和工厂模式
单例模式:防止重复实例化,避免大量的new操作,减少消耗系统和内存的资源,使得有且仅有一个实例对象 header("Content-type: text/html; charset=utf- ...
关于 Expression is not assignable 错误
1.在 Build Phases中导入 UIKit.framework 2.在pch中导入头文件 #import <UIKit/UIKit.h> 3.写一个分类即可解决贴出分类代码 ...
os.remove异常处理
这种情况,正反斜杠都没问题.(windows环境下) 这种情况会出现下列异常对于目录的形式,把反斜杠改成正斜杠就好了
融云(API)
先记录下融云API地址:真是难找 IMKit: https://www.rongcloud.cn/docs/api/android/imkit/index.html IMLib: https://ww ...
POJ 1321 棋盘问题（搜索的方式）
Description 在一个给定形状的棋盘(形状可能是不规则的)上面摆放棋子,棋子没有区别.要求摆放时任意的两个棋子不能放在棋盘中的同一行或者同一列,请编程求解对于给定形状和大小的棋盘,摆放k个棋子 ...
linux批量配置ip
获取使用的网卡接口 ip a 2.查看系统版本 cat /etc/redhat-release 3.执行配置脚本 wget http://d.sshby.com/biaozhun.tar&& ...
20175317 《Java程序设计》第六周学习总结
20175317 <Java程序设计>第六周学习总结教材学习内容总结第六周我学习了教材第七章与第十章的内容,了解了内部类.异常类与输入输出流的知识,学到了以下内容: 什么是内部类如何 ...
background——背景属性
一.背景属性 1.1.背景颜色background-color <style> /*浮动,横向排列*/ div{float: left;} /*background-color属性值支持三 ...

Scrapy中间件user-agent和ip代理使用

一、定义实现随机User-Agent的下载中间件

1.在middlewares.py中完善代码

2.在settings中设置开启自定义的下载中间件，设置方法同管道

3.在settings中添加UA的列表

二、代理ip的使用

1.在middlewares.py中完善代码

2.检测代理ip是否可用

3.在settings中添加代理ip的列表

三. 在中间件中使用selenium

1. 完成爬虫代码

2.在middlewares.py中使用selenium获取cookie信息

3.在middlewares.py中使用selenium获取指定页面渲染后的html源码

Scrapy中间件user-agent和ip代理使用的更多相关文章

随机推荐

热门专题