Python实战：如何隐藏自己的爬虫身份

使用爬虫访问网站，需要尽可能的隐藏自己的身份，以防被服务器屏蔽，在工作工程中，我们有2种方式来实现这一目的，分别是延时访问和动态代理，接下来我们会对这两种方式进行讲解

1、延时访问

见名之意，延时访问就是在访问网站时设置一个访问周期，每隔几秒钟访问一次，这样的方式更像是人为访问网站






import time





import urllib.request





 





cnt = 0





#隐藏自己爬虫的身份的第一种策略是设置访问周期，使得程序更像是人为访问的





while True: #每隔5秒钟访问一次百度网





    url = "https://www.baidu.com" #设置url地址





    param = {} #设置参数，参数是字典





    param = urllib.parse.urlencode(param).encode('utf_8') #将参数以utf-8编码方式来编码





    





    req = urllib.request.Request(url, param)





    #设置header的User-Agent属性，模拟该请求是由狐火浏览器发送的，也就是说欺骗服务器是人为发送的并未程序发送的





    req.add_header("User-Agent", "Mozilla/5.0 (Macintosh; Intel Mac OS X 10.12; rv:53.0) Gecko/20100101 Firefox/53.0")





    response = urllib.request.urlopen(req) #访问网络





    





    html = response.read() #读取响应的结果





    result = html.decode("utf-8") #按照utf-8编码来进行解码





    if result != "":





        cnt += 1





    print("第%s次攻击百度网" %cnt)





    time.sleep(5) #程序睡眠5秒钟

运行结果：

每隔5秒钟访问一次百度网

2、动态代理

使用代理服务器来访问网站，这种方法非常霸道，可以模拟出不同的服务器访问网站，也是最为推荐的一种方式，我们可以在百度网上查找免费的代理服务器IP






import urllib.request





import random





 





ipList = ['119.6.144.73:81', '183.203.208.166:8118', '111.1.32.28:81'] #定义多个代理IP，代理IP可以在网上搜免费的





cnt = 0





#隐藏自己爬虫的身份的第二种策略是使用代理，意思是模拟多个服务器访问





while True: #使用代理服务器不停的访问百度网





    proxy_support = urllib.request.ProxyHandler({'http':random.choice(ipList)}) #定义一个代理对象，使用随机的ip





    





    opener = urllib.request.build_opener(proxy_support)





    opener.add_handlers = [("User-Agent", "Mozilla/5.0 (Macintosh; Intel Mac OS X 10.12; rv:53.0) Gecko/20100101 Firefox/53.0")]





    urllib.request.install_opener(opener)





    





    response = urllib.request.urlopen("https://www.baidu.com") #访问网络





    





    html = response.read() #读取响应的结果





    result = html.decode("utf-8") #按照utf-8编码来进行解码





    if result != "":





        cnt += 1





    print("第%s次攻击百度网" %cnt)

运行结果：

不停的攻击百度网

Python实战：如何隐藏自己的爬虫身份的更多相关文章

Python实战：Python爬虫学习教程，获取电影排行榜
Python应用现在如火如荼,应用范围很广.因其效率高开发迅速的优势,快速进入编程语言排行榜前几名.本系列文章致力于可以全面系统的介绍Python语言开发知识和相关知识总结.希望大家能够快速入门并学习 ...
零基础入门Python实战:四周实现爬虫网站 Django项目视频教程
点击了解更多Python课程>>> 零基础入门Python实战:四周实现爬虫网站 Django项目视频教程适用人群: 即将毕业的大学生,工资低工作重的白领,渴望崭露头角的职场新人, ...
Python实战：美女图片下载器，海量图片任你下载
Python应用现在如火如荼,应用范围很广.因其效率高开发迅速的优势,快速进入编程语言排行榜前几名.本系列文章致力于可以全面系统的介绍Python语言开发知识和相关知识总结.希望大家能够快速入门并学习 ...
再一波Python实战项目列表
前言: 近几年Python可谓是大热啊,很多人都纷纷投入Python的学习中,以前我们实验楼总结过多篇Python实战项目列表,不但有用还有趣,最主要的是咱们实验楼不但有详细的开发教程,更有在线开发环 ...
(转)Python新手写出漂亮的爬虫代码2——从json获取信息
https://blog.csdn.net/weixin_36604953/article/details/78592943 Python新手写出漂亮的爬虫代码2——从json获取信息好久没有写关于爬 ...
Python实战之自己主动化评论
Python实战之自己主动化评论玩csdn博客一个多月了,渐渐发现了一些有意思的事,常常会有人用相同的评论到处刷.不知道是为了加没什么用的积分,还是纯粹为了表达楼主好人.那么问题来了,这种无聊的事情 ...
python scrapy版极客学院爬虫V2
python scrapy版极客学院爬虫V2 1 基本技术使用scrapy 2 这个爬虫的难点是 Request中的headers和cookies 尝试过好多次才成功(模拟登录),否则只能抓免费课 ...
zeromq 学习和python实战
参考文档: 官网 http://zeromq.org/ http://www.cnblogs.com/rainbowzc/p/3357594.html 原理解读 zeromq只是一层针对socke ...
【python】一个简单的贪婪爬虫
这个爬虫的作用是,对于一个给定的url,查找页面里面所有的url连接并依次贪婪爬取主要需要注意的地方: 1.lxml.html.iterlinks() 可以实现对页面所有url的查找 2.获取页面 ...

随机推荐

[DP]【最大全零矩阵】【2015.7.9TEST】E
E 0.9 seconds, 32 MB " 于是乎,你至少证明了你智商比金天成高.也就说你证明了你不是低智儿童,不错不错. 然而这次, 我貌似也卡住了,你给我打下手吧. 勇敢的少年啊快去创 ...
android adb常见问题的解决方法！
** adb的常见问题 adb:android debug bridge,用于连接模拟器/手机与PC端软件(比如:eclipse或者xx手机助手) adb devices -> ...
amazeui学习笔记一（开始使用3）--兼容性列表compatibility
amazeui学习笔记一(开始使用3)--兼容性列表compatibility 一.总结 1.不要用ie做前端测试,不要碰ie,尽量用google 浏览器: 按照微软官方的说法,IE 开发者工具中的浏 ...
1.12 Python基础知识 - 序列：字符串
字符串是一个有序的字符集合,即字符序列.Pythpn内置数据类型str,用于字符串处理,使用单引号或双引号括起来的字符,就是字符常量,Python解释器会自动创建str型对象实例. 字符串的定义: 1 ...
IOS系统不兼容position: fixed;属性的解决方案
position: fixed;属性在IOS系统手机上会有很明显的抖动,解决方式: 只需要在中间部分外层div添加css样式position:fixed;top:50px; bottom:50px;o ...
Notepad++使用心得和特色功能介绍 -> notepad/ultraedit的最好的替代品
[详细]Notepad++使用心得和特色功能介绍 -> notepad/ultraedit的最好的替代品最近在用Notepad++,发现的确是很不错的工具,具体特色,看了下面介绍就知道了. [ ...
oracle 10g文件目录结构详解
一个典型的oralce目录结构如下: /u01└── oracle ├── admin (数据库管理文件位置,以实例划分) │ ├── mydb │ │ ├── adum ...
3.Docker安装【Docker每天5分钟】
原文:3.Docker安装[Docker每天5分钟] Docker给PaaS世界带来的“降维打击”,其实是提供了一种非常便利的打包机制.该机制打包了应用运行所需要的整个操作系统,从而保证了本地环境和云 ...
从反编译深入理解JAVA内部类类结构以及finalkeyword
1.为什么成员内部类能够无条件訪问外部类的成员? 在此之前,我们已经讨论过了成员内部类能够无条件訪问外部类的成员,那详细到底是怎样实现的呢?以下通过反编译字节码文件看看到底.其实,编译器在进行编译的时 ...
为什么通过空指针（NULL）能够正确调用类的部分成员函数
#include <iostream> using namespace std; class B { public: void foo() { cout << "B ...

Python实战：如何隐藏自己的爬虫身份

Python实战：如何隐藏自己的爬虫身份的更多相关文章

随机推荐

热门专题