有时候我们些代码是总发此疑惑?

为什么别人采集 xx 网站的时候能成功,而我却总是不返回给数据

出现这种原因时往往是我们没有给够伪装, 被识别了出来~

就像人,你出门肯定是要穿衣服的对不,如果你不穿!

走在外面,肯定是最显眼的一个,不抓你抓谁

还有一种就是明明我之前运行成功了,为什么我现在再次运行时就不行了呢~

而且还甩一句话给我 “系统检测到您频繁访问,请稍后再来”

好啦!现在咋们正经的来介绍一下面对此种情况该如何处理~

要会伪装,要想想看,人是怎么访问网站的

这次我们来说说伪装 Header ,当你要去爬取某个网站的数据的时候

你要想想看,如果是别人爬取你的数据,你会做什么操作

你是不是也不想,让别人随随便便就疯狂请求你的服务器

你是不是也会,采取一定的措施

比如,我有一个网站,你分析到了我的地址

当你想要通过 python 来爬取的时候…

这边我来写一个简单的可以被请求的例子

from flask import Flask

app = Flask(__name__)

@app.route('/getInfo')
def hello_world():
return "这里假装有很多数据" if __name__ == "__main__":
app.run(debug=True)

ok ,假设你现在分析到了我的地址了,

也就是可以通过 /getInfo 就可以获取到数据了

你感觉很爽,就开始请求了

 url = 'http://127.0.0.1:5000/getInfo'
response = requests.get(url)
print(response.text)

没错,这个时候你确实获取到数据了

但是!我觉得有点不对劲了,想看看请求的 header 信息

@app.route('/getInfo')
def hello_world():
print(request.headers)
return "这里假装有很多数据" if __name__ == "__main__":
app.run(debug=True)

结果看到的 headers 信息是这样的

Host: 127.0.0.1:5000
User-Agent: python-requests/2.21.0
Accept-Encoding: gzip, deflate
Accept: */*
Connection: keep-alive

User-Agent: python-requests/2.21.0

居然使用 python 的库来请求,你说我不封你封谁呢?

所以我这个时候进行判断,就获取不到数据了

@app.route('/getInfo')
def hello_world():
if(str(request.headers.get('User-Agent')).startswith('python')):
return "系统检测到您频繁访问,请稍后再来"
else:
return "这里假装有很多数据"
欢迎加入白嫖Q群:660193417 ### if __name__ == "__main__":
app.run(debug=True)

你这个时候的请求

if __name__ == '__main__':
url = 'http://127.0.0.1:5000/getInfo'
response = requests.get(url)
print(response.text)

得到的结果就是

“系统检测到您频繁访问,请稍后再来”

你已经在我面前暴露了,想重新再来,那么怎么办呢?

伪装自己呗,python 不可以访问

浏览器可以访问呀,所以你可以修改你的请求头

先在浏览器访问,然后在抓取数据的时候获取到 Header 数据

当然你也可以使用 Chrome 的控制面板获取 Header


有了 Header 信息之后,就可以使用 requests模块轻松获取

恩,现在的你学会假装自己是浏览器了

欢迎加入白嫖Q群:660193417 ###
if __name__ == '__main__': headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.121 Safari/537.36'
} url = 'http://127.0.0.1:5000/getInfo'
response = requests.get(url,headers=headers)
print(response.text)

再获取一次可以发现,返回的是

这里假装有很多数据

ok,你又获取到数据了

好啦,这篇文章就到这里啦~对你有帮助就点赞收藏一下吧!

我是小熊猫,咱下篇文章见

不存在的!python说不给数据的浏览器是不存在的!的更多相关文章

  1. 使用Python解析JSON数据的基本方法

    这篇文章主要介绍了使用Python解析JSON数据的基本方法,是Python入门学习中的基础知识,需要的朋友可以参考下:     ----------------------------------- ...

  2. python matplotlib plot 数据中的中文无法正常显示的解决办法

    转发自:http://blog.csdn.net/laoyaotask/article/details/22117745?utm_source=tuicool python matplotlib pl ...

  3. Python/Numpy大数据编程经验

    Python/Numpy大数据编程经验 1.边处理边保存数据,不要处理完了一次性保存.不然程序跑了几小时甚至几天后挂了,就啥也没有了.即使部分结果不能实用,也可以分析程序流程的问题或者数据的特点.   ...

  4. Windows下Python读取GRIB数据

    之前写了一篇<基于Python的GRIB数据可视化>的文章,好多博友在评论里问我Windows系统下如何读取GRIB数据,在这里我做一下说明. 一.在Windows下Python为什么无法 ...

  5. 为什么说Python 是大数据全栈式开发语言

    欢迎大家访问我的个人网站<刘江的博客和教程>:www.liujiangblog.com 主要分享Python 及Django教程以及相关的博客 交流QQ群:453131687 原文链接 h ...

  6. 用Python浅析股票数据

    用Python浅析股票数据 本文将使用Python来可视化股票数据,比如绘制K线图,并且探究各项指标的含义和关系,最后使用移动平均线方法初探投资策略. 数据导入 这里将股票数据存储在stockData ...

  7. Python读取JSON数据,并解决字符集不匹配问题

    今天来谈一谈Python解析JSON数据,并写入到本地文件的一个小例子. – 思路如下 从一个返回JSON天气数据的网站获取到目标JSON数据串 使用Python解析出需要的部分 写入到本地文件,供其 ...

  8. 使用 python 处理 nc 数据

    前言 这两天帮一个朋友处理了些 nc 数据,本以为很简单的事情,没想到里面涉及到了很多的细节和坑,无论是"知难行易"还是"知易行难"都不能充分的说明问题,还是& ...

  9. 【转】Python——plot可视化数据,作业8

    Python——plot可视化数据,作业8(python programming) subject1k和subject1v的形状相同 # -*- coding: utf-8 -*- import sc ...

随机推荐

  1. HTTP:聊一聊HTTPS

    一.什么是https https是http的升级,因为http是明文传输的,所以非常不安全,https在http的基础上进行了数据加密. 二.https的加密方式 1.对称加密 服务端会给客户端发送一 ...

  2. 【FAQ】HMS Core广告服务:如何获取正式广告位ID以及流量变现的受限情况

    HMS Core广告服务开发指南中提到"xxxx为测试专用的广告位ID,App正式发布时需要改为正式的广告位ID",那么今天咱们就来说说,怎么获取正式的广告位ID. 测试广告位ID ...

  3. 真实本人亲测Elasticsearch未授权访问漏洞——利用及修复【踩坑指南到脱坑!】

    如要转载请注明出处谢谢: https://www.cnblogs.com/vitalemontea/p/16105490.html 1.前言 某天"发现"了个漏洞,咳咳,原本以为这 ...

  4. 集合篇-ConcurrentHashMap

    点赞再看,养成习惯,微信搜索「小大白日志」关注这个搬砖人. 文章不定期同步公众号,还有各种一线大厂面试原题.我的学习系列笔记. jdk1.7和jdk1.8中ConcurrentHashMap的区别? ...

  5. python数据处理-matplotlib入门(2)-利用随机函数生成变化图形2

    鉴于上一篇中最后三个问题: 1.上述程序是否能进行优化(比如功能相同的) 2.创建三个3个实例,用了3个语句,能否建一个函数,只输入一个数n,就自动创建n个实例?同时,每个实例的num_times随机 ...

  6. Glance基础服务运维

    @ 目录 Glance镜像服务介绍 创建镜像 查看镜像 修改镜像 删除镜像 Glance镜像服务介绍 Glance是OpenStack镜像服务,用来注册.登陆和检索虚拟机镜像.Glance服务提供了一 ...

  7. [LBS学习笔记4]地理特征POI、AOI、路径轨迹

    1 简述 今天继续LBS地理信息的学习,目标是写到10篇博客的时候,做出一个地图工具页面用,包含地图空间索引Geohash.S2.H3的可视化展示. 地理特征分为点(POI).线(路径).面(AOI) ...

  8. 鸭的NOI ONLINE杂刷

    好耶!洛谷账号橙了! 水题 [NOI Online #2 入门组] 未了 这就是一道贪心+二分查找,思路很好想 除法有精度问题,建议不使用除法 code [NOI Online #3 提高组] 水壶 ...

  9. scrapy框架第二天

    1.scrapy数据分析 2.scrapy持久化存储 3.全站数据爬取 4.请求传参  +   五大核心组件 - 创建scrapy工程 scrapy startproject ProName - 切换 ...

  10. ansible中的playbook脚本的介绍与使用

    playbook的数据结构,遵循yaml 后缀名为yaml或者yml,这两个后缀名没有区别 字典{key:value} 列表[]或者- - alex - wusir - yantao - yuchao ...