Ajax爬取动态数据和HTTPS自动默认证书

Ajax数据爬取

　　在spider爬取数据的过程中，有些网页的数据是利用Ajax动态加载出来的，所以，在网页源代码中可能不会看到这一部分的数据，因此，我们需要使用另外的方式进行数据多爬取。

　　以豆瓣电影的网页源码获取为例 https://movie.douban.com/ ，我们查看网页源代码，会发现网页中所包含的数据根本不在源代码中，比如查询囧妈，会显示查询结果为0。这时候我们就要注意他可能是使用Ajax进行动态加载的数据。

　　F12进入开发者工具，按照下图步骤进行查看

　　双击第3步骤中的链接，会发现有一些tag标签，最后会发现有一些数据包含其中。

　　有数据的这些连接就是Ajax动态加载的结果了。下面有一个小例子进行简单的运用。

 1 '''

 2 @Description: 爬取异步加载数据——以豆瓣网为例

 3 @Version: 1.0

 4 @Autor: Montoin Yan

 5 @Date: 2020-02-01 18:18:05

 6 @LastEditors  : Montoin Yan

 7 @LastEditTime : 2020-02-03 18:50:01

 8 '''

 9 from urllib import parse

10 from urllib.request import urlopen,Request

11 import simplejson

12 import random

13

14 #设置多个请求头，防止被反扒措施进行拦截

15 ua_list = [

16     "Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:72.0) Gecko/20100101 Firefox/72.0",

17     "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.29 Safari/537.36",

18     "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.102 Safari/537.36 Edge/18.18362",

19     "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.25 Safari/537.36 Core/1.70.3741.400 QQBrowser/10.5.3863.400"

20 ]

21 #随机pick one

22 ua = random.choice(ua_list)

23

24 #以https://movie.douban.com/j/search_subjects?type=movie&tag=%E7%83%AD%E9%97%A8&page_limit=10&page_start=0 为例

25 #将链接进行分割，将Ajax需要传递的参数存储到字典中

26 url = "https://movie.douban.com/j/search_subjects"

27 d = {

28     'type':'movie',

29     'tag':'热门',

30     'page_limit':'10',

31     'page_start':'0'

32 }

33 request = Request('{}?{}'.format(url,parse.urlencode(d)),headers={

34     'User-agent':ua

35 })

36

37 with urlopen(request) as response:

38     subjects = simplejson.loads(response.read())

39     print(len(subjects['subjects']))

40     s = subjects['subjects']

41     for i in s:

42         print(i)

　　结果可以参照以下内容：

HTTPS跳过证书验证

　　引用python自带的ssl库，进行不信任证书的忽略，以12306为例。

 1 '''

 2 @Description: HTTPS利用SSL库进行默认信任证书的模拟

 3 @Version: 1.0

 4 @Autor: Montoin Yan

 5 @Date: 2020-02-03 20:18:52

 6 @LastEditors  : Montoin Yan

 7 @LastEditTime : 2020-02-03 20:32:47

 8 '''

 9

10 from urllib.request import urlopen,Request

11 import random

12 import ssl

13

14 url = "http://www.12306.cn/mormhweb/"

15 ua_list = [

16     "Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:72.0) Gecko/20100101 Firefox/72.0",

17     "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.29 Safari/537.36",

18     "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.102 Safari/537.36 Edge/18.18362",

19     "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.25 Safari/537.36 Core/1.70.3741.400 QQBrowser/10.5.3863.400"

20 ]

21 #随机pick one

22 ua = random.choice(ua_list)

23 request = Request(url,headers={

24     'User-agent':ua

25 })

26

27 #忽略不信任的证书

28 context = ssl._create_unverified_context()

29

30 #利用urlopen的最后一个参数，强调上下文使得在链接传递的时候忽略证书

31 with urlopen(request,context=context) as response:

32     print(response._method)

33     print(response.read())

Ajax爬取动态数据和HTTPS自动默认证书的更多相关文章

Golang+chromedp+goquery 简单爬取动态数据
目录 Golang+chromedp+goquery 简单爬取动态数据 Golang的安装下载golang软件解压golang 配置golang 重新导入配置 chromedp框架的使用实际的代 ...
爬虫系列4：Requests+Xpath 爬取动态数据
爬虫系列4:Requests+Xpath 爬取动态数据 [抓取]:参考前文爬虫系列1:https://www.cnblogs.com/yizhiamumu/p/9451093.html [分页]:参 ...
python 爬取动态数据
按照:https://dryscrape.readthedocs.io/en/latest/installation.html 安装dryscrape 以下是简单实现 import dryscrape ...
Python 爬虫实例（8）—— 爬取动态页面
今天使用python 和selenium爬取动态数据,主要是通过不停的更新页面,实现数据的爬取,要爬取的数据如下图源代码: #-*-coding:utf-8-*- import time from ...
吴裕雄--天生自然PYTHON爬虫：安装配置MongoDBy和爬取天气数据并清洗保存到MongoDB中
1.下载MongoDB 官网下载:https://www.mongodb.com/download-center#community 上面这张图选择第二个按钮上面这张图直接Next 把bin路径添加 ...
Python爬虫实战（一）使用urllib库爬取拉勾网数据
本笔记写于2020年2月4日.Python版本为3.7.4,编辑器是VS code 主要参考资料有: B站视频av44518113 Python官方文档 PS:如果笔记中有任何错误,欢迎在评论中指出, ...
R语言爬取动态网页之环境准备
在R实现pm2.5地图数据展示文章中,使用rvest包实现了静态页面的数据抓取,然而rvest只能抓取静态网页,而诸如ajax异步加载的动态网页结构无能为力.在R语言中,爬取这类网页可以使用RSele ...
使用webdriver+urllib爬取网页数据(模拟登陆，过验证码)
urilib是python的标准库,当我们使用Python爬取网页数据时,往往用的是urllib模块,通过调用urllib模块的urlopen(url)方法返回网页对象,并使用read()方法获得ur ...
使用ajax爬取网站图片()
以下内容转载自:https://www.makcyun.top/web_scraping_withpython4.html 文章关于网站使用Ajaxj技术加载页面数据,进行爬取讲的很详细大致步骤如下 ...

随机推荐

Deep Learning部署TVM Golang运行时Runtime
Deep Learning部署TVM Golang运行时Runtime 介绍 TVM是一个开放式深度学习编译器堆栈,用于编译从不同框架到CPU,GPU或专用加速器的各种深度学习模型.TVM支持来自Te ...
CUDA功能和通用功能
CUDA功能和通用功能本文描述了类似于CUDA ufunc的对象. 为了支持CUDA程序的编程模式,CUDA Vectorize和GUVectorize无法产生常规的ufunc.而是返回类似ufun ...
开放神经网络交换（ONNX）工具
开放神经网络交换(ONNX)工具开放神经网络交换(ONNX)是一个开放的生态系统,它使人工智能开发人员能够在项目发展过程中选择正确的工具.ONNX为人工智能模型提供了一种开源格式,包括深度学习和传统 ...
ubuntu虚拟机安装ssh教程
大家好,这期给大家带来一期Ubuntu虚拟机中ssh的安装教程,话不多说,开整第一步:输入su后输入密码进入root权限第二步:在管理员模式下运行apt-get install openssh-s ...
HAL库与Cubemx系列|Systick-系统滴答定时器详解
Systick是什么? 关于Systick,在Context-M3权威指南中如此描述: SysTick定时器被捆绑在NVIC中,用于产生SYSTICK异常(异常号: 15).在以前,大多操作系统需要一 ...
SpringBoot原理深入及源码剖析（一）依赖管理及自动配置
前言传统的Spring框架实现一个Web服务需要导入各种依赖jar包,然后编写对应的XML配置文件等,相较而言,SpringBoot显得更加方便.快捷和高效.那么,SpringBoot究竟是如何做到 ...
编译原理-一种词法分析器LEX原理
1.将所有单词的正规集用正规式描述 2.用正规式到NFA的转换算得到识别所有单词用NFA 3.用NFA到DFA的转换算法得到识别所有单词用DFA 4.将DFA的状态转换函数表示成二维数组并与DF ...
day05对象和类
day06作业: 第一题:分析以下需求,并用代码实现手机类Phone 属性: 品牌brand 价格price 行为: 打电话call() 发短信sendMessage() 玩游戏playGame() ...
超赞！IDEA 最新版本，支持免打扰和轻量模式！
IntelliJ IDEA 2020.1 的第二个早期访问版本已发布,新的 EAP 构建对调试器和事件探查器(Profiler)进行了改进,并引入了新的提交工具窗口(Commit toolwindow ...
Kubernetes集群安装
一.环境介绍主机名 IP地址 master 192.168.0.100 node1 192.168.0.101 node2 192.168.0.102 1.1.操作系统: CensOS8.4.210 ...

Ajax爬取动态数据和HTTPS自动默认证书

Ajax爬取动态数据和HTTPS自动默认证书的更多相关文章

随机推荐

热门专题