pyspider 示例二升级完整版绕过懒加载，直接读取图片

pyspider 示例二升级完整版绕过懒加载，直接读取图片，见【升级写法处】

#!/usr/bin/env python

# -*- encoding: utf-8 -*-

# Created on 2019-04-08 14:24:34

# Project: qunaer

from pyspider.libs.base_handler import *

class Handler(BaseHandler):

    crawl_config = {

    }

    @every(minutes=24 * 60)

    def on_start(self):

        self.crawl('https://travel.qunar.com/travelbook/list.htm', callback=self.index_page,validate_cert=False)

    @config(age=10 * 24 * 60 * 60)

    def index_page(self, response):

        for each in response.doc('li > .tit>a').items():

            self.crawl(each.attr.href, callback=self.detail_page,validate_cert=False,fetch_type='js',js_viewport_height='')

        next1=response.doc('.next').attr.href

        self.crawl(next1,callback=self.index_page,validate_cert=False)

    @config(priority=2)

    def detail_page(self, response):

        imgs=response.doc('.js_memo_node').find('img')#获取id下的所有（包括多层嵌套的）img标签

        img_list=''                                  #必须事先声明，否则return,img_list时会报引用未事先声明的变量

        for img in imgs.items():

            img_list+=img.attr('data-original')+',' #【升级写法】，绕过懒加载直接读取图片真正地址

                                                    #htm源码<img  data-original="https://tr-osdcp.qunarzz.com/tr-osd-tr-space/img/ee.jpg" src="layz-load">

        return {

            "url": response.url,

            "title": response.doc('title').text(),

            "date":response.doc('li.f_item.when > p > span.data').text(),

            "day":response.doc('li.f_item.howlong > p > span.data').text(),

            "text":response.doc('#b_panel_schedule').text(),

            "img":img_list

        }

#ele-3076663-2 > div.bottom > div.e_img_schedule > div > dl:nth-child(2) > dt > img

pyspider 示例二升级完整版绕过懒加载，直接读取图片的更多相关文章

懒加载 js----例子------图片
转载自:https://www.jianshu.com/p/9b30b03f56c2 懒加载工具类 <script type="text/javascript"> // ...
爬虫（七）图片懒加载技术、selenium和PhantomJS
动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材http://sc.chinaz.com/中的图片数据 #!/usr/bin/env python # -*- coding ...
08.Python网络爬虫之图片懒加载技术、selenium和PhantomJS
引入今日概要图片懒加载 selenium phantomJs 谷歌无头浏览器知识点回顾验证码处理流程今日详情动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材ht ...
JS实现图片懒加载插件
一.前言我在前几篇博客的记录中,有说自己在做一个图片懒加载的功能,然后巴拉巴拉的遇到哪些问题,结果做完了也没对懒加载这个功能做一些记录,所以这篇文章主要针对我所实现的思路,以及代码做个记录,实现不佳 ...
Python网络爬虫之图片懒加载技术、selenium和PhantomJS
引入图片懒加载 selenium phantomJs 谷歌无头浏览器知识点回顾验证码处理流程动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材http://sc.ch ...
爬虫之图片懒加载技术、selenium和PhantomJS
爬虫之图片懒加载技术.selenium和PhantomJS 图片懒加载 selenium phantomJs 谷歌无头浏览器一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材http:/ ...
图片懒加载，Selenium，PhantomJS
引入今日概要图片懒加载 selenium phantomJs 谷歌无头浏览器知识点回顾验证码处理流程今日详情动态数据加载处理一.图片懒加载什么是图片懒加载? 案例分析:抓取站长素材ht ...
基于javascript实现图片懒加载（亲测有效）
这篇文章主要介绍了javascript实现图片懒加载的方法及思路,有时我们需要用懒加载,也就是延迟加载图片的方式,来提高网站的亲和力,需要的朋友可以参考下! 一.定义图片延迟加载也称为懒加载,延迟加 ...
爬虫之图片懒加载技术及js加密
图片懒加载图片懒加载概念: 图片懒加载是一种网页优化技术.图片作为一种网络资源,在被请求时也与普通静态资源一样,将占用网络资源,而一次性将整个页面的所有图片加载完,将大大增加页面的首屏加载时间.为了 ...

随机推荐

【PyQt5-Qt Designer】界面布局
PyQt5 界面布局详谈箱式布局 QHBoxLayout和QVBoxLayout是基本的布局类,它们在水平和垂直方向上排列小部件效果图: from PyQt5.QtCore import Qt f ...
QPS、PV 、RT（响应时间）之间的关系
QPS.PV .RT(响应时间)之间的关系在进行系统性能压测和系统性能优化的时候,会涉及到QPS,PV,RT相关的概念,本文总结一下QPS,PV,RT之间的关系,放在博客备忘,本文参考了之前在淘宝工 ...
InnoDB master thread学习
很久很久没有写博客了,工作比较忙,也没什么时间学习了,恰逢国庆放假,安心的学习一下,其实只是把之前学习过的知识再温习了一下而已.InnoDB 有众多的线程,其中非常核心的就是master thread ...
前端 HTML body标签相关内容常用标签定义列表<dl>
定义列表<dl> 定义列表的作用非常大. <dl>英文单词:definition list,没有属性.dl的子元素只能是dt和dd. <dt>:definition ...
Redis入门到高可用（四）—— Redis的五种数据结构的内部编码
Redis的五种数据结构的内部编码
Ajax与跨域Ajax
Ajax 对于WEB应用程序:用户浏览器发送请求,服务器接收并处理请求,然后返回结果,往往返回就是字符串(HTML),浏览器将字符串(HTML)渲染并显示浏览器上.对于传统的Web应用,一个简单操作需 ...
异常Exception分类
1:编译时被检测异常:只要有是Exception和其子类都是,除了特殊子类RuntimeException体系. 这种问题已但出现,希望在编译时进行检测,让这种问题有对应处理方式 ...
DL中train\dev\test集
转自:https://blog.csdn.net/l8947943/article/details/80328721 training set:训练集是用来训练模型的.遵循训练集大,开发,测试集小的特 ...
如何使用Hive&R从Hadoop集群中提取数据进行分析
一个简单的例子! 环境:CentOS6.5 Hadoop集群.Hive.R.RHive,具体安装及调试方法见博客内文档. 1.分析题目 --有一个用户数据样本(表名huserinfo)10万数据左右: ...
plt.contour 与 plt.contourf
contour:轮廓,等高线 1.为等高线上注明等高线的含义: cs = plt.contour(x, y, z) plt.clabel(cs, inline=True, fontsize=10)#i ...

pyspider 示例二 升级完整版绕过懒加载，直接读取图片

pyspider 示例二 升级完整版绕过懒加载，直接读取图片的更多相关文章

随机推荐

热门专题

pyspider 示例二升级完整版绕过懒加载，直接读取图片

pyspider 示例二升级完整版绕过懒加载，直接读取图片的更多相关文章