pyspider使用

#!/usr/bin/env python

# -*- encoding: utf-8 -*-

# Created on 2018-11-08 22:33:55

# Project: qsbk

from pyspider.libs.base_handler import *

from lxml import html

from urlparse import urljoin

import datetime

class Handler(BaseHandler):

    crawl_config = {

    }

    def __init__(self):

        self.start_url='https://www.qiushibaike.com/'

    @every(minutes=24 * 60)

    def on_start(self):

        self.crawl(self.start_url, callback=self.index_page)

    @config(age=10 * 24 * 60 * 60)

    def index_page(self, response):

        root=html.fromstring(response.content.decode('utf-8'))

        content_left_node = root.xpath("//div[@id='content-left']")

        div_node_list = content_left_node[0].xpath("./div")

        tasks=[]

        for div_node in div_node_list:

            title_node = div_node.xpath(

                ".//div[@class='author clearfix']/a[contains(@onclick,'web-list-author-text')]/h2/text()")

            __content_url =div_node.xpath("./a[@class='contentHerf']/@href")

            content_url = urljoin(self.start_url, __content_url[0])

            content_node = div_node.xpath(".//div[@class='content']/span[1]")

            content = content_node[0].xpath('string(.)')

            name = title_node[0]

            info = ''.join(content)

            crawldate = datetime.datetime.now().strftime('%Y-%m-%d %H:%M:%S')

            item = {}

            item['name'] = name.strip() if name else name

            item['info'] = info.strip() if info else info

            item['crawldate'] = crawldate

            item['url'] = content_url

            tasks.append(item)

        return {'data':tasks}

pyspider使用的更多相关文章

用pyspider爬淘宝MM照片
#!/usr/bin/env python # -*- encoding: utf-8 -*- # Created on 2016-12-09 15:24:54 # Project: taobaomm ...
Python爬虫进阶二之PySpider框架安装配置
关于首先,在此附上项目的地址,以及官方文档 PySpider 官方文档安装 1. pip 首先确保你已经安装了pip,若没有安装,请参照 pip安装 2. phantomjs PhantomJS ...
pyspider爬豆瓣电影实例
直接copy官网实例会出现599的错误,百度了很久发现是因为证书的问题添加这一句忽略证书 validate_cert = False 代码如下: ++++++++++++++++++++++++++ ...
pyspider 简单应用之快速问医生药品抓取（一）
网址:http://yp.120ask.com/search/-0-0--0-0-0-0.html from pyspider.libs.base_handler import * class Han ...
Ubuntu下配置Pyspider环境
Ubuntu 14.04.4 LTS 1.ubuntu 系统自带Python 所以不用安装Python 注:安装前先更新下软件源命令 :sudo apt-get update 2.开始安装pip 命 ...
pyspider安装
官方文档上说的比较简单: pip install pyspider 但是实际安装时还是有些问题导致无法成功. windows下安装先安装PhantomJS 可以依照自己的开发平台选择不同的包进行下载 ...
安装pyspider
费了三个小时,换了很多版本的Python pip lxml,最终选择安装anaconda2 非常顺利运行pyspider后localhost:500正常显示开森
python3.4学习笔记(十三) 网络爬虫实例代码，使用pyspider抓取多牛投资吧里面的文章信息，抓取政府网新闻内容
python3.4学习笔记(十三) 网络爬虫实例代码,使用pyspider抓取多牛投资吧里面的文章信息PySpider:一个国人编写的强大的网络爬虫系统并带有强大的WebUI,采用Python语言编写 ...
【转】CentOS 6.5安装pyspider过程记录
原文地址:http://blog.sina.com.cn/s/blog_48c95a190102wczx.html 1.根据pyspider官方推荐的安装方法,使用pip命令直接安装pyspider ...
centos安装lxml和pyspider
yum -y install --nogpgcheck python34u-devel.x86_64 yum -y install libcurl-devel yum -y install libxs ...

随机推荐

Canvas与javaScript特效笔记
第六章 Canvas与javaScript特效笔记 q <canvas>标签的用途 HTML5 canvas 提供了通过 JavaScript 绘制图形的方法,此方法使用简单但功能强 ...
【CF960G】Bandit Blues（第一类斯特林数,FFT）
[CF960G]Bandit Blues(第一类斯特林数,FFT) 题面洛谷 CF 求前缀最大值有\(a\)个,后缀最大值有\(b\)个的长度为\(n\)的排列个数. 题解完完全全就是[FJOI] ...
Python面向对象编程和模块
在面向对象编程中,你编写表示现实世界中的事物和情景的类,并基于这些类来创建对象. 编写类时,你定义一大类对象都有的通用行为.基于类创建对象时,每个对象都自动具备这种通用行为,然后根据需要赋予每个对象独 ...
windows下用bat启动jar包，修改cmd标题（title)
新建start.bat,输入以下内容即可. @echo off title myprogress-%date%-%time%-%cd% java -jar myprogress.jar
A1096. Consecutive Factors
Among all the factors of a positive integer N, there may exist several consecutive numbers. For exam ...
[luoguU42591][小T的绝对值]
luoguU42592 20分思路对给出的序列求出前缀和,然后\(n^2\)暴力枚举即可拿到第一档分 40分思路对于数列中的数都相同的情况.只需要特判即可.只要特别注意全都是0的情况即可. 100 ...
（转）Maven中的DependencyManagement和pluginmanagement
背景:最近在学习maven的多模块构建过程中看到DependencyManagement选项,对这个选项的使用做个记录! 区别与联系这里介绍一个在父项目中的根结点中声明dependencyManag ...
python数据类型(二)
跟着慕课网练习的,一些简单的知识点如下
csp20140904最优配餐_Solution
Solution 经典bfs,所有的点到店的最短距离其中一开始队列的长度为店的数目一个点可能有多个订单关于数据大小: 1.1000*(1000*1000)*2000=2,0000,0000,00 ...
虚拟化技术之KVM
虚拟化技术之KVM 作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.什么是虚拟化其实虚拟化技术已经不是一个新技术了,上个世纪六十年代IBM公司已经在使用,只不过后来(上个世纪八 ...

pyspider使用

pyspider使用的更多相关文章

随机推荐

热门专题