scrapy爬虫实例(1)

爬虫实例

对象阳光问政平台
目标 : 主题,时间,内容
爬取思路

预先设置好items

import scrapy

class SuperspiderItem(scrapy.Item):

    title = scrapy.Field()

    date = scrapy.Field()

    content = scrapy.Field()

爬取范围和start_url

class Spider1Spider(scrapy.Spider):

    name = 'spider1'

    allowed_domains = ['http://wz.sun0769.com/']

    start_urls = ['http://wz.sun0769.com/html/top/report.shtml']

parse实现三大大功能抓取具体内容url链接和下一页url链接,并提取title和date

    def parse(self, response):

        tr_list = response.xpath("//div[@class='newsHead clearfix']/table[2]//tr")

        for tr in tr_list:

            items = SuperspiderItem()

            items['title'] = tr.xpath("./td[3]/a[1]/@title").extract_first()  ##### 提取title  用xpath

            items['date'] = tr.xpath("./td[6]//text()").extract_first()    #### 同样的方法提取date

            content_href = tr.xpath("./td[3]/a[1]/@href").extract_first()   #### 提取内容链接

  ####---将提取的内容链接交给下一个函数,并将date和title也交给下一个函数最终数据统一处理---#########

  ####---有关yiled----####----content_url传url链接,callback指定回调函数----####

            yield scrapy.Request(

                content_href,

                callback=self.get_content,

     ####----meta-可以将数据转移----####

     ####----一个类字典的数据类型----####

                meta={

                    'date': items['date'],

                    'title': items['title']

                      }

            )

        new_url = response.xpath("//div[contains(@align,'center')]//@href").extract()

        print(new_url[-2])

        if "page="+str(page_num*30) not in new_url[-2]:

   ####---指明爬取的页数---####

            yield scrapy.Request(

                new_url[-2],

                callback=self.parse

            )

第二个函数

-汇集所有的函数并传给piplines

    def get_content(self, response):

        items = SuperspiderItem()

        items['date'] = response.meta['date']

        items['title'] = response.meta['title']

        items['content'] = response.xpath("//td[@class='txt16_3']/text()").extract_first()

        yield items

piplines里面并没做什么.因为没对数据进行什么处理,只是简单的将数据打印

class SuperspiderPipeline(object):

    def process_item(self, item, spider):

        items = item

        print('*'*100)

        print(items['date'])

        print(items['title'])

        print(items['content'])

完整代码

items里面的部分



import scrapy

class SuperspiderItem(scrapy.Item):

    title = scrapy.Field()

    date = scrapy.Field()

    content = scrapy.Field()

spider代码

# -*- coding: utf-8 -*-

import scrapy

from superspider.items import SuperspiderItem

page_num = 3

class Spider1Spider(scrapy.Spider):

    name = 'spider1'

    allowed_domains = ['wz.sun0769.com']

    start_urls = ['http://wz.sun0769.com/html/top/report.shtml']

    def parse(self, response):

        tr_list = response.xpath("//div[@class='newsHead clearfix']/table[2]//tr")

        for tr in tr_list:

            items = SuperspiderItem()

            items['title'] = tr.xpath("./td[3]/a[1]/@title").extract_first()

            items['date'] = tr.xpath("./td[6]//text()").extract_first()

            content_href = tr.xpath("./td[3]/a[1]/@href").extract_first()

            yield scrapy.Request(

                content_href,

                callback=self.get_content,

                meta={

                    'date': items['date'],

                    'title': items['title']

                      }

            )

        new_url = response.xpath("//div[contains(@align,'center')]//@href").extract()

        print(new_url[-2])

        if "page="+str(page_num*30) not in new_url[-2]:

            yield scrapy.Request(

                new_url[-2],

                callback=self.parse

            )

    def get_content(self, response):

        items = SuperspiderItem()

        items['date'] = response.meta['date']

        items['title'] = response.meta['title']

        items['content'] = response.xpath("//td[@class='txt16_3']/text()").extract_first()

        yield items

piplines代码

class SuperspiderPipeline(object):

    def process_item(self, item, spider):

        items = item

        print('*'*100)

        print(items['date'])

        print(items['title'])

        print(items['content'])

中间遇到的问题

爬取范围写错而日志等级又设置为warning,导致找不出问题
yield相关内容不清楚
要先导入并初始化一个SuperspiderItem()(加括号)
piplines中不需要导入SuperspiderItem()
extract()忘写
xpath://div[contains(@align,'center')注意写法
- 找到一篇xpath定位的博文

scrapy爬虫实例(1)的更多相关文章

简单scrapy爬虫实例
简单scrapy爬虫实例流程分析抓取内容:网站课程页面:https://edu.hellobi.com 数据:课程名.课程链接及学习人数观察页面url变化规律以及页面源代码帮助我们获取所有数据 ...
Scrapy爬虫实例——校花网
学习爬虫有一段时间了,今天使用Scrapy框架将校花网的图片爬取到本地.Scrapy爬虫框架相对于使用requests库进行网页的爬取,拥有更高的性能. Scrapy官方定义:Scrapy是用于抓取网 ...
Scrapy爬虫实例教程（二）---数据存入MySQL
书接上回实例教程(一) 本文将详细描述使用scrapy爬去左岸读书所有文章并存入本地MySql数据库中,文中所有操作都是建立在scrapy已经配置完毕,并且系统中已经安装了Mysql数据库(有权限操 ...
Scrapy 爬虫实例教程（一）---简介及资源列表
Scrapy(官网 http://scrapy.org/)是一款功能强大的,用户可定制的网络爬虫软件包.其官方描述称:" Scrapy is a fast high-level screen ...
python scrapy 爬虫实例
1 创建一个项目 scrapy startproject basicbudejie 2 编写爬虫 import scrapy class Basicbudejie(scrapy.Spider): na ...
Python Scrapy 爬虫框架实例（一）
之前有介绍 scrapy 的相关知识,但是没有介绍相关实例,在这里做个小例,供大家参考学习. 注:后续不强调python 版本,默认即为python3.x. 爬取目标这里简单找一个图片网站,获取图片 ...
Python Scrapy 爬虫框架实例
之前有介绍 scrapy 的相关知识,但是没有介绍相关实例,在这里做个小例,供大家参考学习. 注:后续不强调python 版本,默认即为python3.x. 爬取目标这里简单找一个图片网站,获取图片 ...
转：Scrapy安装、爬虫入门教程、爬虫实例（豆瓣电影爬虫）
Scrapy在window上的安装教程见下面的链接:Scrapy安装教程上述安装教程已实践,可行.(本来打算在ubuntu上安装Scrapy的,但是Ubuntu 磁盘空间太少了,还没扩展磁盘空间,所 ...
Scrapy安装、爬虫入门教程、爬虫实例（豆瓣电影爬虫）
Scrapy在window上的安装教程见下面的链接:Scrapy安装教程上述安装教程已实践,可行.(本来打算在ubuntu上安装Scrapy的,但是Ubuntu 磁盘空间太少了,还没扩展磁盘空间,所 ...

随机推荐

spring bean的装载过程简略赏析
spring一个bean的容器,它从这个最基本的功能进而扩展出AOP,transaction,cache,schedule,data等等,将业务与框架代码解耦,让我们可以将大部分精力投入到业务代码中, ...
mongodb的更新语句
MongoDB 使用 update() 和 save() 方法来更新集合中的文档: update()方法: update() 方法用于更新已存在的文档.语法格式如下: db.collection.up ...
Reactor模式和Proactor模式
Reactor 主线程往epoll内核事件表中注册socket上的读就绪事件主线程调用epoll_wait等待socket上有数据可读当socket上有数据可读时,epoll_wait通知主线程, ...
3.用IntelliJ IDEA 创建Maven
一.File→New→ Project (需要下载安装配置Maven等,这些步骤省略) 二.Maven→org.apache.maven.archetypes:maven-archetype-quic ...
python之openpyxl模块（最全总结足够初次使用）
openpyxl模块 Python_Openpyxl 1. 安装 pip install openpyxl 2. 打开文件 ① 创建 from openpyxl import Workbook # 实 ...
H - 覆盖的面积(线段树-线段扫描 + 离散化(板题))
给定平面上若干矩形,求出被这些矩形覆盖过至少两次的区域的面积. Input 输入数据的第一行是一个正整数T(1<=T<=100),代表测试数据的数量.每个测试数据的第一行是一个正整数N(1 ...
Vue引用阿里图标库
首先进入官网http://www.iconfont.cn/ 转载:https://blog.csdn.net/qq_34802010/article/details/81451278 选择图标库在里 ...
springboot 启动时执行方法
Springboot提供了两种“开机启动”某些方法的方式:ApplicationRunner和CommandLineRunner.下面简单介绍下ApplicationRunner 1.创建个Tests ...
Python内置函数分类汇总
Python解释器内置了很多函数,这些内置函数使用方便,无需导入,直接调用.可以在交互模式下输入dir(__builtins__),输出的列表中包含了所有的内置函数: 1.可迭代对象.序列操作相关 ...
整数逆序输出 Python
输入形式:123 输出形式:321 输入形式:120 输出形式:21 (整数不能以0打头) 输入形式:-123 输出形式:-321 代码: a=int(input()) b=0 if a<0 ...

scrapy爬虫实例(1)

爬虫实例

完整代码

中间遇到的问题

scrapy爬虫实例(1)的更多相关文章

随机推荐

热门专题