scrapy爬虫系列之四--爬取列表和详情

功能点：如何爬取列表页，并根据列表页获取详情页信息？

爬取网站：东莞阳光政务网

完整代码：https://files.cnblogs.com/files/bookwed/yangguang.zip

主要代码：

yg.py

import scrapy

from yangguang.items import YangguangItem

class YgSpider(scrapy.Spider):

    name = 'yg'

    allowed_domains = ['sun0769.com']

    start_urls = ['http://wz.sun0769.com/index.php/question/report']

    def parse(self, response):

        tr_list = response.xpath("//div[@class='greyframe']/table[2]//tr")

        for tr in tr_list:

            item = YangguangItem()

            item["title"] = tr.xpath("./td[2]/a[2]/text()").extract_first()

            item["href"] = tr.xpath("./td[2]/a[2]/@href").extract_first()

            item["status"] = tr.xpath("./td[3]/span/text()").extract_first()

            item["publish_time"] = tr.xpath("./td[last()]/text()").extract_first()

            if type(item["href"]) == str:

                # 请求详情页

                yield scrapy.Request(

                    item["href"],

                    callback=self.parse_detail,

                    meta={"item": item}

                )

        # 翻页

        next_url = response.xpath("//a[text()='>']/@href").extract_first()

        if next_url is not None:

            yield scrapy.Request(next_url, callback=self.parse)

    # 解析详情页

    def parse_detail(self, response):

        item = response.meta["item"]

        # 获取详情页的内容、图片

        item["content"] = response.xpath("//div[@class='wzy1']/table[2]//tr[1]/td[@class='txt16_3']/text()").extract()

        item["content_image"] = response.xpath("//div[@class='wzy1']/table[2]//tr[1]/td[@class='txt16_3']//img/@src").extract()

        item["content_image"] = ["http://wz.sun0769.com"+i for i in item["content_image"]]

        yield item  # 对返回的数据进行处理

pipelines.py

class YangguangPipeline(object):

    def __init__(self):

        self.f = open('yangguang.json', 'w', encoding='utf-8')

    def process_item(self, item, spider):

        item["content"] = self.process_content(item["content"])

        self.f.write(json.dumps(dict(item), ensure_ascii=False) + ',\n')

        return item

    def process_content(self, content):

        # 对内容项里的\xa0 和 空白字符替换为空

        content = [re.sub(r"\xa0|\s", "", i) for i in content]

        # 对替换过的空字符串去除

        content = [i for i in content if len(i) > 0]

        return content

scrapy爬虫系列之四--爬取列表和详情的更多相关文章

Scrapy爬虫框架之爬取校花网图片
Scrapy Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 其可以应用在数据挖掘,信息处理或存储历史数据等一系列的程序中.其最初是为了页面抓取 (更确切来说, 网络抓取 )所设 ...
scrapy爬虫系列之三--爬取图片保存到本地
功能点:如何爬取图片,并保存到本地爬取网站:斗鱼主播完整代码:https://files.cnblogs.com/files/bookwed/Douyu.zip 主要代码: douyu.py im ...
windows下使用python的scrapy爬虫框架，爬取个人博客文章内容信息
scrapy作为流行的python爬虫框架,简单易用,这里简单介绍如何使用该爬虫框架爬取个人博客信息.关于python的安装和scrapy的安装配置请读者自行查阅相关资料,或者也可以关注我后续的内容. ...
Python爬虫系列之爬取美团美食板块商家数据（二）
今天为大家重写一个美团美食板块小爬虫,说不定哪天做旅游攻略的时候也可以用下呢.废话不多说,让我们愉快地开始吧~ 开发工具 Python版本:3.6.4 相关模块: requests模块: argpar ...
Python爬虫系列之爬取美团美食板块商家数据（一）
主要思路目的: 根据输入的城市名,爬取该城市美团美食板块所有商家的数据.数据包括: 店名.评分.评论数量.均价.地址, 并将这些数据存入Excel中. 最后尝试对爬取到的数据做一个简单的分析. 克服 ...
python爬虫系列之爬取多页gif图像
python爬取多页gif图像作者:vpoet mail:vpoet_sir@163.com #coding:utf-8 import urllib import ur ...
2019基于python的网络爬虫系列，爬取糗事百科
**因为糗事百科的URL改变,正则表达式也发生了改变,导致了网上许多的代码不能使用,所以写下了这一篇博客,希望对大家有所帮助,谢谢!** 废话不多说,直接上代码. 为了方便提取数据,我用的是beaut ...
[Python爬虫] scrapy爬虫系列 <一>.安装及入门介绍
前面介绍了很多Selenium基于自动测试的Python爬虫程序,主要利用它的xpath语句,通过分析网页DOM树结构进行爬取内容,同时可以结合Phantomjs模拟浏览器进行鼠标或键盘操作.但是,更 ...
scrapy爬虫系列之开头--scrapy知识点
介绍:Scrapy是一个为了爬取网站数据.提取结构性数据而编写的应用框架,我们只需要实现少量的代码,就能够快速抓取.Scrapy使用了Twisted异步网络框架,可以加快我们的下载速度. 0.说明: ...

随机推荐

C++编程 - tuple、any容器
C++编程 - tuple.any容器 flyfish 2014-10-29 一 tuple tuple是固定大小的容器,每一个元素类型能够不同作用1 替换struct struct t1 { in ...
一、Open CV3.0.0 与 VS2012配置
原创:博乐Bar,转载请注明出处. 第一步,准备软件及开发环境 1.OpenCV 3.0.0 下载地址:http://www.opencv.org.cn/index.php/Download ,下载最 ...
简单html弹窗
css: <style type="text/css"> .moneyrecord { display:none; border:0.5em solid #00AAEE ...
mac Virtualbox Ubuntu 设置共享目录
如果要用VirtualBox自带的共享文件夹功能,必须先安装Guest Additions.安装方法:置顶的菜单条->devices->Install Guest Additions.点击 ...
[转]SQL注入漏洞及绑定变量浅谈
1.一个问题引发的思考大家在群里讨论了一个问题,奉文帅之命写篇作文,且看: String user_web = "user_web" String sql = "upd ...
如何在浏览器控制台(console)里输出彩色样式调试信息
console.log(XX,XX,XX) log 的第一个参数声明第二.第三个参数的作用,第二个参数就是样式,第三个参数是要输出的字符串 console.log("%c%s", ...
Java任务调度开源框架quartz学习
一.quartz学习 Java框架介绍:Quartz从入门到进阶 http://edu.yesky.com/edupxpt/233/2209233.shtml 1.例子:http://javacraz ...
安装并配置ROS环境1
ros学习之路(原创博文,转载请标明出处-周学伟http://www.cnblogs.com/zxouxuewei/) 一.ros核心教程 1.安装并配置ROS环境: 注意: 学习这节课之前请按 ...
rac_grid自检提示缺少cvuqdisk包
原创作品,出自 "深蓝的blog" 博客,欢迎转载.转载时请务必注明下面出处.否则追究版权法律责任. 深蓝的blog:http://blog.csdn.net/huangyanlo ...
Python 字符串处理（转）
转自:黄聪:Python 字符串操作(替换.删除.截取.复制.连接.比较.查找.包含.大小写转换.分割等) http://www.cnblogs.com/huangcong/archive/2011/ ...

scrapy爬虫系列之四--爬取列表和详情

scrapy爬虫系列之四--爬取列表和详情的更多相关文章

随机推荐

热门专题