Scrapy框架Crawler模板爬虫

1、创建一个CrawlerSpider

scrapy genspider -t crawl wx_spider 'wxapp-union.com'

#导入规则

from scrapy.spiders import Rule,CrawlSpider

from scrapy.linkextractors import LinkExtractor

2、Rule规则

class scrapy.spiders.Rule(

    link_extractor,#一个LinkExtractor对象，用于定义爬取规则

    callback，#满足这个规则的url执行的回调函数 【注意】：不要使用parse函数，因为Crawlspider征用了

    follow,#指定根据该规则从response又提取出类似链接要不要继续跟进, 默认为True

    process_link，#从link_extractor中获取到的链接会传递给这个函数，用于过滤不需要爬取的链接

)

3、LinkExtractor提取器

class scrapy.linkextractors.LinkExtractor(

    allow=(),#允许的url，满足这个正则表达式的url都会被提取

    deny=(),#不允许的url

    allow_domains=(),#允许的域名

    deny_domains=(),#禁止的域名

    restrict_xpaths=(),#严格的xpath，与allow共同过滤

    unique=True/False，#链接是否去重

)

示例（抓取微信小程序社区）

class WxSpiderSpider(CrawlSpider):

    name = 'wx_spider'

    allowed_domains = ['wxapp-union.com']

    start_urls = ['http://www.wxapp-union.com/portal.php?mod=list&catid=2&page=1']

    rules = (

        Rule(LinkExtractor(allow=r'.+mod=list&catid=2&page=\d'), follow=True),#定义页面抓取规则，这里允许跟进

        Rule(LinkExtractor(allow=r'.+/article-.+\.html'),callback = "parse_detail_page", follow=False)#定义内容抓取规则，这里不允许跟进，也就是内容页上的类似链接不跟进

    )

    def parse_detail_page(self, response):

        title = response.xpath('//h1[@class="ph"]/text()').get()

        content =response.xpath('//td[@id="article_content"]//text()').getall()

        content = ''.join(content)

        author_p = response.xpath('//p[@class="authors"]')

        author=author_p.xpath('.//a/text()').get()

        pub_time=author_p.xpath('.//span/text()').get()

        yield WxappItem(title=title,author=author,pub_time=pub_time,content=content)

Scrapy框架Crawler模板爬虫的更多相关文章

Scrapy框架——CrawlSpider类爬虫案例
Scrapy--CrawlSpider Scrapy框架中分两类爬虫,Spider类和CrawlSpider类. 此案例采用的是CrawlSpider类实现爬虫. 它是Spider的派生类,Spide ...
python学习之-用scrapy框架来创建爬虫(spider)
scrapy简单说明 scrapy 为一个框架框架和第三方库的区别: 库可以直接拿来就用, 框架是用来运行,自动帮助开发人员做很多的事,我们只需要填写逻辑就好命令: 创建一个项目 : cd 到需 ...
如何使用Scrapy框架实现网络爬虫
现在用下面这个案例来演示如果爬取安居客上面深圳的租房信息,我们采取这样策略,首先爬取所有租房信息的链接地址,然后再根据爬取的地址获取我们所需要的页面信息.访问次数多了,会被重定向到输入验证码页面,这个 ...
scrapy框架修改单个爬虫的配置,包括下载延时，下载超时设置
在一个框架里面有多个爬虫时,每个爬虫的需求不相同,例如,延时的时间,所以可以在这里配置一下custom_settings = {},大括号里面写需要修改的配置,然后就能把settings里面的配置给覆 ...
一个基于Scrapy框架的pixiv爬虫
源码 https://github.com/vicety/Pixiv-Crawler,功能什么的都在这里介绍了说几个重要的部分吧登录部分困扰我最久的部分,网上找的其他pixiv爬虫的登录方式大多 ...
python基于scrapy框架的反爬虫机制破解之User-Agent伪装
user agent是指用户代理,简称 UA. 作用:使服务器能够识别客户使用的操作系统及版本.CPU 类型.浏览器及版本.浏览器渲染引擎.浏览器语言.浏览器插件等. 网站常常通过判断 UA 来给不同 ...
基于scrapy框架的分布式爬虫
分布式概念:可以使用多台电脑组件一个分布式机群,让其执行同一组程序,对同一组网络资源进行联合爬取. 原生的scrapy是无法实现分布式调度器无法被共享管道无法被共享基于 scrapy+redi ...
scrapy框架与python爬虫
关于使用scrapy框架编写爬虫以及Ajax动态加载问题、反爬问题解决方案
Python爬虫总结总的来说,Python爬虫所做的事情分为两个部分,1:将网页的内容全部抓取下来,2:对抓取到的内容和进行解析,得到我们需要的信息. 目前公认比较好用的爬虫框架为Scrapy,而且 ...

随机推荐

shell脚本练习06
######################################################################### # File Name: -.sh # Author ...
wpf 纯样式写按钮
 <LinearGradientBrush x:Key="LinearGradientBlueBackground" EndPoint ...
Python基础知识之4——三大控制结构
控制结构就是控制程序执行顺序的结构. Python 有三大控制结构,分别是顺序结构.分支结构(选择结构)以及循环结构.任何一个项目或者算法都可以使用这三种结构来设计完成.这三种控制结构也是结构化程序 ...
Python全栈开发：Ajax全套
概述对于WEB应用程序:用户浏览器发送请求,服务器接收并处理请求,然后返回结果,往往返回就是字符串(HTML),浏览器将字符串(HTML)渲染并显示浏览器上. 1.传统的Web应用一个简单操作需要 ...
使用vue-cli3快速适配H5项目
跟我老大学到了一招使用vue-cli3快速适配H5项目的方法. 我之前也有进行一个版本的适配,直接使用cnpm install -g vue-cli,然后安装各种插件进行适配,见我之前的博客. 后来老 ...
field方法属于模型的连贯操作方法之一
field方法属于模型的连贯操作方法之一,主要目的是标识要返回或者操作的字段,可以用于查询和写入操作. 1.用于查询指定字段在查询操作中field方法是使用最频繁的. $Model->fie ...
linux 每天一个命令
Nginx [emerg]: bind() to 0.0.0.0:80 failed (98: Address already in use) 使用命令关闭占用80端口的程序 sudo fuser ...
【源码】PyObject_VAR_HEAD 定长对象变长对象
PyObject_VAR_HEAD Python-3.7.4\Include\object.h /* PyObject_VAR_HEAD defines the initial segm ...
IDEA如何像Eclipse打开多个项目？
简述: 不能采用open方式,得采用 import module方式 (多个项目,可以不再同一个根目录下,真正的类似eclipse方式打开多个项目) 具体操作步骤: 1.选择一个maven项目,右键选 ...
WhaleCTF之隐写-Find
WhaleCTF之隐写-Find 前往题目图片保存到本地,用Stegsolve打开图片找到二维码用微信或qq扫描,得到flag~

Scrapy框架Crawler模板爬虫

1、创建一个CrawlerSpider

2、Rule规则

3、LinkExtractor提取器

示例（抓取微信小程序社区）

Scrapy框架Crawler模板爬虫的更多相关文章

随机推荐

热门专题