Link Extractors

Link Extractors 是那些目的仅仅是从网页(scrapy.http.Response 对象)中抽取最终将会被follow链接的对象｡

Scrapy默认提供2种可用的 Link Extractor, 但你通过实现一个简单的接口创建自己定制的Link Extractor来满足需求｡

每个LinkExtractor有唯一的公共方法是 extract_links ,它接收一个 Response 对象,并返回一个 scrapy.link.Link 对象｡Link Extractors,要实例化一次并且 extract_links 方法会根据不同的response调用多次提取链接｡

Link Extractors在 CrawlSpider 类(在Scrapy可用)中使用, 通过一套规则,但你也可以用它在你的Spider中,即使你不是从 CrawlSpider 继承的子类, 因为它的目的很简单: 提取链接｡

上面都是官网解释，看看就行了，这个Rule啊其实就是为了爬取全站内容的写法，首先我们继承的就不是scrapy.spider类了，而是继承CrawlSpider这个类，看源码就回明白CrawlSpider这个类也是继承scrapy.spider类。

　　具体参数：

　　allow：这里用的是re过滤，我们其实就是start_urls加上我们这个匹配到的具体链接下的内容。　 LinkExtractor：故名思议就是链接的筛选器，首先筛选出来我们需要爬取的链接。

　　deny：这个参数跟上面的参数刚好想反，定义我们不想爬取的链接。

　　follow：默认是false，爬取和start_url符合的url。如果是True的话，就是爬取页面内容所有的以start_urls开头的url。

　　restrict_xpaths：使用xpath表达式，和allow共同作用过滤链接。还有一个类似的restrict_css

　　callback：定义我们拿到可以爬取到的url后，要执行的方法，并传入每个链接的response内容（也就是网页内容）

　　注意：rule无论有无callback，都由同一个_parse_response函数处理，只不过他会判断是否有follow和callback

from scrapy.spiders.crawl import Rule, CrawlSpider

from scrapy.linkextractors import LinkExtractor

示例：

from whole_website.items import DoubanSpider_Book

from scrapy.spiders.crawl import Rule, CrawlSpider

from scrapy.linkextractors import LinkExtractor

class DoubanSpider(CrawlSpider):

    name = "douban"

    allowed_domains = ["book.douban.com"]

    start_urls = ['https://book.douban.com/']

    rules = [

        Rule(LinkExtractor(allow='subject/\d+'),callback='parse_items)

    ]

    def parse_items(self, response):

        items = DoubanSpider_Book()

        items['name'] = response.xpath('//*[@id="wrapper"]/h1/span/text()').extract_first()

        items['author'] = response.xpath('//*[@id="info"]//a/text()').extract()

        data = {'book_name':items['name'],

                'book_author':items['author']

                }

        print(data)

参考地址：http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/link-extractors.html

python爬虫scrapy之rules的基本使用的更多相关文章

python爬虫scrapy框架——人工识别登录知乎倒立文字验证码和数字英文验证码(2)
操作环境:python3 在上一文中python爬虫scrapy框架--人工识别知乎登录知乎倒立文字验证码和数字英文验证码(1)我们已经介绍了用Requests库来登录知乎,本文如果看不懂可以先看之前 ...
python爬虫Scrapy(一)-我爬了boss数据
一.概述学习python有一段时间了,最近了解了下Python的入门爬虫框架Scrapy,参考了文章Python爬虫框架Scrapy入门.本篇文章属于初学经验记录,比较简单,适合刚学习爬虫的小伙伴. ...
python爬虫scrapy项目详解（关注、持续更新）
python爬虫scrapy项目(一) 爬取目标:腾讯招聘网站(起始url:https://hr.tencent.com/position.php?keywords=&tid=0&st ...
[Python爬虫] scrapy爬虫系列 <一>.安装及入门介绍
前面介绍了很多Selenium基于自动测试的Python爬虫程序,主要利用它的xpath语句,通过分析网页DOM树结构进行爬取内容,同时可以结合Phantomjs模拟浏览器进行鼠标或键盘操作.但是,更 ...
Python爬虫Scrapy框架入门（0）
想学习爬虫,又想了解python语言,有个python高手推荐我看看scrapy. scrapy是一个python爬虫框架,据说很灵活,网上介绍该框架的信息很多,此处不再赘述.专心记录我自己遇到的问题 ...
安装python爬虫scrapy踩过的那些坑和编程外的思考
这些天应朋友的要求抓取某个论坛帖子的信息,网上搜索了一下开源的爬虫资料,看了许多对于开源爬虫的比较发现开源爬虫scrapy比较好用.但是以前一直用的java和php,对python不熟悉,于是花一天时 ...
Python 爬虫-Scrapy爬虫框架
2017-07-29 17:50:29 Scrapy是一个快速功能强大的网络爬虫框架. Scrapy不是一个函数功能库,而是一个爬虫框架.爬虫框架是实现爬虫功能的一个软件结构和功能组件集合.爬虫框架是 ...
python爬虫scrapy学习之篇二
继上篇<python之urllib2简单解析HTML页面>之后学习使用Python比较有名的爬虫scrapy.网上搜到两篇相应的文档,一篇是较早版本的中文文档Scrapy 0.24 文档, ...
python爬虫scrapy命令工具学习之篇三
命令行工具(Command line tools) 全局命令 startproject settings runspider shell fetch view version 项目命令 crawl c ...

随机推荐

图上最短路(Dijkstra, spfa)
单源最短路径题目描述如题,给出一个有向图,请输出从某一点出发到所有点的最短路径长度. 输入输出格式输入格式: 第一行包含三个整数N.M.S,分别表示点的个数.有向边的个数.出发点的编号. 接下来 ...
转://Oracle中定义者权限和调用者权限案例分析
定义者权限:定义者权限指使用它所有者的权限,而不是当前用户来执行过程.因此,你可以限制用户执行的数据库操作,允许他们仅通过运行定义者权限的过程和函数访问数据.创建过程.函数和程序包的默认权限是定义者权 ...
python3 迭代器
''' 迭代:重复的过程,并且每次迭代的结果都是下次迭代的初始值可迭代的 Iterable 迭代器 Iterator iter(数据) == 数据.__iter__() 将数据转换为迭代器 next ...
SkylineGlobe 7.0版本矢量数据查询示例代码
在Pro7.0.0和7.0.1环境下测试可用. <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" ...
for或者while的标记循环
for或者while的标记循环今天在写代码的时候,发现一个for循环前有一个字母,不知道这个是什么语法,后来查了一下,这个语法是用来实现标记循环的功能这个是代码块 r:for(int rowNum ...
开发框架模块视频系列（2）-Winform分页控件介绍
在软件开发过程中,为了节省开发时间,提高开发效率,统一用户处理界面,尽可能使用成熟.功能强大的分页控件,这款Winform环境下的分页控件,集成了数据分页.内容提示.数据打印.数据导出.表头中文转义等 ...
朱晔的互联网架构实践心得S2E4：小议微服务的各种玩法（古典、SOA、传统、K8S、ServiceMesh）
十几年前就有一些公司开始践行服务拆分以及SOA,六年前有了微服务的概念,于是大家开始思考SOA和微服务的关系和区别.最近三年Spring Cloud的大火把微服务的实践推到了高潮,而近两年K8S在容器 ...
Bus Video System CodeForces - 978E （思维）
The busses in Berland are equipped with a video surveillance system. The system records information ...
史上最全原生javascript的知识总结，适合新手及查资料用！
适合右键另存为图片保存,再放大看!
每周分享之cookie详解
本章从JS方向讲解cookie的使用.(实质上后端代码也是差不多用法,无非读取和设置两块) 基本用法:document.cookie="username=pengpeng"; 修改 ...

python爬虫scrapy之rules的基本使用

Link Extractors

python爬虫scrapy之rules的基本使用的更多相关文章

随机推荐

热门专题