scrapy框架之CrawlSpider全站自动爬取

全站数据爬取的方式

　　1.通过递归的方式进行深度和广度爬取全站数据，可参考相关博文（全站图片爬取），手动借助scrapy.Request模块发起请求。

　　2.对于一定规则网站的全站数据爬取，可以使用CrawlSpider实现自动爬取。

CrawlSpider是基于Spider的一个子类。和蜘蛛一样，都是scrapy里面的一个爬虫类，但 CrawlSpider是蜘蛛的子类，子类要比父类功能多，它有自己的都有功能------ 提取链接的功能LinkExtractor（链接提取器）。Spider是所有爬虫的基类，其设计原则只是为了爬取start_url列表中网页，而从爬取到的网页中提取出的url进行继续的爬取工作使用CrawlSpider更合适。

项目创建

#创建工程项目：项目名CrawlSpiderPro可自定义
scrapy startproject CrawlSpiderPro
#切换到当前工程目录下
cd  CrawlSpiderPro
#创建爬虫文件，比普通的爬虫文件多了参数“-t crawl”
scrapy genspider -t crawl crawlSpiderTest www.xxx.com
#开启爬虫项目
scrapy crawl crawlSpiderTest

初始化爬虫文件解析　　

 class CrawlspidertestSpider(CrawlSpider):

     name = 'crawlSpiderTest'

     allowed_domains = ['www.xxx.com']

     start_urls = ['http://www.xxx.com/']

     #爬虫规则rules指定不同的规则解析器，一个Rule就是一个解析规则，可以定义多个

     rules = (

         #Rule是规则解析器；

         # LinkExtractor是连接提取器，提取符合allow规则的完整的url；

         #callback指定当前规则解析器的回调解析函数；

         #follow指定是否将链接提取器继续作用到链接提取器提取出的链接网页；

         Rule(LinkExtractor(allow=r'Items/'), callback='parse_item', follow=True),

     )

     def parse_item(self, response):

         item = {}

         #item['domain_id'] = response.xpath('//input[@id="sid"]/@value').get()

         #item['name'] = response.xpath('//div[@id="name"]').get()

         #item['description'] = response.xpath('//div[@id="description"]').get()

         return item

东莞阳光网(http://wz.sun0769.com/index.php/question/report?page=)全站爬取案例：

　　1.爬虫脚本crawlSpiderTest.py

 # -*- coding: utf-8 -*-

 import scrapy

 from scrapy.linkextractors import LinkExtractor

 from scrapy.spiders import CrawlSpider, Rule

 from CrawlSpiderPro.items import CrawlspiderproItem

 class CrawlspidertestSpider(CrawlSpider):

     name = 'crawlSpiderTest'

     # allowed_domains = ['www.xxx.com']

     start_urls = ['http://wz.sun0769.com/index.php/question/report?page=']

     #爬虫规则rules指定不同的规则解析器，一个Rule就是一个解析规则，可以定义多个

     rules = (

         #Rule是规则解析器；

         # LinkExtractor是连接提取器，提取符合allow规则的完整的url；

         #callback指定当前规则解析器的回调解析函数；

         #follow指定是否将链接提取器继续作用到链接提取器提取出的链接网页；

         #follow不指定默认False;

         Rule(LinkExtractor(allow=r'page=\d+'), callback='parse_item', follow=False),#提取页码

         Rule(LinkExtractor(allow=r'question/\d+/\d+.shtml'), callback='parse_detail'),#提取详细信息页面

     )

     def parse_item(self, response):

         print(response)

         item = CrawlspiderproItem()

         tr_list=response.xpath('//*[@id="morelist"]/div/table[2]/tbody/tr/td/table/tbody/tr')

         for tr in tr_list:

             item['identifier']=tr.xpath('./td[1]/text()').extract_first()#解析编号

             item['title']=tr.xpath('/td[2]/a[2]/text()').extract_first()#解析标题

             yield item

     def parse_detail(self, response):

         print(12345678765)

         item = CrawlspiderproItem()

         #xpath解析不识别tbody

         item['identifier']=response.xpath('/html/body/div[9]/table[1]/tr/td[2]/span[2]/text()').extract_first().split(':')[-1]

         item['content']="".join(response.xpath('/html/body/div[9]/table[2]//text()').extract())

         yield item

crawlSpiderTest.py

　　2.itmes.py字段属性定义

 import scrapy

 #也可以定义两个类分别存储，最后在和管道通过编号字段进行汇总对应，然后持久化存储

 class CrawlspiderproItem(scrapy.Item):

     #编号

     identifier=scrapy.Field()

     #标题

     title=scrapy.Field()

     #内容

     content=scrapy.Field()

     pass

itmes.py

　　3.pipelines.py管道配置

 #自定义持久化处理

 class CrawlspiderproPipeline(object):

     def process_item(self, item, spider):

         print(item)

         return item

pipelines.py

　　4.settings.py配置

#UA伪装

USER_AGENT = "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36"

#robots协议

ROBOTSTXT_OBEY = False

#日志输出等级

LOG_LEVEL='ERROR'

#开启管道

ITEM_PIPELINES = {

   'CrawlSpiderPro.pipelines.CrawlspiderproPipeline': 300,

}

scrapy框架之CrawlSpider全站自动爬取的更多相关文章

Scrapy 框架 CrawlSpider 全站数据爬取
CrawlSpider 全站数据爬取创建 crawlSpider 爬虫文件 scrapy genspider -t crawl chouti www.xxx.com import scrapy fr ...
Crawlspider的自动爬取
引子 : 如果想要爬取糗事百科的全栈数据的方法 ? 方法一 : 基于scrapy框架中的scrapy的递归爬取进行实现(requests模块递归回调parse方法) . 方法二 : 基于Crawl ...
scrapy进阶（CrawlSpider爬虫__爬取整站小说）
# -*- coding: utf-8 -*- import scrapy,re from scrapy.linkextractors import LinkExtractor from scrapy ...
(4)分布式下的爬虫Scrapy应该如何做-规则自动爬取及命令行下传参
本次探讨的主题是规则爬取的实现及命令行下的自定义参数的传递,规则下的爬虫在我看来才是真正意义上的爬虫. 我们选从逻辑上来看,这种爬虫是如何工作的: 我们给定一个起点的url link ,进入页面之后提 ...
Scrapy框架学习（四）爬取360摄影美图
我们要爬取的网站为http://image.so.com/z?ch=photography,打开开发者工具,页面往下拉,观察到出现了如图所示Ajax请求, 其中list就是图片的详细信息,接着观察到每 ...
scrapy框架基于CrawlSpider的全站数据爬取
引入提问:如果想要通过爬虫程序去爬取”糗百“全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法 ...
Scrapy框架之CrawlSpider
提问:如果想要通过爬虫程序去爬取”糗百“全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法二:基 ...
16.Python网络爬虫之Scrapy框架（CrawlSpider）
引入提问:如果想要通过爬虫程序去爬取”糗百“全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法 ...
scrapy框架之CrawlSpider操作
提问:如果想要通过爬虫程序去爬取”糗百“全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法二:基 ...

随机推荐

javascript-文件File转换成base64格式
不能直接访问用户计算机中的文件,一直都是Web应用开发中的一大障碍.2000年以前,处理文件的唯一方式就是在表单中加入<input type="file">字段,仅此而 ...
elementaryos5安装chrome，修复依赖
1.首先去下载个chrome:https://www.google.cn/chrome/ 2.尝试安装chrome:sudo dpkg -i google-chrome-stable_current_ ...
QIntValidator没有最小值的限制，继承然后写个新类来控制最小值
版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明.本文链接:https://blog.csdn.net/firecityplans/article ...
[Windows]允许未签名的驱动
bcdedit.exe -set loadoptions ENABLE_INTEGRITY_CHECKS bcdedit.exe -set TESTSIGNING OFF https://social ...
Zabbix备份数据文件
mysql自带的工具mysqldump,当数据量大了之后进行全备所花的时间比较长,这样将会造成数据库的锁读.从而zabbix服务的监控告警不断,想着做下配置文件的备份.刚好有这么个脚本.满足了需求. ...
TCP链接的三次握手与四次断开
一直总觉得三次握手和四次断开,之前老师讲的有问题,经过自己再次琢磨,发现是的,老师讲的没毛病,这次也把自己的理解总结一下,让对这个知识模糊的小伙伴再换种思路去理解首先看一下TCP三次握手发生了哪些: ...
Java本地的项目，怎么可以让别人通过外网访问-内网穿透
2019独角兽企业重金招聘Python工程师标准>>> 一.点击链接 https://natapp.cn/ 注册个免费的账户 NATAPP官网二.登陆进去以后查看authtoken ...
Everything 本地磁盘文件搜索工具下载！
如何运用布尔算子? AND(且)是缺省使用的布尔算子. 例如:如果要搜索 foo 和 bar 同时出现的文件:foo bar 如果从两者之中任一个都可以,则用 | 介于两者之间. 例如:如果要搜索.j ...
docker学习笔记一篇就通系列（持续更新）
docker三要素仓库镜像容器仓库仓库用来存放docker的镜像,类似于github存放代码医养镜像镜像是一个模板,封装了应用程序和配置依赖的可交付的运行环境,这个打包好的运行环境就是镜 ...
从0开始学自定义View -1
PS:好久没有写博客了,之前的东西有所忘记,百度一下竟然查到了自己的写过的博客,访问量还可以,一开始的写博客的初衷是把自己不会的记录下来,现在没想到也有博友会关注我,这就给了我动力,工作之余把零零碎碎 ...

scrapy框架之CrawlSpider全站自动爬取

scrapy框架之CrawlSpider全站自动爬取的更多相关文章

随机推荐

热门专题