Scrapy中的crawlspider

crawlspider

能自动的获取url并提交请求

命令:scrapy genspider -t crawl spidername 'example.cn'

所导入的模块

# -*- coding: utf-8 -*-

import scrapy

from scrapy.linkextractors import LinkExtractor

from scrapy.spiders import CrawlSpider, Rule

继承CrawlSpider

LInkEctractor(allow=r'Items/') : 通过正则表达式提取url链接
url不完整时crawlspider会自动补充
callback='parse_item':回调函数(可不写)
follow=True: 是否继续从响应内容里提取url链接
可添加多个Rule

class PspiderSpider(CrawlSpider):

    name = 'spidername'

    allowed_domains = ['']

    start_urls = ['']

    rules = (

        Rule(LinkExtractor(allow=r'Items/'), callback='parse_item', follow=True),

    )

还可以自定义函数对数据进行处理
不能定义parse函数
也可以yiled传递数据
可以通过正则表达式提取内容
可以xpath提取内容

    def parse_item(self, response):

        item = {}

        #item['domain_id'] = response.xpath('//input[@id="sid"]/@value').get()

        #item['name'] = response.xpath('//div[@id="name"]').get()

        # import re

        #item['description'] = re.findall('', response.body.decode())[0]

        return item

补充内容:
- LinkExtractor更多常见参数:
  - allow:满足括号中“正则表达式”的URL会被提取，如果为空，则全部匹配。
  - deny:满足括号中“正则表达式”的URL-定不提取(优先级高于allow)。
  - allow_ domains:会被提取的链接的domains.
  - deny_ domains:-定不会被提取链接的domains.
  - restrict_ xpaths: 使用xpath表达式，和allow共同作用过滤链接，xpath满足范围内的url地址会被提取
- spiders . Rule常见参数:
  - link_ extractor: 是一个Link Extractor对象，用于定义需要提取的链接。
  - callback:从link extractor中每获取到链接时，参数所指定的值作为回调函数
  - follow:是一个布尔(boolean)值,指定了根据该规则从response提取的链接是否需要跟进。如果callback为None, fllw 默认设置为True，否则默认为False。
  - process_ links:指定该spider中哪个的函数将会被调用, link_ extractor中获取到链接列表时将会调用该函数，该方法主要用来过滤url。
  - process_ request: 指定该spider中哪个的函数将会被调用，该规则提取到每个request时都会调用该函数，用来过滤request.

Scrapy中的crawlspider的更多相关文章

Scrapy框架中的CrawlSpider
小思考:如果想要通过爬虫程序去爬取”糗百“全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法二: ...
python框架Scrapy中crawlSpider的使用——爬取内容写进MySQL
一.先在MySQL中创建test数据库,和相应的site数据表二.创建Scrapy工程 #scrapy startproject 工程名 scrapy startproject demo4 三.进入 ...
爬虫07 /scrapy图片爬取、中间件、selenium在scrapy中的应用、CrawlSpider、分布式、增量式
爬虫07 /scrapy图片爬取.中间件.selenium在scrapy中的应用.CrawlSpider.分布式.增量式目录爬虫07 /scrapy图片爬取.中间件.selenium在scrapy ...
scrapy 中crawlspider 爬虫
爬取目标网站: http://www.chinanews.com/rss/rss_2.html 获取url后进入另一个页面进行数据提取检查网页: 爬虫该页数据的逻辑: Crawlspider爬虫类: ...
python框架Scrapy中crawlSpider的使用
一.创建Scrapy工程 #scrapy startproject 工程名 scrapy startproject demo3 二.进入工程目录,根据爬虫模板生成爬虫文件 #scrapy genspi ...
python爬虫入门（八）Scrapy框架之CrawlSpider类
CrawlSpider类通过下面的命令可以快速创建 CrawlSpider模板的代码: scrapy genspider -t crawl tencent tencent.com CrawSpid ...
爬虫框架之Scrapy（三 CrawlSpider）
如何爬取一个网站的全站数据? 可以使用Scrapy中基于Spider的递归方式进行爬取(Request模块回调parse方法) 还有一种更高效的方法,就是基于CrawlSpider的自动爬取实现简介 ...
Scrapy框架之CrawlSpider
提问:如果想要通过爬虫程序去爬取”糗百“全站数据新闻数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模块递归回调parse方法). 方法二:基 ...
Scrapy中集成selenium
面对众多动态网站比如说淘宝等,一般情况下用selenium最好那么如何集成selenium到scrapy中呢? 因为每一次request的请求都要经过中间件,所以写在中间件中最为合适 from se ...

随机推荐

一文读懂什么是CA证书
Normal 0 7.8 磅 0 2 false false false EN-US ZH-CN X-NONE /* Style Definitions */ table.MsoNormalTable ...
线程间交换数据的Exchanger
作者:Steven1997 链接:https://www.jianshu.com/p/9b59829fb191 来源:简书简书著作权归作者所有,任何形式的转载都请联系作者获得授权并注明出处. Exc ...
【WPF学习】第六十四章构建基本的用户控件
创建一个简单用户控件是开始自定义控件的好方法.本章主要介绍创建一个基本的颜色拾取器.接下来分析如何将这个控件分解成功能更强大的基于模板的控件. 创建基本的颜色拾取器很容易.然而,创建自定义颜色拾取器仍 ...
Vertica的这些事（十三）——Vertica备份元数据信息
---备份资源池 SELECT 'CREATE RESOURCE POOL ' || name || CASE WHEN memorysize IS NULL THEN ' ' ELSE ' MEMO ...
新安装的eclipse配置好了环境变量后，打开还是出现A Java runtime environment错误
新安装的eclipse配置好了环境变量后,打开还是出现如下图的A Java runtime environment错误; 解决方法: 第一步: Windows环境下:把C:\Users\你的用户名目 ...
多转一ETH(ERC20代币汇集)
1.下载表格模板 2.导入小号地址 NO1.地址整理 NO2.地址导入 NO3.导入完成 3.查询地址余额1.下图是汇集ETH的操作图片 2.下图是汇集ERC20代币的操作图片注 ...
30 HashSet
/* * 使用HashSet存储字符串并遍历 * * Set的特点: * 无序(存储和读取的顺序可能不一样) * 不允许重复 * 没有整数索引于List正好相反 */ public class Ha ...
ubuntu core文件
ubuntu开启core 检查是否开启core ulimit -c //0表示没有开启开启core ulimit -c unlimited sudo sh -c 'echo 1 > /proc ...
"选择图片"组件:<pickimage> —— 快应用组件库H-UI
<import name="pickimage" src="../Common/ui/h-ui/media/c_pickimage"></ ...
怎么入门python？不懂你别瞎尝试，看看大佬怎么说
学习任何一门语言都是从入门,通过不间断练习达到熟练水准.虽然万事开头难,但好的开始是成功的一半,今天这篇文章就来谈谈怎么入门python? 在开始学习python之前,你需要确定好学习计划和方式比如 ...

Scrapy中的crawlspider

crawlspider

Scrapy中的crawlspider的更多相关文章

随机推荐

热门专题