爬虫之scrapy安装与基本使用

安装

pip install scrapy

基本使用　

创建项目

scrapy startproject 项目名

cd 项目名

生成爬虫

创建spider爬虫：scrapy genspider 爬虫名允许的域名

爬虫类需要继承scrapy.Spider
爬虫的名字: name
允许的域名: allowed_domains
起始的url: start_urls
解析函数:

创建crawlspider爬虫：scrapy genspider -t crawl 爬虫名称允许的域

完善提取URL的规则
Rule表示规则
1. rules是一个元组或者是列表 --> Rule对象
2. rules = (Rule(LinkExtractor(allow=r'Items/'), callback='parse_item', follow=True),)

LinkExtractor[必选]:连接提取器，可以通过正则或者是xpath来提取URL

allow: 用于指定一个正则表达, 只有与该正则匹配的链接才被提取出来

restrict_xpaths: 用于指定一个XPATH, 只有该XPATH指定的区域中链接才被提取出来

callback[可选]: 表示经过连接提取器提取出来的url对应响应的解析函数，可以没有，表示该响应不需要解析函数来处理

follow[可选]：连接提取器提取的url地址对应的响应是否还会继续被rules中的规则进行提取，True表示会，False表示不会

完善爬虫

response.xpath('xpath语法') --> 返回selector对象
extract() --> 返回提取到的字符串列表 --> 无数据[]
extract_first() --> 返回提取到的第一个字符串 --> 无数据None

注意： yield后不可以接列表

保存数据　

完善Pipeline类
在settings.py中开启管道

运行项目

scrapy crawl 爬虫名

CrawlSpider 与 Spider如何选择

　　自定义爬虫, 是继承CrawlSpider 还是 Spider呢?

一般当一类页面中可以获取所有数据的时候, 使用CrawlSpider
需要从多类页面中提取数据, 进行组合, 使用Spider

爬虫之scrapy安装与基本使用的更多相关文章

python爬虫框架—Scrapy安装及创建项目
linux版本安装 pip3 install scrapy 安装完成 windows版本安装 pip install wheel 下载twisted,网址:http://www.lfd.uci.edu ...
Python爬虫框架--Scrapy安装以及简单实用
scrapy框架框架 -具有很多功能且具有很强通用性的一个项目模板环境安装: Linux: pip3 install scrapy Windows: ...
python爬虫的scrapy安装+pymongo的安装
我的:python2.7版本 32位注意scrapy只支持2.7及以上的版本. 1.安装python 2.安装pip 安装pip就不赘述了,网上很多教学 pip安装时要注意更新,如果pip版本 ...
Python爬虫框架Scrapy安装使用步骤
一.爬虫框架Scarpy简介Scrapy 是一个快速的高层次的屏幕抓取和网页爬虫框架,爬取网站,从网站页面得到结构化的数据,它有着广泛的用途,从数据挖掘到监测和自动测试,Scrapy完全用Python ...
python爬虫之scrapy安装（一）
简介: Scrapy,Python开发的一个快速.高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据.Scrapy用途广泛,可以用于数据挖掘.监测和自动化测试. Scrap ...
[Python爬虫] scrapy爬虫系列 <一>.安装及入门介绍
前面介绍了很多Selenium基于自动测试的Python爬虫程序,主要利用它的xpath语句,通过分析网页DOM树结构进行爬取内容,同时可以结合Phantomjs模拟浏览器进行鼠标或键盘操作.但是,更 ...
转：Scrapy安装、爬虫入门教程、爬虫实例（豆瓣电影爬虫）
Scrapy在window上的安装教程见下面的链接:Scrapy安装教程上述安装教程已实践,可行.(本来打算在ubuntu上安装Scrapy的,但是Ubuntu 磁盘空间太少了,还没扩展磁盘空间,所 ...
Scrapy安装、爬虫入门教程、爬虫实例（豆瓣电影爬虫）
Scrapy在window上的安装教程见下面的链接:Scrapy安装教程上述安装教程已实践,可行.(本来打算在ubuntu上安装Scrapy的,但是Ubuntu 磁盘空间太少了,还没扩展磁盘空间,所 ...
Linux 安装python爬虫框架 scrapy
Linux 安装python爬虫框架 scrapy http://scrapy.org/ Scrapy是python最好用的一个爬虫框架.要求: python2.7.x. 1. Ubuntu14.04 ...

随机推荐

集合线性表--List之ArrayList
集合操作——线性表 List: add().remove().subList().list.toArray().array.asList(). List排序: Collections.sort(li ...
java中&和&&
&和&&都可以用作逻辑与的运算符,表示逻辑与(and) &&还具有短路的功能,即如果第一个表达式为false,则不再计算第二个表达式,例如: If(x==33 ...
asp.net开源流程引擎API开发调用接口大全-工作流引擎设计
关键词: 工作流引擎 BPM系统接口调用工作流快速开发平台工作流流设计业务流程管理 asp.net 开源工作流一.程序调用开发接口二. 接口说明所谓的驰骋工作流引擎的接口,在B ...
XCTF-Misc
最近无聊在做一下杂项,随便总结一下关于杂项的知识. 一. xcaliflag 这个直接拖进stegsolve里面,大约是在Blue的第3位左右就很清楚了二.
python编程基础之三十
时间模块: 时间戳:就是当前是键距离1970年1月1日0:0:0的秒数,后面还带小数,可以说是非常精确时间的表示形式: a.以整数或者浮点数表示一个以秒为单位的时间间隔,这个时间的基础值1970.1 ...
小白学 Python（1）：开篇
人生苦短,我用 Python 引言大家好,可能大家都对我比较熟悉了,不熟悉请去面壁(现在熟悉一下也来得及)~ 简单做一个自我介绍,我是极客挖掘机的唯一作者,一位油腻的 Java 程序员[臭鸡蛋什么的 ...
比较两个文件的异同Python3 标准库difflib 实现
比较两个文件的异同Python3 标准库difflib 实现对于要比较两个文件特别是配置文件的差异,这种需求很常见,如果用眼睛看,真是眼睛疼. 可以使用linux命令行工具diff a_file b ...
[NOIp2012] luogu P1083 借教室
该*的英语,这么长还要背. 题目描述你有 nnn 个数 ai{a_i}ai,mmm 次操作,每次操作将 [l,r][l,r][l,r] 区间的每个数减去 ccc.要求任何时刻 ∀x∈[1,n]\f ...
1、Struts2基本入门
一.了解了这几个主要的优点,会促使你考虑使用Struts2 : 1.POJO表单及POJO操作 - Struts2 去除掉了Struts框架中的Action Forms部分.在Struts2框架下,你 ...
java集合之Stack栈基础
Stack堆栈: 是后进先出(LIFO)的对象堆栈,继承Vector—AbstractList--AbstractCollection类,底层是通过数组实现, boolean empty() 判断堆栈 ...

爬虫之scrapy安装与基本使用

安装

基本使用

创建项目

生成爬虫

完善爬虫

保存数据

运行项目

CrawlSpider 与 Spider如何选择

爬虫之scrapy安装与基本使用的更多相关文章

随机推荐

热门专题

基本使用　

保存数据