爬虫--Scrapy框架的初步使用

1.scrapy在windows环境下安装

- 环境的安装：

      a. pip3 install wheel

      b. 下载twisted: http://www.lfd.uci.edu/~gohlke/pythonlibs/#twisted

      c. 进入下载目录，执行 pip3 install Twisted‑17.1.0‑cp35‑cp35m‑win_amd64.whl

      d. pip3 install pywin32

      e. pip3 install scrapy

2.scrapy的基本使用指令

- 使用流程：

    - 创建一个工程：scrapy startproject 工程名称

    - cd 工程名称

    - 创建爬虫文件：scrapy genspider 爬虫名称 初始url

    - 执行：scrapy crawl 爬虫名称  #后面可以加--nolog参数

3.scrapy的基本配置　

#创建scrapy后,对settings.py进行基本配置

1.ROBOTSTXT_OBEY = True  #True改为False  规避robots协议

2.#USER_AGENT = 'first (+http://www.yourdomain.com)'  #进行UA伪装

4.scrapy在使用xpath解析的时候使用extract进行取值　

author = div.xpath('./div[1]/a[2]/h2/text()').extract_first() 

content = div.xpath('./a/div/span//text()').extract()

5.scrapy的持久化存储

5.1基于终端的持久化存储

基于终端指令：scrapy crawl 爬虫名称 -o 文件名称.csv

- 好处：便捷

- 弊端：局限性强（只可以将数据写入本地文件，文件后缀是由具体要求）

5.2基于管道的持久化存储

1.在items.py文件中封装一个类似容器的东西,用于装爬取到的数据

    author = scrapy.Field()

    content = scrapy.Field()

2.在爬虫文件中,对爬取到的数据进行封装,并提交给管道

    from qiubaiPro.items import QiubaiproItem

            #实例化一个item类型的对象

            item = QiubaiproItem()

            #使用中括号的形式访问item对象中的属性

            item['author'] = author

            item['content'] = content

            #将item提交给管道

            yield item

3.在settings中打开管道

ITEM_PIPELINES = {

    'first.pipelines.FirstPipeline': 300,

}

4.在pipelines.py文件中对数据进行保存(三种保存分别是本地,redis,mysql)

import pymysql

from redis import Redis

class QiubaiproPipeline(object):

    fp = None

    def open_spider(self,spider):

        print('开始爬虫......')

        self.fp = open('./qiubai.txt','w',encoding='utf-8')

    #可以将item类型的对象中存储的数据进行持久化存储

    def process_item(self, item, spider):

        author = item['author']

        content = item['content']

        self.fp.write(author+':'+content+'\n')

        return item #返回给了下一个即将被执行的管道类

    def close_spider(self,spider):

        print('结束爬虫!!!')

        self.fp.close()

class MysqlPipeLine(object):

    conn = None

    cursor = None

    def open_spider(self,spider):

        self.conn = pymysql.Connect(host='127.0.0.1',port=3306,user='root',password='',db='qiubai',charset='utf8')

        print(self.conn)

    def process_item(self, item, spider):

        self.cursor = self.conn.cursor()

        try:

            self.cursor.execute('insert into qiubai values("%s","%s")'%(item['author'],item['content']))

            self.conn.commit()

        except Exception as e:

            print(e)

            self.conn.rollback()

        return item

    def close_spider(self,spider):

        self.cursor.close()

        self.conn.close()

class RedisPipeLine(object):

    conn = None

    def open_spider(self,spider):

        self.conn = Redis(host='127.0.0.1',port=6379)

        print(self.conn)

    def process_item(self,item,spider):

        dic = {

            'author':item['author'],

            'content':item['content']

        }

        self.conn.lpush('qiubai',dic)

爬虫--Scrapy框架的初步使用的更多相关文章

python爬虫scrapy框架——人工识别登录知乎倒立文字验证码和数字英文验证码(2)
操作环境:python3 在上一文中python爬虫scrapy框架--人工识别知乎登录知乎倒立文字验证码和数字英文验证码(1)我们已经介绍了用Requests库来登录知乎,本文如果看不懂可以先看之前 ...
爬虫scrapy框架之CrawlSpider
爬虫scrapy框架之CrawlSpider 引入提问:如果想要通过爬虫程序去爬取全站数据的话,有几种实现方法? 方法一:基于Scrapy框架中的Spider的递归爬取进行实现(Request模 ...
安装爬虫 scrapy 框架前提条件
安装爬虫 scrapy 框架前提条件 (不然会报错) pip install pypiwin32
爬虫Ⅱ:scrapy框架
爬虫Ⅱ:scrapy框架 step5: Scrapy框架初识 Scrapy框架的使用 pySpider 什么是框架: 就是一个具有很强通用性且集成了很多功能的项目模板(可以被应用在各种需求中) scr ...
Python爬虫Scrapy框架入门（2）
本文是跟着大神博客,尝试从网站上爬一堆东西,一堆你懂得的东西附上原创链接: http://www.cnblogs.com/qiyeboy/p/5428240.html 基本思路是,查看网页元素,填写 ...
爬虫Scrapy框架运用----房天下二手房数据采集
在许多电商和互联网金融的公司为了更好地服务用户,他们需要爬虫工程师对用户的行为数据进行搜集.分析和整合,为人们的行为选择提供更多的参考依据,去服务于人们的行为方式,甚至影响人们的生活方式.我们的scr ...
自己动手实现爬虫scrapy框架思路汇总
这里先简要温习下爬虫实际操作: cd ~/Desktop/spider scrapy startproject lastspider # 创建爬虫工程 cd lastspider/ # 进入工程 sc ...
爬虫--Scrapy框架课程介绍
Scrapy框架课程介绍: 框架的简介和基础使用持久化存储代理和cookie 日志等级和请求传参 CrawlSpider 基于redis的分布式爬虫一scrapy框架的简介和基础使用 a) ...
爬虫--Scrapy框架的基本使用
流程框架安装Scrapy: (1)在pycharm里直接就可以进行安装Scrapy (2)若在conda里安装scrapy,需要进入cmd里输入指令conda install scrapy ...

随机推荐

MySQL 里有 2000w 数据，redis 中只存 20w 的数据，如何保证 redis 中的数据都是热点数据？
Redis 内存数据集大小上升到一定大小的时候,就会施行数据淘汰策略. 相关知识:Redis 提供 6 种数据淘汰策略: volatile-lru:从已设置过期时间的数据集(server.db[i]. ...
Linux如何查看某个端口是否被占用
1.netstat -anp |grep 端口号 2.netstat -nultp(此处不用加端口号) 3.netstat -anp |grep 82 查看82端口的使用情况
编写大型项目web页面从写web登陆页面开始
web页面搭建需要准备什么工具首先我们会和设计师沟通我们需要一些检验设计的工具 ps 自动裁图自动测量工具 (我这里安利一下一个工具我用的cutterman) sketch 可以使用阿里的工具 ...
centos报错：Could not retrieve mirrorlist http://mirrorlist.centos.org/
检查是否可以上网. ping 114.114.114.114 如果不可以,调试通.通了之后下一步: 然后检查DNS设置是否正常. ping www.baidu.com 不正常的话,设置DNS,如下: ...
小程序checkbox调整大小(checkbox样式修改)
.skyCheckbox{ transform: scale(0.7,0.7); -webkit-transform: scale(0.7,0.7); } <label class=" ...
截取url传值
// 页面传值 subStr(url) { var obj = {}; var str = url.split('?')[1]; var str2 = str.split('&'); cons ...
css换算rem单位
地址:https://www.freetechs.cn/tool/rem2px.html
python输出二维数组中，每行N个最大值的索引
`import heapq import numpy as np import random a = np.random.randint(50,size= (4,5)) a = np.array(a) ...
01 | 堆、栈、RAII：C++里该如何管理资源？（极客时间笔记）
基本概念堆,英文是 heap,在内存管理的语境下,指的是动态分配内存的区域.这个堆跟数据结构里的堆不是一回事.这里的内存,被分配之后需要手工释放,否则,就会造成内存泄漏. C++ 标准里一个相关概念 ...
Linux 开启远程访问
系统:Ubuntu16.0 虚拟机问题:Windows访问Ubun被拒绝解决方法: 1.先检测是否安装SSH服务 1 sudo apt-get install ssh 2.编辑ssh配置文件 1 ...

爬虫--Scrapy框架的初步使用

爬虫--Scrapy框架的初步使用的更多相关文章

随机推荐

热门专题