这几天一直在学习scrapy框架,刚好学到了CrawlSpider和Rule的搭配使用,就想着要搞点事情练练手!!!

信息提取

算了,由于爬虫运行了好几次,太过分了,被封IP了,就不具体分析了,附上《战狼2》豆瓣影评页面链接:https://movie.douban.com/subject/26363254/reviews

抓包

影评页面是分页的,为了爬取到更多条影评,用Chrome抓包分析请求发现,其实上面的网址可以是这样的:https://movie.douban.com/subject/26363254/reviews?start=0

这下明了了,URL最后的"start=0"就是我们搞更大的事情要用的东西了,先放着。

准备工作

  • pymysql驱动(pip安装就行了)
  • mysql数据库
  • scrapy

开搞


创建一个scrapy项目

选择一个自己中意的目录,在终端打开,输入一下命令:

scrapy startproject douban

这样就创建成功了,我使用Pycharm打开的项目,项目目录结构大概就是这样:



关于各个文件和文件夹有什么用,请自行百度,或者阅读scrapy官方文档


代码实现

items.py

因为只是练个手,就不爬太多东西了!

# items.py

import scrapy

class DoubanItem(scrapy.Item):
title=scrapy.Field()
author=scrapy.Field()
time=scrapy.Field()
link=scrapy.Field()
  • title : 题目
  • author : 影评作者
  • time : 影评发布时间
  • link : 影评链接

doubanspider.py

爬虫核心代码

# doubanspider.py

from scrapy.spider import CrawlSpider,Rule
from scrapy.linkextractors import LinkExtractor
from douban.items import DoubanItem class doubanspider(CrawlSpider): name='douban' urls=[]
for i in range(0,60,20):
page='https://movie.douban.com/subject/26363254/reviews?start={0}'.format(i)
urls.append(page) start_urls=urls rules =(Rule(LinkExtractor(allow=(r'https://movie.douban.com/review/\d+/')),callback='parse_item'),) def parse_item(self,response):
douban=DoubanItem()
douban['title']=response.xpath('//div[@id="content"]//span[@property="v:summary"]/text()')[0].extract()
douban['author']=response.xpath('//div[@class="main"]//span[@property="v:reviewer"]/text()')[0].extract()
douban['time']=response.xpath('//span[@property="v:dtreviewed"]/text()')[0].extract()
douban['link']=response.url
# print(douban['title'],douban['author'],douban['content'],douban['time'])
yield douban
  • name

    关于name这个变量,是这个爬虫名字的代号,不可和其他爬虫程序重复
  • start_urls

    是爬虫程序爬取的对象。前面说到要爬取更多条影评,抓包的到URL里面有 start 参数,通过改变这个参数就可以翻页爬取,这里一共爬取了三页。(尴尬的是其实一开始是一次性爬的5页,后来程序多运行了几次,被douban封了IP,然后我就改成了3页,虽然这个改动没什么用)
  • CrawlSpider

    这里自定义的doubanspider继承自CrawlSpider,后者继承于Spider,需要注意的是,CrawlSpider 重写了parse 方法,所以在自己写的 doubanspider 里不能重写 parse 方法,否则爬虫程序会运行出错。
  • Rule

    Rule 和 CrawlSpider 搭配使用更方便于爬取全站,上面的代码中的 rules 就定义了爬取规则:
rules =(Rule(LinkExtractor(allow=(r'https://movie.douban.com/review/\d+/')),callback='parse_item'),)

allow 参数传入要爬取内容的规则,callback 传入回调方法名,其实还有一个 follow 参数,默认为 True ,具体用途这里不赘述了。

目前爬取数据可以做到了,但是一运行发现服务器给了 304(呵呵),就在setting.py 里面做了这样一个改动:

ROBOTSTXT_OBEY = False

这个参数原来默认是 True 的,改了这个,然后程序愉快的跑起来了。


数据存储到MySQL

这一步。。。个人对连接数据库这个知识点不是很熟,有更好的请指教。

链接数据库主要用的是 SQLAlchemy 这个 python 包,挺好用的,不知道怎么用的可以取廖雪峰大神的教程里面看看。

直接贴代码:

# pipelines.py

from douban.models import Douban
from sqlalchemy.orm import sessionmaker
from sqlalchemy import create_engine class DoubanPipeline(object):
def process_item(self, item, spider):
return item class DOubanDatabasePipeline(object): def __init__(self):
engine=create_engine('mysql+pymysql://root:password@localhost:3306/scrapy_spider?charset=utf8')
self.DBsession=sessionmaker(bind=engine) def close_spider(self,spider):
pass def open_spider(self,spider):
pass def process_item(self,item,spider):
douban=Douban(title=item['title'],author=item['author'],time=item['time'],link=item['link'])
session=self.DBsession()
session.add(douban)
session.commit()
session.close()

最后别忘了在 setting.py 中设置一下:

ITEM_PIPELINES={
'douban.pipelines.DOubanDatabasePipeline':5
}

至此,基本上差不多了,感觉这个项目真的挺粗制滥造的。

github项目地址:https://github.com/killerYe/scrapy_spider

个人微信:yxw19971203

我只是一个初学编程的人,有兴趣可以加微信交流一下!!!

使用scrapy爬取豆瓣上面《战狼2》影评的更多相关文章

  1. scrapy爬取豆瓣电影top250

    # -*- coding: utf-8 -*- # scrapy爬取豆瓣电影top250 import scrapy from douban.items import DoubanItem class ...

  2. Scrapy爬取豆瓣图书数据并写入MySQL

    项目地址 BookSpider 介绍 本篇涉及的内容主要是获取分类下的所有图书数据,并写入MySQL 准备 Python3.6.Scrapy.Twisted.MySQLdb等 演示 代码 一.创建项目 ...

  3. scrapy爬取豆瓣电影信息

    最近在学python,对python爬虫框架十分着迷,因此在网上看了许多大佬们的代码,经过反复测试修改,终于大功告成! 原文地址是:https://blog.csdn.net/ljm_9615/art ...

  4. Scrapy爬取豆瓣电影top250的电影数据、海报,MySQL存储

    从GitHub得到完整项目(https://github.com/daleyzou/douban.git) 1.成果展示 数据库 本地海报图片 2.环境 (1)已安装Scrapy的Pycharm (2 ...

  5. scrapy 爬取豆瓣互联网图书

    安装scrapy conda install scrapy 生成一个scrapy项目 scrapy startproject douban settings文件 # -*- coding: utf-8 ...

  6. Scrapy中用xpath/css爬取豆瓣电影Top250:解决403HTTP status code is not handled or not allowed

    好吧,我又开始折腾豆瓣电影top250了,只是想试试各种方法,看看哪一种的方法效率是最好的,一直进行到这一步才知道 scrapy的强大,尤其是和selector结合之后,速度飞起.... 下面我就采用 ...

  7. Scrapy实战篇(三)之爬取豆瓣电影短评

    今天的主要内容是爬取豆瓣电影短评,看一下网友是怎么评价最近的电影的,方便我们以后的分析,以以下三部电影:二十二,战狼,三生三世十里桃花为例. 由于豆瓣短评网页比较简单,且不存在动态加载的内容,我们下面 ...

  8. Scrapy 通过登录的方式爬取豆瓣影评数据

    Scrapy 通过登录的方式爬取豆瓣影评数据 爬虫 Scrapy 豆瓣 Fly 由于需要爬取影评数据在来做分析,就选择了豆瓣影评来抓取数据,工具使用的是Scrapy工具来实现.scrapy工具使用起来 ...

  9. scrapy爬虫框架教程(二)-- 爬取豆瓣电影TOP250

    scrapy爬虫框架教程(二)-- 爬取豆瓣电影TOP250 前言 经过上一篇教程我们已经大致了解了Scrapy的基本情况,并写了一个简单的小demo.这次我会以爬取豆瓣电影TOP250为例进一步为大 ...

随机推荐

  1. SQL强化(三) 自定义函数

    ---恢复内容开始--- Oracle中我们可以通过自定义函数去做一些逻辑判断,这样可以减少查询语句,提高开发效率 create  -- 创建自定义函数 or replace -- 有同名函数就替换, ...

  2. React Native学习(六)—— 轮播图

    本文基于React Native 0.52 Demo上传到Git了,有需要可以看看,写了新内容会上传的.Git地址 https://github.com/gingerJY/React-Native-D ...

  3. 使用Eclipse在Excel中找出两张表中相同证件号而姓名或工号却出现不同的的项

    1:首先把Excel中的文本复制到txt中,复制如下: A表: 证件号                           工号  姓名 310110xxxx220130004 101 傅家宜3101 ...

  4. python+appium+unittest

    一个流行语言,一个主流工具,一个实用框架: For android 实例如下: import unittest from appium import webdriver from time impor ...

  5. java if与for循环的题

    //打印一个4*5的空心长方形        /*        for (int i = 0; i < 5;i++ ) {            if (i == 0 | i == 4) {  ...

  6. 解决spring定时任务执行2次和tomcat部署缓慢的问题

    spring定时任务执行2次 问题重现和解析 最近使用quartz定时任务框架,结果发现开发环境执行无任何问题,部署到服务器上后,发现同一时间任务执行了多次.经过搜索发现是服务器上tomcat的配置文 ...

  7. wamp apache无法启动的解决方法

    作者 grunmin 2014.03.12 14:44* 字数 535 阅读 22167评论 9喜欢 5 如题,近日在安装wamp的时候出现了apache无法启动的情况.wamp图标一直显示橙色.网上 ...

  8. myeclipse10不用打开myeclipse configuration center安装插件的方法

    我使用myeclipse10,网上找了一大堆的插件安装方法,全部都是要通过help->myeclipse configuration center进行安装 不用打开myeclipse  conf ...

  9. hash类型

    redis的hash是一个string的key与value的映射表.适合存储对象,与string的类型相比,可以节省内存,并且方便获取整个对象 hset  设置hash field的指定值.不存在则先 ...

  10. python_如何让字典保持有序?

    案例: 某编程竞赛系统,对参赛选手编程解题进行计时,选手完成题目后,把该选手解题用时记录到字典中,以便赛后按选手名查询成绩(答题时间越短,成绩越优秀) {'lili':(1,43),'yuyu':(2 ...