Scrapy项目 - 实现豆瓣 Top250 电影信息爬取的爬虫设计

通过使Scrapy框架，掌握如何使用Twisted异步网络框架来处理网络通讯的问题，进行数据挖掘和对web站点页面提取结构化数据，可以加快我们的下载速度，也可深入接触各种中间件接口，灵活的完成各种需求，使得我们的爬虫更强大、更高效。

一、项目分析

豆瓣电影网页爬虫，要求使用scrapy框架爬取豆瓣电影 Top 250网页（https://movie.douban.com/top250?start=0）上所罗列上映电影的标题、主要信息、评分和电影简介等的信息，将所爬取的内容保存输出为CSV和JSON格式文件，在python程序代码中要求将所输出显示的内容进行utf-8类型编码。

1. 网页分析

对于本例实验，要求爬取的豆瓣电影 Top 250网页上的电影信息，显而易见，网页（https://movie.douban.com/top250?start=0）的页面布局结构可如图2-1所示：

图1-1 所要爬取的信息页面布局

使用xpath_helper_2_0_2辅助工具，对其中上映电影的标题、主要信息、评分和电影简介等的信息内容进行xpath语法分析如下：

标题：//div[@class='info']//span[@class='title'][1]/text()

信息：//div[@class='info']//div[@class='bd']/p[@class='']/text()

评分：.//div[@class='bd']/div[@class='star']/span[@class='rating_num']/text()

简介：//div[@class='info']//div[@class='bd']/p[@class='quote']/span/text()

2. url分析

获取url进行解析移交给scrapy，而对于request类，含有的参数 url 与callback回调函数为parse_details。出现搜索到的url不全，加上当前目录的url拼接，采用prase.urljoin(base,url)，最后获取下一页url交给scrapy ，再用Request进行返回。

换句话说，Spiders处理response时，提取数据并将数据经ScrapyEngine交给ItemPipeline保存,提取url重新经ScrapyEngine交给Scheduler进行下一个循环。直到无Url请求程序停止结束。

二、项目工具

Python 3.7.1 、 JetBrains PyCharm 2018.3.2 其它辅助工具：略

三、项目过程

（一）使用Xmind工具对Python爬虫程序（网络爬虫）流程图进行分析，绘制如图3-1所示的程序逻辑框架图：

图3-1 程序逻辑框架图

（二）爬虫程序调试过程BUG描述（截图）

图3-2 爬虫程序BUG描述①

图3-3 爬虫程序BUG描述②

（三）爬虫运行结果

图3-4 爬虫程序输出运行结果1

图3-5 爬虫程序输出文件

四、项目心得

关于本例实验心得可总结如下：

1、当Scrapy执行crawl命令报错：ModuleNotFoundError: No module named ***时，应该首先检查Project Interpreter是否为系统安装的python环境路径，如图4-1所示：

图4-1 检查Project Interpreter路径

2、 schelduler会按照一定的次序取出请求，经由引擎, 下载器中间键，发送给下载器dowmloader 这里的下载器中间键是设定在请求执行前，因此可以设定代理，请求头，cookie等

3、 spider打开某网页，获取到一个或者多个request，经由scrapy engine传送给调度器scheduler request特别多并且速度特别快会在scheduler形成请求队列queue，由scheduler安排执行

Scrapy项目 - 实现豆瓣 Top250 电影信息爬取的爬虫设计的更多相关文章

Scrapy项目 - 源码工程 - 实现豆瓣 Top250 电影信息爬取的爬虫设计
一.项目目录结构 spiders文件夹内包含doubanSpider.py文件,对于项目的构建以及结构逻辑,详见环境搭建篇. 二.项目源码 1.doubanSpider.py # -*- coding ...
Scrapy项目 - 数据简析 - 实现豆瓣 Top250 电影信息爬取的爬虫设计
一.数据分析截图(weka数据分析截图 ) 本例实验,使用Weka 3.7对豆瓣电影网页上所罗列的上映电影信息,如:标题.主要信息(年份.国家.类型)和评分等的信息进行数据分析,Weka 3.7数据分 ...
Scrapy项目 - 实现斗鱼直播网站信息爬取的爬虫设计
要求编写的程序可爬取斗鱼直播网站上的直播信息,如:房间数,直播类别和人气等.熟悉掌握基本的网页和url分析,同时能灵活使用Xmind工具对Python爬虫程序(网络爬虫)流程图进行分析. 一.项目 ...
Scrapy项目 - 实现腾讯网站社会招聘信息爬取的爬虫设计
通过使Scrapy框架,进行数据挖掘和对web站点页面提取结构化数据,掌握如何使用Twisted异步网络框架来处理网络通讯的问题,可以加快我们的下载速度,也可深入接触各种中间件接口,灵活的完成各种需求 ...
python 豆瓣top250电影的爬取
我们先看一下豆瓣的robot.txt 然后我们查看top250的网页链接和源代码通过对比不难发现网页间只是start数字发生了变化. 我们可以知道电影内容都存在ol标签下的 div class属性为 ...
Scrapy项目 - 数据简析 - 实现斗鱼直播网站信息爬取的爬虫设计
一.数据分析截图(weka数据分析截图 2-3个图,作业文字描述) 本次将所爬取的数据信息,如:房间数,直播类别和人气,导入Weka 3.7工具进行数据分析.有关本次的数据分析详情详见下图所示: ...
Scrapy项目 - 数据简析 - 实现腾讯网站社会招聘信息爬取的爬虫设计
一.数据分析截图本例实验,使用Weka 3.7对腾讯招聘官网中网页上所罗列的招聘信息,如:其中的职位名称.链接.职位类别.人数.地点和发布时间等信息进行数据分析,详见如下图: 图1-1 Weka ...
Scrapy项目 - 项目源码 - 实现腾讯网站社会招聘信息爬取的爬虫设计
1.tencentSpider.py # -*- coding: utf-8 -*- import scrapy from Tencent.items import TencentItem #创建爬虫 ...
requests爬取豆瓣top250电影信息
''' 1.爬取豆瓣top250电影信息 - 第一页: https://movie.douban.com/top250?start=0&filter= - 第二页: https://movie ...

随机推荐

egret之每日登陆奖励
//*******首登奖励********* */ //*********************** */ public setUserSetting(key, value) { if (value ...
记一次CentOS7-MySQL排坑历程
一.报错及起因今天在 CentOS7 中安装了 mysql5.7,然后为了测试数据库环境是否配置成功,便写了个基于 mybatis+Spring 的 java web 程序连接操作 mysql 数据 ...
Java Builder 模式,你搞明白了么？
Builder 模式定义 Builder 模式中文叫作建造者模式,又叫生成器模式,它属于对象创建型模式,是将一个复杂对象的构建与它的表示分离,使得同样的构建过程可以创建不同的表示.建造者模式是一步一步 ...
Badboy运行脚本 - 登录QQ邮箱，编写及发送邮件
参考: http://leafwf.blog.51cto.com/872759/1112128 http://www.51testing.com/html/00/130600-1367743.html ...
P2698 [USACO12MAR]花盆Flowerpot 单调队列
https://www.luogu.org/problemnew/show/P2698 警示用数组写双端队列的话,记得le = 1, ri = 0:le<=ri表示队列非空题意求一个最小的 ...
牛客小白月赛8 - E - 诡异数字数位DP
牛客小白月赛8 - E - 诡异数字题意: 求区间中,满足限制条件的数字的个数. 限制条件就是某些数字不能连续出现几次. 思路: 比较裸的数位DP, DP数组开一个dp[len][x][cnt] 表 ...
牛客-2018多校算法第五场C-KMP
字符串的问题在原来的字符串中前缀与后缀相同,且原来的中间还含有这个子串: 这里加的num[]数组真是太厉害了,可以直接用来判断中间是否有子串: #include <iostream> # ...
uva 796 C - Critical Links（tarjan求桥）
题目链接:https://vjudge.net/contest/67418#problem/C 题意:求出桥的个数并且按顺序输出题解:所谓桥就是去掉这条边后连通块增加,套用一下模版就行. #incl ...
SecureCRT安装及破解
### SecureCRT简介 > SecureCRT是一款支持SSH(SSH1和SSH2)的终端仿真程序,简单地说是Windows下登录UNIX或Linux服务器主机的软件. > &g ...
math库的使用
math库简介 math库是Python提供的内置数学内函数库,因为复数类型常用于科学计算,一般计算并不常用,因此math库不支持复数类型,仅支持整数和浮点数运算,math库一共提供4个数学常数和44 ...

Scrapy项目 - 实现豆瓣 Top250 电影信息爬取的爬虫设计

Scrapy项目 - 实现豆瓣 Top250 电影信息爬取的爬虫设计的更多相关文章

随机推荐

热门专题