scrapy爬取阳光电影网全站资源

说一下我的爬取过程吧

第一步: 当然是 scrapy startproject + 名字新建爬虫项目

第二步: scrapy genspider -t crawl +爬虫名字+ 所爬取网站的域名 (-t crawl是全站爬虫)

第三步:

spider文件下的代码

import scrapy

import re

from scrapy.linkextractors import LinkExtractor  # 链接提取器

from scrapy.spiders import CrawlSpider, Rule  # 导入全站爬虫和采集规则

class Ygdy8Spider(CrawlSpider):

    name = 'ygdy8'  # 爬虫名字

    allowed_domains = ['www.ygdy8.com']  # 爬虫只在该域名下爬取数据

    start_urls = ['http://www.ygdy8.com/']  # 开始采集的网址

    # 采集规则集合

    rules = (

        # 具体采集的规则

        # allow 是选择出所有带有index的网址 allow是正则表达式 只要写你想提取的链接的一部分就可以了, deny是不允许提取的

        Rule(LinkExtractor(allow=r'index.html', deny='game')),

        # follow=true 意思是下一次提取的网页中如果包含我们需要提取的信息,是否还要继续提取,True代表继续提取

        Rule(LinkExtractor(allow=r'list_\d+_\d+.html'), follow=True),

        # 提取详情页信息 callback 回调函数, 将相应交给这个函数来处理

        Rule(LinkExtractor(allow=r'/\d+/\d+.html'), follow=True, callback='parse_item'),

    )

    # 解析采集回来的数据

    def parse_item(self, response):

        # 处理网页数据,提取下载链接

        # .*?代表提取除了换行以外的任何信息

        ftp_url = re.findall(r'<a href="(.*?)">ftp', response.text)

        name = re.findall(r'<title>(.*?)</title>', response.text)

        if ftp_url and name:

            items = {

                'name': name,

                'ftp_url': ftp_url

            }

        yield items

管道文件

import json

import os

import csv

class JsonPipeline(object):

    def __init__(self):

        self.file = open('阳光电影.json', 'w+', encoding='utf-8')

    def open_spider(self, spider):

        self.file.write('[')

    def process_item(self, item, spider):

        line = json.dumps(dict(item), ensure_ascii=False) + ",\n"

        self.file.write(line)

        return item

    def close_spider(self, spider):

        self.file.seek(-1, os.SEEK_END)

        self.file.truncate()

        self.file.write(']')

        self.file.close()

class CsvPipeline(object):

    def __init__(self):

        self.f = open("阳光电影.csv", "w", newline='')

        self.writer = csv.writer(self.f)

        self.writer.writerow(['name', 'ftp_url'])

    def process_item(self, item, spider):

        yangguang_list = [item['name'], item['ftp_url']]

        self.writer.writerow(yangguang_list)

        return item

settings

ITEM_PIPELINES = {

   'movie.pipelines.JsonPipeline': 300,

   'movie.pipelines.CsvPipeline': 300,

}

最后执行爬虫代码 scrapy crawl + 爬虫名字

scrapy爬取阳光电影网全站资源的更多相关文章

Python 2.7_First_try_爬取阳光电影网_20161206
之前看过用Scrapy 框架建立项目爬取网页解析时候用的Xpath进行解析的网页元素这次尝试用select方法匹配元素 1.入口爬取页面 http://www.ygdy8.com/index.ht ...
Python 2.7_Second_try_爬取阳光电影网_获取电影下载地址并写入文件 20161207
1.昨天文章http://www.cnblogs.com/Mr-Cxy/p/6139705.html 是获取电影网站主菜单然后获取每个菜单下的电影url 2.今天是对电影url 进行再次解析获取下 ...
scrapy爬取豆瓣电影top250
# -*- coding: utf-8 -*- # scrapy爬取豆瓣电影top250 import scrapy from douban.items import DoubanItem class ...
使用 Scrapy 爬取去哪儿网景区信息
Scrapy 是一个使用 Python 语言开发,为了爬取网站数据,提取结构性数据而编写的应用框架,它用途广泛,比如:数据挖掘.监测和自动化测试.安装使用终端命令 pip install Scrapy ...
Python Scrapy 爬取煎蛋网妹子图实例（一）
前面介绍了爬虫框架的一个实例,那个比较简单,这里在介绍一个实例爬取煎蛋网妹子图,遗憾的是上周煎蛋网还有妹子图了,但是这周妹子图变成了随手拍, 不过没关系,我们爬图的目的是为了加强实战应用,管 ...
scrapy爬取猫眼电影排行榜
做爬虫的人,一定离不开的一个框架就是scrapy框架,写小项目的时候可以用requests模块就能得到结果,但是当爬取的数据量大的时候,就一定要用到框架. 下面先练练手,用scrapy写一个爬取猫眼电 ...
Python网络爬虫 | Scrapy爬取妹子图网站全站照片
根据现有的知识,写了一个下载妹子图(meizitu.com)Scrapy脚本,把全站两万多张照片下载到了本地. 网站的分析网页的网址分析打开网站,发现网页的网址都是以 http://www.mei ...
网络爬虫之scrapy爬取某招聘网手机APP发布信息
1 引言过段时间要开始找新工作了,爬取一些岗位信息来分析一下吧.目前主流的招聘网站包括前程无忧.智联.BOSS直聘.拉勾等等.有段时间时间没爬取手机APP了,这次写一个爬虫爬取前程无忧手机APP岗位 ...
scrapy爬取迅雷电影天堂最新电影ed2k
前言几天没用scrapy爬网站了,正好最近在刷电影,就想着把自己常用的一个电影分享网站给爬取下来保存到本地mongodb中项目开始第一步仍然是创建scrapy项目与spider文件切换到工作目 ...

随机推荐

Flink架构（四）- 状态管理
状态管理之前我们提到过大多数流应用是有状态的.很多operators会不断的访问并更新某中状态,例如一个window中收集了多少条记录,输入源中当前读到的位置,亦或是用户定义的特定operators ...
查看和设置mysql字符集
http://218.194.248.2/~wuxiaogang/cpcourse/database/mysql/charset.htm 1. 修改mysql的my.cnf# vi /etc/my.c ...
CSS和JS两种颜色渐变文字效果代码
js实现颜色渐变文字效果代码:  <div id="moml"> <div style="text-al ...
【C语言】已知三角形三边长，求三角形面积
一. 数学基础: 已知三角形的三边,计算三角形面积,需要用到海伦公式: 即p=(a+b+c)/2 二. 算法: 输入三个边长,套用海伦公式计算面积,并输出. 可以先判断是否可以构成三角形,即任意两边之 ...
MYSQL导入CSV格式文件数据执行提示错误（ERROR 1290）： The MySQL server is running with the --secure-file-priv option so it cannot execute this statement.
MYSQL导入CSV格式文件数据执行提示错误(ERROR 1290): The MySQL server is running with the --secure-file-priv option s ...
TCL create list from file
proc create_list {filename {prompt verbose} {opts "" }} { set list_return {} if {[file exi ...
在VS2017中配置VLD(Visual Leak Detector)内存泄漏检测工具
首先在官方下载VLD 下载地址: https://kinddragon.github.io/vld/ 此版本为V2.5.1,为最后发布版本,下载后安装.加入你的安装路径为:VLD_Path,后面会用到 ...
svn还原与本地版本回退
今天遇到了一个情况,由于没及时更新,对整个项目进行了Ctrl+shift+O,提交代码时冲突:然后就先还原项目,导致之前没有冲突的代码也回退了.然后就在eclipse中获取本地的版本记录,并回退具体 ...
eclipse中怎么导入git库下载下来的web项目
总的看来是有两种方式: 方式一:可以对已经从版本库下载到本地的项目操作(Maven导入) 你可以通过公司提供的内部的版本库的网址登录版本库,之后在里面下载自己想要的那个版本的代码包,见下图点击右侧的 ...
datatable自动增加序号
{ "targets": [0], "visible": true, "render": function (data, type, ful ...

scrapy爬取阳光电影网全站资源

scrapy爬取阳光电影网全站资源的更多相关文章

随机推荐

热门专题