python scrapy框架爬取豆瓣

刚刚学了一下，还不是很明白。随手记录。

在piplines.py文件中将爬到的数据放到json中

class DoubanmoviePipelin2json(object):
#打开文件 open_spider 内部自带 不能自己起名

    def open_spidef(self,spider):

        self.json=open("doubantop250.json","w",encoding="utf-8")

        self.jsonfile.write("["+"/n")

        self.first=1
# 对数据进行跌代 放入json文件中

    def process_item(self,item,spider):

        if self ==1:

            movie=json.dumps(dict(item),ensure_ascii=False)

            self.jsonfile.write(movie)

            self.first=0

        else:

             movie=",\n"+json.dumps(dict(item),ensure_ascii=False)

            self.jsonfile.write(movie)

    return item
#关闭文件

    def close_spider(self,spider):

        self.jsonfile.write("\n"+"]")

        self.jsonfile.close()

写入xls中

 class DoubanmoviePipline2xls(object):

     def open_spider(self,spider):

         self.workbook=xlwt.Workbook(encoding="utf-8")

         self.worksheet=self.work.add_sheet("doubantop250")

         hearder=["电影排名","电影名"]

         for colsIndex in range(len(header)):

             worksheet.write(0,colsIndex,header[colsIndex])

         self.rows=1

     def process_item(self,item,spider):

         movie=[item[k] for k in item]

         for colsIndex in range(len(movie)):

 　　　　　　　self.worksheet.write(self.rows,colsIndex,movie[colsIndex])]

 　　　　　　　self.rows+=1

14　　 return item

     def close_spider(self,spider):

         self.rows=0

         self.workbook.save("doubantop250.xls")

python scrapy框架爬取豆瓣的更多相关文章

基于python的scrapy框架爬取豆瓣电影及其可视化
1.Scrapy框架介绍主要介绍,spiders,engine,scheduler,downloader,Item pipeline scrapy常见命令如下: 对应在scrapy文件中有,自己增加 ...
scrapy框架爬取豆瓣读书（1）
1.scrapy框架 Scrapy,Python开发的一个快速.高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据.Scrapy用途广泛,可以用于数据挖掘.监测和自动化测试 ...
利用python scrapy 框架抓取豆瓣小组数据
因为最近在找房子在豆瓣小组-上海租房上找,发现搜索困难,于是想利用爬虫将数据抓取. 顺便熟悉一下Python. 这边有scrapy 入门教程出处:http://www.cnblogs.com/txw1 ...
Python scrapy框架爬取瓜子二手车信息数据
项目实施依赖: python,scrapy ,fiddler scrapy安装依赖的包: 可以到https://www.lfd.uci.edu/~gohlke/pythonlibs/ 下载 pywi ...
使用scrapy框架爬取自己的博文（2）
之前写了一篇用scrapy框架爬取自己博文的博客,后来发现对于中文的处理一直有问题- - 显示的时候 [u'python\u4e0b\u722c\u67d0\u4e2a\u7f51\u9875\u76 ...
scrapy框架爬取笔趣阁完整版
继续上一篇,这一次的爬取了小说内容 pipelines.py import csv class ScrapytestPipeline(object): # 爬虫文件中提取数据的方法每yield一次it ...
scrapy框架爬取笔趣阁
笔趣阁是很好爬的网站了,这里简单爬取了全部小说链接和每本的全部章节链接,还想爬取章节内容在biquge.py里在加一个爬取循环,在pipelines.py添加保存函数即可 1 创建一个scrapy项目 ...
【python数据挖掘】爬取豆瓣影评数据
概述: 爬取豆瓣影评数据步骤: 1.获取网页请求 2.解析获取的网页 3.提速数据 4.保存文件源代码: # 1.导入需要的库 import urllib.request from bs4 impo ...
Python使用Scrapy框架爬取数据存入CSV文件(Python爬虫实战4)
1. Scrapy框架 Scrapy是python下实现爬虫功能的框架,能够将数据解析.数据处理.数据存储合为一体功能的爬虫框架. 2. Scrapy安装 1. 安装依赖包 yum install g ...

随机推荐

ASP.NET Core学习系列
.NET Core ASP.NET Core ASP.NET Core学习之一入门简介 ASP.NET Core学习之二菜鸟踩坑 ASP.NET Core学习之三 NLog日志 ASP.NET C ...
technologies
RPC Apache Thrift, Thrift is an interface definition language and binary communication protocol, lik ...
Ubantu更新hostname & hosts
一.概述 Hostname 即主机名,一般存放在 /etc/hostname 中.而hosts则是本地域名解析文件,存放于 /etc/hosts. 二.测试 2.1 hostname musion@m ...
学习 razor pages 指南
这是一个系列,我打算把此人的系列翻译一下,学习技术的同时,顺便提高一下英文水平. 原文地址:https://www.learnrazorpages.com/ 前言欢迎来学习 razor pages ...
poj 3268 Silver Cow Party(最短路dijkstra）
描述: One cow from each of N farms (1 ≤ N ≤ 1000) conveniently numbered 1..N is going to attend the bi ...
Vue.js学习笔记(介绍)
Vue语法也可以进行APP开发,需要借助weex Vue.js是一套构建用户界面的框架,只关注视图层,便于与第三方库或既有项目整合. 在Vue中的核心概念:让用户不能操作Dom元素(减少不必要的dom ...
P1250 种树
P1250 种树题目描述一条街的一边有几座房子.因为环保原因居民想要在路边种些树.路边的地区被分割成块,并被编号成1..N.每个部分为一个单位尺寸大小并最多可种一棵树.每个居民想在门前种些树并指定 ...
java web项目最简单的结构
为了解“徒手”建立一个web应用,此博客建立简单过程 1.在任意一个目录下,建立一个文件夹,取名字 webDemo .这个应用名字. 2.在 webDemo 内建立一个 WEB-INF 文件夹,此处大 ...
VMware虚拟机安装WIN7
VMware在IT工作人员的学习之中,使用的较多,故聊一聊VMware中WIN7的安装: 第一步:安装VMware,这个软件百度就可以下载,但是是收费软件,注册码可以百度到. 第二步:VMware安装 ...
2018-2019-2 网络对抗技术 20165323 Exp4 恶意代码分析
一.原理与实践说明 1.实践目标监控你自己系统的运行状态,看有没有可疑的程序在运行. 分析一个恶意软件,就分析Exp2或Exp3中生成后门软件:分析工具尽量使用原生指令或sysinternals,s ...

python scrapy框架爬取豆瓣

python scrapy框架爬取豆瓣的更多相关文章

随机推荐

热门专题