scrapy爬虫系列之一--scrapy的基本用法

功能点：scrapy基本使用

爬取网站：传智播客老师

完整代码：https://files.cnblogs.com/files/bookwed/first.zip

主要代码：

ff.py

# -*- coding: utf-8 -*-

import scrapy

from first.items import FirstItem

class FfSpider(scrapy.Spider):    #scrapy.Spider是最基本的类，必须继承这个类

    # 爬虫名称

    name = 'ff'

    # 允许的域名，可选

    allowed_domains = ['itcast.cn']

    start_urls = ['http://www.itcast.cn/channel/teacher.shtml']

    # 默认的Request对象回调函数，用来处理网页返回的response，以及生成Item或者Request对象

    def parse(self, response):

        teacher_list = response.xpath("//div[@class='li_txt']")

        for teacher in teacher_list:

            # 创建item对象

            item = FirstItem()

            # 此处由于疏忽，把teacher写成了item，结果找了半天

            name = teacher.xpath("./h3/text()").extract()        # xpath返回的是xpath对象，需要用extract提取字符串，同时，因为返回的是一个列表，所以要用[0]取值

            level = teacher.xpath("./h4/text()").extract()

            desc = teacher.xpath("./p/text()").extract()

            item["name"] = name[0]

            item["level"] = level[0]

            item["desc"] = desc[0]

            yield item

pipelines.py

import json

# 注意点：对应的settings配置，别忘了打开注释

# 可以做数据去重

class FirstPipeline(object):

    def __init__(self):

        self.f = open('teachers.json', 'w', encoding='utf-8')

    # 处理item

    def process_item(self, item, spider):

        print(dict(item))

        content = json.dumps(dict(item), ensure_ascii=False)

        self.f.write(content+",")

        self.f.write("\n")

        return item

    def close_spider(self):

        self.f.close()

scrapy爬虫系列之一--scrapy的基本用法的更多相关文章

[Python爬虫] scrapy爬虫系列 <一>.安装及入门介绍
前面介绍了很多Selenium基于自动测试的Python爬虫程序,主要利用它的xpath语句,通过分析网页DOM树结构进行爬取内容,同时可以结合Phantomjs模拟浏览器进行鼠标或键盘操作.但是,更 ...
5、爬虫系列之scrapy框架
一 scrapy框架简介 1 介绍 (1) 什么是Scrapy? Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架,非常出名,非常强悍.所谓的框架就是一个已经被集成了各种功能(高性能 ...
scrapy爬虫系列之开头--scrapy知识点
介绍:Scrapy是一个为了爬取网站数据.提取结构性数据而编写的应用框架,我们只需要实现少量的代码,就能够快速抓取.Scrapy使用了Twisted异步网络框架,可以加快我们的下载速度. 0.说明: ...
爬虫系列之Scrapy框架
一 scrapy框架简介 1 介绍 (1) 什么是Scrapy? Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架,非常出名,非常强悍.所谓的框架就是一个已经被集成了各种功能(高性能 ...
scrapy爬虫系列之六--模拟登录
功能点:如何发送携带cookie访问登录后的页面,如何发送post请求登录爬取网站:bilibili.github 完整代码:https://files.cnblogs.com/files/book ...
scrapy爬虫系列之二--翻页爬取及日志的基本用法
功能点:如何翻页爬取信息,如何发送请求,日志的简单实用爬取网站:腾讯社会招聘网完整代码:https://files.cnblogs.com/files/bookwed/tencent.zip 主要 ...
scrapy爬虫系列之七--scrapy_redis的使用
功能点:如何发送携带cookie访问登录后的页面,如何发送post请求登录简单介绍: 安装:pip3 install scrapy_redis 在scrapy的基础上实现了更多的功能:如reques ...
scrapy爬虫系列之五--CrawlSpider的使用
功能点:CrawlSpider的基本使用爬取网站:保监会主要代码: cf.py # -*- coding: utf-8 -*- import scrapy from scrapy.linkextr ...
python爬虫系列：Scrapy安装与使用
这篇博文主要写Scrapy框架的安装与使用 Scrapy框架安装命令行进入C:\Anaconda2\Scripts目录,运行:conda install Scrapy 创建Scrapy项目 1)进入 ...

随机推荐

高速入门：十分钟学会Python
初试牛刀如果你希望学习Python这门语言.却苦于找不到一个简短而全面的新手教程.那么本教程将花费十分钟的时间带你走入Python的大门.本文的内容介于教程(Toturial)和速查手冊(Cheat ...
par函数bty参数-控制绘图边框
bty 可以看作box type 的缩写,控制绘图边框的显示,取值范围为o, l, u, c, ], n 默认值为"o", 代码示例: par(bty = "o" ...
电视不支持AirPlay镜像怎么办？苹果iPhone手机投屏三种方法
导读:苹果手机多屏互动功能在哪里?iPhone苹果手机没有AirPlay镜像怎么办?三种方法教你苹果iPhone手机怎么投影到智能电视上. 前言: 苹果iPhone手机投屏到电视设备上,需要使用到Ai ...
iOS10.0 & Swift 3.0 对于升级项目的建议
iOS & Swift新旧版本更替, 在Apple WWDC大会开始之际, 也迎来了iOS 10.0, Swift 3.0 测试版, 到目前为止, 已经是测试版2.0, 每次更新都带来了新的语 ...
React封装RadioGroup
class RadioGroup extends React.Component { getRadioComponent(item, index) { return <div className ...
C++与Java混合编程
现在的程序员,不再像以前一样,掌握一种编程语言就可以混得有模有样了,现实的情况是,真实的项目中,通常是涉及多种编程语言,举几个简单的例子,一个软件为了快速开发,可能是使用Delphi或VB作为界面开发 ...
angular学习（十五）——Provider
转载请写明来源地址:http://blog.csdn.net/lastsweetop/article/details/60966263 Provider简单介绍每一个web应用都是由多个对象协作完毕 ...
超全面的JavaWeb笔记day21<过滤器>
1.过滤器的原理 2.实现过滤器写一个类实现javax.servlet.Filter接口在web.xml中对Filter进行配置 3.Filter接口 void init(FilterConfig ...
swift -- 计步器CMPedometer的使用
最近公司接了个项目,是一款运动类型的APP,可以检测运动量(例如:步数,上下楼等).睡眠信息.速度等信息,因为以前粗略的了解过传感器方面的相关信息,知道主要是苹果设备内置的传感器在起作用,传感器的种类 ...
Linux 任务计划：crontab
(1) 什么是任务计划:也就是设置服务器在某个指定的时间执行某个指定的任务,比如执行一个命令,或执行一个脚本(2) Linux 使用 cron 服务来制定任务计划,cron 是服务名称,crond 是 ...

scrapy爬虫系列之一--scrapy的基本用法

scrapy爬虫系列之一--scrapy的基本用法的更多相关文章

随机推荐

热门专题