爬虫--Scrapy-参数等级和请求传参

日志等级

日志等级(种类)：

    ERROR：错误

    WARNING：警告

    INFO：一般信息

    DEBUG：调试信息（默认）

指定输入某一中日志信息：

    settings:LOG_LEVEL = ‘ERROR’

将日志信息存储到制定文件中，而并非显示在终端里：

    settings：LOG_FILE = ‘log.txt’

请求传参：爬取的数据值不在同一个页面中。

    需求：将id97电影网站中电影详情数据进行爬取（名称，类型，导演，语言，片长）

如何让终端显示错误信息

在settings.py中配置

# 指定终端输入指定种类日志信息

LOG_LEVEL = 'ERROR'

# 存储到文件

LOG_FILE = 'log.txt'

请求传参

请求传参：爬取的数据值不在同一个页面中。
（id97电影网站）

在电影网站中电影详情数据进行爬取（名称，类型，导演，语言，片长）

创建moviePro工程

scrapy startproject moviePro

cd moviePro

scrapy genspider movie www.id97.com

电影名称和类型在一页

电影的其他详情在另外一页

爬虫文件movie.py

import scrapy

from moviePro.items import MovieproItem

class MovieSpider(scrapy.Spider):

    name = 'movie'

    #allowed_domains = ['www.id97.com']

    start_urls = ['https://www.55xia.com/movie']

    print(' start_urls')

    # 用于解析二级页面数据

    def parseBySecondPage(self,response):

        # 直接复制网页端的xpath

        director = response.xpath('/html/body/div[1]/div/div/div[1]/div[1]/div[2]/table/tbody/tr[1]/td[1]/span/text()').extract_first()

        language = response.xpath('/html/body/div[1]/div/div/div[1]/div[1]/div[2]/table/tbody/tr[6]/td[2]/text()').extract_first()

        longTime = response.xpath('/html/body/div[1]/div/div/div[1]/div[1]/div[2]/table/tbody/tr[8]/td[2]/text()').extract_first()

        # 取出Request方法的meta参数传递过来的字典(response.meta)

        item = response.meta['item']

        item['director'] = director

        item['language'] = language

        item['longTime'] = longTime

        # 将item提交给管道

        print('将item提交给管道')

        yield item

    def parse(self, response):

        # 需求：将id97电影网站中电影详情数据进行爬取（名称，类型，导演，语言，片长）

        div_list = response.xpath('/html/body/div[1]/div[1]/div[2]/div')

        for div in div_list:

            # extract_first()第一个

            name = div.xpath(".//div[@class='meta']/h1/a/text()").extract_first()

            kind = div.xpath('.//div[@class="otherinfo"]//text()').extract()

            # 将kind列表转化成字符串

            kind = " ".join(kind)

            url = div.xpath('.//div[@class="meta"]/h1/a/@href').extract_first()

            # href="//www.55xia.com/movie/638284.html

            url = 'https:'+url

            # 创建items对象

            item = MovieproItem()

            item['name'] = name

            item['kind'] = kind

            item['url'] = url

            print('创建items对象')

            # 需要对url发起请求，获取页面数据，进行指定数据解析

            # 问题：如何将剩下的电影详情数据存储到item对象（meta）

            # 需要对url发起请求，获取页面数据，进行指定数据解析

            # meta参数只可以赋值一个字典（将item对象先封装到字典）

            yield scrapy.Request(url=url, callback=self.parseBySecondPage, meta={'item': item})

movie.py

items.py

import scrapy

class MovieproItem(scrapy.Item):

    # define the fields for your item here like:

    # name = scrapy.Field()

    name = scrapy.Field()

    kind = scrapy.Field()

    director = scrapy.Field()

    language = scrapy.Field()

    longTime = scrapy.Field()

    url = scrapy.Field()

管道pipelines.py

class MovieproPipeline(object):

    fp = None

    def open_spider(self, spider):

        self.fp = open('movie.txt', 'w', encoding='utf-8')

    def process_item(self, item, spider):

        print('------process_item-------')

        detail = item['name'] + ':' + item['kind'] + ':' + item['director'] + ':' + item['language'] + ':' + item[

            'longTime'] + '\n\n\n'

        self.fp.write(detail)

        return item

    def close_spider(self, spider):

        self.fp.close()

爬虫--Scrapy-参数等级和请求传参的更多相关文章

Scrapy日志等级以及请求传参
日志等级请求传参提高scrapy的爬取效率日志等级 - 日志信息: 使用命令:scrapy crawl 爬虫文件运行程序时,在终端输出的就是日志信息: - 日志信息的种类: - ERROR ...
scrapy框架的日志等级和请求传参, 优化效率
目录 scrapy框架的日志等级和请求传参, 优化效率 Scrapy的日志等级请求传参如何提高scripy的爬取效率 scrapy框架的日志等级和请求传参, 优化效率 Scrapy的日志等级在使 ...
爬虫开发10.scrapy框架之日志等级和请求传参
今日概要日志等级请求传参今日详情一.Scrapy的日志等级 - 在使用scrapy crawl spiderFileName运行程序时,在终端里打印输出的就是scrapy的日志信息. - 日志 ...
13.scrapy框架的日志等级和请求传参
今日概要日志等级请求传参如何提高scrapy的爬取效率今日详情一.Scrapy的日志等级 - 在使用scrapy crawl spiderFileName运行程序时,在终端里打印输出的就是s ...
scrapy框架的日志等级和请求传参
日志等级请求传参如何提高scrapy的爬取效率一.Scrapy的日志等级 - 在使用scrapy crawl spiderFileName运行程序时,在终端里打印输出的就是scrapy的日志信息 ...
scrapy框架之日志等级和请求传参-cookie-代理
一.Scrapy的日志等级 - 在使用scrapy crawl spiderFileName运行程序时,在终端里打印输出的就是scrapy的日志信息. - 日志信息的种类: ERROR : 一般错误 ...
Scrapy的日志等级和请求传参
日志等级日志信息: 使用命令:scrapy crawl 爬虫文件运行程序时,在终端输出的就是日志信息: 日志信息的种类: ERROR:一般错误: WARNING:警告: INFO:一般的信息: ...
scrapy框架post请求发送，五大核心组件，日志等级，请求传参
一.post请求发送 - 问题:爬虫文件的代码中,我们从来没有手动的对start_urls列表中存储的起始url进行过请求的发送,但是起始url的确是进行了请求的发送,那这是如何实现的呢? - 解答: ...
Scrapy框架之日志等级和请求传参
一.Scrapy的日志等级在使用scrapy crawl spiderFileName运行程序时,在终端里打印输出的就是scrapy的日志信息. 1.日志等级(信息种类) ERROR:错误 WARN ...

随机推荐

python之路——6
王二学习python的笔记以及记录,如有雷同,那也没事,欢迎交流,wx:wyb199594 复习增dic['age'] = 21 dic.setfault()删popcleardel popitem ...
[UE4]Return Node节点好用法
蓝图自定义函数中,碰到“Return Node”也会推出当前的函数,跟高级语言的“return”是一样的用法
android webview内存泄露解决方法
完整的activity的onDestroy()方法:@Override protected void onDestroy() { if( mWebView!=null) { // 如果先调用destr ...
BCGcontrolBar(三) 添加表格(Grid)组件
表格组件和图表组件是BCG的亮点之一如下图 BCG有众多的表格样式可供选择下图是插入基本表格组件后的效果首先在程序中添加 BasicGridCtrl.h BasicGridCtrl.cpp 因为 ...
javasript-for循环
先来个for循环的例子: var i=0,j=0; for(;i<10,j<6;i++,j++){ k=i+j; } console.log(k) 想知道会输出什么,首先得知道完整循环了多 ...
RabbitMQ install (Ubuntu)
1. key 1) Online way apt-key adv --keyserver "hkps.pool.sks-keyservers.net" --recv-keys &q ...
CS229 6.1 Neurons Networks Representation
面对复杂的非线性可分的样本是,使用浅层分类器如Logistic等需要对样本进行复杂的映射,使得样本在映射后的空间是线性可分的,但在原始空间,分类边界可能是复杂的曲线.比如下图的样本只是在2维情形下的示 ...
Spring配置,事务使用
1.spring redis session超时配置 <bean class="org.springframework.session.data.redis.config.annota ...
MySQL通过游标来实现通过查询结果集循环
/*我们有时候会遇到需要对从A表查询的结果集S_S 的记录进行遍历并做一些操作(如插入),且这些操作需要的数据或许部分来自S_S集合*/ /*临时存储过程,没办法,不能直接在查询窗口做这些事.*/ ...
[Lua]string与中文
参考链接: https://baike.baidu.com/item/%E5%AD%97%E7%AC%A6%E7%BC%96%E7%A0%81/8446880?fr=aladdin#7 http:// ...

爬虫--Scrapy-参数等级和请求传参

日志等级

请求传参

爬虫--Scrapy-参数等级和请求传参的更多相关文章

随机推荐

热门专题