Scrapy框架的学习(6.item介绍以及items的使用（提前定义好字段名）)转载https://blog.csdn.net/wei18791957243/article/details/86259688

在Scrapy框架中的items.py的作用

1.可以预先定义好要爬取的字段 items.py

import scrapy

class TencentItem(scrapy.Item):

# define the fields for your item here like:

# name = scrapy.Field()

"""定义好字段,并不代表真正的值，只是占一个位置，用的时候直接赋值就行"""

position = scrapy.Field()

category = scrapy.Field()

date = scrapy.Field()

2. 把字段定义好之后 ,就可以在爬虫中进行使用

在用的时候， item的键名要和在items.py里面定义好的字段名称一致

import scrapy

''' 导入不同爬虫的类字段'''

from tencent.items import TencentItem,TencentItem2,TencentItem3

class TencentSpiderSpider(scrapy.Spider):

name = 'tencent_spider'

allowed_domains = ['tencent.com']

start_urls = ['https://hr.tencent.com/position.php']

def parse(self, response):

tr_list = response.xpath("//table[@class='tablelist']//tr")[1:-1]

for tr in tr_list:

"""使用定义好的类"""

item = TencentItem()

"""里面的键名，必须提前在items里面定义好之后才能用"""

item["position"] = tr.xpath("./td/a/text()").extract_first()

item["category"] = tr.xpath(".//td[2]/text()").extract_first()

item["date"] = tr.xpath(".//td[5]/text()").extract_first()

yield item

3. 如果想在pipelines.py中使用的方法是大同小异，只是在进行处理的时候item传过来的是一个类对象，要对其进行相应的转化

'''分别导入不同爬虫的字段类'''

from tencent.items import TencentItem, TencentItem2, TencentItem3

class TencentPipeline(object):

def process_item(self, item, spider):

"""使用item的时候这里接收的是TencentItem类的对象，我们可以把它转化字典"""

print(dict(item))

'''针对与不同的爬虫字段类的对象，做不同的处理'''

return item

4. 这样做有什么好处呢，个人理解：

(1) 可以直接看items.py，可以看出来要爬取那些字段

(2) 防止我们在item["键名"] 输入键名的时候输入错误

有多个爬虫时Item的处理

例如有个腾讯爬虫、有个京东爬虫，怎样处理

1. 在items.py里面创建不同的类，分别保存各自的字段

class TencentItem(scrapy.Item):

"""腾讯爬虫要爬取的字段"""

"""定义好字段,并不代表真正的值，只是占一个位置，用的时候直接赋值就行"""

position = scrapy.Field()

category = scrapy.Field()

date = scrapy.Field()

class JdItem(scrapy.Item):

"""京东爬虫要爬取的字段"""

"""定义好字段,并不代表真正的值，只是占一个位置，用的时候直接赋值就行"""

position = scrapy.Field()

category = scrapy.Field()

date = scrapy.Field()

2. 然后在不同的爬虫程序里使用对应的类即可

在腾讯的爬虫里，导入和使用

import scrapy

# 导入不同爬虫的类字段

from tencent.items import TencentItem

class TencentSpiderSpider(scrapy.Spider):

pass

def parse(self, response):

pass

for tr in tr_list:

"""使用定义好的腾讯爬虫的类的字段"""

item = TencentItem()

yield item

在京东的爬虫中，可以这样使用

import scrapy

# 导入不同爬虫的类字段

from JD.items import JdItem

class JdSpiderSpider(scrapy.Spider):

pass

def parse(self, response):

pass

for tr in tr_list:

"""使用定义好的腾讯爬虫的类的字段"""

item = JdItem()

yield item

3. 对于多个爬虫，在pipelines,py中可以进行判断，分别对不同的爬虫的字段进行不同的处理

isinstance() 函数来判断一个对象是否是一个已知的类型

'''分别导入不同爬虫的字段类'''

from tencent.items import TencentItem, JdItem2

class TencentPipeline(object):

def process_item(self, item, spider):

'''针对与不同的爬虫字段类的对象，做不同的处理'''

if isinstance(item, TencentItem):

pass

if isinstance(item, JdItem2):

pass

return item

Scrapy框架的学习(6.item介绍以及items的使用（提前定义好字段名）)转载https://blog.csdn.net/wei18791957243/article/details/86259688的更多相关文章

K8S 使用NFS 创建PV和PVC的例子学习From https://blog.csdn.net/xts_huangxin/article/details/51494472
1. 获取资料网址: https://blog.csdn.net/xts_huangxin/article/details/51494472 感谢原作者这里面按照自己的机器情况进行了学习模仿 ...
Android 学习路线图（转载自https://blog.csdn.net/lixuce1234/article/details/77947405）
程序设计一.java (a)基本语法(如继承.异常.引用.泛型等) Java核心技术卷I(适合入门) 进阶 Effective Java中文版(如何写好的Java代码) Java解惑 (介绍烂Ja ...
OpenGL学习脚印: uniform blocks在着色器中的使用转自https://blog.csdn.net/wangdingqiaoit/article/details/52717963
写在前面目前,我们在着色器中要传递多个uniform变量时,总是使用多个uniform,然后在主程序中设置这些变量的值:同时如果要在多个shader之间共享变量,例如投影矩阵projection和视 ...
scala学习（idea编译过程https://blog.csdn.net/guiying712/article/details/68947747）
scala官网 https://www.scala-lang.org/ 菜鸟教程学习 http://www.runoob.com/scala/scala-basic-syntax.html w3sch ...
Bootstrap学习4--Table样式（转载：https://blog.csdn.net/Fanbin168/article/details/53208869）
备注:最新Bootstrap手册:http://www.jqhtml.com/bootstraps-syntaxhigh/index.html 将<table>标签添加class=‘tab ...
学习mongoDB的一些感受（转自：http://blog.csdn.net/liusong0605/article/details/11581019）
曾经使用过mongoDB来保存文件,最一开始,只是想总结一下在开发中如何实现文件与mongoDB之间的交互.在此之前,并没有系统的了解过mongoDB,虽然知道我们用它来存储文件这些非结构化数据,但是 ...
jbpm的学习出处http://blog.csdn.net/hxirui/article/details/1221911
jbpm入门例子分类: opensourse2006-09-14 11:30 37308人阅读评论(22) 收藏举报 jbpmhibernate数据库oraclemysqltransition ...
Mapreduce之序列化框架（转自http://blog.csdn.net/lastsweetop/article/details/9376495）
框架简介 MapReduce仅仅可以支持Writable做key,value吗?答案是否定的.事实上,一切类型都是支持的,只需满足一个小小的条件:每个类型是以二进制流的形式传输.为此Hadoop提供了 ...
H5学习系列之文件读取API--本文转自http://blog.csdn.net/jackfrued/article/details/8967667
HTML5定义了FileReader作为文件API的重要成员用于读取文件,根据W3C的定义,FileReader接口提供了读取文件的方法和包含读取结果的事件模型. FileReader的使用方式非常简 ...

随机推荐

在Linux下使用gcc编译mesa文件报undefined reference to symbol 'sin@@GLIBC_2.2.5和DSO missing from command line两个错误的解决方案
一.概述在Linux系统下使用gcc编译用C语言写的mesa的示例程序. 环境:Ubuntu Server 18.04.1 二.问题的出现在Ubuntu下安装好mesa所需的库文件,将目标文件从g ...
【BZOJ4025】二分图
Description 神犇有一个n个节点的图.由于神犇是神犇,所以在T时间内一些边会出现后消失.神犇要求出每一时间段内这个图是否是二分图.这么简单的问题神犇当然会做了,于是他想考考你. Input ...
spring 测试类test测试方法
实例掩码地址为:孔浩组织结构设计 web.xml配置文件:  <context-param ...
C# 解决“请求被中止: 未能创建 SSL/TLS 安全通道”的问题
最近在开发项目的时候,使用爬虫抓取网络数据的时候,当请求Web数据时,碰到了“请求被中止: 未能创建 SSL/TLS 安全通道”的问题,尝试过很多网上的方法,例如添加证书等都没有用.最后在GitHub ...
对于已经添加引用，还找不到类型或名字空间的错误及svn客户端清除用户帐号密码
1 已经添加过引用,却找不到类型或名字空间. 可以看下项目的的.net framework版本是否一致. 项目(例如类库项目)右键(vs解决方案资源管理器)——>属性——>应用程序——&g ...
Python读取一个目录下的所有文件
#!/usr/bin/python # -*- coding:utf8 -*- import os allFileNum = 0 def printPath(level, path): global ...
ora-01017 和oracle database link
DB link ,创建完了后总是报密码错误.我感到奇怪.明明密码是对的.怎么可能错误呢. SQL> create public database link kk40 connect to khf ...
C++关于运算符重载知识点
1) 除了类属关系运算符".".成员指针运算符".*".作用域运算符"::".sizeof运算符和三目运算符"?:"以外 ...
python开发 *进程数据隔离.守护进程,进程同步工具 * 180725
进程数据隔离.守护进程,进程同步工具一.进程之间的数据隔离: from multiprocessing import Process n=100 #主程序中变量n= def func(): glob ...
poj2480（利用欧拉函数的积性求解）
题目链接: http://poj.org/problem?id=2480 题意:∑gcd(i, N) 1<=i <=N,就这个公式,给你一个n,让你求sum=gcd(1,n)+gcd(2, ...

Scrapy框架的学习(6.item介绍以及items的使用（提前定义好字段名）)转载https://blog.csdn.net/wei18791957243/article/details/86259688

有多个爬虫时Item的处理

Scrapy框架的学习(6.item介绍以及items的使用（提前定义好字段名）)转载https://blog.csdn.net/wei18791957243/article/details/86259688的更多相关文章

随机推荐

热门专题